arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-22 至 2025-08-22 共收录 142 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 30 篇

2504.00406 2025-08-22 cs.CL cs.AI 84%

VerifiAgent: a Unified Verification Agent in Language Model Reasoning

Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15501 2025-08-22 cs.RO cs.AI 83%

LLM-Driven Self-Refinement for Embodied Drone Task Planning

Deyu Zhang, Xicheng Zhang, Jiahao Li, Tingting Long, Xunhua Dai, Yongjian Fu, Jinrui Zhang, Ju Ren, Yaoxue Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18915 2025-08-22 cs.LG cs.CL 82%

MATATA: Weakly Supervised End-to-End MAthematical Tool-Augmented Reasoning for Tabular Applications

Vishnou Vinayagame, Gregory Senay, Luis Martí

机构 * Docugami Inc(Docugami公司) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);SLM(abstract);language agent(abstract)

Comments Published as a conference paper at ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15388 2025-08-22 cs.IR 80%

TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation

Yu Xia, Rui Zhong, Zeyu Song, Wei Yang, Junchen Wan, Qingpeng Cai, Chi Lu, Peng Jiang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04714 2025-08-22 cs.AI cs.CL cs.LG cs.MA eess.SP 80%

Prescriptive Agents based on RAG for Automated Maintenance (PARAM)

Chitranshu Harbola, Anupam Purwar

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06855 2025-08-22 cs.CL cs.AI cs.LG 80%

Self-Supervised Prompt Optimization

Jinyu Xiang, Jiayi Zhang, Zhaoyang Yu, Xinbing Liang, Fengwei Teng, Jinhao Tu, Fashen Ren, Xiangru Tang, Sirui Hong, Chenglin Wu, Yuyu Luo

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15754 2025-08-22 cs.CL cs.AI 79%

Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis

Yufeng Zhao, Junnan Liu, Hongwei Liu, Dongsheng Zhu, Yuan Shen, Songyang Zhang, Kai Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Preprint, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15507 2025-08-22 cs.AI cs.LG 79%

Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning

Yekun Zhu, Guang Chen, Chengjun Mao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02037 2025-08-22 cs.CL cs.AI 79%

Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time

Huihan Li, You Chen, Siyuan Wang, Yixin He, Ninareh Mehrabi, Rahul Gupta, Xiang Ren

机构 * University of Southern California(南加州大学) University of California, San Diego(加州大学圣地亚哥分校) Meta Amazon AGI(亚马逊人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01539 2025-08-22 cs.CL cs.AI 79%

Pragmatic Inference Chain (PIC) Improving LLMs' Reasoning of Authentic Implicit Toxic Language

Xi Chen, Shuo Wang

机构 * Nanyang Technological University(南洋理工大学) University of Macau(澳门大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18021 2025-08-22 cs.AI cs.CL cs.HC q-bio.QM 79%

CRISPR-GPT for Agentic Automation of Gene-editing Experiments

Yuanhao Qu, Kaixuan Huang, Ming Yin, Kanghong Zhan, Dyllan Liu, Di Yin, Henry C. Cousins, William A. Johnson, Xiaotong Wang, Mihir Shah, Russ B. Altman, Denny Zhou, Mengdi Wang, Le Cong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Nature Biomedical Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15274 2025-08-22 cs.CL cs.IR 77%

TComQA: Extracting Temporal Commonsense from Text

Lekshmi R Nair, Arun Sankar, Koninika Pal

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Journal ref IRRAG@SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21969 2025-08-22 cs.RO cs.AI 77%

Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation

Yuan Meng, Xiangtong Yao, Haihui Ye, Yirui Zhou, Shengqiang Zhang, Zhenguo Sun, Xukun Li, Zhenshan Bing, Alois Knoll

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments update ICRA 6 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08324 2025-08-22 cs.AI 77%

ADAM: An AI Reasoning and Bioinformatics Model for Alzheimer's Disease Detection and Microbiome-Clinical Data Integration

Ziyuan Huang, Vishaldeep Kaur Sekhon, Roozbeh Sadeghian, Maria L. Vaida, Cynthia Jo, Doyle Ward, Vanni Bucci, John P. Haran

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15757 2025-08-22 cs.AI cs.CL cs.LG cs.MA 75%

Language-Guided Tuning: Enhancing Numeric Optimization with Textual Feedback

Yuxing Lu, Yucheng Hu, Nan Sun, Xukai Zhao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15050 2025-08-22 cs.AI cs.CL 74%

Don't Think Twice! Over-Reasoning Impairs Confidence Calibration

Romain Lacombe, Kerrie Wu, Eddie Dilworth

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments Published at ICML 2025 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07592 2025-08-22 cs.CL cs.AI 73%

IBPS: Indian Bail Prediction System

Puspesh Kumar Srivastava, Uddeshya Raj, Praveen Patel, Shubham Kumar Nigam, Noel Shallum, Arnab Bhattacharya

机构 * IIT Kanpur, India(印度克达尔理工大学) Symbiosis Law School Pune, India(印度浦那塞布里奥斯法学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15260 2025-08-22 cs.LG 70%

Deep Think with Confidence

Yichao Fu, Xuewei Wang, Yuandong Tian, Jiawei Zhao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15204 2025-08-22 cs.AI 70%

R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling

Raj Jain, Marc Wetter

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10794 2025-08-22 cs.LG math.AP math.DS 70%

A mathematical perspective on Transformers

Borjan Geshkovski, Cyril Letrouit, Yury Polyanskiy, Philippe Rigollet

机构 * Department of Mathematics, Massachusetts Institute of Technology, 77 Massachusetts Ave, 02139 Cambridge MA, USA CNRS \& Université Paris-Saclay Laboratoire de mathématiques d'Orsay, 307 rue Michel Magat, Bâtiment 307, 91400 Orsay, France Department of EECS, Massachusetts Institute of Technology, 77 Massachusetts Ave, 02139 Cambridge MA, USA

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

Journal ref Bull. Amer. Math. Soc. 62 (2025), 427-479

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15360 2025-08-22 cs.CV 67%

An Empirical Study on How Video-LLMs Answer Video Questions

Chenhui Gou, Ziyu Ma, Zicheng Duan, Haoyu He, Feng Chen, Akide Liu, Bohan Zhuang, Jianfei Cai, Hamid Rezatofighi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15021 2025-08-22 cs.RO 67%

In-Context Iterative Policy Improvement for Dynamic Manipulation

Mark Van der Merwe, Devesh Jha

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) MERL

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments 14 pages. Accepted at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15641 2025-08-22 cs.CV 50%

When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding

Pengcheng Fang, Yuxia Chen, Rui Guo

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 41 篇

2504.15640 2025-08-22 cs.CL cs.AI 91%

Cequel: Cost-Effective Querying of Large Language Models for Text Clustering

Hongtao Wang, Taiyan Zhang, Renchi Yang, Jianliang Xu

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15606 2025-08-22 cs.CR 89%

Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models

Yu Yang, Zhenyuan Li, Xiandong Ran, Jiahao Liu, Jiahui Wang, Bo Yu, Shouling Ji

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15370 2025-08-22 cs.CL cs.AI 88%

Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation

Yichi Zhang, Yao Huang, Yifan Wang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Department of Computer Science and Technology, College of AI, Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(计算机科学与技术系、人工智能学院、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院、北航) RealAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments For Appendix, please refer to arXiv:2406.07057

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21635 2025-08-22 cs.CL cs.AI 88%

Sadeed: Advancing Arabic Diacritization Through Small Language Model

Zeina Aldallal, Sara Chrouf, Khalil Hennara, Mohamed Motaism Hamed, Muhammad Hreden, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13612 2025-08-22 cs.CL cs.AI 88%

Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition

Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures, 5 tables, Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15361 2025-08-22 cs.CL 88%

A Survey on Large Language Model Benchmarks

Shiwen Ni, Guhong Chen, Shuaimin Li, Xuanang Chen, Siyi Li, Bingli Wang, Qiyao Wang, Xingjian Wang, Yifan Zhang, Liyang Fan, Chengming Li, Ruifeng Xu, Le Sun, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所) Southern University of Science and Technology(南方科技大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Shanghai University of Electric Power(上海电力大学) Shanghai AI Lab(上海人工智能实验室) South China University of Technology(华南理工大学) Shenzhen University(深圳大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16622 2025-08-22 cs.CL 88%

Leveraging Large Language Models for Explainable Activity Recognition in Smart Homes: A Critical Evaluation

Michele Fiori, Gabriele Civitarese, Priyankar Choudhary, Claudio Bettini

机构 * EveryWare Lab, Dept. of Computer Science, University of Milan(米兰大学计算机科学系EveryWare实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏