arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-21 至 2025-11-21 共收录 148 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 23 篇

2511.07979 2025-11-21 cs.AI 89%

Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models

对多步骤法律推理进行基准测试并分析思维链效应在大型语言模型中的表现

Wenhan Yu, Xinbo Lin, Lanxin Ni, Jinhua Cheng, Lei Sha

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) KoGuan School of Law, Shanghai Jiao Tong University, Shanghai, China(上海交通大学KoGuan法学院) School of Criminal Law, China University of Political Science and Law, Beijing, China(中国政法大学刑事法律学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出MSLR数据集,用于评估大型语言模型在多步骤法律推理中的表现,并通过实验展示自主生成的思维链提示提升了推理质量。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV 88%

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16331 2025-11-21 cs.CL 86%

Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement

将自我修正纳入大语言模型推理强化

Jiashu Yao, Heyan Huang, Shuang Zeng, Chuwei Luo, WangJie You, Jie Tang, Qingsong Liu, Yuhang Guo, Yangyang Kang

机构 * ByteDance China(字节跳动中国)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究提出自我修正框架,通过重写推理文本提升大语言模型的内部推理质量,实验表明其在准确性与推理长度权衡上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12115 2025-11-21 cs.CL cs.AI 84%

Eliciting Reasoning in Language Models with Cognitive Tools

通过认知工具激发语言模型的推理能力

Brown Ebouky, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research - Zurich(IBM瑞士研究中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :language model(title);LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过引入认知工具,提升语言模型在数学推理任务上的性能,探索推理机制并补充训练后方法的作用。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16016 2025-11-21 cs.LG cs.AI 79%

CARE: Turning LLMs Into Causal Reasoning Expert

CARE: 将大语言模型转化为因果推理专家

Juncheng Dong, Yiling Liu, Ahmed Aloui, Vahid Tarokh, David Carlson

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 CARE通过监督微调提升LLMs的因果推理能力,使其在因果发现任务中超越传统算法和大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16369 2025-11-21 eess.SP cs.NI 78%

Reasoning Meets Representation: Envisioning Neuro-Symbolic Wireless Foundation Models

推理与表征的结合:展望神经符号无线基础模型

Jaron Fontaine, Mohammad Cheraghinia, John Strassner, Adnan Shahid, Eli De Poorter

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出神经符号无线基础模型,结合神经网络与符号推理,以解决无线通信中的可解释性、鲁棒性和合规性问题,推动6G网络的智能化发展。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI and ML for Next-Generation Wireless Communications and Networking (AI4NextG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16043 2025-11-21 cs.LG 77%

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning

Agent0: 通过工具集成推理从零数据中释放自进化代理

Peng Xia, Kaide Zeng, Jiaqi Liu, Can Qin, Fang Wu, Yiyang Zhou, Caiming Xiong, Huaxiu Yao

机构 * Stanford University(斯坦福大学) Salesforce Research(Salesforce研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Agent0通过多步骤共进化和工具集成,在无需外部数据的情况下自主提升代理性能,显著增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16005 2025-11-21 cs.SE cs.AI 77%

InfCode-C++: Intent-Guided Semantic Retrieval and AST-Structured Search for C++ Issue Resolution

InfCode-C++: 基于意图的语义检索与AST结构化搜索用于C++问题解决

Qingao Dong, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 INFCODE-C++ 是首个针对 C++ 的自主系统,通过结合语义代码意图检索和 AST 结构查询,实现端到端的问题解决,其性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06941 2025-11-21 cs.AI cs.CL cs.LG 75%

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

思维的幻觉:通过问题复杂性的视角理解推理模型的优势与局限

Parshin Shojaee, Iman Mirzadeh, Keivan Alizadeh, Maxwell Horton, Samy Bengio, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过问题复杂性分析,研究揭示大规模推理模型在不同复杂度任务中的表现差异及局限性。

Comments NeurIPS 2025. camera-ready version + additional discussion in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08546 2025-11-21 cs.RO 75%

Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback

通过闭环状态反馈接地LLMs用于机器人任务规划

Vineet Bhat, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出BrainBody-LLM方法,通过闭环反馈机制提升LLMs在机器人任务规划中的鲁棒性,实现在复杂任务中的显著性能提升。

Comments Preprint version. Accepted full paper available here: https://advanced.onlinelibrary.wiley.com/doi/10.1002/adrr.202500072

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16671 2025-11-21 cs.CV cs.AI cs.CL 73%

Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

生成中思考:在视觉生成过程中穿插文本推理

Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Meituan Project(美团项目)

专题命中 推理与问题求解 :SFT(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TwiG框架,通过在视觉生成过程中穿插文本推理,提升生成内容的上下文感知和语义丰富性。

Comments Project Page: https://think-while-gen.github.io Code: https://github.com/ZiyuGuo99/Thinking-while-Generating

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15994 2025-11-21 cs.AI cs.CL 73%

CARE-RAG - Clinical Assessment and Reasoning in RAG

CARE-RAG - 临床评估与推理中的RAG

Deepthi Potluri, Aby Mammen Mathew, Jeffrey B DeWitt, Alexander L. Rasgon, Yide Hao, Junyuan Hong, Ying Ding

机构 * Department of Computer Science(计算机科学系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Behavioral Science and Psychiatry(行为科学与精神病学) Department of Statistics(统计学系) University of Michigan(密歇根大学) School of Information(信息学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CARE-RAG研究了检索增强生成在临床环境中的推理能力,提出评估框架以确保推理的准确性和一致性。

Comments The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13803 2025-11-21 cs.CL 72%

LLMs as Models for Analogical Reasoning

大型语言模型作为类比推理模型

Sam Musker, Alex Duchnowski, Raphaël Millière, Ellie Pavlick

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL;LLM(comments)

AI总结 本文通过设计新的类比推理任务,探讨了大型语言模型在类比推理中的表现,发现其在某些条件下能匹配人类,但对特定变体反应不同,表明LLMs可能在某些领域提供可能的解释,但无法完全替代人类的类比能力。

Comments The title has been changed from Semantic Structure-Mapping in LLM and Human Analogical Reasoning to LLMs as Models for Analogical Reasoning to improve clarity and accuracy

Journal ref Journal of Memory and Language 145 (2025) 104676

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16004 2025-11-21 cs.SE cs.AI 70%

InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution

InfCode: 基于对抗的测试和补丁迭代精炼框架用于可靠的软件问题解决

KeFan Li, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航大学) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 InfCode通过对抗多代理框架实现测试和补丁的迭代精炼,以提高软件问题解决的可靠性,实验表明其在SWE-bench Verified上达到79.4%的性能,创下了新的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 70%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19753 2025-11-21 cs.CL 70%

CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering

CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答

Yike Wu, Yi Huang, Nan Hu, Yuncheng Hua, Guilin Qi, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) China Mobile Research Institute(中国移动研究院) Monash University(墨尔本大学) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16150 2025-11-21 cs.CV 67%

Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval

基于推理的嵌入:利用多模态大语言模型推理提升多模态检索

Chunxu Liu, Jiyuan Yang, Ruopeng Gao, Yuhan Zhu, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出基于推理的嵌入方法,利用多模态大语言模型的推理能力提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14210 2025-11-21 cs.CV cs.AI cs.LG 62%

Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution

Orion:一个多模态感知、高级视觉推理与执行的统一视觉代理

N Dinesh Reddy, Dylan Snyder, Lona Kiragu, Mirajul Mohin, Shahrear Bin Amin, Sudeep Pillai

机构 * VLM Run Research(VLM Run研究)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Orion通过整合视觉推理与工具增强执行,实现了多模态感知、高级视觉推理与执行的统一,提升多步骤视觉智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 57%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16198 2025-11-21 cs.CL cs.DL 57%

SemanticCite: Citation Verification with AI-Powered Full-Text Analysis and Evidence-Based Reasoning

SemanticCite: 借助AI全文本分析和基于证据的推理进行引文验证

Sebastian Haan

机构 * The University of Sydney(悉尼大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 SemanticCite通过AI全文本分析和证据推理,提供高效的引文验证系统,结合多种检索方法和四类分类系统,实现精准的引文准确性验证,并开源数据集和模型以促进研究诚信。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15895 2025-11-21 cs.AI 57%

Decomposing Theory of Mind: How Emotional Processing Mediates ToM Abilities in LLMs

解构理论思维:情绪处理如何调节LLMs的理论思维能力

Ivan Chulo, Ananya Joshi

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究通过对比激活加法引导,发现LLMs的理论思维能力提升由情绪处理而非分析推理所驱动。

Comments Published at ToM4AI workshop@AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15886 2025-11-21 cs.CL 57%

What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning

什么真的重要?检验多语言Co-T推理中的步骤和令牌级归因

Jeremias Ferrao, Ezgi Basar, Khondoker Ittehadul Islam, Mahrokh Hassani

机构 * University of Groningen(格罗宁根大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 本研究通过对比多语言Co-T推理中步骤和令牌级归因方法,揭示了归因分数的偏差及结构化提示对高资源语言准确性的影响,强调了多语言鲁棒性和解释透明性的挑战。

Comments Received the Best Student Project Award at RuG's Advanced-NLP course

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 28 篇

2511.15958 2025-11-21 cs.AI cs.CL 91%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16122 2025-11-21 cs.CL cs.AI 88%

ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models

基于集成学习的提示优化:大型语言模型的提示优化

Qing Zhang, Bing Xu, Xudong Zhang, Yifan Shi, Yang Li, Chen Zhang, Yik Chung Wu, Ngai Wong, Yijie Chen, Hong Dai, Xiansen Chen, Mian Zhang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ELPO通过集成学习方法提升大型语言模型的提示优化效果,实现更准确和稳健的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 88%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08764 2025-11-21 cs.IR cs.CL 87%

Evaluation of the phi-3-mini SLM for identification of texts related to medicine, health, and sports injuries

对phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的评估

Chris Brogly, Saif Rjaibi, Charlotte Liang, Erica Lam, Edward Wang, Adam Levitan, Sarah Paleczny, Michael Cusimano

专题命中 评测与基准 :SLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文评估了phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的表现,发现其在不同过滤条件下与人类评估者评分的相关性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06017 2025-11-21 cs.CL 85%

AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search

AgentSwift: 通过价值引导的分层搜索高效设计LLM代理

Yu Li, Lehui Li, Zhihao Wu, Qingmin Liao, Jianye Hao, Kun Shao, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentSwift通过价值引导的分层搜索高效设计LLM代理,实现8.34%的性能提升。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 85%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15720 2025-11-21 cs.AI 83%

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

利用大语言和视觉-语言模型进行施工工地自动危险检测

Islem Sahraoui

机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。

Comments Master thesis, University of Houton

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 79%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏