arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-21 至 2025-11-21 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2511.16043 2025-11-21 cs.LG 79%

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning

Agent0: 通过工具集成推理从零数据中释放自进化代理

Peng Xia, Kaide Zeng, Jiaqi Liu, Can Qin, Fang Wu, Yiyang Zhou, Caiming Xiong, Huaxiu Yao

机构 * Stanford University(斯坦福大学) Salesforce Research(Salesforce研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 Agent0通过多步骤共进化和工具集成,在无需外部数据的情况下自主提升代理性能,显著增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16077 2025-11-21 cs.CV 78%

VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning

VideoSeg-R1: 通过强化学习进行视频对象分割的推理

Zishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Junxin Li

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 VideoSeg-R1通过引入强化学习,首次实现了视频对象分割的推理任务,采用解耦架构和显式推理链提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15661 2025-11-21 cs.CV cs.AI cs.CL cs.LG 67%

VisPlay: Self-Evolving Vision-Language Models from Images

VisPlay: 从图像中自我进化视觉-语言模型

Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VisPlay通过自我进化强化学习框架,利用未标注图像数据提升视觉-语言模型的推理能力,实现多模态智能的可扩展发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 62%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16283 2025-11-21 cs.AI 57%

MuISQA: Multi-Intent Retrieval-Augmented Generation for Scientific Question Answering

MuISQA: 多意图检索增强生成用于科学问答

Zhiyuan Li, Haisheng Yu, Guangchuan Guo, Nan Zhou, Jiajun Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MuISQA提出一种多意图检索增强生成框架,通过意图感知检索和RRF融合提升科学问答任务的证据覆盖和检索准确性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15752 2025-11-21 cs.AI cs.MA 57%

Build AI Assistants using Large Language Models and Agents to Enhance the Engineering Education of Biomechanics

利用大型语言模型和智能体构建AI助教以增强生物力学工程教育

Hanzhi Yan, Qin Lu, Xianqiao Wang, Xiaoming Zhai, Tianming Liu, He Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用RAG和MAS提升LLM在生物力学教育中的表现,通过双模块框架增强教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 15 篇

2506.06941 2025-11-21 cs.AI cs.CL cs.LG 82%

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

思维的幻觉:通过问题复杂性的视角理解推理模型的优势与局限

Parshin Shojaee, Iman Mirzadeh, Keivan Alizadeh, Maxwell Horton, Samy Bengio, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过问题复杂性分析,研究揭示大规模推理模型在不同复杂度任务中的表现差异及局限性。

Comments NeurIPS 2025. camera-ready version + additional discussion in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15994 2025-11-21 cs.AI cs.CL 81%

CARE-RAG - Clinical Assessment and Reasoning in RAG

CARE-RAG - 临床评估与推理中的RAG

Deepthi Potluri, Aby Mammen Mathew, Jeffrey B DeWitt, Alexander L. Rasgon, Yide Hao, Junyuan Hong, Ying Ding

机构 * Department of Computer Science(计算机科学系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Behavioral Science and Psychiatry(行为科学与精神病学) Department of Statistics(统计学系) University of Michigan(密歇根大学) School of Information(信息学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CARE-RAG研究了检索增强生成在临床环境中的推理能力,提出评估框架以确保推理的准确性和一致性。

Comments The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 81%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16198 2025-11-21 cs.CL cs.DL 79%

SemanticCite: Citation Verification with AI-Powered Full-Text Analysis and Evidence-Based Reasoning

SemanticCite: 借助AI全文本分析和基于证据的推理进行引文验证

Sebastian Haan

机构 * The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SemanticCite通过AI全文本分析和证据推理,提供高效的引文验证系统,结合多种检索方法和四类分类系统,实现精准的引文准确性验证,并开源数据集和模型以促进研究诚信。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15717 2025-11-21 cs.AI cs.CV cs.MA 79%

How Modality Shapes Perception and Reasoning: A Study of Error Propagation in ARC-AGI

模态如何塑造感知与推理:ARC-AGI中误差传播的研究

Bo Wen, Chen Wang, Erhan Bilal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过对比文本和图像模态,发现结构化文本能精确获取稀疏特征,图像对分辨率敏感,结合两者可提升执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14366 2025-11-21 cs.CL 79%

ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning

ATLAS:面向前沿科学推理的高难度、多学科基准

Hongwei Liu, Junnan Liu, Shudong Liu, Haodong Duan, Yuqiang Li, Mao Su, Xiaohong Liu, Guangtao Zhai, Xinyu Fang, Qianhong Ma, Taolin Zhang, Zihan Ma, Yufeng Zhao, Peiheng Zhou, Linchen Xiao, Wenlong Zhang, Shijie Zhou, Xingjian Ma, Siqi Sun, Jiaye Ge, Meng Li, Yuhong Liu, Jianxin Dong, Jiaying Li, Hui Wu, Hanwen Liang, Jintai Lin, Yanting Wang, Jie Dong, Tong Zhu, Tianfan Fu, Conghui He, Qi Zhang, Songyang Zhang, Lei Bai, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ATLAS是一个由领域专家开发的高难度、跨学科科学推理基准,通过原创问题和严格质量控制,评估模型在多领域知识整合和复杂推理能力上的表现。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16150 2025-11-21 cs.CV 78%

Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval

基于推理的嵌入:利用多模态大语言模型推理提升多模态检索

Chunxu Liu, Jiyuan Yang, Ruopeng Gao, Yuhan Zhu, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于推理的嵌入方法,利用多模态大语言模型的推理能力提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16356 2025-11-21 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

CaKE: Circuit-aware Editing Enables Generalizable Knowledge Learners

CaKE:电路感知编辑实现通用知识学习

Yunzhi Yao, Jizhan Fang, Jia-Chen Gu, Ningyu Zhang, Shumin Deng, Huajun Chen, Nanyun Peng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CaKE通过电路感知编辑提升LLMs对更新知识的多跳推理能力,实现20%的准确率提升并降低内存消耗

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16267 2025-11-21 cs.CL cs.AI 62%

From Confidence to Collapse in LLM Factual Robustness

从信心到崩溃:大语言模型事实鲁棒性的研究

Alina Fastowski, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种通过分析令牌分布熵和温度缩放敏感性来评估大语言模型事实鲁棒性的新方法,并通过实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16438 2025-11-21 cs.CL cs.IR 57%

ESGBench: A Benchmark for Explainable ESG Question Answering in Corporate Sustainability Reports

ESGBench:用于企业可持续发展报告中可解释ESG问答的基准

Sherine George, Nithish Saji

机构 * BNY FedEx

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ESGBench是一个用于评估企业可持续发展报告中可解释ESG问答系统性能的基准,通过领域相关问题和人工整理答案来评估模型推理能力,揭示了事实一致性、可追溯性和领域对齐等关键挑战。

Comments Workshop paper accepted at AI4DF 2025 (part of ACM ICAIF 2025). 3 pages including tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16231 2025-11-21 cs.LG 57%

Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective

Pass@k指标用于RLVR:探索的诊断工具,而非目标

Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文分析了pass@k指标作为强化学习中探索诊断工具的优劣,指出其作为优化目标的局限性,并提出鼓励高效探索的机制作为替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14813 2025-11-21 cs.LG 57%

DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models

DEVAL:一个用于评估和提升大语言模型推导能力的框架

Yifan Li, Qin Li, Min Zhang, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 DEVAL框架通过评估和提升大语言模型的推导能力,提出了一种新的提示工程方法DP,显著提高了模型在问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 57%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20470 2025-11-21 cs.CV 50%

Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence

Conan:基于多尺度视觉证据的逐步学习以像侦探一样推理

Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 推理评测 :reasoning(abstract)

AI总结 Conan通过多阶段渐进冷启动策略和AIR RLVR框架,实现证据基础的多步视频推理,超越基线模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 9 篇

2511.16016 2025-11-21 cs.LG cs.AI 81%

CARE: Turning LLMs Into Causal Reasoning Expert

CARE: 将大语言模型转化为因果推理专家

Juncheng Dong, Yiling Liu, Ahmed Aloui, Vahid Tarokh, David Carlson

机构 * Duke University(杜克大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CARE通过监督微调提升LLMs的因果推理能力,使其在因果发现任务中超越传统算法和大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16664 2025-11-21 cs.CL 79%

Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs

Nemotron弹性:迈向高效多任务推理LLM

Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan, Ruisi Cai, Marcin Chochowski, Ameya Sunil Mahabaleshwarkar, Yoshi Suhara, Oluwatobi Olabiyi, Daniel Korzekwa, Mostofa Patwary, Mohammad Shoeybi, Jan Kautz, Bryan Catanzaro, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Nemotron弹性通过嵌套子模型和多预算优化,实现高效多任务推理LLM,显著降低训练成本并提升部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV 78%

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16402 2025-11-21 cs.AI cs.DB 57%

Trustworthy AI in the Agentic Lakehouse: from Concurrency to Governance

可信AI在代理湖仓中的实现:从并发到治理

Jacopo Tagliabue, Federico Bianchi, Ciro Greco

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Bauplan设计,通过事务机制实现湖仓中的数据和计算隔离,解决代理工作流的可信性问题,并提供自修复管道的实现。

Comments AAAI26, pre-print of paper accepted at the Trustworthy Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16229 2025-11-21 cs.CR cs.AI 57%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16004 2025-11-21 cs.SE cs.AI 57%

InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution

InfCode: 基于对抗的测试和补丁迭代精炼框架用于可靠的软件问题解决

KeFan Li, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航大学) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 InfCode通过对抗多代理框架实现测试和补丁的迭代精炼,以提高软件问题解决的可靠性,实验表明其在SWE-bench Verified上达到79.4%的性能,创下了新的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15895 2025-11-21 cs.AI 57%

Decomposing Theory of Mind: How Emotional Processing Mediates ToM Abilities in LLMs

解构理论思维:情绪处理如何调节LLMs的理论思维能力

Ivan Chulo, Ananya Joshi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过对比激活加法引导,发现LLMs的理论思维能力提升由情绪处理而非分析推理所驱动。

Comments Published at ToM4AI workshop@AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15712 2025-11-21 cs.CR cs.AI cs.DC 57%

Secure Autonomous Agent Payments: Verifying Authenticity and Intent in a Trustless Environment

安全的自主代理支付:在无信任环境中验证真实性和意图

Vivek Acharya

机构 * Vivek Acharya(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于区块链的框架,通过密码学认证和零知识证明,实现自主代理支付中的意图验证和身份认证,确保交易安全性和可追溯性。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏