arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-27 至 2026-02-27 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2602.22583 2026-02-27 cs.AI cs.CL 81%

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

数学推理中的策略可执行性:利用人类-模型差异实现有效指导

Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSR框架,通过显式建模策略可执行性,利用人类-模型差异提升数学推理的指导效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 73%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22296 2026-02-27 cs.LG cs.AI 62%

UpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMs

UpSkill: 为大语言模型的结构化响应多样性进行互信息技能学习

Devan Shah, Owen Yang, Daniel Yang, Chongyi Zheng, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 UpSkill通过互信息技能学习提升大语言模型在结构化响应多样性中的表现,提高pass@k准确性而不影响pass@1。

Comments First two authors equal contribution. 29 pages total (11 pages main text), 10 figures, 10 tables. Project website: https://dshah.io/upskill/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21306 2026-02-27 cs.CL 57%

PARL: Prompt-based Agents for Reinforcement Learning

PARL:基于提示的强化学习智能体

Yarik Menchaca Resendiz, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 62%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00168 2026-02-27 cs.FL cs.LO 50%

Generalised Möbius Categories and Convolution Kleene Algebras

广义莫比乌斯范畴与卷积克里勒代数

James Cranch, Georg Struth, Jana Wagemaker

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出广义莫比乌斯范畴与经典星定义的结合,用于构建卷积克里勒代数,应用于程序验证和高维重写中的代数推理。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2602.22923 2026-02-27 cs.CV cs.RO 78%

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体

Runwei Guan, Shaofeng Liang, Ningwei Ouyang, Weichen Fei, Shanliang Yao, Wei Dai, Chenhao Ge, Penglei Sun, Xiaohui Zhu, Tao Huang, Ryan Wen Liu, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) School of Engineering, Stanford University(斯坦福大学工程学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10195 2026-02-27 cs.LG cs.AI hep-th 73%

Versor: A Geometric Sequence Architecture

Versor:一种几何序列架构

Truong Minh Huy, Edward Hirst

机构 * Trương Minh Huy Independent Researcher(Trương Minh Huy 独立研究者) Instituto de Matemática, Estatística e Computação Científica University of Campinas (UNICAMP), Brazil(巴西坎皮纳斯大学数学、统计与科学计算研究所)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Versor通过共形几何代数实现结构泛化和高效任务处理,优于Transformer等基线模型。

Comments 19+28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16661 2026-02-27 cs.CL cs.AI cs.LG cs.LO 67%

RLSF: Fine-tuning LLMs via Symbolic Feedback

通过符号反馈进行LLM微调:RLSF

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLSF通过符号反馈微调LLM,利用符号推理工具提供精细反馈,提升领域特定任务的性能,使小模型超越大模型。

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, Vol. 413, pp. 1687-1694, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22554 2026-02-27 cs.LG 57%

Multilingual Safety Alignment Via Sparse Weight Editing

多语言安全对齐 via 稀疏权重编辑

Jiaming Liang, Zhaoxin Wang, Handing Wang

机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23005 2026-02-27 cs.SE 50%

Managing Uncertainty in LLM-based Multi-Agent System Operation

在基于大语言模型的多智能体系统操作中管理不确定性

Man Zhang, Tao Yue, Yihua He

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种基于生命周期的不确定性管理框架,用于提升基于大语言模型的多智能体系统在安全关键领域的可靠性和可诊断性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 14 篇

2602.22624 2026-02-27 cs.CV cs.AI 90%

Instruction-based Image Editing with Planning, Reasoning, and Generation

基于指令的图像编辑与规划、推理和生成

Liya Ji, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。

Comments 10 pages, 7 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21670 2026-02-27 cs.RO cs.AI cs.MA 79%

Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning

分层基于大语言模型的多智能体框架与提示优化用于多机器人任务规划

Tomoya Kawabe, Rin Takano

机构 * Data Science Laboratories, NEC Corporation(日本电气株式会社数据科学实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种分层多智能体框架,结合提示优化提升多机器人任务规划的准确性和效率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23220 2026-02-27 cs.DC 78%

STELLAR: Storage Tuning Engine Leveraging LLM Autonomous Reasoning for High Performance Parallel File Systems

STELLAR:利用LLM自主推理的存储调优引擎用于高性能并行文件系统

Chris Egersdoerfer, Philip Carns, Shane Snyder, Robert Ross, Dong Dai

专题命中 规划推理 :reasoning(title,abstract)

AI总结 STELLAR利用LLM自主推理实现高性能并行文件系统的存储调优,通过多代理设计和检索增强生成技术提升调优效率与准确性。

Comments Published in the Proceedings of the 2025 International Conference for High Performance Computing, Networking, Storage, and Analysis (SC25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22225 2026-02-27 cs.IR cs.AI cs.CL cs.LG 78%

SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG

SmartChunk检索:具有规划的查询感知分块压缩以实现高效的文档RAG

Xuechen Zhang, Koustava Goswami, Samet Oymak, Jiasi Chen, Nedim Lipka

机构 * University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 规划推理 :planning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 SmartChunk通过查询自适应框架和强化学习方案提升长文档问答效率与准确性。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22576 2026-02-27 cs.CL cs.IR cs.LG 62%

Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training

Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练

Tianle Xia, Ming Xu, Lingxiang Hu, Yiding Sun, Wenwei Li, Linfang Shang, Liqun Liu, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22297 2026-02-27 cs.LG cs.AI 62%

Learning Rewards, Not Labels: Adversarial Inverse Reinforcement Learning for Machinery Fault Detection

学习奖励,而非标签:面向机械故障检测的对抗性逆强化学习

Dhiraj Neupane, Richard Dazeley, Mohamed Reda Bouadjenek, Sunil Aryal

机构 * Deakin University(德肯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出对抗性逆强化学习方法,用于机械故障检测,通过学习奖励动态实现无需标签的故障识别。

Comments This article is accepted to be published in AAMAS2026. The doi is listed below but the production is on the way as of now (26/02/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22280 2026-02-27 cs.LG cs.AI 62%

Integrating Machine Learning Ensembles and Large Language Models for Heart Disease Prediction Using Voting Fusion

将机器学习集成与大型语言模型结合用于心脏病预测的投票融合

Md. Tahsin Amin, Tanim Ahmmod, Zannatul Ferdus, Talukder Naemul Hasan Naem, Ehsanul Ferdous, Arpita Bhattacharjee, Ishmam Ahmed Solaiman, Nahiyan Bin Noor

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过结合机器学习集成与大型语言模型的投票融合方法,提高了心脏病预测的准确性与可靠性。

Comments 7 pages, 8 figures, (Accepted at a peer-reviewed conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23193 2026-02-27 cs.AI 57%

ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering

基于大语言模型的自主代理的事件溯源:ESAA

Elzo Brito dos Santos Filho

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ESAA架构通过事件溯源技术提升自主代理在软件工程中的状态管理和任务执行能力,支持多代理并发调度和异构LLM的协同工作。

Comments 13 pages, 1 figure, 4 tables. Includes 5 technical appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22963 2026-02-27 cs.AI 57%

FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning

FactGuard:通过强化学习进行代理视频虚假信息检测

Zehao Li, Hongwei Yu, Hao Jiang, Qiang Sheng, Yilong Xu, Baolong Bi, Yang Li, Zhenlong Yuan, Yujun Cai, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) University of Science and Technology Beijing(北京科技大学) The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19128 2026-02-27 cs.AI 57%

K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

K-Search: 通过共进化内在世界模型生成LLM内核

Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15339 2026-02-27 cs.CL 57%

DeVisE: Behavioral Testing of Medical Large Language Models

DeVisE:医疗大语言模型的行为测试

Camila Zurdo Tagliabue, Heloisa Oss Boll, Aykut Erdem, Erkut Erdem, Iacer Calixto

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 DeVisE通过受控反事实测试评估医疗大语言模型的行为,揭示其在临床决策中的表现差异。

Comments Camera-ready version published at Findings of the EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22260 2026-02-27 cs.LG cs.NE 57%

Code World Models for Parameter Control in Evolutionary Algorithms

用于进化算法参数控制的代码世界模型

Camilo Chacón Sartori, Guillem Rodríguez Corominas

机构 * ICN2 -- Catalan Institute of Nanoscience Nanotechnology, Barcelona, Spain Artificial Intelligence Research Institute (IIIA-CSIC), Barcelona, Spain Universitat Polit\` e cnica de Catalunya (UPC), Barcelona, Spain

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出利用代码世界模型进行进化算法参数控制,通过模拟器实现高效突变强度选择,在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22226 2026-02-27 cs.IR cs.LG 57%

SEGB: Self-Evolved Generative Bidding with Local Autoregressive Diffusion

SEGB: 自适应生成性竞价与局部自回归扩散

Yulong Gao, Wan Jiang, Mingzhe Cao, Xuepu Wang, Zeyu Pan, Haonan Yang, Ye Liu, Xin Yang

机构 * Beijing China(中国北京)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 SEGB通过自适应生成性竞价与局部自回归扩散,实现动态市场中的高效竞价策略,显著提升广告效果与商业价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23363 2026-02-27 cs.CV 50%

MediX-R1: Open Ended Medical Reinforcement Learning

MediX-R1:开放端医疗强化学习

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学) Jubilee Mission Medical College(jubilee mission 医学院) Research Institute(研究院) JJM Medical College(JJM 医学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 MediX-R1通过综合奖励信号和LLM评估,实现医疗多模态模型的开放端强化学习,提升临床推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2504.01445 2026-02-27 cs.AI 79%

Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning

Compositional-ARC: 评估抽象空间推理中的系统泛化能力

Philipp Mondorf, Shijia Zhou, Monica Riedler, Barbara Plank

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过元学习方法在抽象空间推理领域实现系统泛化,展示了一个小型模型在组合变换任务上的优越表现。

Comments ICLR 2026, 37 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 50%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 8 篇

2602.22751 2026-02-27 cs.AI 83%

Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning

知晓所知:用于可验证强化学习推理的元认知熵校准

Qiannian Zhao, Chen Yang, Jinhao Jing, Yunke Zhang, Xuhui Ren, Lu Yu, Shijie Zhang, Hongzhi Yin

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 EGPO通过整合内在不确定性提升强化学习推理性能,实现稳定且不确定性的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22871 2026-02-27 cs.CL cs.AI 73%

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

通过奖励引导缝合实现扩散语言模型的测试时扩展

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

机构 * Huawei London Research Center(华为伦敦研究中心) MVP Lab(MVP实验室)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 70%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏