arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-16 至 2026-02-16 共收录 65 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2508.05004 2026-02-16 cs.LG cs.AI cs.CL 82%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16543 2026-02-16 cs.AI 57%

Mathematics and Machine Creativity: A Survey on Bridging Mathematics with AI

数学与人工智能:连接数学与AI的综述

Shizhe Liang, Wei Zhang, Tianyang Zhong, Tianming Liu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了AI在数学研究中的应用,探讨了AI通过提供灵活框架和归纳推理能力,如何支持数学研究,并促进数学与AI的跨学科理解。

Comments This article is withdrawn due to internal authorship and supervisory considerations that require clarification before the work can proceed in its current form. After further review, I believe it is appropriate to pause and formally resolve these matters to ensure full compliance with institutional and collaborative research policies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12674 2026-02-16 cs.CL 57%

$\mathcal{X}$-KD: General Experiential Knowledge Distillation for Large Language Models

$\mathcal{X}$-KD:用于大型语言模型的通用经验知识蒸馏

Yuang Cai, Yuyu Yuan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出$\mathcal{X}$-KD,通过模拟教师的原始学习环境,提升大型语言模型的蒸馏效果,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2602.12630 2026-02-16 cs.CR cs.AI 57%

TensorCommitments: A Lightweight Verifiable Inference for Language Models

张量承诺:一种轻量级可验证的语言模型推断

Oguzhan Baser, Elahe Sadeghi, Eric Wang, David Ribeiro Alves, Sam Kazemian, Hong Kang, Sandeep P. Chinchali, Sriram Vishwanath

机构 * The University of Texas at Austin(德克萨斯大学) Georgia Institute of Technology(佐治亚理工学院) Theseus AI Labs(Theseus AI实验室) McGill University(麦吉尔大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 张量承诺通过轻量级的证明方案实现可验证的语言模型推断,提高对抗性攻击的鲁棒性。

Comments 23 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12540 2026-02-16 cs.CV cs.RO 50%

Self-Supervised JEPA-based World Models for LiDAR Occupancy Completion and Forecasting

基于JEPA的世界模型的自监督LiDAR占用完成与预测

Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出AD-LiST-JEPA,一种基于JEPA框架的自监督世界模型,用于自动驾驶中通过LiDAR数据预测未来时空演变,并在占用完成与预测任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2602.12526 2026-02-16 cs.LG cs.CL 88%

Constraint-Rectified Training for Efficient Chain-of-Thought

约束校正训练用于高效的推理链

Qinhang Wu, Sen Lin, Ming Zhang, Yingbin Liang, Ness B. Shroff

机构 * The Ohio State University(俄亥俄州立大学) University of Houston(休斯顿大学) Google(谷歌)

专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);self-correction(abstract)

AI总结 CRT通过约束校正训练提升推理效率,减少冗余并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12889 2026-02-16 cs.CL 79%

BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models

BaziQA-Benchmark:评估大语言模型中的符号性和时间组合推理

Jiangxi Chen, Qian Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BaziQA-Benchmark通过结构化推理协议评估大语言模型在符号性和时间组合推理中的表现,揭示其在时间难度和推理顺序上的敏感性及系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12669 2026-02-16 cs.PF 67%

Characterize LSM-tree Compaction Performance via On-Device LLM Inference

通过设备端LLM推理特性化LSM树压缩性能

Jiabiao Ding, Yina Lv, Qiao Li, Zhirong Shen, Chun Jason Xue

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文通过设备端LLM推理特性化LSM树压缩性能,评估不同规模LLM在调优与延迟间的权衡,并针对RocksDB v8.8.1优化键压缩参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12569 2026-02-16 cs.HC 50%

Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes

可编辑的可解释性AI:通过可编辑的可解释属性实现双向人机对齐

Haoyang Chen, Jingwen Bai, Fang Tian, Brian Y Lim

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出可编辑的XAI方法CoExplain,通过允许用户编写规则来提升人机对齐,实验表明其在理解和控制方面优于传统只读XAI。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 15 篇

2602.12846 2026-02-16 cs.LG cs.AI 84%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12322 2026-02-16 cs.RO cs.AI 83%

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

ForeAct: 通过高效的视觉前瞻性规划控制您的VLA

Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Caltech(加州理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16198 2026-02-16 cs.CL cs.AI cs.SE 81%

RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation

RPG:一个用于统一和可扩展代码库生成的仓库规划图

Jane Luo, Xin Zhang, Steven Liu, Jie Wu, Jianfeng Liu, Yiming Huang, Yangyu Huang, Chengyu Yin, Ying Xin, Yuefeng Zhan, Hao Sun, Qi Chen, Scarlett Li, Mao Yang

机构 * Microsoft(微软公司) Tsinghua University(清华大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing Jiaotong University(北京交通大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 RPG通过统一的图结构提升代码库生成效率,ZeroRepo在真实项目基准上实现显著更高的代码生成量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12574 2026-02-16 cs.DB cs.AI 79%

Monte Carlo Tree Search with Reasoning Path Refinement for Small Language Models in Conversational Text-to-NoSQL

具有推理路径细化的蒙特卡洛树搜索用于对话文本到NoSQL

Xubang Xiong, Raymond Chi-Wing Wong, Yuanfeng Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Stage-MCTS框架,通过蒙特卡洛树搜索和推理路径细化,提升小型语言模型在对话文本到NoSQL任务中的查询生成能力,实验显示其EVM准确性提升达7.93%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12662 2026-02-16 cs.AI cs.CL 73%

Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents

快速思考与缓慢思考:面向LLM代理的步骤级认知深度适应

Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文恩)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CogRouter通过动态调整认知深度提升LLM代理在多轮决策任务中的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 73%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13685 2026-02-16 eess.IV 71%

Toward Agentic AI: Task-Oriented Communication for Hierarchical Planning of Long-Horizon Tasks

迈向代理AI:面向长周期任务的分层规划任务导向通信

Sin-Yu Huang, Lele Wang, Vincent W. S. Wong

专题命中 规划推理 :planning(title)

AI总结 本文提出HiTOC框架,通过分层任务导向通信提升长周期任务的规划效率,实现更高效的代理AI系统。

Comments Accepted by IEEE International Conference on Communications (ICC), Glasgow, UK, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20577 2026-02-16 cs.RO 67%

MeCo: Enhancing LLM-Empowered Multi-Robot Collaboration via Similar Task Memoization

MeCo:通过相似任务记忆增强基于大语言模型的多机器人协作

Baiqing Wang, Helei Cui, Bo Zhang, Xiaolong Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 MeCo通过引入相似任务记忆化机制,有效提升多机器人协作的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12520 2026-02-16 cs.LG cs.MA 57%

Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings

基于联合状态-动作学习嵌入的多智能体模型驱动强化学习

Zhizun Wang, David Meger

机构 * McGill University(麦吉尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 57%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16348 2026-02-16 cs.CL 57%

Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization

具身智能体与个性化:通过记忆利用的视角探讨挑战与解决方案

Taeyoon Kwon, Dongwook Choi, Hyojun Kim, Sunghwan Kim, Seungjun Moon, Beong-woo Kwak, Kuan-Hao Huang, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出MEMENTO框架,通过分析记忆利用中的挑战,设计了基于层次知识图谱的用户档案记忆模块,提升智能体在个性化任务中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12942 2026-02-16 eess.SP 50%

HoRAMA: Holistic Reconstruction with Automated Material Assignment for Ray Tracing using NYURay

基于NYURay的Holistic Reconstruction with Automated Material Assignment用于射线追踪的全面重建

Mingjun Ying, Guanyue Qian, Xinquan Wang, Peijie Ma, Dipankar Shakya, Theodore S. Rappaport

专题命中 规划推理 :planning(abstract)

AI总结 HoRAMA通过结合MASt3R-SLAM和视觉语言模型实现快速生成RT兼容的3D模型,提升无线传播预测精度并缩短重建时间。

Comments 7 pages, 4 figures, 2 tables, accepted by 2026 IEEE International Conference on Communications (ICC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01239 2026-02-16 eess.IV cs.CV 50%

Can Foundation Models Really Segment Tumors? A Benchmarking Odyssey in Lung CT Imaging

基础模型真的能分割肿瘤吗?在肺部CT成像中的基准测试之旅

Elena Mulero Ayllón, Massimiliano Mantegna, Linlin Shen, Paolo Soda, Valerio Guarrasi, Matteo Tortora

机构 * College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa(海军、电气、电子与电信工程部门,热那亚大学)

专题命中 规划推理 :planning(abstract)

AI总结 本研究评估了基础模型在肺部CT肿瘤分割中的性能,发现MedSAM~2在精度和效率上优于传统模型,展示了其在临床应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12563 2026-02-16 cs.CV 50%

The Constant Eye: Benchmarking and Bridging Appearance Robustness in Autonomous Driving

恒定的眼睛:自动驾驶中外观鲁棒性的基准测试与弥合

Jiabao Wang, Hongyu Zhou, Yuanbo Yang, Jiahao Shao, Yiyi Liao

专题命中 规划推理 :planning(abstract)

AI总结 本文提出navdream基准测试,通过生成像素对齐的风格迁移,评估自动驾驶算法在极端天气等外观变化下的鲁棒性,并提出通用感知接口实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21370 2026-02-16 cs.RO cs.CV 50%

Language-in-the-Loop Culvert Inspection on the Erie Canal

Erie运河的循环检测

Yash Turkar, Yashom Dighe, Karthik Dantu

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 规划推理 :planning(abstract)

AI总结 VISION通过结合视觉-语言模型和受限视角规划,实现Erie运河涵洞的自主检测,生成高分辨率图像并提升专家评估一致性。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 5 篇

2602.12395 2026-02-16 cs.CV cs.AI 79%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 70%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13148 2026-02-16 cs.SD 67%

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

大音频语言模型能理解音频吗?LALMs的语音、场景和事件理解基准

Han Yin, Jung-Woo Choi

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SSEU-Bench,首个考虑语音与非语音音频能量差异的音频理解基准,通过链式思维提升LALMs在联合理解任务中的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13041 2026-02-16 cs.CV 50%

Implicit-Scale 3D Reconstruction for Multi-Food Volume Estimation from Monocular Images

隐式尺度多食物体积估计的单目图像三维重建

Yuhao Chen, Gautham Vinod, Siddeshwar Raghavan, Talha Ibn Mahmud, Bruce Coburn, Jinge Ma, Fengqing Zhu, Jiangpeng He

机构 * University of Waterloo(滑铁卢大学) Purdue University(普渡大学) Indiana University(印第安纳大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出隐式尺度三维重建方法,用于单目图像中多食物体积估计,通过基准数据集验证了基于几何的重建方法在准确性和鲁棒性上的优势。

Comments Paper accepted to 2026 IEEE Southwest Symposium on Image Analysis and Interpretation. The dataset can be downloaded at: https://www.kaggle.com/competitions/3d-reconstruction-from-monocular-multi-food-images/data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14978 2026-02-16 cs.RO 50%

PA-MPPI: Perception-Aware Model Predictive Path Integral Control for Quadrotor Navigation in Unknown Environments

PA-MPPI:感知-aware的模型预测路径积分控制用于未知环境中的四旋翼导航

Yifan Zhai, Rudolf Reiter, Davide Scaramuzza

机构 * University of Zurich(苏黎世大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 PA-MPPI通过结合感知信息,提升了四旋翼在未知环境中的导航能力,能够有效探索未知区域并规划替代路径。

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 1 篇

2602.13035 2026-02-16 cs.LG cs.AI cs.CL 67%

Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL

向内看,向外探:通过分层强化学习从LLM内部状态学习温度策略

Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Introspective LLM通过分层强化学习从LLM内部状态学习温度策略,提升数学推理任务中的探索效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏