arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2602.04925 2026-02-06 cs.LG cs.AI cs.CL 87%

Internalizing LLM Reasoning via Discovery and Replay of Latent Actions

将LLM推理内化:通过发现和重播潜在动作

Zhenning Shi, Yijia Zhu, Junhan Shi, Xun Zhang, Lei Wang, Congcong Miao

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Fuzhou University(福州大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06039 2026-02-06 cs.AI 79%

DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching

DyTopo:通过语义匹配实现多智能体推理的动态拓扑路由

Yuxing Lu, Yucheng Hu, Xukai Zhao, Jiuxin Cao

机构 * Peking University, Beijing, China(北京大学) Georgia Institute of Technology, Atlanta, United States(佐治亚理工学院) Southeast University, Location, Country(东南大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 DyTopo通过语义匹配实现多智能体推理的动态拓扑路由,提升多轮推理性能并提供可解释的协调轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04919 2026-02-06 cs.LG 79%

Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog

逐步压缩大型语言模型以像沸 frog 一样进行推理

Yiran Zhao, Shengyang Zhou, Zijian Wu, Tongyan Hu, Yuhui Xu, Rengan Dou, Kenji Kawaguchi, Shafiq Joty, Junnan Li, Michael Qizhe Shieh

机构 * Salesforce AI Research(Salesforce AI研究部) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05890 2026-02-06 cs.LG cs.CL 73%

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05933 2026-02-06 cs.LG 70%

Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练

Zhenghao Xu, Qin Lu, Changlong Yu, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03531 2026-02-06 cs.CL cs.AI cs.LG 67%

Real-Time Detection of Hallucinated Entities in Long-Form Generation

长文本生成中hallucinated实体的实时检测

Oscar Obeso, Andy Arditi, Javier Ferrando, Joshua Freeman, Cameron Holmes, Neel Nanda

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03493 2026-02-06 cs.LG cs.AI 62%

On Entropy Control in LLM-RL Algorithms

在LLM-RL算法中的熵控制

Han Shen

机构 * Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEnt方法,通过改进的熵控制策略提升LLM-RL算法在数学推理任务中的性能。

Comments Updated with ICLR 2026 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00166 2026-02-06 cs.LG cs.AI 62%

Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints

带有预算约束的本地语言模型与云卸载决策的联合持续学习

Evan Chen, Wenzhi Fang, Shiqiang Wang, Christopher Brinton

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University, West Lafayette, IN(电子与计算机工程学院,普渡大学) Department of Computer Science, University of Exeter, UK(计算机科学系,埃克塞特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DA-GRPO方法,通过联合学习本地语言模型和云卸载决策,有效解决持续学习中的预算约束问题,提升任务准确性并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 57%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2602.05059 2026-02-06 cs.AI 57%

Evaluating Large Language Models on Solved and Unsolved Problems in Graph Theory: Implications for Computing Education

在图论中解决和未解决的问题上评估大语言模型:对计算教育的启示

Adithya Kulkarni, Mohna Chakraborty, Jay Bagga

机构 * Department of Computer Science(计算机科学系) Ball State University(巴尔的摩州立大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) Jio Institute(乔研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在图论已解决和未解决问题上的表现,发现其在已有知识探索上有效,但在需要创新数学洞察的任务中存在局限,对计算教育有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2505.17406 2026-02-06 cs.AI 85%

Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning

鲁棒答案,脆弱逻辑:在LLM推理中探究解耦假说

Enyi Jiang, Changming Xu, Nischay Singh, Tian Qiu, Gagandeep Singh

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究揭示LLM在面对微小输入扰动时,仍能保持正确答案但推理过程不稳定,提出MATCHA框架以探测解耦假说,发现多步骤和常识任务更易受此影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 85%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);logical reasoning(abstract)

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21051 2026-02-06 cs.CL cs.AI cs.CY 81%

Language Models and Logic Programs for Trustworthy Tax Reasoning

语言模型与逻辑程序用于可信的税务推理

William Jurayj, Nils Holzenberger, Benjamin Van Durme

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合语言模型与符号求解器的方法,用于提升税务推理的准确性与经济可行性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04926 2026-02-06 cs.DB cs.CL cs.LG 81%

Pruning Minimal Reasoning Graphs for Efficient Retrieval-Augmented Generation

对检索增强生成进行最小推理图剪枝以提高效率

Ning Wang, Kuanyan Zhu, Daniel Yuehwoon Yee, Yitang Gao, Shiying Huang, Zirun Xu, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 AutoPrunedRetriever通过最小推理图剪枝提升检索增强生成效率,实现更高效的知识密集型任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05758 2026-02-06 cs.CL 79%

LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards

LongR: 通过密集效用奖励的强化学习解锁长上下文推理

Bowen Ping, Zijun Chen, Yiyao Yu, Tingfeng Hui, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 LongR通过整合动态'思考与阅读'机制和上下文密度奖励,提升长上下文推理性能,在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22120 2026-02-06 cs.CV 78%

See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning

看得少,看得对:双向感知塑造用于多模态推理

Shuoshuo Zhang, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Yujiu Yang, Rui Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出BiPS,通过双向感知塑造提升多模态推理性能,有效增强细粒度视觉依赖并提升跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05306 2026-02-06 math.OC 50%

Inverse Optimization Without Inverse Optimization: Direct Solution Prediction with Transformer Models

无需逆向优化:基于Transformer模型的直接解预测

Macarena Navarro, Willem-Jan van Hoeve, Karan Singh

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于Transformer模型的直接解预测方法,用于解决具有未知组件的组合优化问题,通过约束推理模块整合已知约束,生成结构相似且满足约束的解,展现出在复杂问题中优于LSTM和逆向优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 20 篇

2601.21826 2026-02-06 cs.CL 88%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05075 2026-02-06 cs.AI cs.LG cs.RO physics.space-ph 81%

Optimizing Mission Planning for Multi-Debris Rendezvous Using Reinforcement Learning with Refueling and Adaptive Collision Avoidance

利用强化学习优化多碎片对接任务的使命规划

Agni Bandyopadhyay, Gunther Waxenegger-Wilfing

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于强化学习的框架,用于优化多碎片清除任务的使命规划,通过自适应碰撞避让和高效任务规划提高任务效率和安全性。

Comments Accpeted at Conference: 15th IAA Symposium on Small Satellites for Earth System Observation At: Berlin

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05385 2026-02-06 cs.CL 79%

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) Tianjin University(天津大学) Zhongshan University(中山大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments 25 pages, 16 figures, 8 tables. Hongyin Zan is corresponding author, Jiafan Lu is first co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05279 2026-02-06 cs.AI cs.CR 79%

Hallucination-Resistant Security Planning with a Large Language Model

具备抗幻觉能力的安全规划与大语言模型

Kim Hammar, Tansu Alpcan, Emil Lupu

机构 * The University of Melbourne(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种抗幻觉的安全规划框架,通过迭代循环和上下文学习优化LLM决策,减少恢复时间30%。

Comments Accepted to IEEE/IFIP Network Operations and Management Symposium 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16928 2026-02-06 cs.CR 78%

From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models

从沙子到豪宅:迈向自动化网络攻击仿真的方法:经典规划与大语言模型

Lingzhi Wang, Zhenyuan Li, Yi Jiang, Zhengkai Wang, Xiangmin Shen, Wei Ruan, Yan Chen

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出Aurora系统,结合经典规划与大语言模型,实现自动化网络攻击仿真,生成大规模数据集并验证其在入侵检测系统中的有效性。

Comments This is the author-accepted version of a paper accepted at the Applied Cryptography and Network Security (ACNS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24073 2026-02-06 cs.HC 78%

"Having Lunch Now": Understanding How Users Engage with a Proactive Agent for Daily Planning and Self-Reflection

现在午餐时间

Adnan Abbas, Caleb Wohn, Arnav Jagtap, Eugenia H Rho, Young-Ho Kim, Sang Won Lee

专题命中 规划推理 :planning(title,abstract)

AI总结 本文研究用户与主动代理的互动,探讨其在日常规划和自我反思中的作用,发现用户有不同反应模式并提出设计改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10962 2026-02-06 cs.LG cs.AI 73%

WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering

WebSTAR: 可扩展的数据合成用于计算机使用代理的步级过滤

Yifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 WebSTAR通过步级过滤技术合成高质量数据,构建了WebSTAR和WebSCORE数据集,并训练了高效的过程奖励模型StepRM,提升计算机使用代理的训练效果和部署效率。

Comments Project website: https://yifei-he.github.io/webstar-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05327 2026-02-06 cs.AI 70%

ProAct: Agentic Lookahead in Interactive Environments

ProAct:交互环境中的代理前瞻性

Yangbin Yu, Mingyu Yang, Junyou Li, Yiming Gao, Feiyu Liu, Yijun Yang, Zichuan Lin, Jiafei Lyu, Yicheng Liu, Zhicong Lu, Deheng Ye, Jie Jiang

机构 * Tencent Hunyuan(腾讯文言)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ProAct通过双阶段训练范式提升交互环境中的前瞻性推理能力,结合GLAD和MC-Critic实现更稳定的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17767 2026-02-06 cs.CL 70%

Position: The Real Barrier to LLM Agent Usability is Agentic ROI

位置:LLM代理可用性的真正障碍是代理的ROI

Weiwen Liu, Jiarui Qin, Xu Huang, Xingshan Zeng, Yunjia Xi, Jianghao Lin, Chuhan Wu, Yasheng Wang, Lifeng Shang, Ruiming Tang, Defu Lian, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出LLM代理可用性的核心问题在于其投资回报率,主张通过Z字型发展路径提升其在日常应用中的可用性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05552 2026-02-06 cs.RO cs.CV 67%

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

VLN-Pilot: 大型视觉-语言模型作为自主室内无人机操作员

Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

机构 * University Institute for Compute Research(计算研究大学研究所) University of Alicante(阿利坎特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 VLN-Pilot利用大型视觉-语言模型实现自主室内无人机导航,通过自然语言指令和视觉感知结合,提高飞行任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV 67%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05273 2026-02-06 cs.RO 67%

Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions

具有包容性的交互决策与执行以应对模糊指令

Hengxuan Xu, Fengbo Lan, Zhixin Zhao, Shengjie Wang, Mengqiao Liu, Jieqian Sun, Yu Cheng, Tao Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Computer Science and Engineering Department, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 AIDE通过双流框架整合交互式探索与视觉-语言推理,实现对模糊指令的高效决策与执行,提升机器人在陌生环境中的任务规划能力。

Comments 14 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20339 2026-02-06 cs.CL cs.LG 62%

Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space

通过生成顺序和令牌空间的联合搜索改进扩散语言模型解码

Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

机构 * stanford(斯坦福大学) zju(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过联合搜索生成顺序和令牌空间,改进扩散语言模型的解码性能,在多个基准测试中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏