arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2602.04248 2026-02-05 cs.AI cs.CL 62%

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

经验-MCTS:通过双经验蒙特卡洛树搜索实现连续智能体进化

Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

机构 * JianChengXingYun Technology Co., Ltd.(健成星云科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 经验-MCTS通过双环框架实现连续智能体进化,结合局部探索与全局记忆优化,提升复杂推理任务性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03892 2026-02-05 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 62%

Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation

分段后审计:用于语言指代音频视频分段的无参考掩码质量评估

Jinxing Zhou, Yanghao Zhou, Yaoting Wang, Zongyan Han, Jiaqi Ma, Henghui Ding, Rao Muhammad Anwer, Hisham Cholakkal

机构 * MBZUAI National University of Singapore(国立新加坡大学) Fudan University(复旦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 62%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 规划推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18496 2026-02-05 cs.AI 57%

DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference

DEEPMED:通过多跳Med-Search数据和转向控制的代理训练与推理构建医疗深度研究代理

Zihan Wang, Hao Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yiqun Zhang, Jinghao Lin, Haihua Yang, Xiaozhong Ji

机构 * Northeastern University(东北大学) ByteDance(字节跳动)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepMed通过多跳Med-Search数据和转向控制训练推理,提升医疗领域深度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04428 2026-02-05 cs.AI 57%

Building Scaffolding Dialogue Data with LLM-Simulated Novices

构建基于LLM模拟初学者的支架对话数据

Si Chen, Izzy Molnar, Ting Hua, Peiyu Li, Le Huy Khiem, G. Alex Ambrose, Jim Lang, Ronald Metoyer, Nitesh V. Chawla

机构 * University of Notre Dame, USA(美国北达科他大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SimInstruct工具,通过LLM模拟初学者生成支架对话数据,提升教学质量并发现GPT-4o的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL 57%

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18224 2026-02-05 physics.ao-ph 50%

HiRO-ACE: Fast and skillful AI emulation and downscaling trained on a 3 km global storm-resolving model

HiRO-ACE:一种快速且技能优异的AI模拟与降尺度方法,基于3公里全球风暴解析模型训练

W. Andre Perkins, Anna Kwa, Jeremy McGibbon, Troy Arcomano, Spencer K. Clark, Oliver Watt-Meyer, Christopher S. Bretherton, Lucas M. Harris

专题命中 规划推理 :planning(abstract)

AI总结 HiRO-ACE通过结合AI模拟与降尺度技术,高效生成高分辨率降水场,适用于气候适应与极端事件风险评估。

Comments 38 pages, 19 figures, submitted to AGU Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20628 2026-02-05 cs.CV 50%

Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery

Recov-Vision:通过街道视图影像与视觉-语言模型实现灾害后恢复

Yiming Xiao, Archit Gupta, Miguel Esparza, Yu-Hsuan Ho, Antonia Sebastian, Hannah Weas, Rose Houck, Ali Mostafavi

机构 * UrbanResilience.AI Lab(UrbanResilience.AI 实验室) Zachry Department of Civil and Environmental Engineering(Zachry 土木与环境工程系) Texas A&M University(德克萨斯A&M大学) Department of Earth, Marine and Environmental Sciences(地球、海洋与环境科学系) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :reasoning(abstract)

AI总结 Recov-Vision通过结合街道视图影像与视觉-语言模型,实现灾害后建筑占用的高精度评估与可解释决策支持。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 1 篇

2602.04413 2026-02-05 cs.CL cs.AI cs.MM 87%

History-Guided Iterative Visual Reasoning with Self-Correction

基于历史的迭代视觉推理与自我校正

Xinglong Yang, Zhilin Peng, Zhanzhan Liu, Haochen Shi, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(title);分类 cs.CL、cs.AI

AI总结 H-GIVR框架通过迭代视觉推理与自我校正,显著提升多模态推理准确性并保持低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2602.04290 2026-02-05 cs.CL 88%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03975 2026-02-05 cs.AI 83%

Adaptive Test-Time Compute Allocation via Learned Heuristics over Categorical Structure

通过学习的启发式方法在分类结构上实现自适应测试时计算分配

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种基于学习启发式的自适应测试时计算分配方法,通过状态级选择性验证框架在MATH基准测试中实现更高的准确率,同时减少验证器调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00640 2026-02-05 cs.AI cs.CL cs.LG 82%

DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching

DTS: 通过解码树草图增强大推理模型

Zicheng Xu, Xiuyi Lou, Guanchu Wang, Yu-Neng Chuang, Feng Luo, Guangyao Zheng, Alexander S. Szalay, Zirui Liu, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) University of North Carolina at Charlotte(北卡罗来纳大学教堂山分校) Rice University(莱斯大学) University of Minnesota(明尼苏达大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DTS通过解码树草图方法提升大推理模型的推理能力,显著提高准确性并减少重复生成,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04742 2026-02-05 cs.CY cs.CL 79%

Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models

推理时的推理选择性减少大语言模型中的隐性社会偏见

Molly Apsel, Michael N. Jones

机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04254 2026-02-05 cs.CL 79%

Scaling Agentic Verifier for Competitive Coding

为竞争编程设计的扩展代理验证器

Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

机构 * Renmin University of China(中国人民大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出Agentic Verifier,通过主动推理和高效测试输入生成,提升竞争编程问题解决的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 12 篇

2602.04224 2026-02-05 cs.LG cs.AI cs.CL cs.CR math.OC 87%

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

RAPO:面向通用安全推理的风险感知优化

Zeming Wei, Qiaosheng Zhang, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAPO 提出了一种风险感知优化框架,通过提升安全推理的泛化能力,增强大型推理模型在复杂攻击下的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 82%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04496 2026-02-05 cs.AI 79%

ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control

ReThinker:通过引导反思与置信度控制实现科学推理

Zhentao Tang, Yuqi Cui, Shixiong Kai, Wenqian Zhao, Ke Ye, Xing Li, Anxin Tian, Zehua Pei, Hui-Ling Zhen, Shoubo Hu, Xiaoguang Li, Yunhe Wang, Mingxuan Yuan

机构 * Noah's Ark Lab, Huawei, China(诺亚实验室,华为,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 ReThinker通过引导反思与置信度控制,提升大语言模型在专家级科学推理任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03084 2026-02-05 cs.CL 79%

AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback

AERO:通过内生双环反馈实现自主进化推理优化

Zhitao Gao, Jie Ma, Xuhong Li, Pengyu Li, Ning Qu, Yaqiang Wu, Hui Liu, Jun Liu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学) School of Cyber Science and Engineering(网络安全科学与工程学院) MOE KLINNS Lab(教育部KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Lenovo AI Technology Center(联想人工智能技术中心) Lenovo(联想公司) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 AERO通过内生双环反馈机制实现自主进化推理优化,提升模型在多个基准测试中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18321 2026-02-05 cs.MM cs.CL cs.CV 79%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25458 2026-02-05 cs.AI 70%

Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition

即插即用的情感图谱用于零样本语音情感识别的组合提示

Jiacheng Shi, Hongfei Du, Y. Alicia Hong, Ye Gao

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出CCoT-Emo框架,通过引入结构化情感图谱提升零样本语音情感识别的性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 70%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04541 2026-02-05 cs.CL cs.AI 62%

LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding

LycheeDecode: 通过混合头稀疏解码加速长上下文LLM推理

Gang Lin, Dongfang Li, Zhuoen Chen, Yukun Shi, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LycheeDecode通过混合头稀疏解码方法,实现长上下文LLM推理的高效与高质量

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04466 2026-02-05 cs.CL cs.AI 62%

Is Micro Domain-Adaptive Pre-Training Effective for Real-World Operations? Multi-Step Evaluation Reveals Potential and Bottlenecks

微领域适应预训练在现实操作中是否有效?多步骤评估揭示了潜力和瓶颈

Masaya Tsunokake, Yuta Koreeda, Terufumi Morishita, Koichi Nagatsuka, Hikaru Tomonari, Yasuhiro Sogawa

机构 * Research & Development Group, Hitachi, Ltd(日立株式会社研发部)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多步骤评估揭示了微领域适应预训练在生成任务中的潜力和瓶颈,发现其在信息提取方面有效但推理能力有待提升。

Comments 13 pages, 9 figures, Accepted by EACL2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10192 2026-02-05 cs.LG cs.AI cs.DM quant-ph 62%

Multi-Excitation Projective Simulation with a Many-Body Physics Inspired Inductive Bias

多激发投影模拟:受多体物理启发的归纳偏置

Philip A. LeMaitre, Marius Krumm, Hans J. Briegel

机构 * University of Innsbruck, Institute for Theoretical Physics(因斯布鲁克大学理论物理研究所)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多激发投影模拟(mePS)方法,通过受多体物理启发的归纳偏置解决超图建模中的指数复杂性问题,并在多个场景中验证了其资源节省和可解释性优势。

Comments 41 pages, 9 figures; Code repository at https://github.com/MariusKrumm/ManyBodyMEPS. Updated to be consistent with AIJ version

Journal ref Artificial Intelligence 352, 104489 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04693 2026-02-05 cs.CL cs.CY 57%

LinGO: A Linguistic Graph Optimization Framework with LLMs for Interpreting Intents of Online Uncivil Discourse

LinGO:一种结合大语言模型的语言图优化框架,用于解释在线不文明言论的意图

Yuan Zhang, Thales Bertaglia

机构 * University of Zurich(苏黎世大学) Utrecht University(乌特雷赫大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL

AI总结 LinGO通过多步骤语言组件优化,提升大语言模型对在线不文明言论意图的识别与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18998 2026-02-05 eess.AS 50%

MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR

MOSA:混合简单适配器在基于LLM的多语言语音识别中优于单体方法

Junjie Li, Jing Peng, Yangui Fang, Shuai Wang, Kai Yu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 MOSA通过混合简单适配器在基于LLM的多语言语音识别中实现更高性能和更高效的参数使用。

Comments 5 pages, 3 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 17 篇

2602.03979 2026-02-05 cs.CL 87%

Likelihood-Based Reward Designs for General LLM Reasoning

基于似然的奖励设计用于通用大语言模型推理

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

机构 * Meta FAIR University of Amsterdam(阿姆斯特丹大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03978 2026-02-05 cs.AI cs.LG 86%

Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning

监控性作为免费礼物:RLVR如何自发地对齐推理

Zidi Xiong, Shan Chen, Himabindu Lakkaraju

机构 * Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 RLVR通过增强响应分布和提示关注度自发提升推理透明性,但这种提升依赖于数据多样性与训练难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03516 2026-02-05 cs.LG cs.AI 84%

Not All Negative Samples Are Equal: LLMs Learn Better from Plausible Reasoning

并非所有负样本都平等:LLM通过合理推理学习更好

Zixiang Di, Jinyi Han, Shuo Zhang, Ying Liao, Zhi Li, Xiaofeng Ji, Yongqi Wang, Zheming Yang, Ming Gao, Bingdong Li, Jie Wang

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PNS方法,通过合成高质量负样本提升LLM推理能力,实验显示其在多个基准测试中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 79%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏