arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2601.21358 2026-02-05 cs.AI cs.CL 92%

Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization

潜在的思维链作为规划:将推理与言说解耦

Jiecong Wang, Hao Peng, Chunyang Liu

机构 * Beihang University(北航大学) Didi Chuxing(滴滴出行)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);planning(title,abstract);CoT(abstract)

AI总结 PLaT通过解耦推理与言说,实现了更灵活的推理过程和更高的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04326 2026-02-05 cs.AI cs.CL cs.MA 88%

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

从假设到行动:将大语言模型推理转化为具有不确定性的代理规划

SeungWon Seo, SooBin Lim, SeongRae Noh, Haneul Kim, HyeongYeop Kang

机构 * Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI

AI总结 PCE框架通过结构化决策树将LLM推理中的假设转化为可靠策略,提升多智能体环境下的规划效率和任务完成率。

Comments 31 pages, 10 figures, Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03900 2026-02-05 cs.AI 87%

Knowledge Model Prompting Increases LLM Performance on Planning Tasks

知识模型提示增强了LLM在规划任务上的性能

Erik Goh, John Kos, Ashok Goel

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 TMK框架通过显式任务分解和因果推理提升LLM在规划任务中的性能,使其在复杂符号任务中达到97.3%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI 83%

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04515 2026-02-05 cs.RO cs.CV 82%

EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models

EgoActor: 通过视觉语言模型将任务规划接地于空间感知的自我中心动作以实现人形机器人

Yu Bai, MingMing Yu, Chaojie Li, Ziyi Bai, Xinlong Wang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 EgoActor通过视觉语言模型将高层任务指令转化为精确的空间感知动作,实现人形机器人在真实和模拟环境中的稳健任务规划与运动执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04184 2026-02-05 cs.CV cs.AI cs.LG cs.RO 81%

Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models

基于视觉-语言-动作模型的自动驾驶场景响应式人机协同运动规划的自然语言指令

Angel Martinez-Sanchez, Parthib Roy, Ross Greer

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究利用视觉-语言-动作模型,通过指令条件规划提升自动驾驶的鲁棒性和轨迹对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01374 2026-02-05 cs.LG cs.AI cs.PL 81%

REASONING COMPILER: LLM-Guided Optimizations for Efficient Model Serving

推理编译器:基于大语言模型的高效模型服务优化

Annabelle Sujun Tang, Christopher Priebe, Rohan Mahapatra, Lianhui Qin, Hadi Esmaeilzadeh

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 推理编译器利用大语言模型进行编译优化,通过上下文感知决策提升样本效率,实现高效模型服务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04392 2026-02-05 cs.CL 79%

Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models

通过大语言模型评估临床推理中的性别偏见存在性

Isabel Tsintsiper, Sheng Wong, Beth Albert, Shaun P Brennecke, Gabriel Davis Jones

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型在临床推理中存在性别偏见,不同模型表现不同,需谨慎配置与监督以确保医疗应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 79%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04129 2026-02-05 cs.RO cs.AI cs.ET cs.MA 79%

KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning

KGLAMP:基于知识图谱的自适应多机器人规划与再规划语言模型

Chak Lam Shek, Faizan M. Tariq, Sangjae Bae, David Isele, Piyush Gupta

机构 * Honda Research Institute, USA(本田研究院) University of Maryland, College Park(马里兰大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 KGLAMP通过知识图谱引导LLM实现异构多机器人系统的自适应规划与再规划,提升动态环境下的规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 79%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 79%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04454 2026-02-05 cs.CV 78%

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

Seg-ReSearch: 基于交织推理和外部搜索的分割

Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 Seg-ReSearch通过交织推理和外部搜索提升分割系统处理动态开放世界查询的能力,有效克服现有方法的知识瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04315 2026-02-05 cs.RO cs.CV 78%

GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning

GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型

Guoqing Ma, Siheng Wang, Zeyu Zhang, Shan Yu, Hao Tang

机构 * CASIA(中国科学院自动化研究所) Peking University(北京大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 73%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04118 2026-02-05 cs.LG cs.AI cs.CL 67%

Policy Learning with a Language Bottleneck

具有语言瓶颈的策略学习

Megha Srivastava, Cedric Colas, Dorsa Sadigh, Jacob Andreas

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) Inria(法国国家信息与自动化技术研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过语言瓶颈框架,AI代理能生成可解释的策略规则,提升与人类的协作效率。

Comments Accepted to TMLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03351 2026-02-05 cs.AI cs.CY cs.LG 62%

Building Interpretable Models for Moral Decision-Making

构建道德决策的可解释模型

Mayank Goel, Aritra Das, Paras Chopra

机构 * Lossfunk Ashoka University(阿什oka大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种定制的Transformer模型,用于研究神经网络在道德决策中的表现,并通过可解释性技术揭示了道德推理的分布特性。

Comments 8 pages, 4 figures, accepted to AAAI'26 Machine Ethics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 62%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04248 2026-02-05 cs.AI cs.CL 62%

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

经验-MCTS:通过双经验蒙特卡洛树搜索实现连续智能体进化

Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

机构 * JianChengXingYun Technology Co., Ltd.(健成星云科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 经验-MCTS通过双环框架实现连续智能体进化,结合局部探索与全局记忆优化,提升复杂推理任务性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03892 2026-02-05 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 62%

Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation

分段后审计:用于语言指代音频视频分段的无参考掩码质量评估

Jinxing Zhou, Yanghao Zhou, Yaoting Wang, Zongyan Han, Jiaqi Ma, Henghui Ding, Rao Muhammad Anwer, Hisham Cholakkal

机构 * MBZUAI National University of Singapore(国立新加坡大学) Fudan University(复旦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 62%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 规划推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18496 2026-02-05 cs.AI 57%

DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference

DEEPMED:通过多跳Med-Search数据和转向控制的代理训练与推理构建医疗深度研究代理

Zihan Wang, Hao Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yiqun Zhang, Jinghao Lin, Haihua Yang, Xiaozhong Ji

机构 * Northeastern University(东北大学) ByteDance(字节跳动)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepMed通过多跳Med-Search数据和转向控制训练推理,提升医疗领域深度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04428 2026-02-05 cs.AI 57%

Building Scaffolding Dialogue Data with LLM-Simulated Novices

构建基于LLM模拟初学者的支架对话数据

Si Chen, Izzy Molnar, Ting Hua, Peiyu Li, Le Huy Khiem, G. Alex Ambrose, Jim Lang, Ronald Metoyer, Nitesh V. Chawla

机构 * University of Notre Dame, USA(美国北达科他大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SimInstruct工具,通过LLM模拟初学者生成支架对话数据,提升教学质量并发现GPT-4o的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL 57%

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18224 2026-02-05 physics.ao-ph 50%

HiRO-ACE: Fast and skillful AI emulation and downscaling trained on a 3 km global storm-resolving model

HiRO-ACE:一种快速且技能优异的AI模拟与降尺度方法,基于3公里全球风暴解析模型训练

W. Andre Perkins, Anna Kwa, Jeremy McGibbon, Troy Arcomano, Spencer K. Clark, Oliver Watt-Meyer, Christopher S. Bretherton, Lucas M. Harris

专题命中 规划推理 :planning(abstract)

AI总结 HiRO-ACE通过结合AI模拟与降尺度技术,高效生成高分辨率降水场,适用于气候适应与极端事件风险评估。

Comments 38 pages, 19 figures, submitted to AGU Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20628 2026-02-05 cs.CV 50%

Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery

Recov-Vision:通过街道视图影像与视觉-语言模型实现灾害后恢复

Yiming Xiao, Archit Gupta, Miguel Esparza, Yu-Hsuan Ho, Antonia Sebastian, Hannah Weas, Rose Houck, Ali Mostafavi

机构 * UrbanResilience.AI Lab(UrbanResilience.AI 实验室) Zachry Department of Civil and Environmental Engineering(Zachry 土木与环境工程系) Texas A&M University(德克萨斯A&M大学) Department of Earth, Marine and Environmental Sciences(地球、海洋与环境科学系) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :reasoning(abstract)

AI总结 Recov-Vision通过结合街道视图影像与视觉-语言模型,实现灾害后建筑占用的高精度评估与可解释决策支持。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏