arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.03164 2026-01-08 cs.CL 88%

WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning

WebAnchor: 通过锚定代理规划稳定长周期网络推理

Xinmiao Yu, Liwen Zhang, Xiaocheng Feng, Yong Jiang, Bing Qin, Pengjun Xie, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 WebAnchor通过两阶段强化学习框架,解决长周期网络推理中规划不稳定的问题,提升任务成功率和工具效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23412 2026-01-08 cs.AI 85%

MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning

MindWatcher:迈向更智能的多模态工具集成推理

Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Handong Cui, Chaoqun Du, Li Gong, Feng Gu, Xuefeng Hao, Wei He, Jiabang He, Yi Hu, Bin Huang, Shanshan Li, Qizhen Li, Jing Luo, Zide Liu, Xiaobo Liu, Ning Mao, Lifu Mu, Xuhao Pan, Zhiheng Qu, Chang Ren, Xudong Rao, Haoyi Sun, Qian Wang, Shuai Wang, Zhichao Wang, Wei Wang, Lian Wen, Jiqing Zhan, Hongfu Yang, Sheng Yang, Jiajun Yang, Pengfei Yu, Hongyuan Zhang, Bin Zhang, Chunpeng Zhou, Zheng Zhou, Shucheng Zhou, Shuo Xie, Yun Zhu, Hao Ma, Tao Wei, Pan Zhou, Wei Chen

机构 * Li Auto Inc(力汽车公司)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 MindWatcher是一种能够自主调用工具并进行多模态推理的智能体,通过高效训练和高质量数据集提升了多步骤决策任务的性能。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA 85%

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00088 2026-01-08 cs.RO cs.AI cs.LG 84%

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景

NVIDIA, :, Yan Wang, Wenjie Luo, Junjie Bai, Yulong Cao, Tong Che, Ke Chen, Yuxiao Chen, Jenna Diamond, Yifan Ding, Wenhao Ding, Liang Feng, Greg Heinrich, Jack Huang, Peter Karkus, Boyi Li, Pinyi Li, Tsung-Yi Lin, Dongran Liu, Ming-Yu Liu, Langechuan Liu, Zhijian Liu, Jason Lu, Yunxiang Mao, Pavlo Molchanov, Lindsey Pavao, Zhenghao Peng, Mike Ranzinger, Ed Schmerling, Shida Shen, Yunfei Shi, Sarah Tariq, Ran Tian, Tilman Wekel, Xinshuo Weng, Tianjun Xiao, Eric Yang, Xiaodong Yang, Yurong You, Xiaohui Zeng, Wenyuan Zhang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14211 2026-01-08 cs.CL cs.AI 81%

LiteStage: Latency-aware Layer Skipping for Multi-stage Reasoning

LiteStage: 低延迟层跳过用于多阶段推理

Beomseok Kang, Jiwon Song, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LiteStage通过低延迟层跳过框架提升多阶段推理效率,有效解决阶段间跳过敏感性和冗余输出问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03687 2026-01-08 cs.AI 79%

Personalized Medication Planning via Direct Domain Modeling and LLM-Generated Heuristics

通过直接领域建模和LLM生成的启发式方法实现个性化药物规划

Yonatan Vernik, Alexander Tuisov, David Izhaki, Hana Weitman, Gal A. Kaminka, Alexander Shleyfman

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文通过直接领域建模和LLM生成的启发式方法,提升了个性化药物规划的规模和效率,支持更接近临床应用的实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03398 2026-01-08 cs.RO 78%

Towards Zero-Knowledge Task Planning via a Language-based Approach

通过语言方法实现零知识任务规划

Liam Merz Hoffmeister, Brian Scassellati, Daniel Rakita

机构 * Department of Computer Science, Yale University(计算机科学系,耶鲁大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出利用大型语言模型实现零知识任务规划,通过分解自然语言指令生成行为树并实时调整,提升任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02144 2026-01-08 cs.LO 71%

VECSR: Virtually Embodied Common Sense Reasoning System

VECSR:虚拟具身常识推理系统

Alexis R. Tudor, Joaquín Arias, Gopal Gupta

专题命中 规划推理 :reasoning(title)

AI总结 本文提出VECSR系统,通过基于答案集编程的s(CASP)推理器,将自主代理任务分解为中层指令并解释选择,提升家庭环境中的可信度与可解释性。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 76-88

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04191 2026-01-08 cs.RO cs.AI 57%

Embedding Autonomous Agents in Resource-Constrained Robotic Platforms

在资源受限的机器人平台上嵌入自主代理

Negar Halakou, Juan F. Gutierrez, Ye Sun, Han Jiang, Xueming Wu, Yilun Song, Andres Gomez

机构 * Institut für Datentechnik und Kommunikationsnetze, TU Braunschweig(数据技术与通信网络研究所, Braunschweig 技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究在资源受限的机器人平台上嵌入自主代理,通过AgentSpeak编程实现迷宫探索,展示高效推理过程适用于实时自主操作。

Comments This is an open-access, author-archived version of a manuscript published in European Conference on Multi-Agent Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04056 2026-01-08 cs.CL 57%

Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion

弥合离散-连续鸿沟:通过耦合流形离散吸收扩散实现统一多模态生成

Yuanfeng Xu, Yuhao Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 CoM-DAD通过耦合流形离散吸收扩散框架,实现离散与连续数据的统一多模态生成,解决多模态对齐与训练稳定性问题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03775 2026-01-08 cs.CL 57%

Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations

LLM自我解释是否有助于用户预测模型行为?通过语用扰动评估反事实可模拟性

Pingjun Hong, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(计算机科学系,维也纳大学) UniVie Doctoral School Computer Science, University of Vienna(UniVie 计算机科学博士学院,维也纳大学) Faculty of Philological and Cultural Studies, University of Vienna(文学与文化研究系,维也纳大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过语用扰动评估LLM自我解释对用户预测模型行为的帮助,发现自我解释能提升模拟准确性,但效果受扰动策略和评判者能力影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03662 2026-01-08 cs.AI 57%

How Does the Thinking Step Influence Model Safety? An Entropy-based Safety Reminder for LRMs

思考步骤如何影响模型安全性?一种基于熵的安全提醒机制用于大型推理模型

Su-Hyeon Kim, Hyundong Jin, Yejin Lee, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SafeRemind,一种通过熵触发在推理过程中动态注入安全提醒短语,提升大型推理模型安全性的解码时防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03475 2026-01-08 cs.AI 57%

CPGPrompt: Translating Clinical Guidelines into LLM-Executable Decision Support

CPGPrompt:将临床指南转化为LLM可执行的决策支持

Ruiqi Deng, Geoffrey Martin, Tony Wang, Gongbo Zhang, Yi Liu, Chunhua Weng, Yanshan Wang, Justin F Rousseau, Yifan Peng

机构 * Information Science (Health Tech), Cornell Tech, New York, NY, USA(信息科学(健康科技),康奈尔科技,纽约,纽约州) Systems Engineering, Cornell University, Ithaca, NY, USA(系统工程,康奈尔大学,伊萨卡,纽约州) Population Health Sciences, Weill Cornell Medicine, New York, NY, USA(人口健康科学,韦尔医学院,纽约,纽约州) Computer and Information Science, Cornell University, Ithaca, NY, USA(计算机与信息科学,康奈尔大学,伊萨卡,纽约州) Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州) Department of Medicine, Weill Cornell Medicine, New York, NY, USA(医学系,韦尔医学院,纽约,纽约州) Department of Health Information Management, University of Pittsburgh, Pittsburgh, PA, USA(健康信息管理系,匹兹堡大学,匹兹堡,宾夕法尼亚州) Clinical and Translational Science Institute, University of Pittsburgh, Pittsburgh, PA, USA(临床与转化科学研究所,匹兹堡大学,匹兹堡,宾夕法尼亚州) Department of Neurology, UT Southwestern Medical Center, Dallas, TX, USA(神经病学系,德克萨斯西南医学中心,达拉斯,德克萨斯州) Peter O’Donnell Jr. Brain Institute, UT Southwestern Medical Center, Dallas, TX, USA(彼得·奥·donnell Jr.脑研究所,德克萨斯西南医学中心,达拉斯,德克萨斯州) Clinical Informatics Center, University of Texas Southwestern Medical Center, Dallas, USA(临床信息学中心,德克萨斯西南医学中心,达拉斯,美国) Institute of Artificial Intelligence for Digital Health, Weill Cornell Medicine, New York, NY USA(数字健康人工智能研究所,韦尔医学院,纽约,纽约州)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 CPGPrompt通过将临床指南转化为LLM可执行的结构化决策树,实现对患者病例的高效评估,提升了专科转诊和路径分类的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03436 2026-01-08 astro-ph.IM cs.AI 57%

MARVEL: A Multi Agent-based Research Validator and Enabler using Large Language Models

MARVEL:基于大语言模型的多智能体研究验证器与促进器

Nikhil Mukund, Yifang Luo, Fan Zhang, Lisa Barsotti, Erik Katsavounidis

机构 * MIT Kavli Institute for Astrophysics and Space Research and LIGO Laboratory(麻省理工学院凯斯利天文与空间研究所及LIGO实验室) Massachusetts Institute of Technology(麻省理工学院) State Key Laboratory of Ocean Sensing & Ocean College(海洋传感国家重点实验室) Zhejiang University(浙江大学) NSF AI Institute for Artificial Intelligence and Fundamental Interactions (IAIFI)(国家科学基金会人工智能与基本相互作用研究所) Cambridge, MA, USA(美国马萨诸塞州剑桥市)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MARVEL通过结合快速查询路径和深度搜索模式,为科学领域提供可部署的验证器,其在探测器操作内容上显著优于GPT-4o基线。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03376 2026-01-08 cs.LG 57%

Weather-Aware Transformer for Real-Time Route Optimization in Drone-as-a-Service Operations

考虑天气的变换器用于无人机即服务操作中的实时路线优化

Kamal Mohamed, Lillian Wassim, Ali Hamdi, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种天气感知的变换器框架,用于实时优化无人机即服务操作的路线,通过天气启发式方法提升动态环境下的路由决策效率与安全性。

Comments 2025 IEEE/ACS 22nd International Conference on Computer Systems and Applications (AICCSA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03655 2026-01-08 cs.CV 50%

VideoMemory: Toward Consistent Video Generation via Memory Integration

VideoMemory: 通过记忆整合实现一致的视频生成

Jinsong Zhou, Yihua Du, Xinli Xu, Luozhou Wang, Zijie Zhuang, Yehang Zhang, Shuaibo Li, Xiaojun Hu, Bolan Su, Ying-cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 规划推理 :planning(abstract)

AI总结 VideoMemory通过动态记忆库整合叙事规划与视觉生成,实现多镜头中角色、道具和环境的一致性生成。

Comments Project page: https://hit-perfect.github.io/VideoMemory/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27251 2026-01-08 cs.MA 50%

FinPos: A Position-Aware Trading Agent System for Real Financial Markets

FinPos:一种面向真实金融市场的位置感知交易代理系统

Bijia Liu, Ronghao Dang

专题命中 规划推理 :reasoning(abstract)

AI总结 FinPos提出了一种位置感知的交易代理系统,通过专业信息解读、双代理决策结构和多时间尺度奖励信号,提升对连续仓位的管理能力,实验证明其在真实市场条件下的优越性。

Comments LLM Applications, LLM Agents, Financial Technology

详情

展开后加载摘要…

URL PDF HTML 收藏