arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2601.18282 2026-02-09 cs.AI cs.CL cs.LG 85%

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06650 2026-02-09 cs.CL 83%

Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought

超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制

Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。

Comments 13 pages, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12840 2026-02-09 cs.AI cs.MA 83%

Scaling Multi-Agent Epistemic Planning through GNN-Derived Heuristics

通过GNN衍生启发式方法实现多智能体认知规划的扩展

Giovanni Briglia, Francesco Fabiano, Stefano Mariani

机构 * Department of Sciences and Methods for Engineering, University of Modena and Reggio Emilia(工程科学与方法系,摩德纳和雷吉奥艾米利亚大学) Department of Computer Science, University of Oxford(计算机科学系,牛津大学) Department of Computer Science, University of Pisa(计算机科学系,比萨大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文通过GNN衍生启发式方法提升多智能体认知规划的可扩展性,改进求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06413 2026-02-09 cs.AI 81%

Intrinsic Stability Limits of Autoregressive Reasoning: Structural Consequences for Long-Horizon Execution

自回归推理的内在稳定性极限:长视界执行的结构后果

Hsien-Jyh Liao

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI;chain-of-thought(comments)

AI总结 本文研究了自回归推理的内在稳定性限制,发现长视界执行受限于过程级不稳定性,提出结构治理是解决长视界推理问题的关键。

Comments 16 Pages, 7 figures, Keyworda: Autoregressive Reasoning, Long-Horizon Stability, Chain-of-Thought Reasoning, Information-Theoretic Analysis, Structured Reasoning, Inference Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13215 2026-02-09 cs.AI cs.CL 81%

Personalized Learning Path Planning with Goal-Driven Learner State Modeling

基于目标驱动学习者状态建模的个性化学习路径规划

Joy Jia Yin Lim, Ye He, Jifan Yu, Xin Cong, Daniel Zhang-Li, Zhiyuan Liu, Huiqin Liu, Lei Hou, Juanzi Li, Bin Xu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology(计算机科学与技术系,信息科学国家研究中心) Tsinghua University(清华大学) Institution of Education(教育研究所) Department of Statistics and Data Science(统计与数据科学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 Pxplore通过整合强化学习与LLM,实现基于目标驱动的个性化学习路径规划,提升学习路径的连贯性和有效性。

Comments Accepted at The Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06493 2026-02-09 cs.LG 79%

Adaptive Uncertainty-Aware Tree Search for Robust Reasoning

自适应不确定性感知树搜索用于鲁棒推理

Zeen Song, Zihao Ma, Wenwen Qiang, Changwen Zheng, Gang Hua

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences(中国科学院大学) Multimodal Experiences Lab, Dolby Laboratories Inc(多模态体验实验室,Dolby Laboratories Inc) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人研究所,西安交通大学) Electronic Information Science and Technology, Central South University(电子信息科学与技术,中南大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出UATS方法,通过蒙特卡洛Dropout估计不确定性并结合强化学习控制器,以缓解外部搜索中分布外样本的不确定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-02-09 cs.CL 79%

Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Yixin Zhang, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Shuo Wu, Jun Zhao, Lingming Hu, Yumei Wang, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 79%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 70%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV 70%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 70%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06359 2026-02-09 cs.LG cs.AI 62%

Training Data Selection with Gradient Orthogonality for Efficient Domain Adaptation

基于梯度正交性的训练数据选择用于高效的领域适应

Xiyang Zhang, Yuanhe Tian, Hongzhi Wang, Yan Song

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OGS方法,通过梯度正交性选择训练数据,提升领域适应的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07865 2026-02-09 cs.SE cs.AI cs.CL cs.MA 62%

LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost

基于大语言模型的完全自动化混沌工程:实现任何人以低成本构建容错软件系统

Daisuke Kikuta, Hiroki Ikeuchi, Kengo Tajiri

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChaosEater系统,利用大语言模型自动化混沌工程周期,使任何人能低成本构建容错软件系统。

Comments Accepted at ASE 2025 NIER Track. The code is available at https://github.com/ntt-dkiku/chaos-eater

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06763 2026-02-09 cs.CL 57%

R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging

R-Align: 通过以推理为中心的元判断增强生成奖励模型

Yanlin Lai, Mitt Huang, Hangyu Guo, Xiangfeng Wang, Haodong Li, Shaoxiong Zhan, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Chun Yuan, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。

Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06724 2026-02-09 cs.CL 57%

Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion

表格作为搜索:将长周期代理信息寻求任务转化为表格补全

Tian Lan, Felix Henry, Bin Zhu, Qianghuai Jia, Junyang Ren, Qihang Pu, Haijun Li, Longyue Wang, Zhao Xu, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 TaS将长周期信息寻求任务转化为表格补全,通过结构化表格管理搜索状态,统一三种信息搜索任务,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06652 2026-02-09 cs.AI cs.CV 57%

Same Answer, Different Representations: Hidden instability in VLMs

相同答案,不同表示:VLMs中的隐藏不稳定性

Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena, Aryo Pradipta Gema, Wai-Chung Kwan, Fazl Barez, Maria Sofia Bucarelli, Fabrizio Silvestri, Pasquale Minervini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) CNRS(法国国家科学研究中心) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) i3S(i3S研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究揭示了视觉语言模型中隐藏的不稳定性,通过引入新的评估框架发现模型在内部表示漂移、鲁棒性与决策边界等方面存在显著问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06570 2026-02-09 cs.CL 57%

Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making

Baichuan-M3:用于可靠医疗决策的临床查询建模

M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo, Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

机构 * Baichuan-M3 Team(Baichuan-M3团队)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Baichuan-M3通过建模临床查询流程,实现了医疗决策支持的可靠性和准确性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05975 2026-02-09 cs.IR cs.CL 57%

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23306 2026-02-09 cs.AI 57%

GATSim: Urban Mobility Simulation with Generative Agents

GATSim: 基于生成代理的都市交通模拟

Qi Liu, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education, College of Transportation, Tongji University(教育部交通工程重点实验室,交通学院,同济大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GATSim通过生成代理模拟都市交通,结合认知系统与多尺度反思过程,实现对复杂出行行为的高效建模与真实交通模式的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04430 2026-02-09 cs.DB 50%

The Stretto Execution Engine for LLM-Augmented Data Systems

用于LLM增强数据系统的Stretto执行引擎

Gabriele Sanmartino, Matthias Urban, Paolo Papotti, Carsten Binnig

专题命中 规划推理 :planning(abstract)

AI总结 Stretto通过约束优化和梯度优化器,在LLM增强数据系统中实现端到端查询保证,同时高效平衡运行时准确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 50%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 规划推理 :chain-of-thought(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏