arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-30 至 2025-12-30 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 17 篇

2512.23167 2025-12-30 cs.AI cs.LG cs.MA 88%

SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search

SPIRAL:通过 grounded 和 reflective 搜索实现符号 LLM 规划

Yifan Zhang, Giridhar Ganapavarapu, Srideepika Jayaraman, Bhavna Agrawal, Dhaval Patel, Achille Fokoue

机构 * IBM T.J. Watson Research Center(IBM TJ沃森研究中心)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 SPIRAL 通过 grounded 和 reflective 搜索实现更稳健高效的 LLM 规划

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 87%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);planning(abstract)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22536 2025-12-30 cs.CV cs.AI 83%

CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

CoAgent:协作规划与一致性代理用于连贯视频生成

Qinglin Zeng, Kaitong Cai, Ruiqi Chen, Qinhan Lv, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 规划推理 :planning(title);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 CoAgent通过协作框架提升视频生成的连贯性与一致性,采用计划-合成-验证流程优化长视频的叙事质量与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13461 2025-12-30 cs.LG cs.AI cs.CV cs.NE q-bio.NC 81%

Active Predictive Coding: A Unified Neural Framework for Learning Hierarchical World Models for Perception and Planning

主动预测编码:一种统一的神经框架,用于学习感知与规划的分层世界模型

Rajesh P. N. Rao, Dimitrios C. Gklezakos, Vishwas Sathish

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出主动预测编码框架,通过分层世界模型解决人工智能中感知与规划的两大核心问题。

Comments 15 pages, 10 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03427 2025-12-30 cs.AI 79%

TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage

TPTU:基于大型语言模型的AI代理用于任务规划和工具使用

Jingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) SenseTime Research(商汤科技研究院) HKUST(香港科技大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。

Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 79%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22883 2025-12-30 cs.CR cs.AI 70%

Agentic AI for Cyber Resilience: A New Security Paradigm and Its System-Theoretic Foundations

面向网络韧性的代理AI:一种新的安全范式及其系统理论基础

Tao Li, Quanyan Zhu

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的网络韧性新范式,通过系统理论框架设计自主工作流,利用博弈论实现网络防御与攻击的动态平衡,提升系统在攻击下的持续适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20368 2025-12-30 cs.AI 70%

AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning

AI-SearchPlanner: 通过帕累托最优多目标强化学习实现模块化代理搜索

Lang Mei, Zhihan Yang, Xiaohan Yu, Huanyao Zhang, Chong Chen

机构 * Huawei Cloud BU, China(华为云业务部,中国) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AI-SearchPlanner通过帕累托最优多目标强化学习提升冻结QA模型的搜索规划性能,实现模块化代理搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23372 2025-12-30 cs.HC 67%

A Design Space for Intelligent Agents in Mixed-Initiative Visual Analytics

混合倡议式可视化分析中智能代理的设计空间

Tobias Stähle, Matthijs Jansen op de Haar, Sophia Boyer, Rita Sevastjanova, Arpit Narechania, Mennatallah El-Assady

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出了一种混合倡议式可视化分析中智能代理的设计空间框架,通过系统回顾90个系统,提出了六个维度来表征代理能力,并为未来研究提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12018 2025-12-30 cs.CL cs.AI cs.LG 67%

Atom of Thoughts for Markov LLM Test-Time Scaling

思想原子用于马尔可夫LLM测试时间扩展

Fengwei Teng, Quan Shi, Zhaoyang Yu, Jiayi Zhang, Yuyu Luo, Chenglin Wu, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom(DeepWisdom公司) Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思想原子(\our),通过马尔可夫链结构与树搜索等技术结合,实现高效推理,提升LLM测试时间扩展性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22768 2025-12-30 cs.LG cs.AI stat.ML 62%

Understanding the Mechanisms of Fast Hyperparameter Transfer

理解快速超参数转移的机制

Nikhil Ghosh, Denny Wu, Alberto Bietti

机构 * Flatiron Institute(Flatiron研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了深度学习中快速超参数转移的机制,通过理论分析和实验验证,揭示了转移策略在不同问题结构下的有效性及计算效率。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 57%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22435 2025-12-30 cs.AR cs.LG 57%

AnalogSAGE: Self-evolving Analog Design Multi-Agents with Stratified Memory and Grounded Experience

AnalogSAGE: 带分层记忆和基础经验的自进化模拟设计多智能体

Zining Wang, Jian Gao, Weimin Fu, Xiaolong Guo, Xuan Zhang

机构 * Northeastern University(东北大学) Kansas State University(堪萨斯州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 AnalogSAGE通过分层记忆和基础经验提升模拟设计自动化可靠性与自主性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22408 2025-12-30 cs.RO cs.AI 57%

A Unified AI, Embedded, Simulation, and Mechanical Design Approach to an Autonomous Delivery Robot

一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法

Amro Gamar, Ahmed Abduljalil, Alargam Mohammed, Ali Elhenidy, Abeer Tawakol

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法,通过异构计算架构和优化设计实现了高可靠性和实时控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23319 2025-12-30 cs.DB 50%

Flexible Keyword-Aware Top-$k$ Route Search

灵活的关键词感知Top-k路线搜索

Ziqiang Yu, Xiaohui Yu, Yueting Chen, Wei Liu, Anbang Song, Bolong Zheng

专题命中 规划推理 :planning(abstract)

AI总结 本文提出关键词感知top-k路线查询,通过探索与边界范式高效处理路线规划,满足用户对POI访问顺序、旅行预算和评分的多样化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19854 2025-12-30 cs.RO cs.HC 50%

Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models

思考、行动、学习:一种利用闭环大语言模型的自主机器人代理框架

Anjali R. Menon, Rohit K. Sharma, Priya Singh, Chengyu Wang, Aurora M. Ferreira, Mateja Novak

机构 * Dept. of Electronics & Comm. Eng.(电子与通信工程系) Government Engineering College(政府工程学院) Dept. of Electrical & Electronics Eng.(电气与电子工程系) Poornima College of Engineering(波奥尼玛工程学院) Dept. of Electronics & Telecom. Eng.(电子与电信工程系) Shivaji University College of Eng.(希瓦吉大学工程学院) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Dept. of Electrical Eng.(电气工程系) Instituto Federal do Maranhão(马里兰联邦学院) Dept. of Electrical & Computer Eng.(电气与计算机工程系) Technical University of Košice(科希丘夫技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出T-A-L框架,通过闭环大语言模型实现机器人自主学习与策略优化,显著提升复杂任务的成功率和泛化能力。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏