arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11047 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11047 篇

2601.21916 2026-01-30 cs.AI cs.CL cs.IR 73%

JADE: Bridging the Strategic-Operational Gap in Dynamic Agentic RAG

JADE:动态代理RAG中战略-操作鸿沟的弥合

Yiqun Chen, Erhan Zhang, Tianyi Hu, Shijie Wang, Zixuan Yang, Meizhi Zhong, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Institute of Automation,Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 JADE通过联合优化规划与执行,解决动态代理RAG中战略与操作不匹配的问题,提升多轮工作流的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16486 2026-01-26 cs.CL cs.AI 73%

Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic

及时机器:时间意识使测试时间缩放成为代理

Yichuan Ma, Linyang Li, Yongkang chen, Peiji Li, Xiaozhe Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Fudan University Shanghai AI Laboratory(复旦大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 Timely Machine通过重新定义测试时间为实时时钟时间,提出Timely-RL方法提升时间预算意识,以应对高频工具调用和时间受限推理的挑战。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14615 2026-01-22 cs.CL cs.AI 73%

SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation

SearchGym: 通过高效且高保真的环境模拟提升现实世界搜索代理

Xichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 SearchGym通过高效高保真的模拟环境提升搜索代理的鲁棒性和性能,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12307 2026-01-21 cs.MA cs.CL cs.LG 73%

Rethinking the Value of Multi-Agent Workflow: A Strong Single Agent Baseline

重新思考多智能体工作流的价值:一个强大的单智能体基线

Jiawei Xu, Arief Koesdwiady, Sisong Bei, Yan Han, Baixiang Huang, Dakuo Wang, Yutong Chen, Zheshen Wang, Peihao Wang, Pan Li, Ying Ding

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊) Emory University(埃默里大学) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过单个代理的多轮对话模拟多智能体工作流,提出OneFlow算法,实现高效且准确的多代理流程,为多智能体系统研究提供强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15676 2026-01-15 cs.AI cs.CL 73%

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

AutoToM: 通过自动化代理建模实现基于模型的心理推理扩展

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu

机构 * Peking University(北京大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 AutoToM通过自动化代理建模实现可扩展、稳健且可解释的心理推理,优于现有方法并支持在线心理推理。

Comments NeurIPS 2025 (Spotlight). 42 pages, 11 figures, 15 tables. Website at https://chuanyangjin.com/AutoToM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04285 2026-01-12 cs.AI cs.HC cs.LG cs.MA 73%

A Future Capabilities Agent for Tactical Air Traffic Control

战术空交通管制中的未来能力代理

Paul Kent, George De Ath, Martin Layton, Allen Hart, Richard Everson, Ben Carvell

机构 * University of Exeter(埃克塞特大学) NATS(英国航空交通服务提供商)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent Mallard,一种基于规则的前瞻性规划代理,用于战术空交通管制,通过嵌入随机数字双胞胎实现安全冲突解决,并在简化场景中展示与专家推理一致的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16769 2026-01-12 cs.AI cs.CL 73%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03790 2025-12-22 cs.CL cs.LG stat.ML 73%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11464 2025-12-15 cs.CV cs.AI cs.LG 73%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07020 2025-12-15 cs.RO cs.AI cs.LG 73%

Driving Through Uncertainty: Risk-Averse Control with LLM Commonsense for Autonomous Driving under Perception Deficits

在不确定性中驾驶:利用大语言模型常识实现风险厌恶控制以应对自动驾驶中的感知缺陷

Yuting Hu, Chenhui Xu, Ruiyang Qin, Dancheng Liu, Amir Nassereldine, Yiyu Shi, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) University of Notre Dame(诺特尔大学)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-RCO框架,利用大语言模型整合人类驾驶常识,以提升自动驾驶在感知缺陷下的风险规避与适应性控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03065 2025-12-04 cs.LG cs.AI cs.MA 73%

Optimizing Life Sciences Agents in Real-Time using Reinforcement Learning

利用强化学习实时优化生命科学代理

Nihir Chadderwala

机构 * Nihir Chadderwala(独立研究者)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种结合AWS Strands Agents与汤普森采样上下文带障的框架,通过用户反馈实时优化生命科学代理的决策策略,提升用户满意度15-30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02555 2025-12-03 cs.CL cs.AI cs.IR 73%

ADORE: Autonomous Domain-Oriented Relevance Engine for E-commerce

ADORE:面向电商的自主领域导向相关性引擎

Zheng Fang, Donghao Xie, Ming Pang, Chunyuan Yuan, Xue Jiang, Changping Peng, Zhangang Lin, Zheng Luo

机构 * JD.COM Beijing China(京东公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ADORE通过规则意识、错误类型感知和关键属性增强的创新,实现电商搜索中高效且认知对齐的相关性建模。

Comments Accepted by SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02038 2025-12-03 cs.CL cs.AI cs.IR 73%

Deep Research: A Systematic Survey

深度研究:系统性综述

Zhengliang Shi, Yiqun Chen, Haitao Li, Weiwei Sun, Shiyu Ni, Yougang Lyu, Run-Ze Fan, Bowen Jin, Yixuan Weng, Minjun Zhu, Qiujie Xie, Xinyu Guo, Qu Yang, Jiayi Wu, Jujia Zhao, Xiaqiang Tang, Xinbei Ma, Cunxiang Wang, Jiaxin Mao, Qingyao Ai, Jen-Tse Huang, Wenxuan Wang, Yue Zhang, Yiming Yang, Zhaopeng Tu, Zhaochun Ren

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了深度研究系统,提出三阶段路线图,引入四个核心组件,并总结优化技术与评估标准,旨在推动该领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20720 2025-11-27 cs.CV cs.AI cs.LG cs.RO 73%

DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving

DeeAD: 视觉-语言动作的动态早期退出以实现高效的自动驾驶

Haibo HU, Lianming Huang, Nan Guan, Chun Jason Xue

机构 * City University of Hongkong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 DeeAD通过动态早期退出机制提升自动驾驶中视觉-语言动作模型的效率,实现28%的变换器层稀疏性和29%的延迟减少,同时保持规划质量和安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18428 2025-11-26 cs.AI cs.CL 73%

Multi-Modal Data Exploration via Language Agents

通过语言代理进行多模态数据探索

Farhad Nooralahzadeh, Yi Zhang, Jonathan Furst, Kurt Stockinger

机构 * Zurich University of Applied Sciences(瑞士应用科学大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上

Comments Accepted to the IJCNLP AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17967 2025-11-26 cs.LG cs.AI cs.CV 73%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18743 2025-11-25 cs.CL cs.AI 73%

RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and Context

RhinoInsight: 通过模型行为和上下文的控制机制提升深度研究

Yu Lei, Shuzheng Si, Wei Wang, Yifei Wu, Gang Chen, Fanchao Qi, Maosong Sun

机构 * DeepLang AI Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Jiaotong University(北京交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 RhinoInsight通过引入可验证检查表和证据审计两种控制机制,提升深度研究任务的鲁棒性和可追溯性,同时保持在深度搜索任务中的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00588 2025-11-21 cs.LG cs.AI cs.CY 73%

Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation

诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架

Dong Chen, Yanzhe Wei, Zonglin He, Guan-Ming Kuang, Canhua Ye, Meiru An, Huili Peng, Yong Hu, Huiren Tao, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13712 2025-11-18 cs.LG cs.AI 73%

From Black Box to Insight: Explainable AI for Extreme Event Preparedness

Kiana Vu, İsmet Selçuk Özer, Phung Lai, Zheng Wu, Thilanka Munasinghe, Jennifer Wei

机构 * Department of Cybersecurity University at Albany, SUNY Albany, NY, USA Dept. of Atmospheric \& Environmental Sciences University at Albany, SUNY Albany, NY, USA Lally School of Management Rensselaer Polytechnic Institute Albany, NY, USA Goddard Space Flight Center NASA Greenbelt, MD, USA

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13118 2025-11-18 cs.CL cs.AI 73%

Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction

Quanjiang Guo, Sijie Wang, Jinchuan Zhang, Ben Zhang, Zhao Kang, Ling Tian, Ke Yan

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 5 figures, accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17797 2025-11-10 cs.CL cs.AI 73%

Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics

Akshara Prabhakar, Roshan Ram, Zixiang Chen, Silvio Savarese, Frank Wang, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Technical report; 13 pages plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14926 2025-11-10 cs.LG cs.AI cs.RO 73%

Ethics-Aware Safe Reinforcement Learning for Rare-Event Risk Control in Interactive Urban Driving

Dianzhao Li, Ostap Okhrin

机构 * Chair of Econometrics and Statistics Corresponding author esp. in the Transport Sector(计量经济学与统计学教授职位(交通运输领域特别对应作者)) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据与人工智能研究中心(ScaDS.AI))

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02532 2025-11-05 cs.AI cs.LG 73%

Agentic AI for Mobile Network RAN Management and Optimization

Jorge Pellejero, Luis A. Hernández Gómez, Luis Mendo Tomás, Zoraida Frias Barroso

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17311 2025-11-04 cs.LG cs.AI physics.ao-ph 73%

A Self-Evolving AI Agent System for Climate Science

Zijie Guo, Jiong Wang, Fenghua Ling, Wangxu Wei, Xiaoyu Yue, Zhe Jiang, Wanghan Xu, Jing-Jia Luo, Lijing Cheng, Yoo-Geun Ham, Fengfei Song, Pierre Gentine, Toshio Yamagata, Ben Fei, Wenlong Zhang, Xinyu Gu, Chao Li, Yaqiang Wang, Tao Chen, Wanli Ouyang, Bowen Zhou, Lei Bai

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00993 2025-11-04 cs.AI cs.LG 73%

Aligning LLM agents with human learning and adjustment behavior: a dual agent approach

Tianming Liu, Jirong Yang, Yafeng Yin, Manzi Li, Linghao Wang, Zheng Zhu

机构 * Department of Civil and Environmental Engineering, University of Michigan, Ann Arbor, United States(美国密歇根大学土木与环境工程系) Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, United States(美国密歇根大学电气工程与计算机科学系) College of Civil Engineering and Architecture, Zhejiang University, Hangzhou, China(浙江大学建筑工程学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27267 2025-11-03 cs.CL cs.AI 73%

MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models

Kangkun Mao, Jinru Ding, Jiayuan Chen, Mouxiao Bian, Ruiyao Chen, Xinwei Peng, Sijie Ren, Linyang Li, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26935 2025-11-03 cs.RO cs.AI cs.CL cs.FL 73%

RepV: Safety-Separable Latent Spaces for Scalable Neurosymbolic Plan Verification

Yunhao Yang, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Zhanyang Wang, Ufuk Topcu

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments Code and data are available at: https://repv-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02992 2025-10-28 cs.AI cs.CL 73%

Learning to Better Search with Language Models via Guided Reinforced Self-Training

Seungyong Moon, Bumsoo Park, Hyun Oh Song

机构 * Seoul National University(首尔国立大学) KRAFTON

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16024 2025-10-28 cs.CL cs.AI 73%

The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement

Ruihan Yang, Fanghua Ye, Jian Li, Siyu Yuan, Yikai Zhang, Zhaopeng Tu, Xiaolong Li, Deqing Yang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20176 2025-10-27 cs.CL cs.AI 73%

Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding

Yuhang Zhou, Mingrui Zhang, Ke Li, Mingyi Wang, Qiao Liu, Qifei Wang, Jiayi Liu, Fei Liu, Serena Li, Weiwei Li, Mingze Gao, Abhishek Kumar, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta AI

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏