arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2505.23564 2025-10-22 cs.LG cs.AI cs.CL 80%

Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models

Yiran Guo, Lijie Xu, Jie Liu, Dan Ye, Shuang Qiu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 80%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04098 2025-06-11 cs.CL cs.AI cs.LG 80%

TextAtari: 100K Frames Game Playing with Language Agents

Wenhao Li, Wenwu Li, Chuyun Shen, Junjie Sheng, Zixiao Huang, Di Wu, Yun Hua, Wei Yin, Xiangfeng Wang, Hongyuan Zha, Bo Jin

机构 * Tongji University(同济大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学) Bank of Communications(中国银行) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 51 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06401 2025-06-10 cs.CL cs.AI cs.LG 80%

Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMs

Hongming Yang, Shi Lin, Jun Shao, Changting Lin, Donghai Zhu, Meng Han, Qinglei Kong

机构 * Zhejiang Gongshang University(浙江工商大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This work is accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17701 2025-06-03 cs.AI cs.CL cs.CY cs.LG 80%

From Perceptions to Decisions: Wildfire Evacuation Decision Prediction with Behavioral Theory-informed LLMs

Ruxiao Chen, Chenguang Wang, Yuran Sun, Xilei Zhao, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Florida(佛罗里达大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13549 2025-05-27 cs.CL cs.AI cs.LG 80%

EscapeBench: Towards Advancing Creative Intelligence of Language Model Agents

Cheng Qian, Peixuan Han, Qinyu Luo, Bingxiang He, Xiusi Chen, Yuji Zhang, Hongyi Du, Jiarui Yao, Xiaocheng Yang, Denghui Zhang, Yunzhu Li, Heng Ji

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages, 15 figures, ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16805 2025-05-23 cs.CV 80%

SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving

Xuesong Chen, Linjiang Huang, Tao Ma, Rongyao Fang, Shaoshuai Shi, Hongsheng Li

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05048 2024-11-11 cs.CL cs.AI cs.DB cs.IR cs.LG 80%

Leveraging LLMs to Enable Natural Language Search on Go-to-market Platforms

Jesse Yao, Saurav Acharya, Priyaranjan Parida, Srinivas Attipalli, Ali Dasdan

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10292 2024-10-10 cs.AI cs.CL cs.CV cs.LG 80%

Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Yuexiang Zhai, Hao Bai, Zipeng Lin, Jiayi Pan, Shengbang Tong, Yifei Zhou, Alane Suhr, Saining Xie, Yann LeCun, Yi Ma, Sergey Levine

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10601 2023-12-05 cs.CL cs.AI cs.LG 80%

Tree of Thoughts: Deliberate Problem Solving with Large Language Models

Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2023 camera ready version. Code repo with all prompts: https://github.com/princeton-nlp/tree-of-thought-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10675 2024-12-17 cs.CL cs.AI 80%

Chasing Progress, Not Perfection: Revisiting Strategies for End-to-End LLM Plan Generation

Sukai Huang, Trevor Cohn, Nir Lipovetzky

专题命中 规划推理 :planning(abstract,comments);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 8 pages main body, 10 pages appendix, accepted by Workshop on Planning in the Era of LLMs (LM4Plan @ AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27225 2026-08-28 cs.RO cs.AI 新提交 79%

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Honda Research Institute(本田研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。

Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25583 2026-08-27 cs.CL 新提交 79%

GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning

GRIP:用于高效推理的粒度奖励引导参数插值

Lam So, Canhui Wu, Han Lin

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对推理模型与指令模型的准确性-效率不匹配问题,提出GRIP框架,通过优化同架构两模型模块的可学习插值比例,实现更优的准确性-效率权衡。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24888 2026-08-27 cs.AI 新提交 79%

SIMGUIDE: Procedurally Grounded Multi-Context Representations for Personalized Agent Planning

SIMGUIDE:用于个性化智能体规划的过程式基础多上下文表示

Chirag Shah

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究针对个性化AI智能体无法适配用户多场景优先级的问题,提出SIMGUIDE方法,构建SIMBENCH基准验证,发现过程式基础的Sims优于RAG,且表示格式是关键设计变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07148 2026-08-27 cs.LG 版本更新 79%

Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing

面向移动边缘计算的任务卸载的多轮推理LLM

Ning Yang, Chuangxin Cheng, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Machano-Electronic Engineering, Xidian University(西安电子科技大学机电工程学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出COMLLM框架,通过整合GRPO与LACS机制,实现移动边缘计算中的前瞻性决策,提升任务卸载效率与负载均衡公平性,支持零样本拓扑扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24310 2026-08-26 cs.AI 新提交 79%

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏

Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) Wuhan University(武汉大学) Georgia Institute of Technology(佐治亚理工学院) Northwestern Polytechnical University(西北工业大学) University of Hong Kong(香港大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OPDSearch+是无需教师微调的搜索增强推理蒸馏范式,利用冻结的现成指令模型分两阶段优化3B模型,在7个QA基准上优于所有3B RL基线,HotpotQA和2WikiMultihopQA分别提升13.1%、8.5%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24237 2026-08-26 cs.AI 新提交 79%

STRIVE: Multi-Agent Structured Temporal Reasoning with Integrated Verification for Longitudinal Radiology Report Generation

STRIVE:面向纵向放射报告生成的集成验证多智能体结构化时序推理

Junyeong Maeng, Eunsong Kang, Heung-Il Suk

机构 * Korea University(高丽大学) Kangwon National University(江原国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 STRIVE将临床推理分解为多智能体并引入两阶段验证,在Longitudinal-MIMIC数据集上实现纵向放射报告生成的最佳临床效能,纵向变化一致性较最强基准提升超一倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24048 2026-08-26 cs.SD cs.AI 新提交 79%

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

不止聆听,尝试规划:面向长音频会议理解的基于图的检索-生成智能体

Quanwei Tang, Dong Zhang, Shoushan Li, Guodong Zhou

机构 * Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对长音频会议理解任务的问答数据集稀缺及现有语音模型的声学信息丢失、长期记忆差问题,构建LongAudioQA数据集,提出基于图的GRGA模型,利用智能体规划实现检索与答案生成。

Comments ACL Findings 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-26 cs.CL 版本更新 79%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22449 2026-08-25 cs.RO cs.AI 新提交 79%

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIRE:将显式操作规划作为可学习中间表征用于自我中心视角下手运动预测

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对现有手运动预测方法忽略操作过程、梯度干扰的问题,提出两阶段框架EMPIRE,构建EMPIRE-651K数据集,实现了更优的手运动预测精度。

Comments 14 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20129 2026-08-25 cs.MA cs.CL cs.CV 版本更新 79%

Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶

Mehdi Azarafza, Faezeh Pasandideh, Ali Ehteshami Bejnordi, Stefan Henkler, Achim Rettberg

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新 79%

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20564 2026-08-24 cs.AI 新提交 79%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11821 2026-08-24 cs.LG 版本更新 79%

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力

Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯A&M大学) Prime Intellect Morgan Stanley(摩根大通)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文针对LLM智能体多轮推理的信用分配问题,提出适配三类奖励结构的GRPO与PPO算法,实验证实密集每轮奖励结构优于稀疏奖励,PPO在搜索任务上表现最优。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20161 2026-08-21 cs.AI 新提交 79%

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

DARS:用于基于指令的图像编辑的带结构化推理的双层级信用分配强化学习

Haoxiang Cao, Jiajiong Cao, Xuanpu Zhang, Changqian Yu, Chaoqun Wang

机构 * South China Normal University(华南师范大学) KlingAI Research(可灵AI研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DARS框架,解决基于指令的图像编辑系统仅用最终奖励训练效率低的问题,通过双层级信用分配实现更好性能,在推理密集型编辑上增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 79%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07734 2026-08-20 cs.RO cs.AI cs.MA 版本更新 79%

Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity

面向最大容量下多机器人有序存取任务的完备、可扩展且鲁棒的优先规划

William Zhang, Tzvika Geft, Jingjin Yu, Kostas Bekris

机构 * Rutgers University(罗格斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对最大容量下多机器人有序存取问题,提出利用无重排布局特性的在线优先多智能体路径规划算法,实现可扩展且鲁棒的规划,完工时间随机器人数量近线性提升,处理不确定性时执行速度无显著损失。

Comments WAFR 2026 (World Symposium on the Algorithmic Foundations of Robotics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04100 2026-08-20 cs.AI 版本更新 79%

Hybrid Reinforcement Learning and Search for Flight Trajectory Planning

混合强化学习与搜索的飞行轨迹规划

Alberto Luise, Michele Lombardi

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。

详情

展开后加载摘要…

URL PDF HTML 收藏