arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 79%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04265 2026-08-06 cs.MA cs.AI cs.SY eess.SY 新提交 79%

Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

网络物理系统中大语言模型智能体规划策略的战略评估

J. de Curtò, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03735 2026-08-05 cs.MA cs.CL 新提交 79%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究院) Cohere(科here公司)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 79%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 79%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02422 2026-08-04 cs.CR cs.AI 新提交 79%

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

基于数字孪生增强多尺度规划的智能体事件响应

Yiran Gao, Tao Li, Kim Hammar

机构 * City University of Hong Kong(香港城市大学) Imperial College London(伦敦帝国学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。

Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01358 2026-08-04 cs.CL 新提交 79%

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

HopRefusalBench:面向多跳推理的搜索增强智能体的弃权失败诊断基准

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

机构 * Ant Group(蚂蚁集团) NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对多跳搜索增强智能体的弃权问题,构建首个可控基准HopRefusalBench,经实验发现前沿模型弃权能力存在显著不足,为相关可靠性改进提供基础。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交 79%

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 79%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 79%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16745 2026-07-31 cs.AI cs.MA 版本更新 79%

RELIC: Revealed Principles for Learning Interpretable Composable Skills in Multi-Agent Planning

RELIC:多智能体规划中学习可解释可组合技能的揭示原则

Nguyen Viet Tuan Kiet, Bui Dinh Pham, Duong Quoc Chinh, Dao Van Tung, Tran Cong Dao, Huynh Thi Thanh Binh

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对多智能体规划中隐私受限合作难题,提出RELIC框架,通过揭示原则学习可解释可组合技能,各智能体私用大语言模型引导搜索优化技能,协调器依团队性能评估更新,实现跨智能体转移,引入隐私保护技能学习新范式。

Comments v1 accepted at LM4Plan Workshop @ ICML 2026; v2 is the full paper version; Kiet, Pham, and Chinh contributed equally in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25961 2026-07-30 cs.CV cs.AI 版本更新 79%

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

用于视频级矛盾心理和犹豫识别的交互流知识引导多模态推理

Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究视频级矛盾心理和犹豫识别难题,提出PRISM-AH框架,通过冻结编码器、轻量级流模型处理多模态冲突,经窗口级注释监督、知识引导大语言模型推理,在测试中取得较好宏观F1,验证推理增益可转移。

Comments 14 Pages, 1 Figure, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25554 2026-07-29 cs.AI 新提交 79%

Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis

提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型

Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan LongCat Team(美团龙猫团队)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25881 2026-07-29 cs.CL astro-ph.CO astro-ph.IM cs.HC gr-qc 新提交 79%

AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology II: Project Planning and Proposal Evaluation

人工智能在协助物理、天体物理和宇宙学科学研究中的能力II:项目规划与提案评估

Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 研究大语言模型在科学项目规划与提案评估中的作用,人类和三个当代模型生成计划,再由人类与前沿模型盲评,结果显示当前模型能产出类似人工的计划,但人工智能评审员更青睐人工智能生成的提案,部署时需谨慎。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24167 2026-07-28 cs.AI 新提交 79%

Falsifiable Commitment Planning for Self-Correcting Web Agents

用于自我纠正网络代理的可证伪承诺规划

Guangyi Liu, Huan Zhao, Quanming Yao

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究长期运行网络代理易偏离轨道问题,提出FCPAgent框架,将计划步骤表示为FCU,通过计划-测试-修复循环执行,经混合承诺测试模块和范围感知修复提高成功率,在WebArena上相比基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23734 2026-07-28 cs.NI cs.LG 新提交 79%

TRUAV: Distributed Multi-Agent Reinforcement Learning for Trajectory Planning and Routing Enhancement in UAV-Aided IoT-Enabled VANETs

TRUAV:无人机辅助的物联网支持的车联网中用于轨迹规划和路由增强的分布式多智能体强化学习

Muhammad Umar Farooq Qaisar, Lin Zhang, Zhen Chen, Wajdy Othman, Shehzad Ashraf Chaudhry, Chang Liu

机构 * Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院) School of Automation Science and Electrical Engineering at Beihang University(北京航空航天大学自动化科学与电气工程学院) State Key Laboratory of Intelligent Manufacturing Systems Technology(智能制造系统技术国家重点实验室) School of Transportation, Southeast University(东南大学交通学院) Digital Health Research Center, Haihe Lab of ITAI(海河信息技术与人工智能实验室数字健康研究中心) School of Cyber Science, Nankai University(南开大学网络空间科学学院) China-SCO Digital Intelligence Applications (DIA) Joint Laboratory(中国-上海合作组织数字智能应用联合实验室) College of Engineering, Abu Dhabi University(阿布扎比大学工程学院) Faculty of Engineering and Architecture, Nisantasi University(尼桑塔西大学工程与建筑学院) School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 研究无人机辅助车联网中轨迹规划与路由增强问题,提出基于独立表格Q学习的分布式多智能体强化学习框架TRUAV,其智能体依局部信息运行,奖励设计兼顾多种因素,模拟显示该框架在多方面表现良好,还讨论了相关挑战与方向。

Comments 7 pages, 3 figures, submitted to IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22621 2026-07-28 cs.AI 新提交 79%

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

Opti-Q:一种用于多语言模型问题规划的基于约束的优化框架

Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Portland State University(波特兰州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究针对多语言模型预算部署难题,提出OPTI-Q框架。该框架将模型调用建模为执行DAG操作符,利用PERFDB估计质量和成本,经帕累托前沿搜索选计划,在指定预算下于MMLU-Pro和SimpleQA上提升QoA,实现更好的质量-资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22574 2026-07-28 cs.AI cs.IR 新提交 79%

Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning

证据过多,时间过少:通过多目标证据推理从文本到可操作的建议

Adela Bara, Simona-Vasilica Oprea

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对临床决策中证据过多难审查的问题,提出SCEPTER框架,结合多种技术将临床病例描述转化为建议,经150个案例研究评估,能大幅压缩搜索空间,留存证据多样,基于帕累托的选择提升了证据多样性和建议效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11169 2026-07-28 cs.CL 79%

CMCTS: A Constrained Monte Carlo Tree Search Framework for Mathematical Reasoning in Large Language Model

CMCTS:一种用于大语言模型数学推理的约束蒙特卡洛树搜索框架

Qingwen Lin, Boyan Xu, Guimin Hu, Zijian Li, Zhifeng Hao, Keli Zhang, Ruichu Cai

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CMCTS通过约束动作空间、过程奖励模型和偏序规则提升大语言模型的数学推理能力,实验表明其在多个基准测试中表现优异。

Journal ref Applied Intelligence 56, 13 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22166 2026-07-27 cs.RO cs.AI 新提交 79%

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

学习时空决策先验以实现部分可观测性下的高效路径规划

Yi Liu, Hongda Zhang, Leyao Zou, Chunlei Meng, Ziqing Zhou, Yuning Chen, Zhuo Zou, Lida Xu, Zhongxue Gan, Chun Ouyang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学) Department of Information Technology, Old Dominion University(信息技术系,老 Dominion 大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究部分可观测性下的路径规划问题,提出ImiPath框架,从示范轨迹提炼时空决策先验,经局部时空观测表示和时空注意力策略网络转换为决策先验并纳入异构规划器,提升路径质量与搜索效率,验证了框架的适应性和实际部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 79%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08825 2026-07-24 cs.CL cs.IR 79%

Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs

图上搜索:面向知识图谱的大语言模型推理的迭代式知情导航

Jia Ao Sun, Hao Yu, Fabrizio Gotti, Fengran Mo, Yihong Wu, Yuchen Hui, Zhan Su, Lingfeng Xiao, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Digital Media, CBC(数字媒体,CBC) Halmstad University College(哈姆斯塔德大学学院) University of Waterloo(滑铁卢大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Search-on-Graph方法,通过让大语言模型自身基于知识图谱结构和完整推理历史选择关系路径,遵循观察-思考-导航范式,在六个KGQA基准上超越现有方法,无需任务特定微调。

Comments Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13621 2026-07-24 cs.LO cs.AI 79%

Decentralized Planning Using Probabilistic Hyperproperties

基于概率超属性的去中心化规划

Francesco Pontiggia, Filip Macák, Roman Andriushchenko, Michele Chiari, Milan Češka

机构 * Brno University of Technology(布拉格技术大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出利用概率超属性和MDP进行去中心化规划,扩展了规划技术的规范能力,并建立了与特定Dec-MDPs规划的联系。

Comments 11 pages, 1 figure, 2 tables. Accepted at AAMAS 2025: the 24th International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19523 2026-07-23 cs.CL 新提交 79%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新 79%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 79%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17710 2026-07-21 cs.LG 新提交 79%

Planning with Transformers: Chain of Computation and Structured Context Windows

使用Transformer进行规划:计算链与结构化上下文窗口

Ehsan Futuhi, Nathan R. Sturtevant

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 研究大语言模型解决规划问题的不足,提出计算链架构,利用结构化上下文窗口,让语言模型学习规划策略、预测世界模型并执行算术运算,在多个任务上取得高成功率,能解决复杂汉诺塔问题且减少训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 79%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17331 2026-07-21 cs.AI cs.MA 新提交 79%

Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

智能企业资源规划(Agentic ERP):用于自主企业资源规划的多智能体大语言模型架构

Zhihao Liu, Tianyu Wang, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering(生产工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究针对ERP系统过度依赖人类决策的问题,提出Agentic ERP架构,结合角色对齐的LLM智能体、人工参与框架和图编排器。通过特定决策问题表述、编排解耦及多层面评估,证明该方法优于基线,能让ERP主动执行决策,提供了参考架构与评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30362 2026-07-21 cs.RO cs.AI cs.CV 版本更新 79%

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

ReactiveBFM:面向通用人形全身控制的反应式闭环运动规划

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出ReactiveBFM,一种实时闭环规划控制框架,通过调度前缀采样课程和异步重规划机制,解决生成式运动规划器与高频跟踪之间的延迟不匹配和暴露偏差问题,实现人形机器人全身协调和零样本反应式运动。

Comments Project page: https://xiao-chen.tech/reactivebfm/

详情

展开后加载摘要…

URL PDF HTML 收藏