arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 65 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 65 篇

2608.26807 2026-08-28 cs.CL cs.AI 新提交 89%

Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory

Behavior2Trip:基于用户行为轨迹的个性化旅行规划

Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu, Xinyi Wang, Xiangrong Zhu, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Meituan Inc.(美团公司) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) University of Edinburgh(爱丁堡大学)

专题命中 规划决策 :agent(summary_cn,abstract);planning(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出行为感知旅行规划新任务,构建Behavior2Trip基准,提出B2T-Agent智能体,实验显示其在旅行规划任务上表现优于基线,凸显任务挑战性与模型泛化性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 88%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 规划决策 :agent(summary_cn,abstract);agentic(title,abstract)

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26442 2026-08-28 cs.AI cs.CL 新提交 88%

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI

不要过度思考,不要思考不足:面向智能体人工智能的自适应推理

Md Jueal Mia, M. Hadi Amini

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 该研究针对智能体AI中推理分配不当导致的过度/思考不足问题,在MATH-500和GAIA基准上验证相关失败模式,为自适应推理机制研究提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27443 2026-08-28 cs.HC cs.CR 新提交 86%

Do User-Authored Permission Policies Improve Protection Against AI Agent Overreach?

用户自主编写的权限策略能否提升对智能体越权行为的防护?

Ting Yan

专题命中 规划决策 :AI agent(title,abstract);agent(title)

AI总结 研究对比HITL、AUTO、POLICY三种场景发现,用户自主编写的POLICY策略未显著提升对AI智能体越权行为的防护,因多数规则选“询问”,总干预时间未降低,且偏好与承诺存在差距。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交 84%

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27348 2026-08-28 cs.CL 新提交 83%

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27158 2026-08-28 cs.LG 新提交 83%

Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation

用于机器人人群导航短程规划的扩散策略

Wendong Li, Jochen Garcke

机构 * Institute for Numerical Simulation(数值模拟研究所) University of Bonn(波恩大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 83%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.SE

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27371 2026-08-28 cs.RO 新提交 82%

Embodied Scene Rearrangement Planning

具身场景重排规划

Canzhi Chen, Zan Wang, Siqi Zhu, Qi Wu, Yixuan Li, Wei Liang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出具身场景重排规划(ESRP)新任务,构建含5400+场景对的ESRP-Bench基准,评估四类方法发现现有方法难高效完成,为智能体现实部署奠定基础。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Project page: this https URL (https://bit-pie.github.io/ESRP/) Code: this https URL (https://github.com/BIT-PIE/ESRP) Dataset: this https URL (https://huggingface.co/datasets/serendipity800/ESRP-PD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26819 2026-08-28 cs.RO cs.CG cs.DS 新提交 82%

CLIPPER: Replayable Shortlisted Optimization for Repeated Spatial Coverage Planning

CLIPPER:用于重复空间覆盖规划的可重放短名单优化

Julian Teusch, Jörg Philipp Müller, Monika Sester

机构 * Clausthal University of Technology(克劳斯塔尔工业大学) Leibniz University Hannover(莱布尼茨汉诺威大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 CLIPPER是用于重复空间覆盖规划的可重放优化方法,通过构建候选池等技术实现,在多地城市规模测试中,大幅降低了规划推出时间,覆盖度与全量贪心算法接近。

Comments Accepted at ACM SIGSPATIAL 2026. 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-28 cs.AI cs.CL 版本更新 81%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12979 2026-08-28 cs.AI cs.CL 版本更新 81%

DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping

DeepPlanner:通过优势塑造提升深度研究智能体的规划能力

Wei Fan, Wenlin Yao, Zheng Li, Feng Yao, Xin Liu, Liang Qiu, Qingyu Yin, Yangqiu Song, Bing Yin

机构 * The Hong Kong University of Science and Technology(香港科技大学) Amazon(亚马逊) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有深度研究智能体规划阶段优化不足的问题,提出端到端 RL 框架 DeepPlanner,通过塑造 token 级优势与选择性提升样本级优势,在7个基准上以更低训练预算实现最优规划效果。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27225 2026-08-28 cs.RO cs.AI 新提交 79%

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Honda Research Institute(本田研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。

Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27219 2026-08-28 cs.CL 新提交 79%

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-28 cs.CL 版本更新 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-28 cs.CL 版本更新 79%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team: Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 规划决策 :agent(title);tool use(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16514 2026-08-28 cs.RO cs.AI 版本更新 79%

No Plan, Yet Human: A Reactive Robotics Model Predicts Human Planning Failures on a Clinical Task

无计划,却有人类:一种反应式机器人模型预测临床任务中人类计划失败

Michael Migacev, Vito Mengers, Antonia Köngeter, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(技术大学柏林机器人与生物学实验室,德国) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(智能科学,卓越研究集群,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究利用反应式梯度下降框架AICON,通过塔罗伦敦测试揭示人类计划能力下降时的反应模式,发现其能更准确预测24个问题的难度排序,并在留出验证中表现优异,揭示了生物系统组织方式的普遍规律。

Comments Accepted at SAB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27151 2026-08-28 cs.RO 新提交 78%

Planning a Shared Modular Fixture Layout Across Robotic Disassembly Stages

面向机器人拆卸阶段的共享模块化夹具布局规划

Haohui Pan, Takuya Kiyokawa, Kensuke Harada

机构 * The University of Osaka(大阪大学) The National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究所(AIST))

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究针对机器人拆卸中支撑布局需适配阶段变化的问题,提出基于去噪扩散概率模型与贝叶斯优化的模块化真空夹具系统,实现螺丝刀、剃须刀拆卸的共享布局,稳定裕度达66.9%和81.6%,验证了方案的可行性与稳定性。

Comments 15 pages, 9 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22294 2026-08-28 cs.RO 版本更新 78%

Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning

超越实例槽:面向物理交互规划的语义丰富世界模型

Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究针对物理交互规划中实例槽无法明确实体任务角色的问题,提出SR-WM模型,通过功能角色绑定实现语义接口,在LIBERO模拟套件等评估中验证了其视觉动力学与规划决策的连接能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-08-28 cs.RO cs.CV 版本更新 78%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: this https URL (https://dpt2026.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02115 2026-08-28 cs.IR 版本更新 78%

Planning over Matrix-Factorization MDPs for Candidate Generation

基于矩阵分解MDP的候选生成规划

Mikhail Trapeznikov, Maksim Utushkin

专题命中 规划决策 :planning(title,abstract)

AI总结 将推荐系统的用户旅程建模为MDP,通过折叠更新用户状态进行规划,实验表明单步前瞻即可显著提升固定嵌入下的检索效果。

Comments Accepted to the 5th Workshop on End-to-End Customer Journey Optimization at KDD 2026. 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-08-28 cs.RO 版本更新 78%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26304 2026-08-28 math.OC 新提交 71%

Multi-Objective Planning for Healthcare Facility Resilience: Mitigate Now or Respond Later?

医疗设施韧性的多目标规划:当前缓解还是事后响应?

Gizem Toplu-Tutay, John J. Hasenbein, Matt Kammer-Kerwick, Erhan Kutanoglu

专题命中 规划决策 :planning(title)

AI总结 本研究针对医疗设施洪水风险,提出双目标两阶段随机优化模型,开发Benders分解与拉格朗日对偶方法,通过得州3752家机构案例验证,可在有限额外成本下平衡经济损失与社会脆弱地区服务中断影响。

Comments Submitted manuscript with supplementary material. Data and code: this https URL (https://doi.org/10.5281/zenodo.21510695)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26867 2026-08-28 cs.AI 新提交 70%

BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click

BekchiAI:一键式测量、观测与控制大语言模型智能体

Mesut Toruk

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 BekchiAI是一款兼具智能体技能测量基准与实时观测控制平台的工具,含2057个测试任务的基准及配套平台,已公开发布并完成多模型对比。

Comments 8 pages, 1 Figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26116 2026-08-28 cs.AI 新提交 70%

The Artificial Experimentalist: Discovery and Control of Self-Organizing Phenomena with Autotelic Reinforcement Learning

人工实验者:利用自目的强化学习发现与控制自组织现象

Marko Cvjetko, Benedikt Hartl, Michael Levin, Clément Moulin-Frier, Pierre-Yves Oudeyer

机构 * Inria Centre at the University of Bordeaux(波尔多大学Inria中心) Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学Wyss生物启发工程研究所) Inria(法国国家信息与自动化研究所) INSA Lyon(里昂国立应用科学学院) CITI(CITI研究所) UR3720(UR3720实验室)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究提出基于自目的强化学习的闭环框架CARL,以Lenia为对象,实现了高效发现、控制自组织孤子及实时引导其穿越迷宫的能力,策略可零样本泛化至分布外条件。

Comments 8 pages, 8 figures. Accepted at ALIFE 2026. Companion website: this https URL (https://developmentalsystems.org/carl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 67%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17873 2026-08-28 cs.LG cs.AI cs.CL 版本更新 67%

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

HINT-SD:针对长 Horizon 智能体的定向 hindsight 自监督学习

Woongyeong Yeo, Yumin Choi, Taekyung Ki, Sung Ju Hwang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出 HINT-SD,一种针对长 Horizon 智能体的定向 hindsight 自监督学习框架,通过全轨迹 hindsight 选择失败相关的动作,并仅在目标动作跨度上应用反馈条件自监督学习,实验表明该方法在 BFCL v3 和 AppWorld 上比密集的每回合反馈基线提高了 18.80 个百分点,同时训练时间降低 2.26 倍。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-08-28 cs.CV 版本更新 67%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Yizhuang Peng, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 规划决策 :tool use(abstract);tool-use(abstract)

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11515 2026-08-28 cs.LG cs.AI cs.CL 版本更新 67%

AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air

AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法

Shiyi Yang, Xiaoxue Yu, Rongpeng Li, Jianhang Zhu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Lab(浙江实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏