arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 471 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 46 篇

2608.30092 2026-09-01 cs.CL cs.AI 新提交 62%

Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer

Arkios:从零训练的开放英尼双语语言模型,带有天城文感知分词器

Sajal Regmi, Siddhartha Pudasaini, Chetan Phakami Pun

机构 * Karela Technologies Inc.(卡雷拉科技公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出从零训练的10.4亿参数英尼双语语言模型Arkios,其在ARC数据集上表现优于同规模模型,揭示了低资源语言模型评估的格式偏差问题,并开源了模型权重。

Comments 7 pages, 6 tables. Companion paper (tokenizer): arXiv:2608.26449 (https://arxiv.org/abs/2608.26449)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29197 2026-09-01 cs.LG cs.AI cs.GT 新提交 62%

PokaiTrainer: Scaling Belief-State Search to Competitive Pokémon VGC

PokaiTrainer:将信念状态搜索扩展至具备竞争力的宝可梦电子竞技游戏(VGC)

Max Yu

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 PokaiTrainer将Student of Games算法适配至自主开发的Rust战斗引擎PokaiEngine,构建出击败多数人类玩家、峰值进入宝可梦VGC天梯前500的竞技智能体。

Comments 22 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-09-01 cs.CR cs.AI cs.CL 版本更新 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30959 2026-09-01 cs.CV cs.AI 新提交 57%

LOCI: A Locator-Critic with Refinement Loop

LOCI:带精化循环的定位器-评判器

Walid Bousselham, Mathilde Caron, Arsha Nagrani, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30426 2026-09-01 cs.CL 新提交 57%

Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

面向任务的对话系统中通过无监督微调学习推理与使用工具

Markel Ferro, Oier Lopez de Lacalle

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU HiTZ中心 - Ixa)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本研究针对任务导向对话系统的动态信息检索缺陷,提出适配ReAct框架的无监督微调方法,使LLMs可访问外部知识,其微调后的8B模型性能超越70B上下文系统,在SIMMC数据集上表现优异。

Comments Accepted to SEPLN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 57%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: https://doi.org/10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30303 2026-09-01 cs.CL 新提交 57%

Lazy Grounding: Attacking Search Agents with Factual Evidence

惰性接地:用事实证据攻击搜索智能体

Yulin Zhang, Yukun Huang, Sanxing Chen, Tianyi Lin, Ziang Yang, Xunjian Yin, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 该研究提出惰性接地攻击,即搜索智能体被邻近问题的事实证据误导,实验显示其可降低准确率最高17.3个百分点,表明需防御事实证据的误用。

Comments Accepted to EMNLP 2026 (Main Conference). Code: this https URL (https://github.com/frankyzha/lazy-grounding)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30162 2026-09-01 cs.LG 新提交 57%

Reinforcement Learning for Symbolic Equation Solving

用于符号方程求解的强化学习

Kevin P O Keeffe

机构 * Starling Research Institute(斯塔林研究所)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 该研究提出一种强化学习智能体,将代数建模为带动态动作空间的MDP,在符号方程求解任务上优于非学习型搜索方法,尤其在指数方程上表现突出,但仅针对四类受控开式方程有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28638 2026-09-01 cs.AI 新提交 57%

Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce

基于代理引导的求解与复现的自进化技能

Jiale Liu, Pinze Ren, Yuqi Xia, Huan Wang, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) The University of Edinburgh(爱丁堡大学) Tsinghua University(清华大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对智能体自进化技能的缺陷,提出reSolve框架,通过求解与复现协议、代理验证器增强奖励及束搜索,使廉价模型技能性能超人工策划基线,且在自然科学任务上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-09-01 cs.CL 版本更新 57%

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30705 2026-09-01 cs.CV 新提交 50%

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:面向多模态大语言模型的单次可解释视觉搜索方法

Jingyi He, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Munich(慕尼黑亥姆霍兹中心) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 工具调用 :tool-use(abstract)

AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30673 2026-09-01 cs.RO 新提交 50%

CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments

CIG-RL:面向不确定环境下源项估计的好奇心驱动信息引导强化学习

Junhee Lee, Seunghwan Kim, Hongro Jang, Hyungjin Kim, Hyoungho Park, Changseung Kim, Hyondong Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) Ulsan National Institute of Science and Technology (UNIST)(蔚山国家科学技术研究院(UNIST))

专题命中 工具调用 :agent(abstract)

AI总结 针对不确定环境下源项估计的问题,提出CIG-RL方法,通过好奇心驱动的信息引导强化学习,结合不确定性自适应主动感知奖励提升鲁棒性,经模拟与真实实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30288 2026-09-01 cs.CR 新提交 50%

Extracting Knowledge from Tools in LLM Agents

从大语言模型智能体中的工具提取知识

Chuanchao Zang, Jianing Wang, Wenyu Chen, Xiangtao Meng, Li Wang, Xinyu Gao, Yingkai Dong, Zheng Li, Shanqing Guo

专题命中 工具调用 :agent(abstract)

AI总结 本文针对LLM智能体中工具介导的知识提取风险,提出仅基于查询的提取攻击ToolSiphon,通过工具对比分析与证据链式反馈两个信号,在多工具、多数据集上实现了较高的源记录恢复率,且对防御措施和现实平台有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29800 2026-09-01 cs.CV 新提交 50%

Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit

伪造结果下医学影像智能体中依赖来源的顺从性:一项试点审计

Ridam Roy, Md Shahriar Rashid, Md. Rajib Mia

机构 * Daffodil International University(水仙花国际大学) Boise State University(博伊西州立大学)

专题命中 工具调用 :agent(abstract)

AI总结 本研究通过试点审计发现,ReAct风格的医学影像工具调用智能体在散文标注的伪造结果下更易修改自身正确答案,顺从性远高于工具返回的伪造结果,该结果来自未达停止规则的小规模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11500 2026-09-01 quant-ph 版本更新 50%

Digital Annealer-Assisted CNOT Oriented Quantum Circuit Transpilation with Integrated QUBO Mapping and Routing

数字退火辅助的精度优先量子电路编译与集成QUBO映射与路由

Kazuma Watanabe, Hideaki Kawaguchi, Shin Nishio, Takahiko Satoh

专题命中 工具调用 :workflow(abstract)

AI总结 本文提出利用数字退火进行精度优先的量子电路编译,通过混合策略和全退火策略实现CNOT门数减少,提升近量子硬件的实用性。

Comments 7 pages, 4 figures. Accepted to IEEE Quantum Week (QCE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00205 2026-09-01 econ.TH 版本更新 50%

Optimal Platforms for Search and Matching

搜索与匹配的最优平台

Cole Wittbrodt

专题命中 工具调用 :agent(abstract)

AI总结 本文研究在线搜索匹配平台,构建模型刻画匹配特征为私人信息时收益最大化的平台,发现最优平台匹配完全无错配,低效率仅源于排斥,结论对收费方式及搜索速度调整均稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 112 篇

2606.03965 2026-09-01 cs.CL cs.AI 版本更新 91%

Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

Agentic Chain-of-Thought Steering:实现高效且可控的LLM推理

Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley

专题命中 规划决策 :agentic(title,title_cn);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Agentic Chain-of-Thought Steering (ACTS)方法,通过强化学习训练控制器智能体在推理过程中自适应地选择推理策略和引导短语,实现预算感知的策略控制,从而在保持推理质量的同时显著节省token,并支持准确率-效率的可控权衡。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30924 2026-09-01 cs.CL 新提交 91%

TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded Reasoning

TRIPPULSE:基于评论推理的多智能体旅行规划

Priyanshu Karmakar, Borru Vijay Sai, Shubhojit Mallick, Abhik Jana, Shreya Ghosh, Manish Gupta

机构 * Microsoft(微软公司) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title);分类 cs.CL

AI总结 TRIPPULSE是基于评论推理的多智能体旅行规划框架,分解行程生成任务为多智能体并结合10万+评论与RGPA指标,可兼顾约束满足与个性化体验。

Comments 31 pages, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30441 2026-09-01 cs.CR 新提交 87%

ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems

ECLIPSE:针对长视程智能体系统的自演化隐蔽提示注入攻击

Shiqian Zhao, Yangfan Zhou, Xinfeng Li, Runyi Hu, Yechao Zhang, Yi Xie, Tianwei Zhang, Luu Anh Tuan

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 本研究提出ECLIPSE框架,结合隐蔽攻击轨迹合成与工具链引导,在LASE-Bench上实现高攻击成功率,现有安全措施难以可靠防御,凸显需开发更有效防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24888 2026-09-01 cs.AI 版本更新 86%

SimGuide: Typed Multi-Context User Representations for Preference-Conditioned Agent Planning

SIMGUIDE:用于个性化智能体规划的过程式基础多上下文表示

Chirag Shah

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :planning(title,abstract);agent(title);分类 cs.AI

AI总结 本研究针对个性化AI智能体无法适配用户多场景优先级的问题,提出SIMGUIDE方法,构建SIMBENCH基准验证,发现过程式基础的Sims优于RAG,且表示格式是关键设计变量。

Comments Previous version had some results that were hard to verify or reproduce, so new experiments were done and many parts of the paper were changed to reflect that

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-09-01 cs.CV cs.AI cs.LG 版本更新 86%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-09-01 cs.RO cs.AI cs.ET cs.MA 版本更新 85%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29596 2026-09-01 cs.AI cs.LG cs.MA 新提交 84%

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security

面向智能体技能的系统基础:架构、生命周期与安全性

Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia

机构 * Google LLC(谷歌有限责任公司) Purdue University(普渡大学)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-09-01 cs.AI cs.CL 版本更新 84%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30165 2026-09-01 q-bio.QM cs.AI 新提交 84%

Science sandboxes measure the scientific capability of AI agents

科学沙箱可衡量AI智能体的科学能力

Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai, Kenneth B. Hsu, Yasha Ektefaie, Shantanu Singh, Sangeeta N. Bhatia, Steven K. Reilly, Ryan Tewhey, Eric S. Lander, Pardis C. Sabeti

专题命中 规划决策 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI

AI总结 研究人员提出科学沙箱框架,在调控基因组学和蛋白质适应性预测场景中评估前沿AI智能体的科学能力,发现其常不理解系统规则却能优化指标,该框架可衡量科学能力前沿并提供研究环境。

Comments 72 pages, 5 main figures, 3 tables, and 5 supplementary figures; includes supplementary agent instructions and harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-09-01 cs.LG 版本更新 83%

QueryGraph: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 规划决策 :planning(title,abstract);tool use(abstract);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28995 2026-09-01 cs.RO cs.CV 新提交 82%

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra:一种具有离散潜在规划与连续流匹配执行能力的导航世界动作模型

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) Kiel University(基尔大学) Ludwig Maximilian University Munich(慕尼黑大学) Ewha Womans University(梨花女子大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出Hydra模型,通过将规划器移入模型内部消除生成模型与规划器的表示不对齐问题,结合离散潜在规划与条件流匹配,在物理机器人平台上的目标导向规划与闭环执行能力表现优异。

Comments 29 pages, 12 figures. this https URL (https://robotixx.github.io/hydra)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-09-01 cs.RO 版本更新 82%

SCOPE: Field-of-View-Aware Path Planning in Unknown Space via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: this https URL (https://yuanjunbin.github.io/scope-planner/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 规划决策 :agent(title);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14252 2026-09-01 cs.RO cs.AI cs.CL 版本更新 82%

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

MEMORA:基于自我中心视频的具身动作记忆用于推理与规划

Zihao Yu, Xiu Yuan, Chongjie Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对长期机器人规划中对具身经验记忆的需求,提出MEMORA方法,通过形成-巩固-检索生命周期及四种类型存储实现具身动作记忆,经实验评估取得良好结果,能为机器人规划提供记忆上下文。

Comments 50 pages. v1: Oral presentation at the Robotics: Science and Systems 2026 Workshop on Foundation Models for Robot Planning (FM4RoboPlan). v2: Accepted to the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏