arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 50 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 50 篇

2608.26086 2026-08-31 cs.LG cs.AI 版本更新 88%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05614 2026-08-31 cs.AI 版本更新 85%

Real-Time AI Service Economy: A Framework for Agentic Computing Across the Continuum

实时AI服务经济:跨连续体的代理计算框架

Lauri Lovén, Alaa Saleh, Reza Farahani, Ilir Murturi, Miguel Bordallo López, Praveen Kumar Donta, Schahram Dustdar

机构 * Future Computing Group, University of Oulu(奥卢大学未来计算组) Department of Information Technology (ITEC), University of Klagenfurt(克雷夫特大学信息科技学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电学院) Multimodal Sensing Lab, University of Oulu(奥卢大学多模态感知实验室) Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) ICREA Barcelona, Spain and the Distributed Systems Group, TU Wien(巴塞罗那ICREA和维也纳技术大学分布式系统组)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一种混合架构,通过封装复杂子图到资源切片,解决实时AI服务在设备-边缘-云连续体上的资源分配问题,验证了依赖图拓扑对价格稳定性和系统性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 85%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30434 2026-08-31 cs.LG cs.AI cs.CL cs.MA 版本更新 85%

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

LongDS-Bench:关于长周期智能数据分析的失败

Kewei Xu, Xiaoben Lu, Shuofei Qiao, Zihan Ding, Haoming Xu, Lei Liang, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LongDS基准,用于评估长周期多轮数据分析中智能体维护和更新分析状态的能力,发现最佳模型平均准确率仅48.45%,且长周期错误占失败原因的52%-69%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27847 2026-08-31 cs.AI 新提交 83%

From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis

从不确定性到临床风险:面向交互式医疗诊断的严重程度感知共形规划

Yue Zhou, Haiyang Zhou, Jin Zhang, Kong Wang, Yongxin Ni, Youhua Li, Hanwen Du

机构 * Lanzhou University(兰州大学) Hunan University(湖南大学) National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学) The Ohio State University(俄亥俄州立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对交互式医疗诊断漏诊重症的风险与长程规划缺失问题,提出严重程度感知共形临床规划框架,在DDXPlus和MediQ上提升了诊断准确性、鉴别质量并降低了高风险错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-08-31 cs.CV cs.AI 版本更新 83%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Lin Gao, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 规划决策 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments Accepted to SIGGRAPH ASIA 2026; Project page: this https URL (https://yuci-gpt.github.io/Beyond-Pixels/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-08-31 cs.CR 版本更新 82%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-08-31 cs.RO 版本更新 82%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12831 2026-08-31 cs.RO eess.SY 版本更新 82%

SIMPNet: Spatial-Informed Motion Planning Network

SIMPNet:空间感知运动规划网络

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

专题命中 规划决策 :planning(title,abstract)

AI总结 针对现有基于采样的运动规划器在高维空间及复杂环境中效率低的问题,提出SIMPNet,其通过GNN与交叉注意力机制生成知情采样,经UR5e评估,性能优于基准规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28305 2026-08-31 cs.RO cs.AI 新提交 79%

PanelShield: Verifiable Closed-Loop Safe Planning for Robotic Industrial Panel Operation

PanelShield:面向机器人工业面板操作的可验证闭环安全规划

Guipeng Xin, Jiahe Xu, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对工业面板操作的安全约束规划问题,提出PanelShield框架,结合LTL与安全FSM实现可验证闭环规划,实验表明其可降低违规率至2.7%并提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28300 2026-08-31 cs.RO cs.AI 新提交 79%

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

MaCoPlanner:面向机器人工业面板操作的、结合主动安全验证的大语言模型辅助人工编译任务规划

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

机构 * Huazhong University of Science and Technology(华中科技大学) University of New South Wales(新南威尔士大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 MaCoPlanner是面向机器人工业面板操作的规划框架,通过编译设备手册知识生成规划,经主动安全验证后执行,大幅提升了任务成功率,在Level-2、Level-3任务上分别提升了21.6、17.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27609 2026-08-31 cs.RO cs.AI 新提交 79%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-31 cs.AI 版本更新 79%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-08-31 cs.AI 版本更新 79%

SEGRA: A Structured Experience Guided Reasoning Agent for Property Graph Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

Comments Accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 78%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19881 2026-08-31 q-bio.NC 版本更新 78%

Planning difficulty and temporal constraints differently shape the level of detail and ordering of visual exploration

问题难度和等待时间影响人类规划中视觉策略的细节和时间组织水平

Mattia Eluchans, Giovanni Pezzulo

专题命中 规划决策 :planning(title,abstract)

AI总结 研究探讨了问题难度和等待时间如何影响人类规划中视觉策略的细节和时间组织,发现难度增加视觉覆盖,时间影响执行中的重计划程度和目光路径一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11072 2026-08-31 cs.RO math.OC 版本更新 78%

Receding Fixed-Horizon Optimization for Near-Time-Optimal Trajectory Planning and Control

后退固定时域优化用于近时间最优轨迹规划与控制

Haotian Tan, Yuan-Hua Ni

机构 * College of Artificial Intelligence, Nankai University, Tianjin 300350, PR China(人工智能学院,南开大学,天津)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对自动驾驶车辆时间最优轨迹规划的两大挑战,提出分层凸优化框架,分解问题为短固定时域规划循环,实验显示其成功率更高、计算时间更短,可实现可靠实时近时间最优轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30105 2026-08-31 cs.SE 版本更新 77%

EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution

EvoRepair: 通过基于经验的自我进化增强漏洞修复智能体

Haichuan Hu, Guoqing Xie, Quanjun Zhang, Jiawei Liu, Shengcheng Yu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 提出EvoRepair框架,通过循环学习-修复过程积累和复用漏洞修复经验,在多个基准上显著提升LLM的自动漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-08-31 cs.AI cs.MA 版本更新 77%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 规划决策 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28128 2026-08-31 cs.LG cs.AI 新提交 76%

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28182 2026-08-31 physics.soc-ph cs.CL 新提交 74%

Benchmarking large language model agent societies against human behavioural distributions

针对人类行为分布的大语言模型智能体群体基准测试

Raad Bin Tareaf

专题命中 规划决策 :agent(title);分类 cs.CL

AI总结 该研究开发了开源工具SILICA,测试12个大语言模型智能体群体与人类行为的契合度,发现多数模型仅起始行为与人类相近,最终行为、合作模式等均存在显著差距,仅推理训练模型表现接近人类,当前硅基智能体群体仅支持探索性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22538 2026-08-31 cs.AI 版本更新 74%

STAGE: Stateful Translation to Agentic Graph Execution with Policy-Scoped Context and Deterministic Control

STAGE:基于策略范围上下文与确定性控制的面向智能体图执行的有状态翻译

Mengxi Luo, Changjia Chen, An Cao, Zirong Huang, Wanyi Dai

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 该研究提出可执行图框架\textsc{Stage},将模型判断限缩于策略范围节点、流程控制交由确定性代码,在多基准测试中提升了策略执行的任务成功率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-08-31 cs.AI 版本更新 74%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-08-31 cs.CL cs.AI 新提交 73%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 规划决策 :agentic(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 73%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00864 2026-08-31 math.OC 版本更新 71%

BattOpt: Optimal Facility Planning for Electric Vehicle Battery Recycling

BattOpt:电动汽车电池回收的最优设施规划

Matthew Brun, Xu Andy Sun

专题命中 规划决策 :planning(title)

AI总结 本文提出多阶段随机优化模型,将EverBatt转化为决策工具,结合计量经济学预测生成场景,得出最优电池回收投资可降22%制造成本、26%环境影响,算法求解速度提升14倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28490 2026-08-31 cs.CR cs.AI 新提交 70%

LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment

基于大语言模型(LLM)的软件与系统安全智能体:方法、应用与评估

Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过系统综述2023-2026年的同行评审文献,梳理基于LLM的软件与系统安全智能体的技术方法、应用及评估,指出当前智能体权限未受限、行为不可审计的局限,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27969 2026-08-31 cs.AI 新提交 70%

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents

openJiuwen:超越静态框架的长程编码智能体

openJiuwen Team: Tao Yu, Xinyu Zhang, Qianqian Chen, Xiaoneng Xiang, Chia Kwangyang, Xingchen Huang, Ran Chen, Yangkai Ding, Zheng Wang, Yeo Boon Hong, Bingzheng Gan, Enrui Hu, Shuo Cheng, Deyang Li, Ruifeng Shi, Hongbo Wang, Qi Ye, Xuefeng Jin, Zhangchun Zhao

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 openJiuwen是一款开源智能体框架,针对长程编码智能体的结构可组合性与运行时适应性挑战设计,在SWE-bench Verified和Terminal-Bench 2.1上的准确率分别达82.6%、87.19%,性能优于官方排行榜顶尖方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23629 2026-08-31 cs.RO cs.AI 版本更新 70%

Macro-Operator Generation and Predicate Selection for TAMP Operator Learning

TAMP算子学习的宏算子生成与谓词选择

Can Emir Bora, Emre Ugur

机构 * Bogazici University(博加齐奇大学)

专题命中 规划决策 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对TAMP算子学习的效率问题,提出自动生成宏算子并剪枝未被引用谓词的系统,在四个TAMP领域实现最高4.6倍规划加速,还解决了基线无法处理的长序列任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-08-31 cs.AI cs.CL cs.SE 版本更新 69%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ye Ziwei

专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.CL、cs.SE

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

Comments Accepted at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏