arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-17 至 2026-08-17 共收录 46 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 3 篇

2511.08001 2026-08-17 cs.RO cs.MA 版本更新 71%

Effective Game-Theoretic Motion Planning via Nested Search

通过嵌套搜索实现有效的博弈论运动规划

Avishav Engle, Andrey Zhitnikov, Oren Salzman, Omer Ben-Porat, Kiril Solovey

机构 * Technion–Israel Institute of Technology(技术离子以色列理工学院)

专题命中 工具调用 :planning(title)

AI总结 本文提出GTNS方法,通过嵌套搜索有效计算博弈论中的纳什均衡,适用于自动驾驶等场景,实现快速且可靠的运动规划。

Comments Updated version. Offline graph creation runtime added. Acknowledgements added

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10155 2026-08-17 eess.IV cs.CV 版本更新 50%

Data-driven registration and modeling of brain deformation for image-guided neurosurgery

数据驱动的图像配准与变形建模在图像引导神经外科中的应用:系统综述

Tiago Assis, Colin P. Galvin, Joshua P. Castillo, Nazim Haouchine, Marta Kersten-Oertel, Zeyu Gao, Mireia Crispin-Ortuzar, Stephen J. Price, Thomas Santarius, Yangming Ou, Sarah Frisken, Nuno C. Garcia, Alexandra J. Golby, Reuben Dorent, Ines P. Machado

机构 * LASIGE, Faculty of Sciences, University of Lisbon(里斯本大学科学学院LASIGE) Department of Neurosurgery and Department of Radiology, Brigham and Women's Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院神经外科与放射科) Gina Cody School of Engineering and Computer Science, Concordia University(康科迪亚大学工程与计算机科学学院) Cancer Research UK Cambridge Centre, University of Cambridge(剑桥大学癌症研究英国中心) Department of Oncology, University of Cambridge(剑桥大学肿瘤科) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系) Computational Health Informatics Program (CHIP) and Department of Radiology, Boston Children's Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院计算健康信息学计划与放射科) Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学巴黎脑研究所-ICM)

专题命中 工具调用 :planning(abstract)

AI总结 系统综述2020-2025年间基于学习的脑变形补偿方法,包括深度学习配准、变形场回归、多模态对齐、切除感知架构及混合模型,指出当前方法在鲁棒性、标准化基准、可解释性和临床部署方面的局限,并展望未来研究方向。

Comments 41 pages, 7 figures, 9 tables. Final postprint version available in Medical Image Analysis at https://doi.org/10.1016/j.media.2026.104217

Journal ref Assis, T., et al. (2026). Data-driven registration and modeling of brain deformation for image-guided neurosurgery. Medical Image Analysis, 114, 104217

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12486 2026-08-17 cs.GT 版本更新 50%

Simultaneous AlphaZero: Extending Tree Search to Markov Games

同时AlphaZero:将树搜索扩展到马尔可夫游戏

Tyler Becker, Zachary Sunberg

专题命中 工具调用 :planning(abstract)

AI总结 同时AlphaZero通过矩阵游戏求解器扩展了AlphaZero框架,以处理多步骤双人零和马尔可夫游戏中的同时行动和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 17 篇

2604.11753 2026-08-17 cs.CL 版本更新 83%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at https://github.com/princeton-pli/AggAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12751 2026-08-17 cs.AR cs.AI 版本更新 79%

SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization

SynAct:用于自适应综合优化的推理-行动大语言模型智能体

Fangzhou Liu, Peiyi Han, Jiawei Liu, Yuan Pu, Zhuolun He, Rongliang Fu, Tsung-Yi Ho, Bei Yu

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 SynAct是一种自适应闭环LLM推理-行动智能体,通过结合电路状态、工具知识与历史经验发布针对性命令,在14个商用设计实验中将平均WNS降至引导式综合的27%,实现高效自适应逻辑综合优化。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09035 2026-08-17 cs.SD cs.AI cs.MM 版本更新 79%

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

MusicLayout:用于可控文本生成音乐的显式结构规划

Shuyu Li, Kejun Zhang, Jiahe Lei, Shulei Ji, Zihao Wang, Jiaxing Yu, Wanying Wu, Lei Wang

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Ant Group(蚂蚁集团)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对文本生成音乐结构隐含难控的问题,提出MusicLayout显式中间表示,将其集成到统一自回归框架实现布局级控制,实验证实该方法可改进音乐长程结构组织并支持布局级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01236 2026-08-17 cs.RO cs.AI 版本更新 79%

LLM-Advisor: An LLM Advisor for Cost-efficient Path Planning across Multiple Terrains

LLM-Advisor: 一种用于多地形高效路径规划的LLM基准

Ling Xiao, Toshihiko Yamasaki

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。

Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09430 2026-08-17 cs.RO cs.AI 版本更新 79%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13552 2026-08-17 cs.CV 版本更新 78%

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: https://kxding.github.io/project/PlayWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08990 2026-08-17 cs.CV 版本更新 78%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 规划决策 :agentic(title,abstract)

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16509 2026-08-17 cs.RO cs.LG 版本更新 70%

Learning-Guided Sparsification of Dynamic Graphs in Robotic Exploration

基于学习的动态图稀疏化在机器人探索算法中的应用

Adithya V. Sastry, Bibek Poudel, Weizi Li

机构 * Independent Researcher(独立研究者) University of Tennessee, Knoxville(田纳西大学,基洛尼尔) University of California, Riverside(加州大学河滨分校)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的框架,利用PPO算法在机器人探索中稀疏化动态图,减少冗余信息,提升性能,实验表明该方法能有效降低图规模并提高探索一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 62%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 62%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at https://idan-tankel.github.io/InformCT_ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06746 2026-08-17 cs.AI cs.LG 版本更新 62%

Semantically Labelled Automata for Multi-Task Reinforcement Learning with LTL Instructions

语义标注的自动机用于带有LTL指令的多任务强化学习

Alessandro Abate, Giuseppe De Giacomo, Mathias Jackermeier, Jan Kretínský, Maximilian Prokop, Christoph Weinhuber

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学) Masaryk University Brno(布拉格马萨里克大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于语义标注自动机的多任务强化学习方法,利用LTL指令实现高效任务嵌入和泛化能力,实验表明其在复杂规范下的优越性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11195 2026-08-17 cs.AI cs.CC cs.HC math.FA 版本更新 57%

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

格罗滕迪克常数的长周期AI研究:人机数学协作的案例研究

Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过案例探究AI在数学研究中的有效应用,利用AI研究系统将格罗滕迪克常数的最优界收紧,同时分析了AI用于数学研究的优劣势及相关经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 57%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08491 2026-08-17 cs.RO cs.AI cs.SY eess.SY 版本更新 57%

Edge Case Detection in Automated Driving: Methods, Challenges, and Future Directions

自动驾驶中的边缘案例检测:方法、挑战与未来方向

Saeed Rahmani, Sabine Rieder, Erwin de Gelder, Marcel Sonntag, Jorge Lorente Mallada, Sytze Kalisvaart, Vahid Hashemi, Bart van Arem, Simeon C. Calvert

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对自动驾驶边缘案例检测缺乏全面综述的问题,对相关方法分层分类,引入知识驱动方法,评估检测技术指标,指出数据、验证等挑战,为自动驾驶测试提供框架与实际测试支持。

Comments This article has been accepted for inclusion in a future issue of this journal. Content is final as presented, with the exception of pagination. doi: https://doi.org/10.1109/TITS.2026.3715674

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11461 2026-08-17 cs.RO 版本更新 50%

CoViLLM: An Adaptive Human-Robot Collaborative Assembly Framework Using Large Language Models

CoViLLM:一种利用大语言模型的自适应人机协作装配框架

Jiabao Zhao, Jonghan Lim, Hongliang Li, Ilya Kovalenko

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。

Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07791 2026-08-17 stat.ME stat.AP 版本更新 50%

Design Effect Ratios for Bayesian Survey Models: A Diagnostic Framework for Identifying Survey-Sensitive Parameters

贝叶斯调查模型的设计效应比率:一种识别调查敏感参数的诊断框架

JoonHo Lee, Matthew R. Williams, Terrance D. Savitsky

专题命中 规划决策 :workflow(abstract)

AI总结 本文提出设计效应比率作为识别调查敏感参数的诊断工具,通过选择性校正提升覆盖率并保持受保护参数的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 7 篇

2608.12921 2026-08-17 cs.MA cs.AI 版本更新 88%

Discovering Efficient and Explainable Communication Topologies for LLM-based Multi-Agent Systems via Causal Inference

通过因果推理发现基于大语言模型的多智能体系统的高效且可解释的通信拓扑

Junzhi Li, Peng He, Qirui Ji, Wei Wang, Lixiang Liu, Chuxiong Sun

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 该研究针对基于LLM的多智能体系统通信拓扑可解释性不足的问题,提出模型无关框架E2-Explainer,通过因果推理识别关键通信子图,在保持任务性能的同时降低了通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06452 2026-08-17 cs.CL 版本更新 88%

Learning to Interrupt in Language-based Multi-agent Communication

语言基多智能体通信中的中断学习

Danqing Wang, Da Yin, Ruta Desai, Lei Li, Asli Celikyilmaz, Ansong Ni

机构 * CMU(卡内基梅隆大学) Meta FAIR

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 本文提出一种可中断的通信框架,通过学习预测合适的中断点,减少通信成本,提升多智能体任务性能。

Comments Accepted in CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 88%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00530 2026-08-17 cs.SE 版本更新 77%

Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions

Sakura: 一种从自然语言测试描述生成复杂测试的方法

Tyler Stennett, Rangeet Pan, Bridget McGinn, Alessandro Orso, Saurabh Sinha

专题命中 多智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出基于多智能体框架Sakura,从自然语言描述生成结构复杂的测试用例,通过分解描述、静态分析定位、迭代合成与执行反馈,显著提升测试可编译性和覆盖率。

Comments 25 pages, 11 figures. Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04743 2026-08-17 cs.CL cs.AI cs.LG 版本更新 75%

TIDE: Proactive Multi-Problem Discovery via Template-Guided Iteration

TIDE:通过模板引导迭代的主动多问题发现

Soyeong Jeong, Jinheon Baek, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出TIDE框架,通过模板引导的迭代机制主动发现用户上下文中隐藏的多个问题,并给出具体行动方案,在个人工作区和软件仓库两个场景中显著提升任务覆盖率和问题识别与解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30893 2026-08-17 cs.RO cs.MA 版本更新 67%

Sampling-Based Coordination-Informed Multi-Objective Multi-Robot Reinforcement Learning

基于采样的协调感知多目标多机器人强化学习

Antonio Marino, Esteban Restrepo, Soon-jo Chung, Paolo Robuffo Giordano, Claudio Pacchierotti

机构 * University of Cambridge(剑桥大学) CNRS, Univ Rennes, Inria, IRISA(法国国家科学研究中心、雷恩大学、法国国家信息与自动化研究所、IRISA) California Institute of Technology(加州理工学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 提出CIMORL框架,通过分布式权重预测、特权专家训练和采样变体(CIMORL-TS/MPPI),在合作与对抗场景中实现Pareto最优解,超体积提升21.2%。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13030 2026-08-17 cs.CR cs.MA cs.NI 版本更新 50%

InterSAGE: The Secure and Verifiable Interoperability Protocol for An Internet of Agents

InterSAGE:面向智能体互联网的安全可互操作且可验证的协议

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Zhuotao Liu

专题命中 多智能体 :agent(abstract)

AI总结 针对现有智能体互操作协议缺失安全底层的问题,提出InterSAGE四层协议套件,补充MCP等通信协议,经对比验证其为首个统一实现四大安全特性的架构。

Comments 35 pages, 4 figures, 7 tables. Positioning paper

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 工作流自动化 5 篇

2509.21834 2026-08-17 cs.MA 版本更新 88%

RobustFlow: Towards Robust Agentic Workflow Generation

RobustFlow:面向鲁棒智能体工作流生成

Shengxiang Xu, Jiayi Zhang, Shimin Di, Yuyu Luo, Liang Yao, Hanmo Liu, Jia Zhu, Min-Ling Zhang

专题命中 工作流自动化 :workflow(title,abstract);agentic(title,abstract)

AI总结 针对现有智能体工作流生成方法对语义等价不同表述指令鲁棒性不足的问题,提出RobustFlow系统,结合偏好优化与专用基准,在多扰动下鲁棒性得分70%--90%,优于AFlow、ScoreFlow等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28008 2026-08-17 cs.CL cs.AI 版本更新 62%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11625 2026-08-17 cs.AI 版本更新 57%

Making AI-Generated Feedback Matter: A Large-Scale Study of Feedback Workflows and Student Enactment

让AI生成的反馈发挥作用:从提供到学生执行

Omar Alsaiari, Nilufar Baghaei, Jason M. Lodge, Dragan Gaševi'c, Naomi Winstone, Hassan Khosravi

机构 * The University of Queensland(昆士兰大学) University of Surrey(萨里大学) The University of Hong Kong(香港大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 该研究通过13037名学生的大规模准实验,发现主动构建的AI反馈执行工作流可显著提升学生对AI反馈的接受度、自我评估信心及作品质量,强调需设计针对性AI反馈工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏