arXivDaily arXiv每日学术速递 周一至周五更新
爬虫太凶残了,网站这两天有点不稳定,紧急升级ing

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 481 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 88 篇

2608.31076 2026-09-01 cs.CL cs.AI cs.IR cs.LG cs.MA cs.SE 新提交 70%

Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

先评估再改进:面向自动研究智能体的自动评分准则生成

Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang, Yijun Chen, Zirui Xue, Shumin Deng

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University of Technology(浙江工业大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AutoSciRub框架,在自主科学研究前生成任务特定可执行评分准则,经多基准测试可提升智能体研究表现,为自主科研提供有效控制机制。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30916 2026-09-01 cs.LG stat.AP stat.ML 新提交 70%

Selection-Aware Stress Testing for Interactive Agents

面向交互式智能体的选择感知压力测试

Yang Xu, Chenang Li, Jiefu Zhang, Haixiang Sun, Zhou Li, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.LG

AI总结 该研究针对智能体评估的选择偏差问题,提出SASST方法,通过发现任务学习重加权并在独立确认任务评估,经实验验证其有效性,发现工作流程优势在确认阶段可能消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 70%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30188 2026-09-01 cs.CL 新提交 70%

GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

GPAgentBench-2K:复杂临床动作空间中的大语言模型智能体基准测试

Boqi Chen, Xudong Liu, Yunke Ao, Heejin Do, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 该研究推出首个面向初级保健临床决策的CMDP LLM智能体基准GPAgentBench-2K,评估16种LLM时发现其存在临床质量-安全差距,且C-GRPO建模约束仍未达临床安全要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29133 2026-09-01 cs.CL 新提交 70%

AI Historian: Helping historians organize and verify person-centred temporal clues from dispersed historical narratives

AI历史学家:帮助历史学家从分散的历史叙事中整理和验证以人为中心的时间线索

Yifeng Lu, Zijie Yang, Jie Li, Qingkai Min, Yue Zhang

机构 * Westlake University(西湖大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 研究提出AIH智能体系统,可从分散历史叙事中整理验证时间线索,在《史记》案例中表现优于人类及大语言模型,已应用于多国历史材料并降低整理成本。

Comments 37 pages, 21 figures. Code: https://github.com/YiFengLu1999/AI-Historian

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28824 2026-09-01 cs.AI 新提交 70%

Discovering Machine Correlates of Consciousness

发现机器意识关联物

Romain Salvi, Ouri Wolfson

机构 * Pirouette Software Inc.(皮鲁埃特软件公司) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Polytechnic of Turin(都灵理工大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出可迁移的机器意识关联物(MCCs)定义,通过对Llama-2 7B和Llama-3.1 70B开展实验,发现规模更大的Llama-3.1 70B中存在MCCs,且MCCs可用于检测AI智能体情绪。

Comments published in: Springer Lecture Notes in Artificial Intelligence Vol. 16855, Proceed- ings of the 19th International Conference on Artificial General Intelligence (AGI- 2026), San Francisco, CA, July 2026. pp. 237-255 https://doi.org/10.1007/978-3- 032-33195-3_18

Journal ref Springer Lecture Notes in Artificial Intelligence Vol. 16855, Proceedings of the 19th International Conference on Artificial General Intelligence (AGI-2026), San Francisco, CA, July 2026. pp. 237-255

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28596 2026-09-01 cs.AI 新提交 70%

Paper Pilot: A Human-in-the-Loop Expert System for Evidence-Traceable Scientific Manuscript Generation in Applied Sciences

Paper Pilot:面向应用科学的可追溯证据的科学手稿生成的人在环专家系统

Nidhi Jha, Siddharth Chaudhary, Ajinkya Kulkarni

机构 * University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Paper Pilot,一种应用科学领域可追溯证据的人在环专家系统,通过8个批准门等机制解决AI辅助手稿生成的治理问题,实证验证其可减少引用伪造,将LLM辅助写作定位为受控人机决策支持流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28594 2026-09-01 cs.AI 新提交 70%

From Question-First to Analyst-First: Domain-Expert Skills and Verified Knowledge Compilation for Proactive Enterprise Analytics

从问题优先到分析师优先:面向主动企业分析的领域专家技能与验证知识编译

Harmohit Singh, Rahul Sharma

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究提出了一种从问题优先转为分析师优先的主动企业分析系统,通过领域专家技能抽象与离线知识编译循环实现,无需查询日志,可生成验证过的报告与建议问题。

Comments 21 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-09-01 cs.CL cs.DB 版本更新 70%

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.CL

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-09-01 cs.RO cs.AI cs.CV 版本更新 70%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Shang Wu, Jiayi Wang, Jianshu Zhang, Jihai Zhao, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

Comments v2:Expanded the supplementary materials by adding three sections-Scene YAML, Robot Embodiment List, and Atomic Skill List-corrected typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-09-01 cs.CL 版本更新 70%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 60 pages, 56 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29410 2026-09-01 cs.IR 新提交 67%

Agents as Knowledge Integrator and Utilizer in Multimodal Recommendation

智能体作为多模态推荐中的知识整合器与利用器

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Puzhen Wu, Zewei Liu, Zheng Lin, Jianheng Tang, Jing Yang, Wei Wang, Xiping Hu, Edith Ngai

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 该研究针对多模态推荐中信号与目标不匹配的问题,提出AgentMMRec框架,通过整合与利用两个智能体角色优化图结构与表示,在亚马逊数据集上提升了推荐指标,且适用于稀疏与冷启动场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29100 2026-09-01 cs.RO 新提交 67%

Agri-Sim: Agricultural Simulation Platform for Embodied Intelligence Evaluation in Greenhouse Robotics

Agri-Sim:用于温室机器人具身智能评估的农业仿真平台

Shuhan Shi, Zhenfeng Xue, Minghao Mei, Chao Zheng, Nan Li, Zhonghua Miao

机构 * School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Sino-European School of Technology of Shanghai University(上海大学中欧工程技术学院) School of Future Technology (Institute of Artificial Intelligence), Shanghai University(上海大学未来技术学院(人工智能研究院))

专题命中 Agent评测 :planning(abstract);workflow(abstract)

AI总结 研究针对农业机器人开发所需的仿真环境需求,提出基于Unity和ROS2的Agri-Sim平台,通过实验验证其可支持导航与操纵工作流的闭环集成及可重复功能评估,为后续相关研究提供实用基础。

Comments 13 pages, 9 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28677 2026-09-01 cs.RO 新提交 67%

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

面向未知物理环境地面机器人的认知基础型端侧运行时学习

Yihao Cai, Yanbing Mao, Christian Lebiere

机构 * Wayne State University(韦恩州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文提出CogRun框架,使地面机器人可在边缘AI设备上实现认知基础型运行时学习,经实验验证该框架能让机器人在未知环境中安全高效交互以提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23440 2026-09-01 eess.SY cs.SY 版本更新 67%

Temporal Property-driven Design Space Exploration with Reinforcement Learning for Cyber-Physical Systems

面向网络物理系统的、基于时间属性驱动的强化学习设计空间探索

Tagir Fabarisov, Maxime Cordy

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 该研究针对网络物理系统设计空间探索的难题,提出基于强化学习的时间属性驱动工作流,在矿用泵CPS案例中,其引导搜索需更少仿真次数即可找到最优设计。

Comments Accepted manuscript for IECON 2026 - 52nd Annual Conference of the IEEE Industrial Electronics Society, Doha, Qatar, 18-21 October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13979 2026-09-01 cs.HC 版本更新 67%

Personality pairing improves human-AI collaboration

人格配对改善人机协作

Harang Ju, Sinan Aral

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 通过大规模实验,将人类与具有不同大五人格特质的AI配对,发现人格匹配显著影响广告质量和团队表现,外倾人类与尽责AI配对效果最差,而神经质人类与神经质AI配对点击率最高。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30968 2026-09-01 cs.CL cs.AI 新提交 62%

CogEvol: Towards Efficient and Reliable Learning Environment Generation

CogEvol:面向高效且可靠的学习环境生成

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang, Huiqiang Rong, Mofei Chen, Shen Yang, Yini Chen, Yinuo Duan, Haoxuan Li, Binglin Liu, Ye He, Danqi Zheng, Zhanxin Hao, Yuxuan Wu, Mengting Tao, Yuqiu Liu, Jifan Yu, Juanzi Li, Bin Xu, Lei Hou, Huiqin Liu, Yu Zhang

机构 * CogEvol Inc.(CogEvol公司) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出专门用于学习环境生成的CogEvol模型,可将课程简介一次性转化为学习产物,在22万条生产请求中表现高效可靠,参数规模远小于旗舰编码模型,还可在国产昇腾加速器运行,降低AI原生教育单位成本。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30429 2026-09-01 cs.AI cs.CL 新提交 62%

EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents

EvoSkill注入:针对自进化智能体中自主技能生成与进化的红队测试

Doyun Kim, Chanwoo Kim, Sugyeong Eo, Yeo-Chan Yoon, Chanjun Park

机构 * Soongsil University(崇实大学) Yonsei University(延世大学) Jeju National University(济州国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文定义了针对自进化智能体自主技能进化流程的EvoSkill注入威胁模型,提出SARGE红队测试框架,构建相关基准并验证其可诱导恶意技能形成与持久激活,凸显能力损坏风险。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30362 2026-09-01 cs.AI cs.CL 新提交 62%

Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents

用户会知道吗?针对使用工具的大语言模型智能体的隐蔽间接提示注入攻击

Yunseok Lee, Yunji Kim, Woojin Lee

机构 * Dongguk University-Seoul(东国大学首尔校区)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对工具型LLM智能体的间接提示注入攻击,将攻击成功率分解为隐蔽与公开成功率,提出ICoA诱导隐蔽攻击,在AgentDojo的四个模型上提升了隐蔽成功率3.79-12.01个百分点。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30322 2026-09-01 cs.AI cs.CL 新提交 62%

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

无知还是无能?构建面向大语言模型智能体的知识门控可验证任务

Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu

机构 * DataGrids Shanghai University(上海大学) Peking University(北京大学) Northwestern Polytechnical University(西北工业大学) Nanyang Technological University(南洋理工大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对大语言模型智能体任务缺乏对约定访问控制的问题,提出知识门控任务构建协议,经实验验证其有效性并发布部分任务套件与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22559 2026-09-01 cs.AI cs.CL cs.IR 版本更新 62%

ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准

Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

机构 * Emory University(埃默里大学) University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27476 2026-09-01 cs.AI cs.LG 版本更新 62%

PeopleSearchBench: Evaluating AI-Powered People Search Platforms with Criteria-Grounded Verification

PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台

Tianyu Shi, Wei Wang, Zequn Xie, Shuai Zhang, Boyang Xia, Chenyu Zeng, Qi Zhang, Lynn Ai, Yaqi Yu, Kaiming Zhang, Feiyue Tang, Zhenyu Yu, Lei Ding

机构 * LessieAI research team(LessieAI 研究团队)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-09-01 cs.LG cs.AI cs.MA 版本更新 62%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments Long paper accepted to EMNLP 2026 main conference, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31100 2026-09-01 cs.CL 新提交 57%

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

S3Gym:大型语言模型能否将自我测试与自我判断转化为自我提升?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动Seed) M-A-P

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究推出交互式基准S³Gym,评估LLM通过自我测试、自我判断、自我提升能力实现的自我提升,发现其效果依赖任务结构,参数训练等途径各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30897 2026-09-01 cs.AI 新提交 57%

CAER: Causal Action Effect Reweighting for World Model Training

CAER:面向世界模型训练的因果动作效应重加权

Jianjie Fang, Xvyuan Liu, Ziyou Wang, Rongze Tang, Zhaolu Wang, Zhuohang Li, Xin Zhang, Haisheng Su, Chen Gao, Wei Wu, Xinlei Chen, Yong Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有动作条件世界模型训练中交互动态未充分优化的问题,提出CAER范式,通过在线定位动作因果影响的令牌并重加权,提升了生成视频的物理一致性、可控性与视觉质量。

Comments 14 pages, 8 figures. Project page: https://manifoldai-research.github.io/CAER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30785 2026-09-01 cs.AI 新提交 57%

SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩

Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30709 2026-09-01 cs.CV cs.AI 新提交 57%

RailSyn: Diagnosis-Guided Image Generation for Traceable Data Completion in Railway Foreign Object Detection

RailSyn:面向铁路异物检测中可追溯数据补全的诊断引导图像生成方法

Quan Hao, Chenxi Zhang, Ziyang Tao, Yuyuan Zhou, Yudong Wang, Rui Shi, Lechuan Xu, Changhao Liu, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Pratt School of Engineering, Duke University(杜克大学普拉特工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RailSyn是诊断引导的图像生成框架,通过检查器定位补全区域并明确需求,生成器满足需求,可提升RFOD检测性能,在9种主流检测器上AP50--95最高增益4.9点,具跨架构实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30047 2026-09-01 cs.AI 新提交 57%

Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks

大语言模型智能体能进行发现吗?在机器学习工程任务上评估创造力

Shitanshu Bhushan, Yunxiang Zhang, Lu Wang

机构 * University of Michigan(密歇根大学) Computer Science and Engineering(计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出评估LLM智能体创造力的框架,以10个ML工程任务测试AIDE等智能体,发现其P-Creativity随探索转利用下降、H-Creativity高于人类但性能更低,明确其能探索新颖方案却难转化为性能提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30041 2026-09-01 cs.CR cs.AI 新提交 57%

Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

间接提示注入下基于可达性的大语言模型智能体能力约束

Wujie Xiong, Rabimba Karanjai, Yang Lu, Weidong Shi, Lei Xu

机构 * Kent State Univeristy(肯特州立大学) PayPal AI Labs(PayPal人工智能实验室) University of Houston(休斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对间接提示注入下大语言模型智能体的权限漏洞,提出SkillGuard防御机制,通过能力限制策略有效降低攻击成功率,且无额外模型调用或令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏