arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2606.19868 2026-06-19 cs.AI 新提交 70%

A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models

大型语言模型黑盒不确定性估计方法的系统评估

Jiayi Wang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 系统评估了24种黑盒不确定性估计方法在4个模型和4个数据集上的表现,发现无单一方法普遍最优,但基于答案空间推理和比较的方法通常有效,混合方法在多数条件下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19704 2026-06-19 cs.AI 新提交 70%

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

超越静态排行榜:LLM智能体评估的预测有效性

Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

机构 * IBM

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。

Comments 17 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15345 2026-06-18 cs.CL cs.IR 新提交 70%

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

超越单语言深度研究:用跨语言 BrowseComp-Plus 评估智能体和检索器

Yuheng Lu, Qingcheng Zeng, Heli Qi, Puxuan Yu, Fuheng Zhao, Rui Yang, Hitomi Yanaka, Naoto Yokoya, Weihao Xuan

机构 * Waseda University(早稻田大学) Northwestern University(西北大学) RIKEN AIP(理化学研究所革新智能研究中心) Snowflake Inc.(Snowflake公司) University of Utah(犹他大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出跨语言基准 XBCP,评估深度研究智能体在证据语言与查询不同时的表现,发现检索和智能体端均存在显著性能下降。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17546 2026-06-17 cs.AI 新提交 70%

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

SEAGym: 自我进化LLM智能体的评估环境

Congjie Zheng, Chuanyi Xue, Bin Liang, Jun Yang, Changshui Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出SEAGym评估环境,通过训练、验证、测试、重放和成本记录多维度衡量智能体框架更新,揭示更新是否带来可复用改进、过拟合、成本增加或旧行为退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交 70%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17114 2026-06-17 cs.CR cs.AI 新提交 70%

An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

现实场景中工具使用LLM代理的数据泄露风险评估

Hankyul Baek, Jaewon Noh, Sang Seo, Yongsu Kim, Gabriel Waikin Loh Matienzo, Young Il Kim, Ee Wei Seah, Akriti Vij

机构 * Korea AI Safety Institute(韩国人工智能安全研究所) Singapore AI Safety Institute(新加坡人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16605 2026-06-16 cs.AI 新提交 70%

ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control

ARB4WM:连续控制中世界模型的对抗鲁棒性基准

Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

机构 * College of Computer Science, National University of Defense Technology(国防科技大学计算机学院) College of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of New Networks, Peng Cheng Laboratory(鹏城实验室新型网络部) National Key Laboratory of Advanced Communication Networks(先进通信网络全国重点实验室)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ARB4WM统一基准,从策略、价值和潜在动力学三个层面评估世界模型在视觉扰动下的对抗鲁棒性,发现多目标攻击和时序暴露模式对安全评估至关重要。

Comments 24 pages, 10 figures, 5 tables. Source code available at https://github.com/zaoanguai/ARB4WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16596 2026-06-16 cs.CL 新提交 70%

How Far Can Machine Translation Quality Take You? Extrinsic Discourse Evaluation in Goal-Oriented Setups

机器翻译质量能带你走多远?目标导向设置中的外在话语评估

Wafaa Mohammed, Kata Naszadi, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 研究机器翻译在静态和交互式目标导向任务中的外在话语评估,发现高内在翻译质量不能保证下游话语成功,且强系统仍存在指代不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16190 2026-06-16 cs.AR cs.AI 新提交 70%

Embedded Arena: Iterative Optimization via Hardware Feedback

嵌入式竞技场:通过硬件反馈的迭代优化

Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu, Chun-Cheng Chang, Jiayi Shao, Yujia Liu, Emmanuel Azuh Mensah, Edward Wang, Kurtis Heimerl, Gregory D. Abowd, Shwetak Patel, Natasha Jaques, Vikram Iyer

机构 * University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出硬件在环智能体框架,通过迭代编译、烧录和测量真实硬件,实现模型与固件的闭环优化,在嵌入式设备上达到250倍压缩且精度损失<3.3%。

Comments Code: https://github.com/ubicomplab/embedded-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 70%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12268 2026-06-11 cs.AI 新提交 70%

The Impossibility of Eliciting Latent Knowledge

引出潜在知识的不可能性

Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport, Tom Everitt, Jonathan Richens

机构 * The London School of Economics and Political Science(伦敦政治经济学院) Independent(独立机构)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文利用因果影响图形式化定义引出潜在知识问题,证明不存在仅依赖行为反馈的训练策略能确保智能体诚实报告其信念。

Comments 24 pages, 3 figures. Includes proofs in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 70%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09826 2026-06-09 cs.CV cs.AI 新提交 70%

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) LIGHTSPEED The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09663 2026-06-09 cs.AI 新提交 70%

From 0-to-1 to 1-to-N: Reproducible Engineering Evidence for MetaAI Recursive Self-Design

从0到1再到N:MetaAI递归自我设计的可复现工程证据

Dun Li, Jiatao Li, Hongzhi Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Maritime University(上海海事大学) Chizhou University(池州学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出可复现证据框架,通过四个标准评估现有系统,其中Darwin Goedel Machine在SWE-bench上提升30%,并给出可复现协议MetaAI-Mini。

Comments 6 pages, 2 figures, 7 tables. Supplementary code: https://github.com/DunLi-Tsinghua/MetaAI-Mini

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09236 2026-06-09 cs.RO cs.AI 新提交 70%

Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation

用于模拟自主超级摩托车赛车的自定进度课程强化学习

Luca Ghisi, Jacopo Essenziale, Carlo D'Eramo, Matteo Luperto

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自定进度课程深度强化学习框架,结合软演员-评论家算法,动态生成渐进任务,在物理精确模拟器中训练自主摩托车赛车,优于标准SAC。

Comments Presented at the "1st Workshop on Generalization in Autonomous Driving: Paradigms, Practice, and Public Road Demonstrations" at ICRA 2026, Vienna. Oral+poster presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06546 2026-06-08 cs.LG 新提交 70%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21209 2026-08-24 cs.AI cs.CL cs.LG 新提交 67%

Personalized Privacy Control in LLMs via Attention Head Intervention

基于注意力头干预的大语言模型个性化隐私控制

Junseok Kim, Nakyeong Yang, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对大语言模型隐私控制的用户偏好差异问题,提出个性化隐私概念及P3Bench基准,发现提示策略执行效果差,进而提出Repair方法提升隐私策略依从性

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20318 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-21 cs.CL cs.AI cs.LG 新提交 67%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18940 2026-08-20 cs.LG cs.AI cs.CE cs.CL 新提交 67%

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

面向单步逆合成的化学合理性感知大语言模型训练

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) Insilico Medicine Canada Inc.(英矽智能加拿大公司) Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18232 2026-08-20 cs.MA 新提交 67%

Contracting for LLM Delegation: Moral Hazard in Technology and Effort Choice

LLM委托的契约:技术与努力选择中的道德风险

Nanda Kishore Sreenivas, Kate Larson

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 该研究扩展委托-代理框架至LLM委托场景,推导最优线性契约,用MATH、MMLUPro基准校准模型,证明线性契约可激励智能体的技术感知委托行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19103 2026-08-20 quant-ph 新提交 67%

Quantum circuit optimization using deep reinforcement learning: Applications across multiple gate sets

基于深度强化学习的量子电路优化:跨多门集的应用

Khoa Dang Tao, Sumin Jin, Muhammad Raza, Changhyoup Lee

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 该研究提出将CR算法嵌入强化学习环境的框架,在两类门集上实现更短量子电路,训练于小电路的RL可应用于大电路,为量子系统编译优化提供稳健方法。

Comments 11 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交 67%

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 67%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12860 2026-08-14 cs.RO 新提交 67%

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

HumanoidVLN:面向多种人形机器人形态的基于物理的视觉语言导航模拟器与基准

Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

机构 * VinMotion, Inc.(VinMotion公司) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本研究针对人形机器人VLN的物理约束与形态差异问题,提出基于NVIDIA Isaac Sim的HumanoidVLN模拟器与基准,验证其与多种模型、机器人的兼容性,实验揭示了VLN模型、控制器与人形形态的交互关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 67%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09312 2026-08-11 cs.NI 新提交 67%

Automated Synthesis of Deterministic Cross-Domain Interfaces

确定性跨域接口的自动合成

Konstantinos Christodoulopoulos, Antonis Selentis-Boulntadakis

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 67%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03874 2026-08-05 cs.AI cs.CL cs.LG 新提交 67%

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

ContinualSkillBench:大语言模型智能体真的能发展其能力吗?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00964 2026-08-04 cs.CY 新提交 67%

Copyright Is the Headline; Capability Is the Blind Spot: AI Technology in the Book-Publishing Trade Press, November 2025--August 2026

版权是头条,能力是盲区:2025年11月—2026年8月图书出版行业媒体中的人工智能技术

Fred Zimmerman

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本研究通过分析多国行业媒体的89篇文章,指出图书出版领域AI报道存在能力盲区,提出设立常设AI报道板块等改进建议。

Comments 7 pages, 2 figures. 15-page Supplemental Information, coded 89-item corpus, crosstabs, BibTeX database, and citation audit included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏