arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2506.16396 2025-12-15 cs.LG 57%

GoalLadder: Incremental Goal Discovery with Vision-Language Models

GoalLadder: 基于视觉语言模型的增量目标发现

Alexey Zakharov, Shimon Whiteson

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 57%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08868 2025-12-12 cs.AI 57%

EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce

EcomBench: 向电子商务基础智能体的全面评估迈进

Rui Min, Zile Qiao, Ze Xu, Jiawen Zhai, Wenyu Gao, Xuanzhong Chen, Haozhen Sun, Zhen Zhang, Xinyu Wang, Hong Zhou, Wenbiao Yin, Bo Zhang, Xuan Zhou, Ming Yan, Yong Jiang, Haicheng Liu, Liang Ding, Ling Zou, Yi R. Fung, Yalong Li, Pengjun Xie

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 57%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08036 2025-12-10 cs.HC cs.AI cs.SY eess.SY 57%

Joint Activity Design Heuristics for Enhancing Human-Machine Collaboration

增强人机协作的联合活动设计启发式方法

Mohammadreza Jalaeian, Dane A. Morey, Michael F. Rayo

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出十四条启发式方法,用于设计支持联合人机协作的技术,强调五个关键宏观认知功能的支持与易用性同等重要。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08012 2025-12-10 cs.LG 57%

Benchmarking Offline Multi-Objective Reinforcement Learning in Critical Care

在重症护理中评估离线多目标强化学习基准

Aryaman Bansal, Divya Sharma

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了三种离线多目标强化学习算法在重症护理中的性能,发现PEDA DT在灵活性和多目标决策方面表现优异,为个性化医疗决策提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG 57%

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07827 2025-12-09 cs.CR cs.DC cs.LG 57%

An Adaptive Multi-Layered Honeynet Architecture for Threat Behavior Analysis via Deep Learning

一种基于深度学习的自适应多层蜜罐架构用于威胁行为分析

Lukas Johannes Möller

机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于深度学习的自适应多层蜜罐架构,通过强化学习实现威胁行为分析,旨在提高威胁情报质量并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07261 2025-12-09 cs.SE 57%

Automatic Syntax Error Repair for Discrete Controller Synthesis using Large Language Model

利用大语言模型实现离散控制器综合的自动语法错误修复

Yusei Ishimizu, Takuto Yamauchi, Sinan Chen, Jinyu Cai, Jialong Li, Kenji Tei

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18229 2025-12-09 cs.RO cs.AI 57%

BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs

BEDI:一种用于无人机上具身智能体评估的综合基准

Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18991 2025-12-09 cs.CL 57%

Surveying the MLLM Landscape: A Meta-Review of Current Surveys

测绘MLLM景观:当前调研的元综述

Ming Li, Keyu Chen, Ziqian Bi, Ming Liu, Xinyuan Song, Zekun Jiang, Tianyang Wang, Benji Peng, Qian Niu, Junyu Liu, Jinlang Wang, Sen Zhang, Xuanhe Pan, Jiawei Xu, Pohsun Feng

机构 * Georgia Institute of Technology(佐治亚理工学院) Indiana University(印第安纳大学) Purdue University(普渡大学) Emory University(埃默里大学) Sichuan University(四川大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) AppCubic Kyoto University(京都大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rutgers University(罗格斯大学) National Taiwan Normal University(台湾师范大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。

Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 57%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 57%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09571 2025-12-04 cs.RO cs.LG 57%

Are you a robot? Detecting Autonomous Vehicles from Behavior Analysis

你是机器人吗?通过行为分析检测自动驾驶汽车

Fabio Maresca, Filippo Grazioli, Antonio Albanese, Vincenzo Sciancalepore, Gianpiero Negri, Xavier Costa-Perez

机构 * NEC Laboratories Europe GmbH(NEC欧洲实验室) Flyhound Co.(Flyhound公司) i2CAT Foundation(i2CAT基金会) Amazon Global Robotics - EU Innovation Lab(亚马逊全球机器人-欧盟创新实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种通过摄像头图像和状态信息自动识别自动驾驶车辆的框架,利用CARLA模拟器创建数据集并测试其识别准确率,达到80%-93%的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02953 2025-12-03 cs.SE cond-mat.dis-nn 57%

The Evolutionary Ecology of Software: Constraints, Innovation, and the AI Disruption

软件的进化生态:约束、创新与人工智能颠覆

Sergi Valverde, Blai Vidiella, Salva Duran-Nebreda

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文研究软件进化生态,探讨人工智能驱动开发工具对软件创新和文化演变的影响。

Comments This article is a contributed chapter to the SFI edited volume: The Economy as a Complex Evolving System, Part IV (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08360 2025-12-03 cs.LG cs.IT math.IT math.ST stat.TH 57%

Minimax Hypothesis Testing for the Bradley-Terry-Luce Model

最小最大假设检验用于布雷德利-蒂尔-刘模型

Anuran Makur, Japneet Singh

机构 * Department of Computer Science and the Elmore Family School of Electrical and Computer Engineering, Purdue University(计算机科学系和埃尔莫尔家族电气与计算机工程学院,普渡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于最小最大理论的假设检验方法,用于判断给定的成对比较数据是否源自布雷德利-蒂尔-刘模型,并通过实验验证了该方法的性能。

Comments 41 pages, 5 figures

Journal ref IEEE Transactions on Information Theory, vol. 71, no. 12, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02444 2025-12-03 cs.DB cs.LG 57%

QJoin: Transformation-aware Joinable Data Discovery Using Reinforcement Learning

QJoin: 基于强化学习的变换感知可连接数据发现

Ning Wang, Sainyam Galhotra

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 QJoin通过强化学习框架学习并重用变换策略,提升连接发现的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02261 2025-12-03 cs.AI 57%

TradeTrap: Are LLM-based Trading Agents Truly Reliable and Faithful?

TradeTrap: LLM-based Trading Agents 是否 truly 可靠和忠实?

Lewen Yan, Jilin Mei, Tianyi Zhou, Lige Huang, Jie Zhang, Dongrui Liu, Jing Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TradeTrap 提出了一种统一的评估框架,用于系统性压力测试基于 LLM 的交易代理,揭示其在系统级扰动下的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19584 2025-12-03 cs.LG cs.CV cs.RO 57%

Learning Massively Multitask World Models for Continuous Control

学习大规模多任务世界模型用于连续控制

Nicklas Hansen, Hao Su, Xiaolong Wang

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Newt通过大规模预训练和在线交互,实现智能体在数百个任务上的多任务学习,提升连续控制的效率和适应性。

Comments Webpage: https://www.nicklashansen.com/NewtWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01896 2025-12-02 cs.CL 57%

OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation

OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现

Jinzheng Yu, Yang Xu, Haozhen Li, Junqi Li, Yifan Feng, Ligu Zhu, Hao Shen, Lei Shi

机构 * Communication University of China(中国传媒大学) Harbin Institute of Technology(哈尔滨工业大学) China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) School of Engineering, Santa Clara University(圣克拉拉大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。

Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00010 2025-12-02 cs.HC cs.AI 57%

Leveraging LLMs for Design Ideation: An AI Tool to Assist Creativity

利用LLMs进行设计构思:一种辅助创造力的AI工具

Rutvik Kokate, Pranati Kompella, Prasad Onkar

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。

Comments 9 pages, 4 figures

Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22598 2025-12-01 cs.LG 57%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19957 2025-12-01 cs.CL 57%

AppSelectBench: Application-Level Tool Selection Benchmark

AppSelectBench: 应用级工具选择基准

Tianyi Chen, Michael Solodko, Sen Wang, Jongwoo Ko, Junheng Hao, Colby Banbury, Sara Abdali, Saeed Amizadeh, Qing Xiao, Yinheng Li, Tianyu Ding, Kamran Ghasedi Dizaji, Suzhen Zheng, Hao Fan, Justin Wagle, Pashmina Cameron, Kazuhito Koishida

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07908 2025-11-27 eess.IV cs.AI cs.CV 57%

ONCOPILOT: A Promptable CT Foundation Model For Solid Tumor Evaluation

ONCOPILOT:一种可提示的CT基础模型用于实体肿瘤评估

Léo Machado, Hélène Philippe, Élodie Ferreres, Julien Khlaut, Julie Dupuis, Korentin Le Floch, Denis Habip Gatenyo, Pascal Roux, Jules Grégory, Maxime Ronot, Corentin Dancette, Tom Boeken, Daniel Tordjman, Pierre Manceron, Paul Hérent

机构 * Raidium, Paris Biotech Santé(Raidium,巴黎生物医疗健康) AP-HP. Nord, Department of Radiology, FHU MOSAIC, Beaujon Hospital(AP-HP. Nord,放射科,FHU MOSAIC,贝琼医院) Université Paris Cité(巴黎城市大学) Université Paris Cité, AP-HP, Hôpital Européen Georges Pompidou, Department of Vascular and Oncological Interventional Radiology(巴黎城市大学,AP-HP,欧文·庞皮杜医院,血管和肿瘤介入放射科) Department of Radiology, Hôpital Cochin, AP-HP(放射科,克里克医院,AP-HP) Centre d’Imagerie du Nord(北影像中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 ONCOPILOT是一种基于CT的可提示基础模型,通过交互式分割提升肿瘤评估精度,实现放射科医生级别的RECIST测量和体积生物标志物分析。

Journal ref npj Precis. Onc. 9, 121 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 57%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18728 2025-11-25 cs.LG 57%

Reinforcement Learning for Self-Healing Material Systems

强化学习用于自修复材料系统

Maitreyi Chatterjee, Devansh Agarwal, Biplab Chatterjee

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究通过强化学习方法实现材料自修复,展示了TD3智能体在动态环境下更高效的自修复能力。

Comments Accepted to INCOM 2026. This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03480 2025-11-25 cs.SE 57%

LLM Agents for Automated Dependency Upgrades

基于大语言模型的自动化依赖升级代理

Vali Tawosi, Salwa Alamir, Xiaomo Liu, Manuela Veloso

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出基于LLM代理的自动化依赖升级方法,通过合成数据验证,实现了高效准确的代码更新与兼容性保障。

Comments Accepted to AISM Workshop at ASE 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17953 2025-11-25 cs.LG stat.ML 57%

On Transportability for Structural Causal Bandits

关于结构因果投递的强化学习

Min Woo Park, Sanghack Lee

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种结构因果投递框架,通过融合源环境的先验信息来增强部署学习,实现了亚线性遗憾界并可能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏