arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2511.10668 2025-11-17 cs.CV 67%

A Mathematical Framework for AI Singularity: Conditions, Bounds, and Control of Recursive Improvement

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) Loughborough University London(洛桑大学伦敦分校) Estonian Business School(爱沙尼亚商业学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09919 2025-11-14 cs.CV 67%

MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding

Ketong Chen, Yuhao Chen, Yang Xue

机构 * Ketong Chen, Yuhao Chen, Yang Xue(作者)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09074 2025-11-13 cs.RO 67%

Trends in Motion Prediction Toward Deployable and Generalizable Autonomy: A Revisit and Perspectives

Letian Wang, Marc-Antoine Lavoie, Sandro Papais, Barza Nisar, Yuxiao Chen, Wenhao Ding, Boris Ivanovic, Hao Shao, Abulikemu Abuduweili, Evan Cook, Yang Zhou, Peter Karkus, Jiachen Li, Changliu Liu, Marco Pavone, Steven Waslander

专题命中 Agent评测 :agent(abstract);planning(abstract)

Comments (Book) To Appear in Foundation and Trends in Robotics. 163 pages, 40 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07685 2025-11-12 cs.AI cs.CL cs.LG 67%

ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents

Manasi Sharma, Chen Bo Calvin Zhang, Chaithanya Bandi, Clinton Wang, Ankit Aich, Huy Nghiem, Tahseen Rabbani, Ye Htet, Brian Jang, Sumana Basu, Aishwarya Balwani, Denis Peskoff, Marcos Ayestaran, Sean M. Hendryx, Brad Kenstler, Bing Liu

机构 * Scale AI University of Maryland(马里兰大学) University of Chicago(芝加哥大学) Washington University, St. Louis(圣路易斯华盛顿大学) McGill University(麦吉尔大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 27 pages, 21 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10225 2025-11-11 cs.AR 67%

ISAAC: Intelligent, Scalable, Agile, and Accelerated CPU Verification via LLM-aided FPGA Parallelism

Jialin Sun, Yuchen Hu, Dean You, Yushu Du, Hui Wang, Xinwei Fang, Weiwei Shan, Nan Guan, Zhe Jiang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments require revision, update later

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05119 2025-11-10 cs.CR 67%

Cybersecurity AI in OT: Insights from an AI Top-10 Ranker in the Dragos OT CTF 2025

Víctor Mayoral-Vilches, Luis Javier Navarrete-Lozano, Francesco Balassone, María Sanz-Gómez, Cristóbal Ricardo Veas Chávez, Maite del Mundo de Torres

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04817 2025-11-10 cs.GT 67%

Dynamic Allocation of Public Goods with Approximate Core Equilibria

Chido Onyeze, David X. Lin, Siddhartha Banerjee, Éva Tardos

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23324 2025-11-07 cs.RO 67%

A Framework for Human-Reason-Aligned Trajectory Evaluation in Automated Vehicles

Lucas Elbert Suryana, Saeed Rahmani, Simeon Craig Calvert, Arkady Zgonnikov, Bart van Arem

机构 * Department of Transport and Planning(交通与规划部门) Centre for Meaningful Human Control(有意义的人控中心) Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract)

Comments This version incorporates revisions based on peer-review feedback from a new submission. The work has been accepted and is being prepared for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01625 2025-11-04 cs.DB 67%

UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured Data

Han Weng, Zhou Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen, Wentao Zhang

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27571 2025-11-03 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum

Zhuoning Guo, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Xiaowen Chu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20849 2025-10-27 cs.AI cs.CL cs.LG 67%

Cultural Alien Sampler: Open-ended art generation balancing originality and coherence

Alejandro H. Artiles, Hiromu Yakura, Levin Brinkmann, Mar Canet Sola, Hassan Abu Alhaija, Ignacio Serna, Nasim Rahaman, Bernhard Schölkopf, Iyad Rahwan

机构 * Max Planck Institute for Human Development(马克斯·普朗克人类发展研究所) Academy of Media Arts Cologne(科隆媒体艺术学院) Tiptree Systems(蒂普特里系统) NVIDIA(NVIDIA公司) BFM, Tallinn University(BFM,塔林大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025). Creative AI Track. 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09710 2025-10-22 cs.CL cs.AI cs.LG 67%

Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data

Sepehr Golrokh Amin, Devin Rhoads, Fatemeh Fakhrmoosavi, Nicholas E. Lownes, John N. Ivan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12997 2025-10-21 cs.LG cs.AI cs.CL 67%

Max It or Miss It: Benchmarking LLM On Solving Extremal Problems

Binxin Gao, Jingjun Han

机构 * University of Maryland(马里兰大学) Fudan University(复旦大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Our benchmark dataset is available at https://huggingface.co/datasets/binxingao/extrem-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16902 2025-10-16 cs.CV cs.RO 67%

RealEngine: Simulating Autonomous Driving in Realistic Context

Junzhe Jiang, Nan Song, Jingyu Li, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Surrey(萨里大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11534 2025-10-14 cs.RO cs.SY eess.SY 67%

IntersectioNDE: Learning Complex Urban Traffic Dynamics based on Interaction Decoupling Strategy

Enli Lin, Ziyuan Yang, Qiujing Lu, Jianming Hu, Shuo Feng

机构 * Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments Accepted by ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09507 2025-10-13 cs.CV cs.RO 67%

PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs

Zixin Zhang, Kanghao Chen, Xingwang Lin, Lutao Jiang, Xu Zheng, Yuanhuiyi Lyu, Litao Guo, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Beihang University(北航大学) Knowin

专题命中 Agent评测 :agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04721 2025-10-07 cs.AI cs.CL cs.LG 67%

BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs

Ivo Petrov, Jasper Dekoninck, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧布里斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04508 2025-10-07 cs.IR 67%

MARCO: A Cooperative Knowledge Transfer Framework for Personalized Cross-domain Recommendations

Lili Xie, Yi Zhang, Ruihong Qiu, Jiajun Liu, Sen Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03688 2025-10-07 cs.AI cs.CL cs.LG 67%

AgentBench: Evaluating LLMs as Agents

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) The Ohio State University(俄亥俄州立大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Published in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01670 2025-10-03 cs.AI cs.CL cs.CR cs.CY cs.LG 67%

Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness

Erfan Shayegani, Keegan Hines, Yue Dong, Nael Abu-Ghazaleh, Roman Lutz, Spencer Whitehead, Vidhisha Balachandran, Besmira Nushi, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Microsoft AI Red Team(微软AI红色团队) University of California, Riverside(加州大学河滨分校) NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00339 2025-10-02 cs.HC cs.AI cs.CL cs.LG 67%

Navigating the Synchrony-Stability Frontier in Adaptive Chatbots

T. James Brandt

机构 * University of Minnesota(明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments pages; 9 tables; 7 figures; code & analysis artifact: https://doi.org/10.5281/zenodo.17238269; under review at ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24923 2025-09-30 cs.LG cs.AI cs.CL 67%

When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training

Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra

机构 * Duke University(杜克大学) Mila - Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17350 2025-09-26 cs.RO 67%

DyDexHandover: Human-like Bimanual Dynamic Dexterous Handover using RGB-only Perception

Haoran Zhou, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18370 2025-09-24 cs.SE cs.CL cs.CR cs.LG 67%

Training Language Model Agents to Find Vulnerabilities with CTF-Dojo

Terry Yue Zhuo, Dingmin Wang, Hantian Ding, Varun Kumar, Zijian Wang

机构 * Monash University(墨尔本大学) AWS AI Labs(亚马逊AI实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12174 2025-09-24 math.OC 67%

Expected Optimal Distances of Random Bipartite Matching in $D$-dimensional Spaces: Approximate Formulas and Applications to Mobility Services

Shiyu Shen, Yuhui Zhai, Yanfeng Ouyang

专题命中 Agent评测 :agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16866 2025-09-23 cs.AI cs.CL cs.LG 67%

seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs

Mohammad Ramezanali, Mo Vazifeh, Paolo Santi

机构 * Salesforce AI Palo Alto(Salesforce AI 巴尔的摩) Capital One MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16232 2025-09-23 q-bio.NC cs.HC 67%

Emotions are Recognized Patterns of Cognitive Activities

Yue Jin

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09281 2025-09-12 cs.HC 67%

Flip Co-op: Cooperative Takeovers in Shared Autonomy

Sandeep Banik, Naira Hovakimyan

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

Comments 11 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08494 2025-09-11 cs.CY cs.AI cs.CL cs.HC cs.LG 67%

HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis

机构 * Apart Research AI Safety Cape Town University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Sentience Institute(意识研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08221 2025-09-11 cs.RO 67%

A Comprehensive Review of Reinforcement Learning for Autonomous Driving in the CARLA Simulator

Elahe Delavari, Feeza Khan Khanzada, Jaerock Kwon

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏