arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2510.11688 2025-10-14 cs.CR cs.AI 57%

PACEbench: A Framework for Evaluating Practical AI Cyber-Exploitation Capabilities

Zicheng Liu, Lige Huang, Jie Zhang, Dongrui Liu, Yuan Tian, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments Project webpage available at https://pacebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10079 2025-10-14 cs.HC cs.AI 57%

How AI Companionship Develops: Evidence from a Longitudinal Study

Angel Hsing-Chi Hwang, Fiona Li, Jacy Reese Anthis, Hayoun Noh

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16620 2025-10-13 cs.LG 57%

CausalDynamics: A large-scale benchmark for structural discovery of dynamical causal models

Benjamin Herdeanu, Juan Nathaniel, Carla Roesch, Jatan Buch, Gregor Ramien, Johannes Haux, Pierre Gentine

机构 * Columbia University(哥伦比亚大学) kausable GmbH(kausable公司) Aeolus Labs(Aeolus实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09247 2025-10-13 q-fin.CP cs.LG q-fin.PR 57%

Application of Deep Reinforcement Learning to At-the-Money S&P 500 Options Hedging

Zofia Bracha, Paweł Sakowski, Jakub Michańków

机构 * Faculty of Economic Sciences, University of Warsaw(华沙大学经济学院) Department of Quantitative Finance and Machine Learning, University of Warsaw(华沙大学量化金融与机器学习系) TripleSun, Krakow(克拉科夫TripleSun)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08928 2025-10-13 cs.AI 57%

LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition

Yushuo Zheng, Zicheng Zhang, Xiongkuo Min, Huiyu Duan, Guangtao Zhai

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08763 2025-10-13 cs.LG 57%

Reinforcement Learning-Based Optimization of CT Acquisition and Reconstruction Parameters Through Virtual Imaging Trials

David Fenwick, Navid NaderiAlizadeh, Vahid Tarokh, Nicholas Felice, Darin Clark, Jayasai Rajagopal, Anuj Kapadia, Benjamin Wildman-Tobriner, Ehsan Samei, Ehsan Abadi

机构 * Duke University(杜克大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08617 2025-10-13 cs.CV cs.LG 57%

Reproducible Evaluation of Data Augmentation and Loss Functions for Brain Tumor Segmentation

Saumya B

机构 * DESE, Indian Institute of Science(印度科学研究院数据与系统工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

Comments Code and results available at https://github.com/Saumya4321/2d-brain-tumor-segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16548 2025-10-13 cs.HC cs.AI cs.ET 57%

Exploring human-SAV interaction using LLMs: The impact of psychological factors on user experience

Lirui Guo, Michael G. Burke, Wynita M. Griggs

机构 * Monash University(墨尔本大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08207 2025-10-10 cs.AI 57%

DODO: Causal Structure Learning with Budgeted Interventions

Matteo Gregorini, Chiara Boldrini, Lorenzo Valerio

机构 * University of Pisa(比萨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments Under review. Supported by SoBigDatait IR0000013, FAIR PE00000013, ICSC CN00000013

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07436 2025-10-10 cs.LG 57%

Parameter-Free Federated TD Learning with Markov Noise in Heterogeneous Environments

Ankur Naskar, Gugan Thoppe, Utsav Negi, Vijay Gupta

机构 * Dept. of Computer Science and Automation, Indian Institute of Science(计算机科学与自动化系,印度科学研究院) School of Electrical and Computer Engineering, Purdue University(电气与计算机工程学院,普渡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04097 2025-10-10 cs.AI 57%

WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning

Peichao Lai, Jinhui Zhuang, Kexuan Zhang, Ningchang Xiong, Shengjie Wang, Yanwei Xu, Chong Chen, Yilei Wang, Bin Cui

机构 * Peking University(北京大学) Xiamen Huaxia University(厦门华夏大学) Fuzhou University(福州市大学) City University of Hong Kong(香港城市大学) Huawei Cloud BU(华为云业务单元)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07064 2025-10-09 cs.AI 57%

Prompt Optimization Across Multiple Agents for Representing Diverse Human Populations

Manh Hung Nguyen, Sebastian Tschiatschek, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06782 2025-10-09 cs.HC cs.CL cs.CV 57%

GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting

Kaichun Yang, Jian Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16192 2025-10-09 cs.LG eess.SP 57%

Nonparametric Bellman Mappings for Value Iteration in Distributed Reinforcement Learning

Yuki Akiyama, Konstantinos Slavakis

机构 * Institute of Science Tokyo, Department of Information and Communications Engineering(东京科学研究所信息与通信工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11334 2025-10-07 cs.AI 57%

Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment

Chao Wen, Jacqueline Staub, Adish Singla

专题命中 Agent评测 :planning(abstract);分类 cs.AI

Comments ACL'25 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03643 2025-10-07 cs.LG 57%

In-Vivo Training for Deep Brain Stimulation

Nicholas Carter, Arkaprava Gupta, Prateek Ganguli, Benedikt Dietrich, Vibhor Krishna, Samarjit Chakraborty

机构 * Dept. of Computer Science(计算机科学系) Dept. of Neurosurgery(神经外科系) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Hochschule München(慕尼黑大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26440 2025-10-07 cs.AI 57%

Transformer Classification of Breast Lesions: The BreastDCEDL_AMBL Benchmark Dataset and 0.92 AUC Baseline

Naomi Fridman, Anat Goldstein

机构 * Department of Industrial Engineering, Ariel University(工业工程系,阿丽尔大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14574 2025-10-07 cs.CV cs.AI 57%

Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark

Rashid Mushkani

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01844 2025-10-07 cs.AI 57%

Towards Generalizable Context-aware Anomaly Detection: A Large-scale Benchmark in Cloud Environments

Xinkai Zou, Xuan Jiang, Ruikai Huang, Haoze He, Parv Kapoor, Hongrui Wu, Yibo Wang, Jian Sha, Xiongbo Shi, Zixun Huang, Jinhua Zhao

机构 * UC San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01921 2025-10-07 cs.CV cs.AI 57%

MedEBench: Diagnosing Reliability in Text-Guided Medical Image Editing

Minghao Liu, Zhitao He, Zhiyuan Fan, Qingyun Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

Comments Project website: https://mliuby.github.io/MedEBench_Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03199 2025-10-06 cs.LG stat.ML 57%

Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling

Qiwei Di, Kaixuan Ji, Xuheng Li, Heyang Zhao, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA 90095, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18389 2025-10-06 cs.LG 57%

Towards Provable Emergence of In-Context Reinforcement Learning

Jiuqi Wang, Rohan Chandra, Shangtong Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments NeurIPS 2025, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01286 2025-10-03 cs.CY cs.AI 57%

Emergent evaluation hubs in a decentralizing large language model ecosystem

Manuel Cebrian, Tomomi Kito, Raul Castro Fernandez

机构 * Center for Automation and Robotics, Spanish National Research Council, Spain(自动化与机器人中心,西班牙国家研究理事会) Graduate School of Creative Science and Engineering, Waseda University, Japan(创意科学与工程研究生院,早稻田大学) Department of Computer Science, University of Chicago, USA(计算机科学系,芝加哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 15 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26632 2025-10-01 cs.AI 57%

Branching Out: Broadening AI Measurement and Evaluation with Measurement Trees

Craig Greenberg, Patrick Hall, Theodore Jensen, Kristen Greene, Razvan Amironesei

机构 * NIST Associate(美国国家标准与技术研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 57%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25625 2025-10-01 cs.SE 57%

M&SCheck: Towards a Checklist to Support Software Engineering Newcomers to the Modeling and Simulation Area

Luiza Martins de Freitas Cintra, Philipp Zech, Mohamad Kassab, Eliomar Araújo Lima, Sofia Larissa da Costa Paiva, Valdemar Vicente Graciano Neto

专题命中 Agent评测 :agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25229 2025-10-01 cs.AI 57%

Blueprint-Bench: Comparing spatial intelligence of LLMs, agents and image models

Lukas Petersson, Axel Backlund, Axel Wennstöm, Hanna Petersson, Callum Sharrock, Arash Dabiri

机构 * Andon Labs(安登实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 9 pages, 8 figures, submitted for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23244 2025-09-30 cs.RO cs.AI 57%

Online Dynamic Goal Recognition in Gym Environments

Shamir Matan, Elhadad Osher, Nageris Ben, Mirsky Reuth

机构 * Bar-Ilan University(巴伊兰大学) Tufts University(塔夫茨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21143 2025-09-30 cs.RO cs.CL 57%

Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems

Junfeng Yan, Biao Wu, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21979 2025-09-30 cs.CL 57%

Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset

Fakhraddin Alwajih, Samar M. Magdy, Abdellah El Mekki, Omer Nacar, Youssef Nafea, Safaa Taher Abdelfadil, Abdulfattah Mohammed Yahya, Hamzah Luqman, Nada Almarwani, Samah Aloufi, Baraah Qawasmen, Houdaifa Atou, Serry Sibaee, Hamzah A. Alsayadi, Walid Al-Dhabyani, Maged S. Al-shaibani, Aya El Aatar, Nour Qandos, Rahaf Alhamouri, Samar Ahmad, Mohammed Anwar Al-Ghrawi, Aminetou Yacoub, Ruwa AbuHweidi, Vatimetou Mohamed Lemin, Reem Abdel-Salam, Ahlam Bashiti, Aisha Alansari, Ahmed Ashraf, Nora Alturayeif, Alcides Alcoba Inciarte, Adel Ammar, Abdelrahim A. Elmadany, Mohamedou Cheikh Tourad, Ismail Berrada, Mustafa Jarrar, Shady Shehata, Muhammad Abdul-Mageed

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

Comments https://github.com/UBC-NLP/pearl

详情

展开后加载摘要…

URL PDF HTML 收藏