arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2503.21383 2025-03-28 cs.CL cs.LG 62%

Controlling Large Language Model with Latent Actions

Chengxing Jia, Ziniu Li, Pengyuan Wang, Yi-Chen Li, Zhenyu Hou, Yuxiao Dong, Yang Yu

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20786 2025-03-27 cs.CL cs.AI 62%

Mobile-MMLU: A Mobile Intelligence Language Understanding Benchmark

Sondos Mahmoud Bsharat, Mukul Ranjan, Aidar Myrzakhan, Jiacheng Liu, Bowei Guo, Shengkun Tang, Zhuang Liu, Yuanzhi Li, Zhiqiang Shen

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

Comments An order-invariant and mobile-centric benchmark. Code and data are available at: https://github.com/VILA-Lab/Mobile-MMLU

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07671 2025-03-26 stat.ML cs.AI cs.LG 62%

Probabilistic Shielding for Safe Reinforcement Learning

Edwin Hamel-De le Court, Francesco Belardinelli, Alexander W. Goodall

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 3 figures, Conference: AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07115 2025-03-25 cs.AI cs.CL cs.CY cs.HC physics.soc-ph 62%

Open Models, Closed Minds? On Agents Capabilities in Mimicking Human Personalities through Open Large Language Models

Lucio La Cava, Andrea Tagarelli

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Accepted and presented at the AAAI 2025 Conference. CHANGES in version v2: (i) Enhanced methodology and evaluation based on BFI in addition to MBTI, with expanded set of LLM agents; (ii) author list changed w.r.t. version (v1), see Acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14443 2025-03-19 cs.LG cs.SE 62%

EnvBench: A Benchmark for Automated Environment Setup

Aleksandra Eliseeva, Alexander Kovrigin, Ilia Kholkin, Egor Bogomolov, Yaroslav Zharov

专题命中 Agent评测 :agentic(abstract);分类 cs.LG、cs.SE

Comments Accepted at the DL4Code workshop at ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11870 2025-03-18 cs.AI cs.LG 62%

Counterfactual Realizability

Arvind Raghavan, Elias Bareinboim

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments published at ICLR'25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11664 2025-03-18 cs.AI cs.CL cs.DB 62%

An LLM-Based Approach for Insight Generation in Data Analysis

Alberto Sánchez Pérez, Alaa Boukhary, Paolo Papotti, Luis Castejón Lozano, Adam Elwood

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Accepted for publication at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05126 2025-03-13 cs.LG cs.AI 62%

Multi-Task Reinforcement Learning Enables Parameter Scaling

Reginald McLean, Evangelos Chatzaroulas, Jordan Terry, Isaac Woungang, Nariman Farsad, Pablo Samuel Castro

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08241 2025-03-12 cs.AI cs.CV cs.LG cs.RO 62%

HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents

Tristan Tomilin, Meng Fang, Mykola Pechenizkiy

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08122 2025-03-12 cs.LG cs.AI cs.CV 62%

Toward Stable World Models: Measuring and Addressing World Instability in Generative Environments

Soonwoo Kwon, Jin-Young Kim, Hyojun Go, Kyungjune Baek

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07988 2025-03-12 cs.LG cs.AI 62%

Provable Zero-Shot Generalization in Offline Reinforcement Learning

Zhiyong Wang, Chen Yang, John C. S. Lui, Dongruo Zhou

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03245 2025-03-11 cs.LG cs.AI cs.CR 62%

Less is more? Rewards in RL for Cyber Defence

Elizabeth Bates, Chris Hicks, Vasilios Mavroudis

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 4 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09099 2025-03-11 cs.LG cs.AI cs.DC 62%

Adaptive Active Inference Agents for Heterogeneous and Lifelong Federated Learning

Anastasiya Danilenka, Alireza Furutanpey, Victor Casamayor Pujol, Boris Sedlak, Anna Lackinger, Maria Ganzha, Marcin Paprzycki, Schahram Dustdar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 12 pages, double column, 17 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05856 2025-03-11 cs.CL cs.AI 62%

This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs

Lorenz Wolf, Sangwoong Yoon, Ilija Bogunovic

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 35 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05573 2025-03-10 cs.RO cs.AI cs.ET cs.LG cs.NE 62%

InDRiVE: Intrinsic Disagreement based Reinforcement for Vehicle Exploration through Curiosity Driven Generalized World Model

Feeza Khan Khanzada, Jaerock Kwon

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments This work has been submitted to IROS 2025 and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02365 2025-03-07 cs.AI cs.CL 62%

EchoQA: A Large Collection of Instruction Tuning Data for Echocardiogram Reports

Lama Moukheiber, Mira Moukheiber, Dana Moukheiiber, Jae-Woo Ju, Hyung-Chul Lee

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

Comments NeurIPS SafeGenAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14688 2025-03-06 cs.CL cs.AI 62%

ExpertPrompting: Instructing Large Language Models to be Distinguished Experts

Benfeng Xu, An Yang, Junyang Lin, Quan Wang, Chang Zhou, Yongdong Zhang, Zhendong Mao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01881 2025-03-05 cs.LG cs.AI 62%

Mapping representations in Reinforcement Learning via Semantic Alignment for Zero-Shot Stitching

Antonio Pio Ricciardi, Valentino Maiorca, Luca Moschella, Riccardo Marin, Emanuele Rodolà

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15044 2025-03-05 cs.LG cs.AI 62%

From Overfitting to Robustness: Quantity, Quality, and Variety Oriented Negative Sample Selection in Graph Contrastive Learning

Adnan Ali, Jinlong Li, Huanhuan Chen, Ali Kashif Bashir

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01811 2025-03-04 cs.CR cs.AI cs.LG 62%

AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses

Nicholas Carlini, Javier Rando, Edoardo Debenedetti, Milad Nasr, Florian Tramèr

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20754 2025-03-03 cs.AI cs.CL cs.HC 62%

Acquiring Grounded Representations of Words with Situated Interactive Instruction

Shiwali Mohan, Aaron H. Mininger, James R. Kirk, John E. Laird

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Journal ref Advances in Cognitive Systems (2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20175 2025-02-28 cs.AI cs.CL 62%

An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs

Kaustubh Vyas, Damien Graux, Sébastien Montella, Pavlos Vougiouklis, Ruofei Lai, Keshuang Li, Yang Ren, Jeff Z. Pan

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01821 2025-02-28 cs.AI cs.CL 62%

SDPO: Segment-Level Direct Preference Optimization for Social Agents

Aobo Kong, Wentao Ma, Shiwan Zhao, Yongbin Li, Yuchuan Wu, Ke Wang, Xiaoqian Liu, Qicheng Li, Yong Qin, Fei Huang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08032 2025-02-28 cs.GT cs.AI cs.LG cs.MA 62%

Strategic Classification With Externalities

Safwan Hossain, Evi Micha, Yiling Chen, Ariel Procaccia

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16238 2025-02-27 q-bio.NC cs.AI cs.LG cs.NE 62%

Brain-Model Evaluations Need the NeuroAI Turing Test

Jenelle Feather, Meenakshi Khosla, N. Apurva Ratan Murty, Aran Nayebi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18685 2025-02-27 cs.AI cs.CL cs.HC 62%

Speaking the Right Language: The Impact of Expertise Alignment in User-AI Interactions

Shramay Palta, Nirupama Chandrasekaran, Rachel Rudinger, Scott Counts

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments arXiv Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06195 2025-02-25 cs.CL cs.AI 62%

EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective

Guiyang Hou, Wenqi Zhang, Yongliang Shen, Zeqi Tan, Sihao Shen, Weiming Lu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16343 2025-02-25 cs.LG cs.AI cs.CE cs.MA 62%

Exploring Sentiment Manipulation by LLM-Enabled Intelligent Trading Agents

David Byrd

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15005 2025-02-24 cs.CL cs.AI cs.HC 62%

A Socratic RAG Approach to Connect Natural Language Queries on Research Topics with Knowledge Organization Systems

Lew Lefton, Kexin Rong, Chinar Dankhara, Lila Ghemri, Firdous Kausar, A. Hannibal Hamdallahi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 6 pages, 2 figures, AAAI 2025 Workshop on A Translational Institute for Knowledge Axiomatization

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14803 2025-02-24 cs.LG cs.AI cs.DC cs.SY eess.SY 62%

DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents

Taiyi Wang, Zhihao Wu, Jianheng Liu, Jianye Hao, Jun Wang, Kun Shao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Paper and Appendix, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏