arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2404.12917 2025-02-19 cs.LG cs.AI cs.CV 62%

R3L: Relative Representations for Reinforcement Learning

Antonio Pio Ricciardi, Valentino Maiorca, Luca Moschella, Riccardo Marin, Emanuele Rodolà

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12328 2025-02-19 cs.CL cs.AI 62%

LM Agents for Coordinating Multi-User Information Gathering

Harsh Jhamtani, Jacob Andreas, Benjamin Van Durme

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12197 2025-02-19 cs.CL cs.AI 62%

A Closer Look at System Prompt Robustness

Norman Mu, Jonathan Lu, Michael Lavery, David Wagner

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Artifacts: https://github.com/normster/RealGuardrails

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11560 2025-02-18 cs.AI cs.LG 62%

A Survey of Automatic Prompt Engineering: An Optimization Perspective

Wenwu Li, Xiangfeng Wang, Wenhao Li, Bo Jin

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10473 2025-02-18 cs.AI cs.LG 62%

Diverse Transformer Decoding for Offline Reinforcement Learning Using Financial Algorithmic Approaches

Dan Elbaz, Oren Salzman

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08684 2025-02-14 cs.LG cs.AI 62%

Self-Evaluation for Job-Shop Scheduling

Imanol Echeverria, Maialen Murua, Roberto Santana

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05306 2025-02-14 cs.LG cs.AI 62%

Interactive Symbolic Regression through Offline Reinforcement Learning: A Co-Design Framework

Yuan Tian, Wenqi Zhou, Michele Viscione, Hao Dong, David Kammer, Olga Fink

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02917 2025-02-12 cs.LG cs.AI cs.SC 62%

Interactive Symbolic Regression through Offline Reinforcement Learning: A Co-Design Framework

Yuan Tian, Wenqi Zhou, Michele Viscione, Hao Dong, David Kammer, Olga Fink

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments This work should not be a new submission but instead should be an update to my existing article, arXiv:2402.05306

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04349 2025-02-10 cs.CL cs.AI 62%

Dynamic benchmarking framework for LLM-based conversational data capture

Pietro Alessandro Aluffi, Patrick Zietkiewicz, Marya Bazzi, Matt Arderne, Vladimirs Murevics

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08822 2025-02-10 cs.LG cs.AI cs.RO 62%

SOLD: Slot Object-Centric Latent Dynamics Models for Relational Manipulation Learning from Pixels

Malte Mosbach, Jan Niklas Ewertz, Angel Villar-Corrales, Sven Behnke

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14202 2025-02-06 cs.CL cs.AI 62%

Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs

SeongYeub Chu, JongWoo Kim, Bryan Wong, MunYong Yi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01243 2025-02-04 cs.CL cs.AI 62%

OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology

Chengfeng Zhou, Ji Wang, Juanjuan Qin, Yining Wang, Ling Sun, Weiwei Dai

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17315 2025-01-30 cs.AI cs.CR cs.SE 62%

A sketch of an AI control safety case

Tomek Korbak, Joshua Clymer, Benjamin Hilton, Buck Shlegeris, Geoffrey Irving

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13431 2025-01-28 cs.LG cs.AI 62%

Improving Out-of-Distribution Generalization of Trajectory Prediction for Autonomous Driving via Polynomial Representations

Yue Yao, Shengchao Yan, Daniel Goehring, Wolfram Burgard, Joerg Reichardt

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14474 2025-01-27 cs.GT cs.AI cs.LG econ.TH 62%

The Pseudo-Dimension of Contracts

Paul Duetting, Michal Feldman, Tomasz Ponitka, Ermis Soumalias

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14199 2025-01-27 cs.LG cs.AI cs.ET 62%

Coordinating Ride-Pooling with Public Transit using Reward-Guided Conservative Q-Learning: An Offline Training and Online Fine-Tuning Reinforcement Learning Framework

Yulong Hu, Tingting Dong, Sen Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00132 2025-01-24 cs.SE cs.AI 62%

ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents

Haiyang Shen, Yue Li, Desong Meng, Dongqi Cai, Sheng Qi, Li Zhang, Mengwei Xu, Yun Ma

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.SE

Comments ICLR'25: https://openreview.net/forum?id=kKILfPkhSz

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02623 2025-01-17 cs.AI cs.CY cs.HC cs.LG 62%

Learning to Assist Humans without Inferring Rewards

Vivek Myers, Evan Ellis, Sergey Levine, Benjamin Eysenbach, Anca Dragan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Conference on Neural Information Processing Systems (NeurIPS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02512 2025-01-16 cs.LG cs.AI 62%

Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal

Jifeng Hu, Li Shen, Sili Huang, Zhejian Yang, Hechang Chen, Lichao Sun, Yi Chang, Dacheng Tao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11484 2025-01-13 cs.AI cs.CL 62%

The Oscars of AI Theater: A Survey on Role-Playing with Language Models

Nuo Chen, Yan Wang, Yang Deng, Jia Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04982 2025-01-10 cs.RO cs.AI cs.LG 62%

CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving

Bhargava Uppuluri, Anjel Patel, Neil Mehta, Sridhar Kamath, Pratyush Chakraborty

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments To be published in the 17th International Conference on Agents and Artificial Intelligence (ICAART), Feb 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12046 2025-01-09 cs.SE cs.HC cs.LG 62%

Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings

Petr Tsvetkov, Aleksandra Eliseeva, Danny Dig, Alexander Bezzubov, Yaroslav Golubev, Timofey Bryksin, Yaroslav Zharov

专题命中 Agent评测 :workflow(abstract);分类 cs.LG、cs.SE

Comments 10 pages, 5 figures (Published at ICSE'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01014 2025-01-03 cs.CL cs.AI 62%

MDSF: Context-Aware Multi-Dimensional Data Storytelling Framework based on Large language Model

Chengze Zhang, Changshan Li, Shiyang Gao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15474 2025-01-03 cs.CV cs.AI cs.LG cs.RO 62%

EC-IoU: Orienting Safety for Object Detectors via Ego-Centric Intersection-over-Union

Brian Hsuan-Cheng Liao, Chih-Hong Cheng, Hasan Esen, Alois Knoll

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 8 pages (IEEE double column format), 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00078 2025-01-03 cs.HC cs.AI cs.LG 62%

Human-like Bots for Tactical Shooters Using Compute-Efficient Sensors

Niels Justesen, Maria Kaselimi, Sam Snodgrass, Miruna Vozaru, Matthew Schlegel, Jonas Wingren, Gabriella A. B. Barros, Tobias Mahlmann, Shyam Sudhakaran, Wesley Kerr, Albert Wang, Christoffer Holmgård, Georgios N. Yannakakis, Sebastian Risi, Julian Togelius

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19619 2024-12-30 cs.CL cs.AI 62%

Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models

Ziqiao Ma, Jacob Sansom, Run Peng, Joyce Chai

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments EMNLP 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08645 2024-12-24 cs.LG cs.AI cs.NE 62%

Need is All You Need: Homeostatic Neural Networks Adapt to Concept Shift

Kingson Man, Antonio Damasio, Hartmut Neven

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14304 2024-12-20 cs.CL cs.AI 62%

Multi-OphthaLingua: A Multilingual Benchmark for Assessing and Debiasing LLM Ophthalmological QA in LMICs

David Restrepo, Chenwei Wu, Zhengxu Tang, Zitao Shuai, Thao Nguyen Minh Phan, Jun-En Ding, Cong-Tinh Dao, Jack Gallifant, Robyn Gayle Dychiao, Jose Carlo Artiaga, André Hiroshi Bando, Carolina Pelegrini Barbosa Gracitelli, Vincenz Ferrer, Leo Anthony Celi, Danielle Bitterman, Michael G Morley, Luis Filipe Nakayama

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

Comments Accepted at the AAAI 2025 Artificial Intelligence for Social Impact Track (AAAI-AISI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01679 2024-12-20 cs.CL cs.AI 62%

STICKERCONV: Generating Multimodal Empathetic Responses from Scratch

Yiqun Zhang, Fanheng Kong, Peidong Wang, Shuang Sun, Lingshuai Wang, Shi Feng, Daling Wang, Yifei Zhang, Kaisong Song

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 7707-7733, Bangkok, Thailand, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04434 2024-12-19 cs.LG cs.AI 62%

Scaling Laws for Pre-training Agents and World Models

Tim Pearce, Tabish Rashid, Dave Bignell, Raluca Georgescu, Sam Devlin, Katja Hofmann

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏