arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2406.01364 2024-06-04 cs.CR cs.AI cs.CL 73%

BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards

Diego Dorn, Alexandre Variengien, Charbel-Raphaël Segerie, Vincent Corruble

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07972 2024-05-31 cs.AI cs.CL 73%

OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

Comments 51 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09935 2024-05-27 cs.CL cs.AI 73%

DEBATE: Devil's Advocate-Based Assessment and Text Evaluation

Alex Kim, Keonwoo Kim, Sangwon Yoon

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17601 2024-05-24 cs.AI cs.LG 73%

LASIL: Learner-Aware Supervised Imitation Learning For Long-term Microscopic Traffic Simulation

Ke Guo, Zhenwei Miao, Wei Jing, Weiwei Liu, Weizi Li, Dayang Hao, Jia Pan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted by CVPR 2024. arXiv admin note: text overlap with arXiv:2306.06401

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12438 2024-05-22 cs.HC cs.AI cs.CL 73%

CoCo Matrix: Taxonomy of Cognitive Contributions in Co-writing with Intelligent Agents

Ruyuan Wan, Simret Gebreegziabhe, Toby Jia-Jun Li, Karla Badillo-Urquiola

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01035 2024-05-03 cs.GT cs.AI cs.LG 73%

LOQA: Learning with Opponent Q-Learning Awareness

Milad Aghajohari, Juan Agustin Duque, Tim Cooijmans, Aaron Courville

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments accepted to ICLR but still not in proceedings https://openreview.net/forum?id=FDQF6A1s6M

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15417 2024-04-29 cs.LG cs.AI stat.ML 73%

The Power of Resets in Online Reinforcement Learning

Zakaria Mhammedi, Dylan J. Foster, Alexander Rakhlin

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Fixed a small typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13340 2024-04-23 cs.SE cs.AI 73%

Large Language Models as Test Case Generators: Performance Evaluation and Enhancement

Kefan Li, Yuan Yuan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10786 2024-04-18 cs.DC cs.AI cs.LG cs.MA cs.SY eess.SY 73%

Sustainability of Data Center Digital Twins with Reinforcement Learning

Soumyendu Sarkar, Avisek Naug, Antonio Guillen, Ricardo Luna, Vineet Gundecha, Ashwin Ramesh Babu, Sajad Mousavi

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 2024 Proceedings of the AAAI Conference on Artificial Intelligence

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, no. 20, pp. 22322-22330, Mar. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03302 2024-04-16 cs.LG cs.AI 73%

MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation

Qian Huang, Jian Vora, Percy Liang, Jure Leskovec

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11940 2024-03-25 cs.AI cs.LG cs.MA 73%

Decision-making with Speculative Opponent Models

Jing Sun, Shuo Chen, Cong Zhang, Yining Ma, Jie Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01557 2024-03-19 cs.LG cs.AI 73%

SmartPlay: A Benchmark for LLMs as Intelligent Agents

Yue Wu, Xuan Tang, Tom M. Mitchell, Yuanzhi Li

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08879 2024-03-19 cs.LG cs.AI cs.MA math.OC 73%

Multi-Objective Optimization Using Adaptive Distributed Reinforcement Learning

Jing Tan, Ramin Khalili, Holger Karl

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14830 2024-02-26 cs.CL cs.AI 73%

Orca-Math: Unlocking the potential of SLMs in Grade School Math

Arindam Mitra, Hamed Khanpour, Corby Rosset, Ahmed Awadallah

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03590 2024-02-07 cs.LG cs.AI cs.MA 73%

Assessing the Impact of Distribution Shift on Reinforcement Learning Performance

Ted Fujimoto, Joshua Suetterlein, Samrat Chatterjee, Auroop Ganguly

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Poster at the Workshop on Regulatable Machine Learning at the 37th Conference on Neural Information Processing Systems (RegML @ NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10750 2024-02-07 cs.CL cs.AI 73%

Improving Grounded Language Understanding in a Collaborative Environment by Interacting with Agents Through Help Feedback

Nikhil Mehta, Milagro Teruel, Patricio Figueroa Sanz, Xin Deng, Ahmed Hassan Awadallah, Julia Kiseleva

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

Comments Findings of EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00323 2024-01-19 cs.AI cs.LG 73%

Thought Cloning: Learning to Think while Acting by Imitating Human Thinking

Shengran Hu, Jeff Clune

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2023 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03993 2024-01-09 cs.LG cs.AI cs.CV 73%

Behavioural Cloning in VizDoom

Ryan Spick, Timothy Bradley, Ayush Raina, Pierluigi Vito Amadori, Guy Moss

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01824 2023-12-29 cs.AI cs.LG cs.RO 73%

Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI

Emily Jin, Jiaheng Hu, Zhuoyi Huang, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Roberto Martín-Martín

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15339 2023-12-27 cs.LG cs.AI cs.CV cs.RO 73%

MaDi: Learning to Mask Distractions for Generalization in Visual Deep Reinforcement Learning

Bram Grooten, Tristan Tomilin, Gautham Vasan, Matthew E. Taylor, A. Rupam Mahmood, Meng Fang, Mykola Pechenizkiy, Decebal Constantin Mocanu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments Accepted as full-paper (oral) at AAMAS 2024. Code is available at https://github.com/bramgrooten/mask-distractions and see our 40-second video at https://youtu.be/2oImF0h1k48

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10809 2023-12-19 cs.AI cs.LG 73%

Deep-Dispatch: A Deep Reinforcement Learning-Based Vehicle Dispatch Algorithm for Advanced Air Mobility

Elaheh Sabziyan Varnousfaderani, Syed A. M. Shihab, Esrat F. Dulia

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08837 2023-12-15 cs.LG cs.AI 73%

Learning Safety Constraints From Demonstration Using One-Class Decision Trees

Mattijs Baert, Sam Leroux, Pieter Simoens

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments accepted for AAAI 2024 Workshop on Neuro-Symbolic Learning and Reasoning in the Era of Large Language Models (NucLeaR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01007 2023-11-09 cs.LG cs.AI cs.HC 73%

Effective Human-AI Teams via Learned Natural Language Rules and Onboarding

Hussein Mozannar, Jimin J Lee, Dennis Wei, Prasanna Sattigeri, Subhro Das, David Sontag

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2023 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05036 2023-11-09 cs.AI cs.CL 73%

AvalonBench: Evaluating LLMs Playing the Game of Avalon

Jonathan Light, Min Cai, Sheng Shen, Ziniu Hu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03196 2023-11-02 cs.GT cs.AI cs.LG cs.MA 73%

Population-based Evaluation in Repeated Rock-Paper-Scissors as a Benchmark for Multiagent Reinforcement Learning

Marc Lanctot, John Schultz, Neil Burch, Max Olan Smith, Daniel Hennes, Thomas Anthony, Julien Perolat

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 8 figures, Accepted at TMLR October 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02265 2023-10-31 cs.AI cs.LG 73%

Learning to Influence Human Behavior with Offline Reinforcement Learning

Joey Hong, Sergey Levine, Anca Dragan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments Published at NeurIPS 2023; 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14993 2023-10-30 cs.AI cs.LG 73%

Thinker: Learning to Plan and Act

Stephen Chung, Ivan Anokhin, David Krueger

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13565 2023-10-23 cs.LG cs.AI 73%

Reward Shaping for Happier Autonomous Cyber Security Agents

Elizabeth Bates, Vasilios Mavroudis, Chris Hicks

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments 12 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08901 2023-10-16 cs.MA cs.AI cs.CL 73%

Welfare Diplomacy: Benchmarking Language Model Cooperation

Gabriel Mukobi, Hannah Erlebach, Niklas Lauffer, Lewis Hammond, Alan Chan, Jesse Clifton

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08483 2023-10-12 cs.LG cs.AI 73%

Honor of Kings Arena: an Environment for Generalization in Competitive Reinforcement Learning

Hua Wei, Jingxiao Chen, Xiyang Ji, Hongyang Qin, Minwen Deng, Siqin Li, Liang Wang, Weinan Zhang, Yong Yu, Lin Liu, Lanxiao Huang, Deheng Ye, Qiang Fu, Wei Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2022

Journal ref Advances in Neural Information Processing Systems, 2022, 35: 11881-11892

详情

展开后加载摘要…

URL PDF HTML 收藏