arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2412.12129 2024-12-18 cs.LG cs.AI cs.CV 62%

SceneDiffuser: Efficient and Controllable Driving Simulation Initialization and Rollout

Chiyu Max Jiang, Yijing Bai, Andre Cornman, Christopher Davis, Xiukun Huang, Hong Jeon, Sakshum Kulshrestha, John Lambert, Shuangyu Li, Xuanyu Zhou, Carlos Fuertes, Chang Yuan, Mingxing Tan, Yin Zhou, Dragomir Anguelov

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11417 2024-12-18 cs.AI cs.LG 62%

RL-LLM-DT: An Automatic Decision Tree Generation Method Based on RL Evaluation and LLM Enhancement

Junjie Lin, Jian Zhao, Lin Liu, Yue Deng, Youpeng Zhao, Lanxiao Huang, Xia Lin, Wengang Zhou, Houqiang Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Length:10 pages. Figures:10 figures. Additional Notes:In this paper, we have introduced a novel hybrid approach which leverages the strengths of both RL and LLMs to itera- tively refine decision tree tactics, enhancing their performance and adaptability

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10726 2024-12-17 cs.CV cs.AI cs.LG cs.RO 62%

NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries

Tao Wu, Chuhao Zhou, Yen Heng Wong, Lin Gu, Jianfei Yang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10415 2024-12-17 cs.CL cs.AI 62%

Generative Adversarial Reviews: When LLMs Become the Critic

Nicolas Bougie, Narimasa Watanabe

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05631 2024-12-10 cs.CL cs.AI 62%

CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds

Lei Wang, Jianxun Lian, Yi Huang, Yanqi Dai, Haoxuan Li, Xu Chen, Xing Xie, Ji-Rong Wen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04775 2024-12-09 cs.LG cs.AI 62%

A Temporally Correlated Latent Exploration for Reinforcement Learning

SuMin Oh, WanSoo Kim, HyunJin Kim

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04492 2024-12-09 cs.CL cs.AI cs.HC cs.SI 62%

Socio-Emotional Response Generation: A Human Evaluation Protocol for LLM-Based Conversational Systems

Lorraine Vanel, Ariel R. Ramos Vela, Alya Yacoubi, Chloé Clavel

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

Journal ref AHRI 2024, Sep 2024, Glasgow, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12027 2024-12-06 cs.CL cs.AI cs.CV 62%

From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models

Kung-Hsiang Huang, Hou Pong Chan, Yi R. Fung, Haoyi Qiu, Mingyang Zhou, Shafiq Joty, Shih-Fu Chang, Heng Ji

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00949 2024-12-03 cs.LG cs.AI cs.RO 62%

STEVE-Audio: Expanding the Goal Conditioning Modalities of Embodied Agents in Minecraft

Nicholas Lenzen, Amogh Raut, Andrew Melnik

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at CoRL 2024: Workshop on Lifelong Learning for Home Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00944 2024-12-03 cs.LG cs.AI 62%

Bilinear Convolution Decomposition for Causal RL Interpretability

Narmeen Oozeer, Sinem Erisken, Alice Rigg

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17135 2024-11-27 cs.AI cs.CL 62%

LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble

Yujeong Lee, Sangwoo Shin, Wei-Jin Park, Honguk Woo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Findings of EMNLP-2024 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16905 2024-11-27 cs.AI cs.CL 62%

Boundless Socratic Learning with Language Games

Tom Schaul

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15230 2024-11-26 cs.AI cs.HC cs.LG 62%

A No Free Lunch Theorem for Human-AI Collaboration

Kenny Peng, Nikhil Garg, Jon Kleinberg

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07435 2024-11-26 eess.SY cs.AI cs.LG cs.NE cs.SY 62%

Real-world validation of safe reinforcement learning, model predictive control and decision tree-based home energy management systems

Julian Ruddick, Glenn Ceusters, Gilles Van Kriekinge, Evgenii Genov, Cedric De Cauwer, Thierry Coosemans, Maarten Messagie

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted version Energy and AI: https://doi.org/10.1016/j.egyai.2024.100448

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08713 2024-11-25 cs.CL cs.AI 62%

GTA: A Benchmark for General Tool Agents

Jize Wang, Zerun Ma, Yining Li, Songyang Zhang, Cailian Chen, Kai Chen, Xinyi Le

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI、cs.CL

Comments Github repo: https://github.com/open-compass/GTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11731 2024-11-19 cs.CL cs.AI 62%

Moral Persuasion in Large Language Models: Evaluating Susceptibility and Ethical Alignment

Allison Huang, Yulu Niki Pi, Carlos Mougan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11409 2024-11-19 cs.CV cs.AI cs.LG cs.RO 62%

IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos

Yunong Liu, Cristobal Eyzaguirre, Manling Li, Shubh Khanna, Juan Carlos Niebles, Vineeth Ravi, Saumitra Mishra, Weiyu Liu, Jiajun Wu

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12176 2024-11-18 cs.CY cs.AI cs.CL 62%

GPT-4V Cannot Generate Radiology Reports Yet

Yuyang Jiang, Chacha Chen, Dang Nguyen, Benjamin M. Mervak, Chenhao Tan

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

Comments 24 pages, 3 figures, code: https://github.com/ChicagoHAI/cxr-eval-gpt-4v Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07781 2024-11-13 cs.SE cs.AI 62%

RedCode: Risky Code Execution and Generation Benchmark for Code Agents

Chengquan Guo, Xun Liu, Chulin Xie, Andy Zhou, Yi Zeng, Zinan Lin, Dawn Song, Bo Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

Comments Accepted by NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19137 2024-11-11 cs.LG cs.AI 62%

Automaton Distillation: Neuro-Symbolic Transfer Learning for Deep Reinforcement Learning

Suraj Singireddy, Precious Nwaorgu, Andre Beckus, Aden McKinney, Chinwendu Enyioha, Sumit Kumar Jha, George K. Atia, Alvaro Velasquez

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04075 2024-11-07 cs.CL cs.AI 62%

M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models

Chuhan Li, Ziyao Shangguan, Yilun Zhao, Deyuan Li, Yixin Liu, Arman Cohan

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16383 2024-11-07 cs.AI cs.CR cs.LG cs.SY eess.SY 62%

Designing Robust Cyber-Defense Agents with Evolving Behavior Trees

Nicholas Potteiger, Ankita Samaddar, Hunter Bergstrom, Xenofon Koutsoukos

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04815 2024-11-07 cs.LG cs.AI cs.RO 62%

Skill-aware Mutual Information Optimisation for Generalisation in Reinforcement Learning

Xuehui Yu, Mhairi Dunion, Xin Li, Stefano V. Albrecht

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments The Thirty-eighth Annual Conference on Neural Information Processing Systems (NeurIPS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23273 2024-10-31 cs.LG cs.AI cs.GT 62%

Proportional Fairness in Non-Centroid Clustering

Ioannis Caragiannis, Evi Micha, Nisarg Shah

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments A preliminary version appeared at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13185 2024-10-31 cs.AI cs.CL 62%

Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents

Long Li, Weiwen Xu, Jiayan Guo, Ruochen Zhao, Xingxuan Li, Yuqian Yuan, Boqiang Zhang, Yuming Jiang, Yifei Xin, Ronghao Dang, Deli Zhao, Yu Rong, Tian Feng, Lidong Bing

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 10 pages,5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15099 2024-10-31 cs.LG cs.AI cs.RO 62%

No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery

Alexander Rutherford, Michael Beukman, Timon Willi, Bruno Lacerda, Nick Hawes, Jakob Foerster

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16642 2024-10-31 cs.LG cs.AI 62%

Fast TRAC: A Parameter-Free Optimizer for Lifelong Reinforcement Learning

Aneesh Muppidi, Zhiyu Zhang, Heng Yang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Code and Website: https://computationalrobotics.seas.harvard.edu/TRAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12399 2024-10-31 cs.LG cs.AI cs.CV 62%

Diffusion for World Modeling: Visual Details Matter in Atari

Eloi Alonso, Adam Jelley, Vincent Micheli, Anssi Kanervisto, Amos Storkey, Tim Pearce, François Fleuret

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21407 2024-10-30 cs.CR cs.AI cs.LG cs.RO 62%

Exploring reinforcement learning for incident response in autonomous military vehicles

Henrik Madsen, Gudmund Grov, Federico Mancini, Magnus Baksaas, Åvald Åslaugson Sommervoll

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments DIGILIENCE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20750 2024-10-29 cs.LG cs.AI 62%

ODRL: A Benchmark for Off-Dynamics Reinforcement Learning

Jiafei Lyu, Kang Xu, Jiacheng Xu, Mengbei Yan, Jingwen Yang, Zongzhang Zhang, Chenjia Bai, Zongqing Lu, Xiu Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏