arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2407.12823 2024-07-19 cs.CL cs.AI 62%

WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models

Kangyun Ning, Yisong Su, Xueqiang Lv, Yuanzhe Zhang, Jian Liu, Kang Liu, Jinan Xu

专题命中 Agent评测 :tool use(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12437 2024-07-18 cs.LG cs.AI 62%

Variable-Agnostic Causal Exploration for Reinforcement Learning

Minh Hoang Nguyen, Hung Le, Svetha Venkatesh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12421 2024-07-18 cs.LG cs.AI 62%

SafePowerGraph: Safety-aware Evaluation of Graph Neural Networks for Transmission Power Grids

Salah Ghamizi, Aleksandar Bojchevski, Aoxiang Ma, Jun Cao

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13890 2024-07-18 eess.IV cs.AI cs.CV cs.LG 62%

Towards Learning Contrast Kinetics with Multi-Condition Latent Diffusion Models

Richard Osuala, Daniel M. Lang, Preeti Verma, Smriti Joshi, Apostolia Tsirikoglou, Grzegorz Skorupko, Kaisar Kushibar, Lidia Garrucho, Walter H. L. Pinaya, Oliver Diaz, Julia A. Schnabel, Karim Lekadir

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Early Accept at MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06212 2024-07-17 eess.SY cs.AI cs.LG cs.SY 62%

Contingency-constrained economic dispatch with safe reinforcement learning

Michael Eichelbeck, Hannah Markgraf, Matthias Althoff

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Journal ref 21st IEEE International Conference on Machine Learning and Applications (ICMLA), 2022, pp. 597-602

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16650 2024-07-17 cs.LG cs.AI 62%

Augmenting Replay in World Models for Continual Reinforcement Learning

Luke Yang, Levin Kuhlmann, Gideon Kowadlo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07091 2024-07-16 cs.LG cs.AI cs.RO 62%

Robotic Manipulation Datasets for Offline Compositional Reinforcement Learning

Marcel Hussing, Jorge A. Mendez, Anisha Singrodia, Cassandra Kent, Eric Eaton

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at the First Reinforcement Learning Conference (RLC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09849 2024-07-16 cs.CL cs.LG 62%

Text-Based Detection of On-Hold Scripts in Contact Center Calls

Dmitrii Galimzianov, Viacheslav Vyshegorodtsev

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures, 4 tables

Journal ref Machine Learning and Applications: An International Journal (MLAIJ) Vol.11, No.2, June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09415 2024-07-15 cs.AI cs.LG 62%

A Benchmark Environment for Offline Reinforcement Learning in Racing Games

Girolamo Macaluso, Alessandro Sestini, Andrew D. Bagdanov

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at IEEE Conference on Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04221 2024-07-12 cs.LG cs.AI 62%

Why Online Reinforcement Learning is Causal

Oliver Schulte, Pascal Poupart

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 43 pages. Version 2 discusses policy evaluation for partially observable MDPs based on a causal model

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05008 2024-07-09 cs.LG cs.AI 62%

Habits and goals in synergy: a variational Bayesian framework for behavior

Dongqi Han, Kenji Doya, Dongsheng Li, Jun Tani

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Journal ref Nat Commun 15, 4461 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12707 2024-07-09 cs.HC cs.AI cs.CL 62%

Keeping Users Engaged During Repeated Administration of the Same Questionnaire: Using Large Language Models to Reliably Diversify Questions

Hye Sun Yun, Mehdi Arjmand, Phillip Sherlock, Michael K. Paasche-Orlow, James W. Griffith, Timothy Bickmore

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 10 pages, ACM International Conference on Intelligent Virtual Agents (IVA '24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21028 2024-07-04 cs.CL cs.AI 62%

LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models

Elias Stengel-Eskin, Peter Hase, Mohit Bansal

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 18 pages. Code: https://github.com/esteng/pragmatic_calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00993 2024-07-02 cs.AI cs.CL 62%

Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents

Shihan Deng, Weikai Xu, Hongda Sun, Wei Liu, Tao Tan, Jianfeng Liu, Ang Li, Jian Luan, Bin Wang, Rui Yan, Shuo Shang

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00264 2024-07-02 cs.AI cs.LG 62%

External Model Motivated Agents: Reinforcement Learning for Enhanced Environment Sampling

Rishav Bhagat, Jonathan Balloch, Zhiyu Lin, Julia Kim, Mark Riedl

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09976 2024-07-02 cs.LG cs.AI 62%

Robust Model-Based Reinforcement Learning with an Adversarial Auxiliary Model

Siemen Herremans, Ali Anwar, Siegfried Mercelis

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Will be presented at the RL Safety Workshop at RLC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19500 2024-07-01 cs.AI cs.CL 62%

Knowledge acquisition for dialogue agents using reinforcement learning on graph representations

Selene Baez Santamaria, Shihan Wang, Piek Vossen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19320 2024-06-28 cs.LG cs.AI cs.CV 62%

Efficient World Models with Context-Aware Tokenization

Vincent Micheli, Eloi Alonso, François Fleuret

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18033 2024-06-27 cs.LG cs.AI stat.ML 62%

Boosting Soft Q-Learning by Bounding

Jacob Adamczyk, Volodymyr Makarenko, Stas Tiomkin, Rahul V. Kulkarni

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments To appear in the 1st Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01389 2024-06-27 cs.LG cs.AI cs.SY eess.SY 62%

RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation

Jeongyeol Kwon, Shie Mannor, Constantine Caramanis, Yonathan Efroni

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Fixed typos + alpha

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02416 2024-06-27 cs.CV cs.AI cs.LG cs.RO 62%

ODIN: A Single Model for 2D and 3D Segmentation

Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Camera Ready (CVPR 2024, Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15990 2024-06-26 cs.CL cs.AI 62%

Enhancing Cross-Document Event Coreference Resolution by Discourse Structure and Semantic Information

Qiang Gao, Bobo Li, Zixiang Meng, Yunlong Li, Jun Zhou, Fei Li, Chong Teng, Donghong Ji

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Journal ref LREC|COLING,Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation,2024,5907-5921

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03984 2024-06-26 cs.CL cs.LG 62%

Toward More Accurate and Generalizable Evaluation Metrics for Task-Oriented Dialogs

Abishek Komma, Nagesh Panyam Chandrasekarasastry, Timothy Leffel, Anuj Goyal, Angeliki Metallinou, Spyros Matsoukas, Aram Galstyan

专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16748 2024-06-25 cs.LG cs.CL 62%

OCALM: Object-Centric Assessment with Language Models

Timo Kaufmann, Jannis Blüml, Antonia Wüst, Quentin Delfosse, Kristian Kersting, Eyke Hüllermeier

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

Comments Accepted at the RLBRew Workshop at RLC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01004 2024-06-25 cs.LG cs.AI 62%

Improving the Diversity of Bootstrapped DQN by Replacing Priors With Noise

Li Meng, Morten Goodwin, Anis Yazidi, Paal Engelstad

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Journal ref IEEE Journal of Transactions on Games, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15527 2024-06-25 cs.LG cs.CL 62%

Data Efficient Evaluation of Large Language Models and Text-to-Image Models via Adaptive Sampling

Cong Xu, Gayathri Saranathan, Mahammad Parwez Alam, Arpit Shah, James Lim, Soon Yee Wong, Foltin Martin, Suparna Bhattacharya

专题命中 Agent评测 :tool use(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12659 2024-06-21 cs.CL cs.AI cs.CE 62%

FinBen: A Holistic Financial Benchmark for Large Language Models

Qianqian Xie, Weiguang Han, Zhengyu Chen, Ruoyu Xiang, Xiao Zhang, Yueru He, Mengxi Xiao, Dong Li, Yongfu Dai, Duanyu Feng, Yijing Xu, Haoqiang Kang, Ziyan Kuang, Chenhan Yuan, Kailai Yang, Zheheng Luo, Tianlin Zhang, Zhiwei Liu, Guojun Xiong, Zhiyang Deng, Yuechen Jiang, Zhiyuan Yao, Haohang Li, Yangyang Yu, Gang Hu, Jiajia Huang, Xiao-Yang Liu, Alejandro Lopez-Lira, Benyou Wang, Yanzhao Lai, Hao Wang, Min Peng, Sophia Ananiadou, Jimin Huang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11681 2024-06-18 cs.CL cs.AI 62%

R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models

Shangqing Tu, Yuanchun Wang, Jifan Yu, Yuyang Xie, Yaran Shi, Xiaozhi Wang, Jing Zhang, Lei Hou, Juanzi Li

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

Comments 12 pages, 9 figures, Accepted by KDD2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11439 2024-06-18 cs.SE cs.AI 62%

GPT-Powered Elicitation Interview Script Generator for Requirements Engineering Training

Binnur Görer, Fatma Başak Aydemir

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

Comments Accepted to RE@Next! at the IEEE International Requirements Engineering Conference 2024 at Reykjavik, Iceland

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10977 2024-06-18 cs.CL cs.AI 62%

Toward Optimal LLM Alignments Using Two-Player Games

Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Hang Li, Yang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Our code is released at https://github.com/ruizheng20/gpo

详情

展开后加载摘要…

URL PDF HTML 收藏