arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2308.11958 2024-10-28 cs.LG cs.AI 62%

Maintaining Plasticity in Continual Learning via Regenerative Regularization

Saurabh Kumar, Henrik Marklund, Benjamin Van Roy

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17904 2024-10-24 cs.LG cs.AI math.OC stat.ML 62%

Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity

Philip Amortila, Dylan J. Foster, Nan Jiang, Akshay Krishnamurthy, Zakaria Mhammedi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16232 2024-10-22 cs.CL cs.AI 62%

Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design Prototyping

Ryan Li, Yanzhe Zhang, Diyi Yang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments preprint, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08440 2024-10-18 cs.CL cs.AI 62%

Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models

Wangtao Sun, Chenxiang Zhang, XueYou Zhang, Xuanqing Yu, Ziyang Huang, Pei Chen, Haotian Xu, Shizhu He, Jun Zhao, Kang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14991 2024-10-18 cs.CL cs.SE 62%

SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation

Zeyao Ma, Bohan Zhang, Jing Zhang, Jifan Yu, Xiaokang Zhang, Xiaohan Zhang, Sijia Luo, Xi Wang, Jie Tang

专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.SE

Comments Neurips 2024 (Spotlight); Homepage: https://spreadsheetbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10394 2024-10-17 cs.RO cs.AI cs.CV cs.LG 62%

PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation

Kaidong Zhang, Pengzhen Ren, Bingqian Lin, Junfan Lin, Shikui Ma, Hang Xu, Xiaodan Liang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10834 2024-10-16 cs.CV cs.AI cs.LG cs.RO 62%

Focus On What Matters: Separated Models For Visual-Based RL Generalization

Di Zhang, Bowen Lv, Hai Zhang, Feifan Yang, Junqiao Zhao, Hang Yu, Chang Huang, Hongtu Zhou, Chen Ye, Changjun Jiang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10179 2024-10-14 cs.RO cs.AI cs.HC cs.LG 62%

Scaling Instructable Agents Across Many Simulated Worlds

SIMA Team, Maria Abi Raad, Arun Ahuja, Catarina Barros, Frederic Besse, Andrew Bolt, Adrian Bolton, Bethanie Brownfield, Gavin Buttimore, Max Cant, Sarah Chakera, Stephanie C. Y. Chan, Jeff Clune, Adrian Collister, Vikki Copeman, Alex Cullum, Ishita Dasgupta, Dario de Cesare, Julia Di Trapani, Yani Donchev, Emma Dunleavy, Martin Engelcke, Ryan Faulkner, Frankie Garcia, Charles Gbadamosi, Zhitao Gong, Lucy Gonzales, Kshitij Gupta, Karol Gregor, Arne Olav Hallingstad, Tim Harley, Sam Haves, Felix Hill, Ed Hirst, Drew A. Hudson, Jony Hudson, Steph Hughes-Fitt, Danilo J. Rezende, Mimi Jasarevic, Laura Kampis, Rosemary Ke, Thomas Keck, Junkyung Kim, Oscar Knagg, Kavya Kopparapu, Rory Lawton, Andrew Lampinen, Shane Legg, Alexander Lerchner, Marjorie Limont, Yulan Liu, Maria Loks-Thompson, Joseph Marino, Kathryn Martin Cussons, Loic Matthey, Siobhan Mcloughlin, Piermaria Mendolicchio, Hamza Merzic, Anna Mitenkova, Alexandre Moufarek, Valeria Oliveira, Yanko Oliveira, Hannah Openshaw, Renke Pan, Aneesh Pappu, Alex Platonov, Ollie Purkiss, David Reichert, John Reid, Pierre Harvey Richemond, Tyson Roberts, Giles Ruscoe, Jaume Sanchez Elias, Tasha Sandars, Daniel P. Sawyer, Tim Scholtes, Guy Simmons, Daniel Slater, Hubert Soyer, Heiko Strathmann, Peter Stys, Allison C. Tam, Denis Teplyashin, Tayfun Terzi, Davide Vercelli, Bojan Vujatovic, Marcus Wainwright, Jane X. Wang, Zhengdong Wang, Daan Wierstra, Duncan Williams, Nathaniel Wong, Sarah York, Nick Young

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13890 2024-10-11 cs.CL cs.AI 62%

ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World

Weixiang Yan, Haitian Liu, Tengxiao Wu, Qian Chen, Wen Wang, Haoyuan Chai, Jiayi Wang, Weishan Zhao, Yixin Zhang, Renjun Zhang, Li Zhu, Xuandong Zhao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15648 2024-10-11 cs.RO cs.AI cs.LG 62%

Cross-Embodied Affordance Transfer through Learning Affordance Equivalences

Hakan Aktas, Yukie Nagai, Minoru Asada, Matteo Saveriano, Erhan Oztop, Emre Ugur

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 9 figures, Submitted to IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18231 2024-10-10 cs.CL cs.AI 62%

From Persona to Personalization: A Survey on Role-Playing Language Agents

Jiangjie Chen, Xintao Wang, Rui Xu, Siyu Yuan, Yikai Zhang, Wei Shi, Jian Xie, Shuang Li, Ruihan Yang, Tinghui Zhu, Aili Chen, Nianqi Li, Lida Chen, Caiyu Hu, Siye Wu, Scott Ren, Ziquan Fu, Yanghua Xiao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to TMLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13642 2024-10-10 cs.LG cs.AI cs.SY eess.SY 62%

Safety Margins for Reinforcement Learning

Alexander Grushin, Walt Woods, Alvaro Velasquez, Simon Khan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 2 pages, 2 figures. Presented at the 2023 IEEE Conference on Artificial Intelligence (CAI), Santa Clara, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12832 2024-10-08 cs.CL cs.AI 62%

FoodPuzzle: Developing Large Language Model Agents as Flavor Scientists

Tenghao Huang, Donghee Lee, John Sweeney, Jiatong Shi, Emily Steliotes, Matthew Lange, Jonathan May, Muhao Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03770 2024-10-08 cs.CL cs.AI 62%

A Two-Stage Proactive Dialogue Generator for Efficient Clinical Information Collection Using Large Language Model

Xueshen Li, Xinlong Hou, Nirupama Ravi, Ziyi Huang, Yu Gan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Prepare for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13627 2024-10-08 cs.CL cs.AI 62%

NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding

Chunkit Chan, Cheng Jiayang, Yauwai Yim, Zheye Deng, Wei Fan, Haoran Li, Xin Liu, Hongming Zhang, Weiqi Wang, Yangqiu Song

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to EMNLP 2024 findings. Dataset: https://github.com/HKUST-KnowComp/NegotiationToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10019 2024-10-08 cs.CL cs.AI 62%

R-Judge: Benchmarking Safety Risk Awareness for LLM Agents

Tongxin Yuan, Zhiwei He, Lingzhong Dong, Yiming Wang, Ruijie Zhao, Tian Xia, Lizhen Xu, Binglin Zhou, Fangqi Li, Zhuosheng Zhang, Rui Wang, Gongshen Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03376 2024-10-07 cs.LG cs.AI 62%

Mitigating Adversarial Perturbations for Deep Reinforcement Learning via Vector Quantization

Tung M. Luu, Thanh Nguyen, Tee Joshua Tian Jin, Sungwoon Kim, Chang D. Yoo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 8 pages, IROS 2024 (Code: https://github.com/tunglm2203/vq_robust_rl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20015 2024-10-07 cs.CL cs.AI 62%

ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models

Yuxiang Zhang, Jing Chen, Junjie Wang, Yaxin Liu, Cheng Yang, Chufan Shi, Xinyu Zhu, Zihao Lin, Hanwen Wan, Yujiu Yang, Tetsuya Sakai, Tian Feng, Hayato Yamana

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05020 2024-10-07 cs.CL cs.AI 62%

Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMs

Xuhui Zhou, Zhe Su, Tiwalayo Eisape, Hyunwoo Kim, Maarten Sap

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02823 2024-10-07 cs.AI cs.LG 62%

DANA: Domain-Aware Neurosymbolic Agents for Consistency and Accuracy

Vinh Luong, Sang Dinh, Shruti Raghavan, William Nguyen, Zooey Nguyen, Quynh Le, Hung Vo, Kentaro Maegaito, Loc Nguyen, Thao Nguyen, Anh Hai Ha, Christopher Nguyen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01458 2024-10-03 cs.AI cs.LG 62%

From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge

Xiefeng Wu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments q-shaping, reinforcement learning, reward shaping

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00240 2024-10-02 cs.AI cs.LG 62%

Demonstrating the Continual Learning Capabilities and Practical Application of Discrete-Time Active Inference

Rithvik Prakki

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12534 2024-10-02 cs.SE cs.CR cs.LG 62%

BertRLFuzzer: A BERT and Reinforcement Learning Based Fuzzer

Piyush Jha, Joseph Scott, Jaya Sriram Ganeshna, Mudit Singh, Vijay Ganesh

专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 38(21), 23521-23522 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11095 2024-10-01 cs.CL cs.AI 62%

Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues

Jiao Ou, Jiayu Wu, Che Liu, Fuzheng Zhang, Di Zhang, Kun Gai

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments Accepted at EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12789 2024-09-30 q-bio.NC cs.AI cs.LG cs.NE 62%

Generalisation to unseen topologies: Towards control of biological neural network activity

Laurens Engwegen, Daan Brinks, Wendelin Böhmer

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13740 2024-09-27 cs.CL cs.AI cs.IR physics.soc-ph 62%

Language agents achieve superhuman synthesis of scientific knowledge

Michael D. Skarlinski, Sam Cox, Jon M. Laurent, James D. Braza, Michaela Hinks, Michael J. Hammerling, Manvitha Ponnapati, Samuel G. Rodriques, Andrew D. White

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17405 2024-09-27 cs.AI cs.LG 62%

AI Enabled Neutron Flux Measurement and Virtual Calibration in Boiling Water Reactors

Anirudh Tunga, Jordan Heim, Michael Mueterthies, Thomas Gruenwald, Jonathan Nistor

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

Journal ref 13th Nuclear Plant Instrumentation, Control & Human-Machine Interface Technologies (NPIC&HMIT 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14913 2024-09-26 cs.CL cs.IR cs.LG 62%

Towards a Realistic Long-Term Benchmark for Open-Web Research Agents

Peter Mühlbacher, Nikos I. Bosse, Lawrence Phillips

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15521 2024-09-25 cs.LG cs.AI 62%

CANDERE-COACH: Reinforcement Learning from Noisy Feedback

Yuxuan Li, Srijita Das, Matthew E. Taylor

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10303 2024-09-24 cs.CL cs.AI 62%

A Survey on Large Language Models from General Purpose to Medical Applications: Datasets, Methodologies, and Evaluations

Jinqiang Wang, Huansheng Ning, Yi Peng, Qikai Wei, Daniel Tesfai, Wenwei Mao, Tao Zhu, Runhe Huang

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

Comments 25 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏