arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-10-06 至 2025-10-06 共收录 9 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 9 篇

2510.02627 2025-10-06 cs.RO cs.AI 85%

A Trajectory Generator for High-Density Traffic and Diverse Agent-Interaction Scenarios

Ruining Yang, Yi Xu, Yixiao Chen, Yun Fu, Lili Su

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02589 2025-10-06 cs.AI 85%

A Benchmark Study of Deep Reinforcement Learning Algorithms for the Container Stowage Planning Problem

Yunqi Huang, Nishith Chennakeshava, Alexis Carras, Vladislav Neverov, Wei Liu, Aske Plaat, Yingjie Fan

机构 * Leiden University(莱顿大学) Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14052 2025-10-06 cs.IR cs.AI cs.CL 81%

FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering

Chanyeol Choi, Jihoon Kwon, Alejandro Lopez-Lira, Chaewoon Kim, Minjae Kim, Juneha Hwang, Jaeseon Ha, Hojun Choi, Suyeol Yun, Yongjin Kim, Yongjae Lee

机构 * University of Florida(佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14766 2025-10-06 econ.TH 78%

An Implementation Relaxation Approach to Principal-Agent Problems

Hang Jiang

专题命中 Agent评测 :agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21185 2025-10-06 cs.LG 70%

Amelia: A Large Dataset and Benchmark for Airport Surface Movement Forecasting

Ingrid Navarro, Pablo Ortega-Kral, Jay Patrikar, Haichuan Wang, Alonso Cano, Zelin Ye, Jong Hoon Park, Sebastian Scherer, Jean Oh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 40 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02343 2025-10-06 cs.CL cs.AI 62%

$\texttt{BluePrint}$: A Social Media User Dataset for LLM Persona Evaluation and Training

Aurélien Bück-Kaeffer, Je Qin Chooi, Dan Zhao, Maximilian Puelma Touzel, Kellin Pelrine, Jean-François Godbout, Reihaneh Rabbany, Zachary Yang

机构 * McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Harvard College(哈佛学院) NYU(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments 8 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02326 2025-10-06 cs.CL cs.AI 62%

Hallucination-Resistant, Domain-Specific Research Assistant with Self-Evaluation and Vector-Grounded Retrieval

Vivek Bhavsar, Joseph Ereifej, Aravanan Gurusami

机构 * CTO Office, Coherent Corporation(Coherent Corporation 技术总监办公室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03199 2025-10-06 cs.LG stat.ML 57%

Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling

Qiwei Di, Kaixuan Ji, Xuheng Li, Heyang Zhao, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA 90095, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18389 2025-10-06 cs.LG 57%

Towards Provable Emergence of In-Context Reinforcement Learning

Jiuqi Wang, Rohan Chandra, Shangtong Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.LG

Comments NeurIPS 2025, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏