arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-29 至 2026-01-29 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2506.00856 2026-01-29 econ.EM cs.AI 89%

Can AI Master Econometrics? Evidence from Econometrics AI Agent on Expert-Level Tasks

AI能否掌握计量经济学?来自计量经济学AI代理在专家级任务上的证据

Qiang Chen, Tianyang Han, Jin Li, Ye Luo, Zigan Wang, Yuxiao Wu, Xiaowei Zhang, Tuo Zhou

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MetricsAI,一个基于MetaGPT框架的计量经济学AI代理,通过实证分析展示其在专家级任务中超越传统模型的能力,推动社会科学研究的智能化与教育应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 88%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 84%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 79%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 79%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20452 2026-01-29 econ.GN physics.soc-ph q-fin.EC q-fin.TR 79%

Manipulation in Prediction Markets: An Agent-based Modeling Experiment

预测市场中的操控:基于代理的建模实验

Bridget Smart, Ebba Mark, Anne Bastian, Josefina Waugh

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过基于代理的模拟实验,探讨了高预算代理如何在预测市场中引入价格扭曲,并分析了市场中从众行为和学习率对价格波动的影响。

Comments Open source code for the agent-based model and Dash application available at https://github.com/ebbam/power_prediction/ 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20714 2026-01-29 cs.LG cs.AI 62%

Adapting the Behavior of Reinforcement Learning Agents to Changing Action Spaces and Reward Functions

适应强化学习智能体的行为以应对变化的动作空间和奖励函数

Raul de la Rosa, Ivana Dusparic, Nicolas Cardozo

机构 * Trinity College Dublin(都柏林三一学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MORPHIN通过动态调整超参数和概念漂移检测,实现强化学习智能体在变化的奖励函数和动作空间中的自适应学习,提升收敛速度和学习效率。

Journal ref 2025 IEEE International Conference on Autonomic Computing and Self-Organizing Systems Companion (ACSOS-C), Tokyo, Japan, 2025, pp. 148-153

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00282 2026-01-29 cs.AI cs.CL 62%

Mind the Gap: The Divergence Between Human and LLM-Generated Tasks

注意差距:人类与LLM生成任务之间的差异

Yi-Long Lu, Jiajun Song, Chunhui Zhang, Wei Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了人类与LLM在任务生成中的核心差异,指出人类受心理驱动影响,而LLM在生成具身目标方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 57%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20035 2026-01-29 econ.TH 50%

Obviously Strategy-Proof Multi-Dimensional Allocation and the Value of Choice

显然策略证明的多维分配与选择的价值

Quitzé Valenzuela-Stookey

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了主导者如何通过委托部分控制权给代理人来优化多维分配,并提出了一类显然策略证明的机制以提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15301 2026-01-29 cond-mat.soft nlin.AO 50%

Collective behaviors of self-propelled particles with tunable alignment angles

具有可调对齐角度的自驱动粒子集体行为

Zichen Qin, Nariya Uchida

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种具有可调对齐角度的自驱动粒子模型,通过数值模拟发现其在特定参数范围内表现出反平行带等独特集体行为,揭示了多体相互作用对向列序的破坏作用。

Comments 7 pages, 5 figures

Journal ref Phys. Rev. E 113, 015411 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09407 2026-01-29 cs.MA 50%

Value-Enriched Population Synthesis: Integrating a Motivational Layer

价值增强的人口合成:整合动机层

Alba Aguilera, Miquel Albertí, Nardine Osman, Georgina Curto

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出价值增强的人口合成框架,通过整合动机层提升社会模拟中代理行为的决策机制,生成保留真实人口分布的合成人口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06344 2026-01-29 cs.MA 50%

Modelleme ve Simulasyon

模型与仿真

Serdar Abut

专题命中 Agent评测 :agent(abstract)

AI总结 本书介绍了自1970年代以来的建模与仿真方法,涵盖社会科学、风险管理及云信息系统的应用,并总结了基于代理的仿真方法。

Comments in Turkish language. Published journal version available at the publisher website

Journal ref Teorik ve Uygulamali Muhendislik Calismalari, IKSAD, vol. 1, no. 1, pp. 135-156, Dec. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏