arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-08 至 2026-01-08 共收录 102 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2510.13936 2026-01-08 cs.CL 70%

FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis

FinDeepResearch:在严谨的金融分析中评估深度研究代理

Fengbin Zhu, Xiang Yao Ng, Ziyang Liu, Chang Liu, Xianwei Zeng, Chao Wang, Tianhui Tan, Xuan Yao, Pengyang Shao, Min Xu, Zixuan Wang, Jing Wang, Xin Lin, Junfeng Li, Jingxian Zhu, Yang Zhang, Wenjie Wang, Fuli Feng, Richang Hong, Huanbo Luan, Ke-Wei Huang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Estates Pte Ltd(6Estates公司) Asian Institute of Digital Finance(亚洲数字金融研究所) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 FinDeepResearch通过HisRubric框架评估深度研究代理在金融分析中的能力,构建包含多语言和多市场的基准测试,揭示不同方法在财务分析中的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03389 2026-01-08 cs.AI cs.LG 62%

Exploration Through Introspection: A Self-Aware Reward Model

反思中的探索:一种自知奖励模型

Michael Petrowski, Milica Gašić

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于反思的奖励模型,通过模拟疼痛信号探索自我意识对强化学习代理学习能力的影响,并展示了其在复杂行为复制中的优势。

Comments Accepted at AAAI-26 ToM4AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 57%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL 57%

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 57%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12302 2026-01-08 cs.CV cs.CL cs.RO 57%

From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving

从人类意图到动作预测:意图驱动的端到端自动驾驶

Huan Zheng, Yucheng Zhou, Tianyi Yan, Jiayi Su, Hongjun Chen, Dubing Chen, Xingtai Gui, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01175 2026-01-08 math.OC 50%

Common Noise by Random Measures: Constructing Mean-Field Equilibria for Competitive Investment and Hedging

共同噪声由随机测度:构造具有相对绩效考虑的竞争投资与对冲的均场均衡

Dirk Becherer, Stefanie Hesse

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于共同噪声的均场均衡构造方法,用于具有相对绩效考虑的竞争投资与对冲问题,通过随机测度和跳跃方程分析,证明了解的存在性和唯一性,并展示了如何通过单个投资者优化问题构造均衡策略。

Comments The first version (arXiv:2408.01175v1) of this preprint has been published under the slightly different title "Common Noise by Random Measures: Mean-Field Equilibria for Competitive Investment and Hedging"; the present ver3 features several new results relative to ver1 and fixes hyperref-related compilation errors present in ver2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 50%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12629 2026-01-08 cs.GT 50%

Bandit Learning in Housing Markets

住房市场中的多玩家多臂老虎机学习

Shiyun Lin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于多玩家多臂老虎机框架的统计学习模型,用于在未知偏好下学习住房市场的核心稳定分配。

Comments Accepted to AAAI 2026 as oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23954 2026-01-08 econ.TH 50%

Flexible Moral Hazard Problems with Adverse Selection

具有逆向选择的灵活道德风险问题

Siwen Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了具有逆向选择的道德风险问题,探讨了委托人在设计合同时如何通过调整合同的权力和范围来激励代理人并优化输出分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11299 2026-01-08 cs.DC cs.NI cs.SI 50%

Grassroots Platforms with Atomic Transactions: Social Networks, Cryptocurrencies, and Democratic Federations

基于原子事务的基层平台:社交网络、加密货币和民主联邦

Ehud Shapiro

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于原子事务的基层平台规范,通过交互式事务定义社交网络、加密货币和民主联邦,并证明其基层性质。

Journal ref ICDCN '26: Proceedings of the 27th International Conference on Distributed Computing and Networking Pages 71 - 81, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07709 2026-01-08 cs.SI cs.MA cs.SY eess.SY math.OC q-bio.PE 50%

Classification-Based Opinion Formation Model Embedding Agents' Psychological Traits

基于分类的意见形成模型:嵌入代理的心理特征

Carlos Andres Devia, Giulia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个基于分类的意见形成模型,通过引入顺从性、激进主义和固执等代理特征,预测现实中的意见演变。

Comments First submitted to the Journal of Artificial Societies and Social Simulation (JASSS) on April 28, 2022. 33 pages, 24 figures, 13 tables

Journal ref Journal of Artificial Societies and Social Simulation 26 (3) 1, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏