arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-08 至 2026-01-08 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2601.03513 2026-01-08 cs.SE cs.AI 86%

Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day

Deploy-Master:在一天内自动化部署50,000多个准备就绪的科学工具

Yi Wang, Zhenting Huang, Zhaohan Ding, Ruoxue Liao, Yuan Huang, Xinzijian Liu, Jiajun Xie, Siheng Chen, Linfeng Zhang

机构 * DP Technology Beijing China(DP技术北京中国) AI for Science Institute Beijing China(AI for Science研究院北京中国) Shanghai Jiao Tong University Shanghai China(上海交通大学上海中国)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 Deploy-Master通过自动化部署50,000多个科学工具,提升AI4S和代理工作流的可重复性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 77%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 75%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20118 2026-01-08 cs.CL cs.CR 74%

TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agent

TrojanStego: 你的语言模型可能 secretly 成为一个隐写术隐私泄露代理

Dominik Meier, Jan Philip Wahle, Paul Röttger, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州检察署) Bocconi University(博科尼大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 TrojanStego通过语言隐写术在LLM输出中隐秘泄露敏感信息,展示了一种新型被动且危险的LLM数据外泄攻击方式。

Comments 9 pages, 5 figures To be presented in the Conference on Empirical Methods in Natural Language Processing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03540 2026-01-08 cs.CL 70%

DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing

DeepSynth-Eval: 从客观角度评估深度调研写作中的信息整合

Hongzhi Zhang, Yuanze Hu, Tinghai Zhang, Jia Fu, Tao Wang, Junwei Jing, Zhaoxin Fan, Qi Wang, Ruiming Tang, Han Li, Guorui Zhou, Kun Gai

机构 * Kuaishou Technology(快手科技) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 DeepSynth-Eval通过客观评估信息整合能力,揭示了深度调研写作中整合碎片信息的挑战,并证明代理计划与写作流程在提升报告质量方面优于单一生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 70%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13936 2026-01-08 cs.CL 70%

FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis

FinDeepResearch:在严谨的金融分析中评估深度研究代理

Fengbin Zhu, Xiang Yao Ng, Ziyang Liu, Chang Liu, Xianwei Zeng, Chao Wang, Tianhui Tan, Xuan Yao, Pengyang Shao, Min Xu, Zixuan Wang, Jing Wang, Xin Lin, Junfeng Li, Jingxian Zhu, Yang Zhang, Wenjie Wang, Fuli Feng, Richang Hong, Huanbo Luan, Ke-Wei Huang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Estates Pte Ltd(6Estates公司) Asian Institute of Digital Finance(亚洲数字金融研究所) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 FinDeepResearch通过HisRubric框架评估深度研究代理在金融分析中的能力,构建包含多语言和多市场的基准测试,揭示不同方法在财务分析中的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03389 2026-01-08 cs.AI cs.LG 62%

Exploration Through Introspection: A Self-Aware Reward Model

反思中的探索:一种自知奖励模型

Michael Petrowski, Milica Gašić

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于反思的奖励模型,通过模拟疼痛信号探索自我意识对强化学习代理学习能力的影响,并展示了其在复杂行为复制中的优势。

Comments Accepted at AAAI-26 ToM4AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 57%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL 57%

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 57%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12302 2026-01-08 cs.CV cs.CL cs.RO 57%

From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving

从人类意图到动作预测:意图驱动的端到端自动驾驶

Huan Zheng, Yucheng Zhou, Tianyi Yan, Jiayi Su, Hongjun Chen, Dubing Chen, Xingtai Gui, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01175 2026-01-08 math.OC 50%

Common Noise by Random Measures: Constructing Mean-Field Equilibria for Competitive Investment and Hedging

共同噪声由随机测度:构造具有相对绩效考虑的竞争投资与对冲的均场均衡

Dirk Becherer, Stefanie Hesse

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于共同噪声的均场均衡构造方法,用于具有相对绩效考虑的竞争投资与对冲问题,通过随机测度和跳跃方程分析,证明了解的存在性和唯一性,并展示了如何通过单个投资者优化问题构造均衡策略。

Comments The first version (arXiv:2408.01175v1) of this preprint has been published under the slightly different title "Common Noise by Random Measures: Mean-Field Equilibria for Competitive Investment and Hedging"; the present ver3 features several new results relative to ver1 and fixes hyperref-related compilation errors present in ver2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 50%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12629 2026-01-08 cs.GT 50%

Bandit Learning in Housing Markets

住房市场中的多玩家多臂老虎机学习

Shiyun Lin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于多玩家多臂老虎机框架的统计学习模型,用于在未知偏好下学习住房市场的核心稳定分配。

Comments Accepted to AAAI 2026 as oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23954 2026-01-08 econ.TH 50%

Flexible Moral Hazard Problems with Adverse Selection

具有逆向选择的灵活道德风险问题

Siwen Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了具有逆向选择的道德风险问题,探讨了委托人在设计合同时如何通过调整合同的权力和范围来激励代理人并优化输出分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11299 2026-01-08 cs.DC cs.NI cs.SI 50%

Grassroots Platforms with Atomic Transactions: Social Networks, Cryptocurrencies, and Democratic Federations

基于原子事务的基层平台:社交网络、加密货币和民主联邦

Ehud Shapiro

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于原子事务的基层平台规范,通过交互式事务定义社交网络、加密货币和民主联邦,并证明其基层性质。

Journal ref ICDCN '26: Proceedings of the 27th International Conference on Distributed Computing and Networking Pages 71 - 81, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07709 2026-01-08 cs.SI cs.MA cs.SY eess.SY math.OC q-bio.PE 50%

Classification-Based Opinion Formation Model Embedding Agents' Psychological Traits

基于分类的意见形成模型:嵌入代理的心理特征

Carlos Andres Devia, Giulia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个基于分类的意见形成模型,通过引入顺从性、激进主义和固执等代理特征,预测现实中的意见演变。

Comments First submitted to the Journal of Artificial Societies and Social Simulation (JASSS) on April 28, 2022. 33 pages, 24 figures, 13 tables

Journal ref Journal of Artificial Societies and Social Simulation 26 (3) 1, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏