arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2601.21629 2026-01-30 quant-ph cs.LG 57%

Reinforcement Learning for Adaptive Composition of Quantum Circuit Optimisation Passes

强化学习用于量子电路优化传递的自适应组合

Daniel Mills, Ifan Williams, Jacob Swain, Gabriel Matos, Enrico Rinaldi, Alexander Koziell-Pipe

机构 * Quantinuum

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出利用强化学习自适应组合量子电路优化传递,有效提升优化效果。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07110 2026-01-30 cs.AI 57%

Two Heads are Better than One: Distilling Large Language Model Features Into Small Models with Feature Decomposition and Mixture

双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中

Tianhao Fu, Xinxin Xu, Weichen Xu, Jue Chen, Ruilong Ren, Bowen Deng, Xinyu Zhao, Jian Cao, Xixin Cao

机构 * Peking university(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04194 2026-01-30 stat.ML cs.LG 57%

Stochastic Matching Bandits with Rare Optimization Updates

具有稀有优化更新的随机匹配老虎机

Jung-hun Kim, Min-hwan Oh

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种批量算法,通过限制匹配更新次数来减少计算开销,同时在随机匹配老虎机中实现O(√T)的遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 57%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04503 2026-01-30 physics.soc-ph cs.AI cs.MA 57%

When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings

当LLMs玩电话游戏:文化吸引子作为评估多轮设置中LLM的观念工具

Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

机构 * Inria(法国国家信息与自动化研究所) Université de Bordeaux(波尔多大学) MIT(麻省理工学院) Computational Cognitive Science Lab(计算认知科学实验室) University of California, Berkeley(加州大学伯克利分校) Institute for Advanced Study in Toulouse(图卢兹高级研究学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过电话游戏实验揭示LLM多轮交互中的信息失真与吸引子现象,探讨初始文本、指令等对吸引子效应的影响。

Comments Code available at https://github.com/jeremyperez2/TelephoneGameLLM. Companion website with a Data Explorer tool at https://sites.google.com/view/telephone-game-llm . This paper was published at the 2025 International Conference on Learning Representations (ICLR2025) https://iclr.cc/virtual/2025/poster/28880

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 57%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19794 2026-01-28 cs.LG cs.SY eess.SY 57%

Component-Aware Pruning Framework for Neural Network Controllers via Gradient-Based Importance Estimation

面向神经网络控制器的组件感知剪枝框架:基于梯度的重要性估计

Ganesh Sundaram, Jonas Ulmen, Daniel Görges

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于梯度的重要性估计框架,用于神经网络控制器中的组件感知剪枝,通过梯度累积、Fisher信息和贝叶斯不确定性度量,提升压缩决策的准确性。

Comments 8 pages, Submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19583 2026-01-28 cs.SE 57%

Toward Architecture-Aware Evaluation Metrics for LLM Agents

迈向面向架构的LLM代理评估指标

Débora Souza, Patrícia Machado

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。

Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06917 2026-01-28 cs.LG cs.DS stat.ML 57%

Sample-Efficient Optimization over Generative Priors via Coarse Learnability

通过粗粒学习能力实现生成先验的高效优化

Pranjal Awasthi, Sreenivas Gollapudi, Ravi Kumar, Kamesh Munagala

机构 * Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出粗粒学习能力假设,设计迭代算法在多项式样本内近似目标分布,为深度生成先验的基于模型优化提供样本复杂度保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 57%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13588 2026-01-27 cs.AI cs.CE cs.CY 57%

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

CoBRA:利用经典社会科学实验编程社会代理中的认知偏差

Xuan Liu, Haoyang Shang, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 CoBRA通过经典社会科学实验设计,为社会代理提供了一种可编程的认知偏差控制方法,实现一致的行为模拟与可重用的AI训练环境。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17596 2026-01-27 cs.CL 57%

Learning to Ideate for Machine Learning Engineering Agents

为机器学习工程代理学习创意

Yunxiang Zhang, Kang Zhou, Zhichao Xu, Kiran Ramnath, Yun Zhou, Sangmin Woo, Haibo Ding, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出MLE-Ideator双代理框架,通过强化学习训练生成更有效的创意,显著提升机器学习工程代理的性能。

Comments EACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17335 2026-01-27 cs.AI 57%

The Relativity of AGI: Distributional Axioms, Fragility, and Undecidability

AGI的相对性:分布公理、脆弱性与不可判定性

Angshul Majumdar

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了AGI的理论定义问题,证明其泛化本质为关系性,且无法通过计算过程可靠认证,指出强AGI主张在无明确索引时是未定义的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16866 2026-01-26 cs.RO cs.AI 57%

Boosting Deep Reinforcement Learning with Semantic Knowledge for Robotic Manipulators

通过语义知识提升机器人操作机的深度强化学习

Lucía Güitta-López, Vincenzo Suriani, Jaime Boal, Álvaro J. López-López, Daniele Nardi

机构 * Institute for Research in Technology (IIT), ICAI School of Engineering, Comillas Pontifical University(研究技术研究所(IIT)、ICAI工程学院、科利马斯天主教大学) University of Basilicata(巴利卡塔大学) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过整合语义知识图嵌入提升机器人操作机深度强化学习效率,实验显示学习时间减少60%且任务准确性提升15个百分点。

Journal ref Robotics, published 24 June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI 57%

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15676 2026-01-23 cs.SD cs.LG eess.AS 57%

Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems

弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统

Hengfan Zhang, Yueqian Lin, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。

Comments 10 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15120 2026-01-23 cs.AI 57%

Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差

Qian Xiong, Yuekai Huang, Bo Yang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li

机构 * Beijing Forestry University(北京林业大学) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08778 2026-01-21 cs.AI cs.DB 57%

Pervasive Annotation Errors Break Text-to-SQL Benchmarks and Leaderboards

广泛注释错误破坏文本到SQL基准测试和排行榜

Tengjun Jin, Yoojin Choi, Yuxuan Zhu, Daniel Kang

机构 * University of Illinois (UIUC)(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究发现文本到SQL基准测试中广泛存在的注释错误显著影响了代理性能和排行榜排名,可能误导研究方向和部署选择。

Comments 18 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 57%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12473 2026-01-21 cs.CL 57%

Capability-Aware Early-Stage Research Idea Evaluation

具备能力的早期研究想法评估

Renlong Jie, Chen Chu, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) School of Statistics and Mathematics(统计与数学学院) iOPEN

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本文提出一种基于能力的框架,通过作者信息和研究想法预测论文接受情况,无需完整文本或实验结果,显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13794 2026-01-21 cs.GR cs.LG cs.RO 57%

MimicKit: A Reinforcement Learning Framework for Motion Imitation and Control

MimicKit:一种用于运动模仿与控制的强化学习框架

Xue Bin Peng

机构 * Simon Fraser University(西蒙弗雷泽大学) NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 MimicKit 通过运动模仿和强化学习结合,提供统一的运动控制训练框架,支持计算机图形学和机器人学的研究与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07772 2026-01-21 cs.AI 57%

An approach for systematic decomposition of complex llm tasks

一种复杂大语言模型任务的系统分解方法

Tianle Zhou, Jiakai Xu, Guanhong Liu, Jiaxiang Liu, Haonan Wang, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ACONIC框架,通过形式复杂度度量系统分解任务,提升大语言模型在复杂任务中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00515 2026-01-21 cs.LG 57%

Zero-shot Generalization in Inventory Management: Train, then Estimate and Decide

库存管理中的零样本泛化:训练,然后估计和决策

Tarkan Temizöz, Christina Imdahl, Remco Dijkman, Douniel Lamghari-Idrissi, Willem van Jaarsveld

机构 * Department of Industrial Engineering and Innovation Sciences, Eindhoven University of Technology(工业工程与创新科学系,埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种针对库存管理的零样本泛化框架,通过训练一般能力代理以应对未知参数的决策问题,提升了在动态环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12260 2026-01-21 cs.AI 57%

Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding

Docs2Synth: 一种用于扫描视觉丰富文档理解的合成数据训练检索框架

Yihao Ding, Qiang Sun, Puzhen Wu, Sirui Li, Siwen Luo, Wei Liu

机构 * University of Western Australia(西澳大学) The University of Hong Kong(香港大学) Murdoch University(默多克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Docs2Synth通过合成监督框架实现私有和低资源领域文档理解,利用检索引导推理提升接地能力和领域泛化,无需人工标注。

Comments Accepted at WWW 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06976 2026-01-21 cs.MA cs.AI 57%

Who is Helping Whom? Analyzing Inter-dependencies to Evaluate Cooperation in Human-AI Teaming

谁在帮助谁?分析相互依赖性以评估人机协同中的合作

Upasana Biswas, Vardhan Palod, Siddhant Bhambri, Subbarao Kambhampati

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出'建设性相互依赖'作为评估人机协同合作的新指标,发现训练智能体虽能获得高任务奖励,但无法诱导协作行为,揭示任务奖励与合作无必然联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00010 2026-01-16 cs.CL 57%

PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization

PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限

Jiajun Zhang, Jianke Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Binyuan Hui, Qiang Liu, Zilei Wang, Liang Wang, Junyang Lin

机构 * USTC(University of Science and Technology of China) THU(Tsinghua University) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(State Key Laboratory of Information Security)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10103 2026-01-16 cs.CV cs.AI 57%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09400 2026-01-15 cs.LG 57%

Preliminary Tests of the Anticipatory Classifier System with Hindsight Experience Replay

前瞻性分类器系统的初步测试与回顾经验回放

Olgierd Unold, Stanisław Franczyk

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出ACS2HER,结合前瞻性机制与回顾经验回放,提升稀疏奖励环境下的学习效率,但伴随计算开销和分类器数量的增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09017 2026-01-15 cs.CL 57%

Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game

多文化间谍迷局:通过动态多语言社交推理解谜游戏评估LLM

Haryo Akbarianto Wibowo, Alaa Elsetohy, Qinrong Cui, Alham Fikri Aji

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出通过动态多语言社交推理解谜游戏Spyfall评估LLM的多语言和多文化能力,发现非英语环境下模型表现较弱,提供了一种更稳健的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏