Reinforcement Learning for Adaptive Composition of Quantum Circuit Optimisation Passes
强化学习用于量子电路优化传递的自适应组合
机构 * Quantinuum
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出利用强化学习自适应组合量子电路优化传递,有效提升优化效果。
Comments 14 pages, 7 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
强化学习用于量子电路优化传递的自适应组合
机构 * Quantinuum
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出利用强化学习自适应组合量子电路优化传递,有效提升优化效果。
Comments 14 pages, 7 figures
双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中
机构 * Peking university(北京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。
Comments accepted by AAAI2026
具有稀有优化更新的随机匹配老虎机
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种批量算法,通过限制匹配更新次数来减少计算开销,同时在随机匹配老虎机中实现O(√T)的遗憾界。
LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用
机构 * United Nations University Institute in Macau(联合国大学澳门研究所) ; IBM Research(IBM研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。
Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work
当LLMs玩电话游戏:文化吸引子作为评估多轮设置中LLM的观念工具
机构 * Inria(法国国家信息与自动化研究所) ; Université de Bordeaux(波尔多大学) ; MIT(麻省理工学院) ; Computational Cognitive Science Lab(计算认知科学实验室) ; University of California, Berkeley(加州大学伯克利分校) ; Institute for Advanced Study in Toulouse(图卢兹高级研究学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文通过电话游戏实验揭示LLM多轮交互中的信息失真与吸引子现象,探讨初始文本、指令等对吸引子效应的影响。
Comments Code available at https://github.com/jeremyperez2/TelephoneGameLLM. Companion website with a Data Explorer tool at https://sites.google.com/view/telephone-game-llm . This paper was published at the 2025 International Conference on Learning Representations (ICLR2025) https://iclr.cc/virtual/2025/poster/28880
YNTP-100: 一个用于下一步令牌预测的基准,包含100人
机构 * Kyoto University(京都大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。
面向神经网络控制器的组件感知剪枝框架:基于梯度的重要性估计
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种基于梯度的重要性估计框架,用于神经网络控制器中的组件感知剪枝,通过梯度累积、Fisher信息和贝叶斯不确定性度量,提升压缩决策的准确性。
Comments 8 pages, Submitted to the 2026 IFAC World Congress
迈向面向架构的LLM代理评估指标
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。
Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)
通过粗粒学习能力实现生成先验的高效优化
机构 * Google Research(谷歌研究)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出粗粒学习能力假设,设计迭代算法在多项式样本内近似目标分布,为深度生成先验的基于模型优化提供样本复杂度保证。
$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任
机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) ; Khalifa University of Science and Technology(科学与技术喀拉奇大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。
CoBRA:利用经典社会科学实验编程社会代理中的认知偏差
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 CoBRA通过经典社会科学实验设计,为社会代理提供了一种可编程的认知偏差控制方法,实现一致的行为模拟与可重用的AI训练环境。
Comments CHI 2026
为机器学习工程代理学习创意
机构 * AWS AI Labs(AWS人工智能实验室) ; University of Michigan(密歇根大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出MLE-Ideator双代理框架,通过强化学习训练生成更有效的创意,显著提升机器学习工程代理的性能。
Comments EACL 2026 main conference
AGI的相对性:分布公理、脆弱性与不可判定性
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文研究了AGI的理论定义问题,证明其泛化本质为关系性,且无法通过计算过程可靠认证,指出强AGI主张在无明确索引时是未定义的。
通过语义知识提升机器人操作机的深度强化学习
机构 * Institute for Research in Technology (IIT), ICAI School of Engineering, Comillas Pontifical University(研究技术研究所(IIT)、ICAI工程学院、科利马斯天主教大学) ; University of Basilicata(巴利卡塔大学) ; Sapienza University of Rome(罗马萨皮恩扎大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出通过整合语义知识图嵌入提升机器人操作机深度强化学习效率,实验显示学习时间减少60%且任务准确性提升15个百分点。
Journal ref Robotics, published 24 June 2025
DSGym: 一个全面的框架用于评估和训练数据科学代理
机构 * Stanford University(斯坦福大学) ; Together AI ; Duke University(杜克大学) ; Harvard University(哈佛大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。
弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统
机构 * Duke University(杜克大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。
Comments 10 pages, 3 figures, 2 tables. Preprint
从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差
机构 * Beijing Forestry University(北京林业大学) ; State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Duke University(杜克大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。
广泛注释错误破坏文本到SQL基准测试和排行榜
机构 * University of Illinois (UIUC)(伊利诺伊大学香槟分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究发现文本到SQL基准测试中广泛存在的注释错误显著影响了代理性能和排行榜排名,可能误导研究方向和部署选择。
Comments 18 pages, 14 figures, 9 tables
通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。
Comments 29 pages, 15 figures
具备能力的早期研究想法评估
机构 * Northwestern Polytechnical University(西北工业大学) ; School of Statistics and Mathematics(统计与数学学院) ; iOPEN
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 本文提出一种基于能力的框架,通过作者信息和研究想法预测论文接受情况,无需完整文本或实验结果,显著提升预测准确性。
MimicKit:一种用于运动模仿与控制的强化学习框架
机构 * Simon Fraser University(西蒙弗雷泽大学) ; NVIDIA(英伟达)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 MimicKit 通过运动模仿和强化学习结合,提供统一的运动控制训练框架,支持计算机图形学和机器人学的研究与应用。
一种复杂大语言模型任务的系统分解方法
机构 * Columbia University(哥伦比亚大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出ACONIC框架,通过形式复杂度度量系统分解任务,提升大语言模型在复杂任务中的可靠性。
库存管理中的零样本泛化:训练,然后估计和决策
机构 * Department of Industrial Engineering and Innovation Sciences, Eindhoven University of Technology(工业工程与创新科学系,埃因霍温理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种针对库存管理的零样本泛化框架,通过训练一般能力代理以应对未知参数的决策问题,提升了在动态环境中的性能。
Docs2Synth: 一种用于扫描视觉丰富文档理解的合成数据训练检索框架
机构 * University of Western Australia(西澳大学) ; The University of Hong Kong(香港大学) ; Murdoch University(默多克大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 Docs2Synth通过合成监督框架实现私有和低资源领域文档理解,利用检索引导推理提升接地能力和领域泛化,无需人工标注。
Comments Accepted at WWW 2026 Demo Track
谁在帮助谁?分析相互依赖性以评估人机协同中的合作
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出'建设性相互依赖'作为评估人机协同合作的新指标,发现训练智能体虽能获得高任务奖励,但无法诱导协作行为,揭示任务奖励与合作无必然联系。
PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限
机构 * USTC(University of Science and Technology of China) ; THU(Tsinghua University) ; Alibaba Group(阿里巴巴集团) ; CASIA(Chinese Academy of Sciences Institute of Automation) ; SIAT(State Key Laboratory of Information Security)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。
ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性
机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。
Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe
FlowAct-R1: 向交互式人形视频生成迈进
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。
前瞻性分类器系统的初步测试与回顾经验回放
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出ACS2HER,结合前瞻性机制与回顾经验回放,提升稀疏奖励环境下的学习效率,但伴随计算开销和分类器数量的增加。
多文化间谍迷局:通过动态多语言社交推理解谜游戏评估LLM
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出通过动态多语言社交推理解谜游戏Spyfall评估LLM的多语言和多文化能力,发现非英语环境下模型表现较弱,提供了一种更稳健的评估方法。