Beyond Attention: True Adaptive World Models via Spherical Kernel Operator
超越注意力:通过球面核算子构建真正的自适应世界模型
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
超越注意力:通过球面核算子构建真正的自适应世界模型
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。
OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!
机构 * Nanyang Technological University(南洋理工大学) ; Walled AI Labs(Walled AI实验室) ; Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) ; Lambda Labs(Lambda实验室)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。
深度强化学习在水下对接应用中的仿真到现实适应
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出利用高保真数字双胞胎环境和PPO算法,开发了用于水下对接的深度强化学习控制器,通过仿真到现实适应提升了对接成功率,并在物理测试中验证了其有效性。
Comments Currently under review by IROS 2026
在通用人工智能中的价值在无知下
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出通过半测度损失将信念分布视为不精确概率分布,并利用Choquet积分计算预期效用,以解决通用人工智能中价值在无知下的问题。
Journal ref In International Conference on Artificial General Intelligence (pp. 338-349). Cham: Springer Nature Switzerland (2025)
你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。
Comments 14 pages
奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。
STADA:基于规范的自动驾驶代理测试
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。
通过强化学习进行回归的自适应主动学习
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出基于强化学习的WiGS方法,通过动态调整探索与调查的平衡,提升回归任务中的主动学习效率和准确性。
Comments 33 pages, 103 figures. Main paper (8 pages, 4 figures) plus appendix with proofs and supplemental experimental results. Submitted to UAI2026. Codebase available at https://github.com/thatswhatsimonsaid/WeightedGreedySampling
利用变分量子射频传感学习无线电信号
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出利用变分量子射频传感技术,通过量子电路优化实现对无线电信号的学习,以提升环境感知能力。
Comments submitted for publication
基于视频的计算机使用代理奖励建模
机构 * University of Southern California(南加州大学) ; University of Washington(华盛顿大学) ; MBZUAI(机器智能研究院) ; Amazon AGI(亚马逊人工通用智能)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。
评估自主网络攻击代理的泛化机制
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文评估了自主网络攻击代理在IP重新分配下的泛化能力,发现基于LLM的代理在测试中表现最佳,但牺牲了透明性和效率。
CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?
机构 * Microsoft Research(微软研究院) ; Microsoft(微软)
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。
Comments Accepted at TMLR
Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856
Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。
Comments under review
DRBench:企业深度研究的现实基准
机构 * ServiceNow Research(ServiceNow 研究所) ; University of British Columbia(不列颠哥伦比亚大学) ; Mila – Quebec AI Institute(魁北克人工智能研究院) ; McGill University(麦吉尔大学) ; Polytechnique Montreal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)
专题命中 Agent评测 :AI agent(abstract);分类 cs.CL
AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。
ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL
AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。
Comments 29 pages, 20 figures, 9 tables
OSExpert: 通过探索学习专业技能的计算机使用智能体
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 OSExpert通过引入GUI-DFS探索算法和技能集,提升智能体在复杂任务中的表现和效率,实现专家级计算机使用。
Comments 26 pages
MERIT反馈促进LLM谈判者更好的协商
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Amazon AGI(亚马逊人工智能实验室) ; LG AI Research(LG人工智能研究)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。
Comments Preprint. Typo corrected, New results added
正确移动,正确时机:多运动空间评估平台用于极限飞盘、篮球和足球
机构 * Nagoya University(名古屋大学) ; Aix-Marseille Université(阿维尼翁-马赛大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Shown Space ; Australian National University(澳大利亚国立大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 本文提出一个多运动空间评估平台,通过标准化输入和时间感知评估,实现极限飞盘、篮球和足球之间的空间度量比较,为不同运动的评估一致性提供实用解决方案。
Comments 23 pages, 6 figures
强化学习的合成监控环境
机构 * Technical University Munich(慕尼黑技术大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出合成监控环境(SMEs),通过可配置的任务特征和已知最优策略,为强化学习提供精确评估框架,用于分析算法在分布内和分布外性能的差异。
敏感性感知的检索增强意图澄清
机构 * ICAI OpenGov Lab x IRLab, University of Amsterdam, The Netherlands(ICAI开放政府实验室 x IRLab,阿姆斯特丹大学,荷兰)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种敏感性感知的检索增强意图澄清方法,旨在保护敏感信息的同时提升对话系统的性能。
Comments Accepted to CoSCIN@ECIR2026 (Workshop on Conversational Search for Complex Information Needs)
面向AI系统的安全案例构建的结构化方法
专题命中 Agent评测 :agentic(abstract);分类 cs.SE
AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。
Comments 45 pages, 8 figures, 9 tables
持续语言引导的机器人操作学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出SkillsCrafter框架,通过操作技能适应和技能专业化聚合,实现持续学习多种技能并减少旧技能的灾难性遗忘。
Comments 14 pages, 7 figures
设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。
Comments 14 pages, 3 figures
传统方法与深度学习在脑胶质瘤成像中的比较评估。综述论文
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本文综述了脑胶质瘤分割与分类技术,指出卷积神经网络在分割和分类任务中优于传统方法。
Comments 22 pages, 4 Figures
Journal ref INTERNATIONAL JOURNAL BIOAUTOMATION, Vol 29, Issue 2, 2025
EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。
边界引导的轨迹预测用于道路感知和物理可行的自动驾驶
机构 * FZI Research Center for Information Technology(弗赖堡研究所信息科技研究中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; CARIAD SE
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于边界引导的轨迹预测框架,通过约束回归和HD地图实现道路感知和运动学可行性,提升了自动驾驶的轨迹预测精度和鲁棒性。
Comments Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)
QFlowNet: 快速、多样且高效的单位元合成与生成流网络
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Seoul National University(首尔国立大学) ; NextQuantum
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 QFlowNet通过结合生成流网络和Transformer,实现高效、多样化的单位元合成,解决了传统强化学习在稀疏奖励下的局限性。
Comments 7 pages, 6 figures, IEEE International Conference on Quantum Communications, Networking, and Computing (QCNC 2026)
非协作用户模拟器用于工具代理
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出一种非协作用户模拟器,用于测试工具代理在面对非协作用户时的鲁棒性,揭示了代理在复杂对话中的弱点。
Comments Accepted to ICLR 2026
TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测
机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; CARIAD SE
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。
Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award
一种利用信念空间度量的离线POMDP学习覆盖框架
机构 * Northwestern University(西北大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种利用信念空间度量的离线POMDP学习覆盖框架,通过分析价值相关函数的Lipschitz连续性,缓解时间与内存的指数增长,提升样本效率。