Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?
Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?
机构 * OpenAI ; Anthropic ; Google DeepMind(谷歌深度思维)
AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。
大厂专区
Who&When Pro:大语言模型真的能归因人工智能代理中的失败吗?
机构 * OpenAI ; Anthropic ; Google DeepMind(谷歌深度思维)
AI总结 研究聚焦于大语言模型能否归因人工智能代理中的失败,引入Who&When Pro基准,通过严格管道构建大量失败轨迹,经广泛实验分析,揭示模型归因故障模式,为自动故障归因系统提供实证指导。
大语言模型中基于参考的蒸馏检测
机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) ; University of Southern California(南加利福尼亚大学) ; OpenAI
AI总结 研究旨在检测大语言模型是否经蒸馏而来,提出基于参考的成员推理蒸馏检测方法,通过比较模型与不同候选教师输出的优先对齐程度识别教师及蒸馏证据,能处理未知管道,扩展到开放世界设置,应用于当代模型获潜在蒸馏关系新证据。
Comments 27 pages (14 main), 21 figures, 16 tables
通过模拟部署预测大语言模型发布前的安全性
机构 * OpenAI(开放人工智能研究公司)
AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。
Comments 31 pages
OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)
机构 * OpenAI
AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。
Comments 20 pages, 3 figures, 12 tables
学习空间物理的可解释性与泛化界
机构 * OpenAI ; Google(谷歌) ; Sandia National Laboratories(桑迪亚国家实验室)
AI总结 利用数值分析技术,严格量化了应用于线性微分方程的机器学习模型在参数发现或求解中的准确性、收敛率和泛化界,并基于格林函数表示引入科学模型的可解释性视角。
Comments To appear in ICML 2026. 18 pages, 13 figures
通过后代理实现可关闭的智能体
机构 * OpenAI
AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。
Vibe Coding 吃掉我的作业:AI 方法在全新软件工程与编程中的评估
机构 * OpenAI
AI总结 本文评估了“氛围编码”(用自然语言提示编程)在全新软件工程任务中的可行性,并分析了现有基准,通过开发 Python 简单独立编程任务评估套件提供见解。
Comments 10 pages, 2 figures, 2 tables
Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成
机构 * DeepMind ; OpenAI
AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。
强化学习迈向广泛且持久有益的模型
机构 * OpenAI
AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。
Comments Blog: https://alignment.openai.com/beneficial-rl/
Harness-MU:面向多用户LLM代理的安全、可控且有效的框架
机构 * OpenAI Codex team(OpenAI Codex团队)
AI总结 针对多用户LLM代理的权限冲突与数据泄露问题,提出模型无关、零微调的基础设施框架Harness-MU,通过执行钩子强制执行确定性治理约束,在Muses-Bench基准上实现隐私保护并提升指令遵循准确率高达48.9个百分点。
Comments 15 pages, 4 figures, 15 tables
积极对齐:人工智能促进人类繁荣
机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) ; Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) ; Google DeepMind(谷歌DeepMind) ; LIFE ; OpenAI ; Anthropic ; University of California, Los Angeles(加州大学洛杉矶分校) ; Aily Labs(Aily实验室) ; Stanford University(斯坦福大学) ; Tufts University(塔夫茨大学) ; Positive AI Labs(积极AI实验室) ; Department of Informatics, University of Sussex(Sussex大学信息学系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。
ExpRL: 用于LLM中期训练的探索性强化学习
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenAI ; Rogo
AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。
范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉
机构 * Anthropic ; OpenAI ; Google ; DeepSeek
AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。
Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120
MAGMaR 2026 共享任务结果
机构 * Johns Hopkins University(约翰霍普金斯大学) ; OpenAI ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Air Force Research Laboratory(空军研究实验室) ; Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心) ; University of Amsterdam(阿姆斯特丹大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文介绍MAGMaR 2026共享任务的结果,包括视频检索和基于检索视频的生成任务,所有提交系统均超越去年基线。
Comments Findings of the 2nd workshop on Multimodal Augmented Generation via Multimodal Retrieval (MAGMaR); Resources at this url: https://github.com/rekriz11/MAGMAR_2026
深度研究智能体在过程级反馈下的多轮评估
机构 * Google DeepMind ; OpenAI ; Perplexity AI ; LangChain AI
AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。
Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)
Kunlun: 通过统一架构设计建立大规模推荐系统的缩放定律
机构 * Meta Platforms, Inc.(Meta平台公司) ; OpenAI
AI总结 针对大规模推荐系统缺乏可预测缩放定律的问题,提出Kunlun架构,通过低层优化(GDPA、HSP、滑动窗口注意力)和高层创新(CompSkip、事件级个性化)提升模型效率,MFU从17%提升至37%,缩放效率翻倍,已在Meta广告模型部署。
Comments 10 pages, 4 figures
重复博弈中与自适应对手的遗憾最小化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; OpenAI ; University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 针对重复博弈中自适应对手的遗憾最小化问题,提出重复策略遗憾(RP-Regret)指标,并设计三种算法实现次线性遗憾,同时证明所有玩家最小化该遗憾可学习子博弈完美均衡。
想象感知标记增强多模态语言模型的空间推理能力
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(Allen人工智能研究所) ; Microsoft(微软) ; OpenAI(开放人工智能研究院)
AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。
机器人控制的仿真到现实转移与动力学随机化
机构 * OpenAI
AI总结 本文提出一种简单方法通过随机化仿真动力学来弥合现实与仿真的差距,使策略能适应不同动态,从而在无需真实系统训练的情况下实现现实世界泛化。
BigFinanceBench: 一个基于工作流的金融研究智能体基准
机构 * Rogo ; OpenAI
AI总结 针对金融研究答案可审计推导过程未被充分评估的问题,提出包含928个专家编写任务、每个任务附带点权评分标准的BigFinanceBench基准,用于评估完整推导过程而非仅最终答案,实验表明最佳系统仅达58.8%评分,存在显著提升空间。
基于物理可控世界模型的物理对象理解
机构 * Stanford University(斯坦福大学) ; OpenAI(开放人工智能公司) ; Noetik Inc.(Noetik公司) ; Google(谷歌)
AI总结 提出一类概率世界模型,通过自回归序列建模高效训练,从视频中推断对象及其物理交互,实现对象发现、3D操控和物理关系计算。
Comments CVPR 2026 Highlight. Project page at: https://neuroailab.github.io/psi-website/blog.html
lmfaoooo at SemEval-2026 Task 1: 幽默是受众。面向约束幽默生成的偏好建模
机构 * Inworld.AI Berlin, Germany(Inworld.AI柏林,德国) ; OpenAI ; Mountain View, CA(山景城,加利福尼亚州)
AI总结 针对约束幽默生成任务,提出“生成多候选-偏好选择”策略,利用人类成对比较训练偏好模型,在MWAHAHA任务英、中、西语子任务中分别获得第1、第1和第2名。
Comments 5 pages. Accepted for SEMEVAL 2026
应用于爱因斯坦望远镜模拟数据分析的智能体AI首次头对头比较
机构 * Anthropic ; OpenAI
AI总结 本文首次直接比较了Claude Code和Codex两种智能体AI系统在无人干预下自主执行引力波数据分析管线的行为、科学结果和计算成本,揭示了速度与可审计性、指令解释差异等关键问题。
Comments Version 2; includes the report autonomoulsy written in PRD style by agentic AI systems as supplemental material
学习推荐什么:逻辑斯蒂老虎机中极小化最优简单遗憾
机构 * University of Alberta(阿尔伯塔大学) ; University of Washington, Seattle(华盛顿大学(西雅图)) ; OpenAI(开放人工智能研究所)
AI总结 针对简单遗憾目标下的随机逻辑斯蒂老虎机,提出两种曲率感知算法(MULog和THATS),实现与下界匹配的遗憾上界,并揭示最优动作处sigmoid逆斜率κ_*决定极小化难度。
扩散模型的原理
机构 * MIT Press(MIT出版社) ; Sony AI(索尼人工智能) ; OpenAI(开放人工智能) ; Stanford University(斯坦福大学) ; Sony Group Corporation(索尼集团)
AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。
Comments Supplementary materials for the book are available at the book website: https://the-principles-of-diffusion-models.github.io/
统一3D场景理解:通过物理世界建模
机构 * Stanford University(斯坦福大学) ; OpenAI
AI总结 提出一个概率图模型3WM,将深度估计、新视角合成和物体操作等3D视觉任务统一为单一模型,通过不同推理路径实现零样本任务执行,无需微调即达到最先进性能。
Comments Published as a conference paper at ICLR 2026
认知卡尔达肖夫指数:量化文明计算所需的物质外壳
机构 * NVIDIA ; OpenAI ; Stargate ; Terafab
AI总结 基于卡尔达肖夫指数,提出认知卡尔达肖夫指数,通过功率、认知占比、能量效率和人脑处理速率量化不同等级文明可支持的AI级计算量,并给出当前人类水平及未来轨迹。
关于RL微调VLMs的鲁棒性和链式思维一致性
机构 * Apple(苹果公司) ; OpenAI
AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。
Comments ICML 2026
OSWorld-Human: 评估计算机使用代理的效率基准
机构 * OpenAI ; Anthropic ; Google DeepMind ; ByteDance(字节跳动) ; Agent S2 ; GTA1 ; Lei ; Jedi
AI总结 本文研究了计算机使用代理在OSWorld基准上的时间性能,发现大模型调用导致高延迟,并构建了包含人类轨迹的OSWorld Human数据集,评估发现最佳代理仍需更多步骤。
DPrivBench:评估大语言模型在差分隐私推理中的基准测试
机构 * Halıcıoğlu Data Science Institute, UC San Diego(哈里奇奥格卢数据科学研究所,加州大学圣地亚哥分校) ; Department of Computer Science and Engineering, UC San Diego(计算机科学与工程系,加州大学圣地亚哥分校) ; Department of Electrical Engineering, National Taiwan University(电气工程系,国立台湾大学) ; OpenAI
AI总结 本文提出DPrivBench基准测试,用于评估大语言模型在差分隐私推理中的能力,发现当前模型在高级算法推理上存在显著差距,并为改进自动化差分隐私推理提供了方向。