Proteus: Incremental Memory Activation for Long-Context Sequence Modeling
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
大厂专区
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
通过瓶颈潜在重构实现无需触觉仿真的触觉Sim2Real
机构 * University of Michigan(密歇根大学) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究提出SBLR框架,无需触觉仿真,通过两阶段策略训练和未配对数据对齐,在插销插入等任务上实现高零样本成功率,性能优于物理仿真基线。
Dear Algo:面向统一搜索与推荐的精准优先智能体意图层
机构 * Meta Platforms Inc.(元平台公司) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究提出面向统一搜索与推荐的精准优先智能体意图层Dear Algo,将多类型意图编译为可执行计划,实验显示其在精度、候选数量及用户相关性上均优于基线。
TransfHAR:用于按需活动识别的自监督手腕表征
机构 * Northwestern University(西北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Google(谷歌)
AI总结 TransfHAR是一种自监督手腕IMU框架,可通过学习粗粒度运动先验实现按需细粒度活动识别,在跨数据集评估及用户研究中均优于或匹配全监督基线,为该领域提供了有效基础。
Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架
机构 * Google Cloud(谷歌云)
AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。
Comments 15 pages, 4 figures
TEA:用于文本到图像模型中稳健概念擦除的文本编码器对齐
机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Google Research(谷歌研究院)
AI总结 该研究提出轻量级文本编码器对齐框架 TEA,将概念擦除建模为文本表示空间的域对齐问题,仅微调文本编码器,在零推理开销下提升了文本到图像模型对对抗攻击的概念擦除稳健性,且模型无关,在 Stable Diffusion 系列模型上表现优异。
大型语言模型(LLMs)知道该问什么以及何时提问吗?评估多轮信息获取能力
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究构建MT-InfoSeek评估套件,从提问内容、时机及信息影响三方面评估LLMs的多轮信息获取能力,发现其存在低估信息需求等缺陷,且该能力未被现有评估覆盖。
生成模型统计可评估性的理论框架
机构 * University of Maryland(马里兰大学) ; Tel Aviv University and Google Research(特拉维夫大学和谷歌研究) ; Technion and Google Research(技术学院和谷歌研究)
AI总结 提出一个理论框架,研究生成模型的统计可评估性,证明基于有界测试类的积分概率度量可有限样本评估,而Rényi和KL散度不可评估。
Comments 30 pages
通过检索增强的视觉语言模型实现机器人在训练数据中的泛化
机构 * Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。
Comments IEEE Robotics and Automation Letters (RA-L)
预算感知的工具使用实现有效的代理扩展
机构 * Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind) ; New York University(纽约大学) ; UC Santa Barbara(加州大学圣塔芭芭拉分校)
AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。
Comments Accepted to COLM 2026
无分类器引导调度的对抗学习
机构 * Google(谷歌公司) ; Google DeepMind(谷歌DeepMind) ; Gatsby UCL(盖茨比伦敦大学学院)
AI总结 本文提出一种对抗学习方法,将无分类器引导调度建模为密度比估计问题,训练判别器与轻量生成器,在文本到图像生成基准上优于启发式CFG调度及现有动态引导学习方法。
自组织数字电路
机构 * IT University of Copenhagen(哥本哈根信息技术大学) ; Imperial College London(帝国理工学院) ; Google(谷歌公司)
AI总结 该研究受生物自组织特性启发,提出自组织数字电路,采用拓扑掩码Transformer结合神经细胞自动机范式,实现电路的自组装与故障容错,还具备跨电路规模的泛化能力。
Comments 9 pages, 10 figures
训练混合:将小规模支架式预训练运行重组为更大的语言模型
机构 * Google(谷歌公司) ; School of Computing, Dublin City University(都柏林城市大学计算机学院)
AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。
Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026
EvDiff:高质视频与事件相机
机构 * Zhejiang University(浙江大学) ; INSAIT ; UC Merced(加州大学默塞德分校) ; Google DeepMind(谷歌DeepMind)
AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。
Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026
超越试错:面向图像到视频一致性的智能体优化
机构 * Google Cloud(谷歌云) ; Google DeepMind(谷歌DeepMind)
AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。
基于概念的任意场景注视目标估计
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌公司)
AI总结 针对现有注视估计方法依赖中间阶段、缺乏灵活性的局限,提出PGE任务,构建Gaze-Co数据集,开发GazeAnywhere模型,实现端到端的概念驱动注视目标估计并达到最优性能。
Comments CVPR 2026 Code and Benchmark are aviliable at https://github.com/IrohXu/GazeAnywhere and https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark
线性核心替代方案:用于分类和结构预测的平滑损失函数与线性速率
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(Courant数学科学研究所)
AI总结 本文提出线性核心替代方案,结合平滑损失的优化优势与边际损失的统计效率,提升结构预测的计算效率和鲁棒性。
Comments ICML 2026
注意间隙:在偏好学习中的结构感知一致性
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(数学科学学院)
AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。
Comments ICML 2026
优化不平衡设置下的延迟策略
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(Courant数学科学研究所)
AI总结 本文研究了在专家不平衡情况下两阶段学习延迟方法,提出新的成本敏感学习算法MILD,通过改进损失函数和保障机制,提升了图像分类和LLM路由任务的性能。
Comments ICML 2026
GESTO:面向动态场景推理的以人为中心的时空记忆
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; University of Stuttgart(斯图加特大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Google Research(谷歌研究院) ; TU Munich(慕尼黑工业大学)
AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。
VoxSumm:用于联合摘要与翻译的多语言长篇口语新闻语料库
机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Google DeepMind(谷歌DeepMind) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席项目)
AI总结 本研究针对长文档摘要与多语言语音翻译的研究缺口,提出联合语音摘要与翻译任务,构建首个多语言跨语言基准VoxSumm,并评估相关模型表现,为多语言语音处理系统提供支撑。
MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准
机构 * Google(谷歌)
AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。
具有个性的患者:通过受控多样性与选择性披露实现逼真的患者模拟
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; TUM University Hospital(慕尼黑技术大学医院) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; Imperial College London(伦敦帝国学院)
AI总结 提出PatientsWithPersonality框架,通过HEXACO人格参数化控制患者对话风格、合作性和信息披露,生成逼真且多样化的虚拟患者,在临床评估中接近真实演员表现。
Comments 22 pages, 11 figures
ArchAgent v2:数据预取锦标赛的案例研究
机构 * Google(谷歌公司) ; University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind)
AI总结 本研究提出ArchAgent v2框架,通过级联进化搜索和硬件可实现性反馈循环,在DPC4中自动设计出性能优于人工方案的三级预取器,为计算机架构师提供了自动化智能体发现的实用工具。
面向专家级的实时视频问诊医疗AI
机构 * Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。
思路搜索:用思路引导树搜索以探索多样化的科学方法
机构 * California Institute of Technology(加州理工学院) ; Google Research(谷歌研究院) ; Harvard University(哈佛大学)
AI总结 该研究针对树搜索在科学方法探索中易陷局部最优的问题,提出Idea Search框架,通过整合动态思路库优化树搜索,在scRNA-seq批次整合任务上提升了性能。
当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征
机构 * Google(谷歌公司) ; University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; Zhejiang University(浙江大学) ; Australian National University(澳大利亚国立大学)
AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。
SimSD:扩散语言模型中的简单推测解码
机构 * University of California San Diego(加州大学圣地亚哥分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌) ; University of California Santa Barbara(加州大学圣芭芭拉分校)
AI总结 针对扩散语言模型无法直接使用标准推测解码的问题,提出SimSD算法,通过即插即用的掩码策略引入参考令牌并设计注意力掩码,实现单次前向传播验证多个草稿令牌,在保持并行解码优势的同时提升解码吞吐量。
Comments 13 pages, 4 figures, code available at https://github.com/airevo2/SimSD-release
范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉
机构 * Anthropic ; OpenAI ; Google ; DeepSeek
AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。
Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120
通过长度惩罚:揭示质量估计指标中的系统性偏差
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
AI总结 研究揭示了质量估计指标在翻译长度上的系统性偏差,指出长度偏差可能导致对长译文的不公平惩罚,并通过长度归一化训练方法改进了指标的可靠性。