LOCI: A Locator-Critic with Refinement Loop
LOCI:带精化循环的定位器-评判器
机构 * Google DeepMind(谷歌DeepMind)
AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。
大厂专区
LOCI:带精化循环的定位器-评判器
机构 * Google DeepMind(谷歌DeepMind)
AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。
RSLM:用于近似最近邻搜索的无训练向量量化方法
机构 * Google(谷歌) ; Technical University of Munich(慕尼黑工业大学) ; University of Copenhagen(哥本哈根大学)
AI总结 该研究提出无训练向量量化方法RSLM,将ANN搜索的嵌入压缩至每维度2-4比特,通过校正重构向量L2范数等创新,在降低系统复杂度与内存成本的同时保持或提升召回率。
Comments 14 Pages, 3 Figures, Preprint
PaperBanana-Interact:基于多轮人类反馈的科学图表优化
机构 * Google(谷歌公司) ; Peking University(北京大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 该研究针对科学图表多轮优化的空白,构建了多轮图表生成基准MTPaperBananaBench,提出多智能体系统PaperBanana-Interact,解决基线系统的质量漂移与遗忘问题,显著提升图表优化效果。
Comments this https URL (https://shirley-wu.github.io/PaperBanana-Interact/)
面向智能体技能的系统基础:架构、生命周期与安全性
机构 * Google LLC(谷歌有限责任公司) ; Purdue University(普渡大学)
AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。
NBS:无偏立体匹配
机构 * Intrinsic (Google)(Intrinsic(谷歌)) ; Texas A&M University(德克萨斯农工大学)
AI总结 该研究提出无架构归纳偏置的NBS模型,采用端到端Vision Transformer,经大规模合成数据集训练,在立体匹配上达到最先进准确率与更优效率,证明显式归纳偏置非必要,解锁3D重建缩放定律。
ORDDAR:面向抗失真决策、行动与认知恢复的观测驱动推理
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) ; Google Research(谷歌研究院)
AI总结 本研究提出ORDDAR推理框架,通过局部认知状态转换检测、失真定位与针对性修复,提升了多类推理任务的质量、恢复能力与可解释性。
语言模型如何选择立场:指令层级的内部表征
机构 * Amazon(亚马逊) ; National Taiwan University(国立台湾大学) ; Plaksha University(普拉卡莎大学) ; RAND Corporation(兰德公司) ; Algoverse ; Google DeepMind(谷歌DeepMind)
AI总结 本研究探究指令微调LLM在系统与用户指令冲突中的仲裁机制,构建含41对约束的基准评估8个模型,发现反层级模型Llama-3.1-8B的冲突结果可从残差流激活线性解码,干预效果取决于读出几何结构。
Comments Published at the ICML 2026 Mechanistic Interpretability workshop, 16 pages (including appendix)
AutoScientist-Quant:用于量化投资自动研究的自进化编码智能体
机构 * Google(谷歌公司) ; University of Cambridge(剑桥大学)
AI总结 AutoScientist-Quant是将量化研究视为带预算约束搜索问题的自进化编码智能体,修复了评估流程的前瞻问题,在CSI universe等场景下实现最优泛化性能。
TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准
机构 * Google Research(谷歌研究院) ; CNRS(法国国家科学研究中心) ; IRIF(法国信息学研究所) ; Université Paris-Cité(巴黎城市大学) ; Princeton University(普林斯顿大学) ; Université Paris-Saclay(巴黎萨克雷大学) ; CEA(法国原子能和替代能源委员会) ; California Institute of Technology(加州理工学院) ; Google DeepMind(谷歌DeepMind)
AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具
从AGI到ASI
机构 * Google DeepMind(谷歌DeepMind) ; University of Waterloo(滑铁卢大学) ; Australian National University(澳大利亚国立大学) ; University College London(伦敦大学学院)
AI总结 探讨从人类级通用人工智能到超级智能的转变路径,包括扩展、范式转变、递归改进和多智能体涌现,并分析摩擦与瓶颈。
Comments v2: minor fixes and addition of related work
POLARIS:引导小模型撰写长篇小说
机构 * University of Maryland(马里兰大学) ; Google(谷歌) ; DeepMind(深Mind)
AI总结 提出POLARIS训练方法,结合LLM裁判奖励和人类参考注入,使9B小模型在长故事写作中达到与27B模型相当的质量,并展现出长度泛化能力。
Comments Accepted to EMNLP 2026 (Main Conference) as a long paper
超越“敬启者”:面向受众和意图的机器翻译定制化
机构 * The University of Melbourne(墨尔本大学) ; Google(谷歌)
AI总结 本文通过系统评估50种语言、5种模型规模和8个文本领域,研究了大型语言模型在机器翻译中利用显式指令实现目的驱动翻译的能力,发现指令能显著提升翻译适应性,但传统指标无法评估适应质量。
Comments Accepted at EMNLP 2026 main
最强的教师并不总是最好的教师:以学生为中心的答案选择
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Southern California(南加州大学) ; Independent Researcher(独立研究者) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; Google(谷歌) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Northwestern University(西北大学) ; Allen Institute for AI (AI2)(人工智能研究院(AI2))
AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。
编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析
机构 * University of Notre Dame(诺丁汉大学) ; Vanderbilt University(范德比大学) ; Google(谷歌)
AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。
MOONSHOT:一种用于视觉和大语言模型多目标剪枝的框架
机构 * Google(谷歌) ; OpenAI ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 MOONSHOT通过联合优化层重建误差和训练损失的二阶泰勒近似,提升视觉和大语言模型在无重新训练下的压缩效果,显著提升模型性能。
面向大语言模型中3D grounding的错误驱动场景编辑
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Michigan(密歇根大学) ; Google Research(谷歌研究)
AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。
Comments Accepted by ECCV 2026. Code: this https URL (https://github.com/zhangyuejoslin/Deer-3D)
当LLM自我基准测试:解构自动评估中的自我偏见
机构 * Google(谷歌) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究LLM自动创建基准测试时存在的自我偏见问题,发现测试集生成和评估两个环节均产生偏见,导致模型偏爱自身输出,并提出了多样性指标以部分缓解该偏见。
从多视角学习:利用多参考人工与合成数据的文学机器翻译
机构 * Northeastern University(东北大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出基于语义相似度的过滤框架,利用多参考人工与合成数据开展文学机器翻译研究,发现中高语义相似度数据微调效果更优,且人工专家译文的微调效果优于合成数据。