arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-09-01 至 2026-09-01 共收录 18
2608.30959 2026-09-01 cs.CV cs.AI 新提交

LOCI: A Locator-Critic with Refinement Loop

LOCI:带精化循环的定位器-评判器

Walid Bousselham, Mathilde Caron, Arsha Nagrani, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30384 2026-09-01 cs.LG cs.IR 新提交

RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search

RSLM:用于近似最近邻搜索的无训练向量量化方法

Rastislav Lenhardt, Teodora Dobos, Thomas Vecchiato, Jiri Isa, Igor Ginzburg

机构 * Google(谷歌) Technical University of Munich(慕尼黑工业大学) University of Copenhagen(哥本哈根大学)

AI总结 该研究提出无训练向量量化方法RSLM,将ANN搜索的嵌入压缩至每维度2-4比特,通过校正重构向量L2范数等创新,在降低系统复杂度与内存成本的同时保持或提升召回率。

Comments 14 Pages, 3 Figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30241 2026-09-01 cs.CL cs.CV 新提交

PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback

PaperBanana-Interact:基于多轮人类反馈的科学图表优化

Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang, Yale Song, Yiwen Song, Rui Meng, Tomas Pfister, Nanyun Peng

机构 * Google(谷歌公司) Peking University(北京大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对科学图表多轮优化的空白,构建了多轮图表生成基准MTPaperBananaBench,提出多智能体系统PaperBanana-Interact,解决基线系统的质量漂移与遗忘问题,显著提升图表优化效果。

Comments this https URL (https://shirley-wu.github.io/PaperBanana-Interact/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29596 2026-09-01 cs.AI cs.LG cs.MA 新提交

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security

面向智能体技能的系统基础:架构、生命周期与安全性

Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia

机构 * Google LLC(谷歌有限责任公司) Purdue University(普渡大学)

AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28933 2026-09-01 cs.CV 新提交

NBS: No Bias Stereo

NBS:无偏立体匹配

Vage Taamazyan, Zhuowen Shen, Stefan Hinterstoisser, Alberto Dall'Olio, Agastya Kalra, Aarrushi Shandilya, Xin Li, Wenping Wang, Kartik Venkataraman

机构 * Intrinsic (Google)(Intrinsic(谷歌)) Texas A&M University(德克萨斯农工大学)

AI总结 该研究提出无架构归纳偏置的NBS模型,采用端到端Vision Transformer,经大规模合成数据集训练,在立体匹配上达到最先进准确率与更优效率,证明显式归纳偏置非必要,解锁3D重建缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28704 2026-09-01 cs.AI cs.LG 新提交

ORDDAR: Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery

ORDDAR:面向抗失真决策、行动与认知恢复的观测驱动推理

Deblina Kar, Anant Nawalgaria, Shyamal Kumar Das Mandal

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) Google Research(谷歌研究院)

AI总结 本研究提出ORDDAR推理框架,通过局部认知状态转换检测、失真定位与针对性修复,提升了多类推理任务的质量、恢复能力与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28648 2026-09-01 cs.AI cs.CL cs.LG 新提交

How Language Models Choose Sides: Internal Representations of Instruction Hierarchy

语言模型如何选择立场:指令层级的内部表征

Enrique Balp-Straffon, Chih-Hao Hsu, Rushiraj Gadhvi, Sunishchal Dev, Callum Stuart McDougall, Anusha Mujumdar

机构 * Amazon(亚马逊) National Taiwan University(国立台湾大学) Plaksha University(普拉卡莎大学) RAND Corporation(兰德公司) Algoverse Google DeepMind(谷歌DeepMind)

AI总结 本研究探究指令微调LLM在系统与用户指令冲突中的仲裁机制,构建含41对约束的基准评估8个模型,发现反层级模型Llama-3.1-8B的冲突结果可从残差流激活线性解码,干预效果取决于读出几何结构。

Comments Published at the ICML 2026 Mechanistic Interpretability workshop, 16 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28632 2026-09-01 cs.AI cs.CL cs.LG 新提交

AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment

AutoScientist-Quant:用于量化投资自动研究的自进化编码智能体

Zongqian Li, Yaoyiran Li, Yaohui Guo, Ming Zhang, Nigel Collier, Eugene Ie

机构 * Google(谷歌公司) University of Cambridge(剑桥大学)

AI总结 AutoScientist-Quant是将量化研究视为带预算约束搜索问题的自进化编码智能体,修复了评估流程的前瞻问题,在CSI universe等场景下实现最优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-09-01 cs.CL cs.AI 版本更新

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

机构 * Google Research(谷歌研究院) CNRS(法国国家科学研究中心) IRIF(法国信息学研究所) Université Paris-Cité(巴黎城市大学) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学) CEA(法国原子能和替代能源委员会) California Institute of Technology(加州理工学院) Google DeepMind(谷歌DeepMind)

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12683 2026-09-01 cs.AI cs.CY cs.LG 版本更新

From AGI to ASI

从AGI到ASI

Tim Genewein, Matija Franklin, Alexander Lerchner, Laurent Orseau, Samuel Albanie, Adam Bales, Cole Wyeth, Stephanie Chan, Iason Gabriel, Joel Z. Leibo, Allan Dafoe, Marcus Hutter, Thore Graepel, Shane Legg

机构 * Google DeepMind(谷歌DeepMind) University of Waterloo(滑铁卢大学) Australian National University(澳大利亚国立大学) University College London(伦敦大学学院)

AI总结 探讨从人类级通用人工智能到超级智能的转变路径,包括扩展、范式转变、递归改进和多智能体涌现,并分析摩擦与瓶颈。

Comments v2: minor fixes and addition of related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04095 2026-09-01 cs.CL cs.AI 版本更新

POLARIS: Guiding Small Models to Write Long Stories

POLARIS:引导小模型撰写长篇小说

Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

机构 * University of Maryland(马里兰大学) Google(谷歌) DeepMind(深Mind)

AI总结 提出POLARIS训练方法,结合LLM裁判奖励和人类参考注入,使9B小模型在长故事写作中达到与27B模型相当的质量,并展现出长度泛化能力。

Comments Accepted to EMNLP 2026 (Main Conference) as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03259 2026-09-01 cs.CL 版本更新

Beyond "To whom it may concern": Tailoring Machine Translation to Audience and Intent

超越“敬启者”:面向受众和意图的机器翻译定制化

Raphael Merx, Ekaterina Vylomova, Trevor Cohn

机构 * The University of Melbourne(墨尔本大学) Google(谷歌)

AI总结 本文通过系统评估50种语言、5种模型规模和8个文本领域,研究了大型语言模型在机器翻译中利用显式指令实现目的驱动翻译的能力,发现指令能显著提升翻译适应性,但传统指标无法评估适应质量。

Comments Accepted at EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-09-01 cs.SE cs.AI cs.HC 版本更新

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13287 2026-09-01 cs.LG 版本更新

MOONSHOT: A Framework for Multi-Objective Pruning of Vision and Large Language Models

MOONSHOT:一种用于视觉和大语言模型多目标剪枝的框架

Gabriel Afriat, Xiang Meng, Shibal Ibrahim, Hussein Hazimeh, Rahul Mazumder

机构 * Google(谷歌) OpenAI Massachusetts Institute of Technology(麻省理工学院)

AI总结 MOONSHOT通过联合优化层重建误差和训练损失的二阶泰勒近似,提升视觉和大语言模型在无重新训练下的压缩效果,显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: this https URL (https://github.com/zhangyuejoslin/Deer-3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26600 2026-09-01 cs.CL cs.AI 版本更新

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

当LLM自我基准测试:解构自动评估中的自我偏见

Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch

机构 * Google(谷歌) ETH Zurich(苏黎世联邦理工学院)

AI总结 研究LLM自动创建基准测试时存在的自我偏见问题,发现测试集生成和评估两个环节均产生偏见,导致模型偏爱自身输出,并提出了多样性指标以部分缓解该偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18707 2026-09-01 cs.CL 版本更新

Learning from Many Voices: Literary MT Using Multi-Reference Human and Synthetic Data

从多视角学习:利用多参考人工与合成数据的文学机器翻译

Si Wu, John Wieting, David A. Smith

机构 * Northeastern University(东北大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出基于语义相似度的过滤框架,利用多参考人工与合成数据开展文学机器翻译研究,发现中高语义相似度数据微调效果更优,且人工专家译文的微调效果优于合成数据。

详情

展开后加载摘要…

URL PDF HTML 收藏