arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-06-10 至 2026-06-10 共收录 18
2606.11063 2026-06-10 cs.AI cs.LG 新提交

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

CIAware-Bench: 评估前沿大语言模型的控制干预感知能力

Joachim Schaeffer, Thomas Jiralerspong, Alexander Panfilov, Guillaume Lajoie, Jonas Geiping, Yoshua Bengio, Roland S. Zimmermann

机构 * MATS Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Astra Fellowship ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center LawZero Google DeepMind(谷歌DeepMind)

AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10481 2026-06-10 cs.LG cs.AI cs.CL cs.CR stat.ML 新提交

Advancing the State-of-the-Art in Empirical Privacy Auditing

推进经验隐私审计的最新水平

Nicole Mitchell, Galen Andrew, Arun Ganesh, Brendan McMahan, Peter Kairouz

机构 * Google Research(谷歌研究院)

AI总结 提出通过高温采样生成合成金丝雀,用于经验隐私审计,并引入基于辅助模型的合成数据审计方法,系统研究模型容量与金丝雀熵对记忆化的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10281 2026-06-10 cs.CR cs.CL 新提交

Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

基准测试与探索LLM在攻击调查中的能力

Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

机构 * University of Chicago(芝加哥大学) University of California, Berkeley(加州大学伯克利分校) Google(谷歌)

AI总结 提出AuditBench基准数据集,评估LLM在安全审计日志分析中的性能,涵盖四种常见调查任务,揭示模型在不同设计选择下的表现差异与错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10267 2026-06-10 cs.RO cs.AI cs.LG 新提交

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

机器人策略编排的关键因素:分层VLA智能体的系统研究

Jiaheng Hu, Mohit Shridhar, Caden Lu, Dhruv Shah, Hao-Tien Lewis Chiang, Jie Tan, Annie Xie

机构 * Google DeepMind(谷歌DeepMind)

AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09853 2026-06-10 cs.LG cs.IT math.IT 新提交

SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

SynIB: 多模态学习中最大化协同的信息瓶颈

Konstantinos Kontras, Teodora Gagaleska, Thomas Strypsteen, Christos Chatzichristos, Matthew Blaschko, Maarten De Vos, Paul Pu Liang

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院) University of Amsterdam(阿姆斯特丹大学)

AI总结 提出SynIB方法,通过信息瓶颈理论直接优化多模态协同,在训练中屏蔽单模态时惩罚高置信度,提升跨模态推理能力,在合成和真实任务上准确率提升达7.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10294 2026-06-10 cs.LG cs.AI cs.AR cs.NE physics.comp-ph 新提交

LLM-Guided Neural Architecture Search for Robust Co-Design of Physical Neural Networks

LLM引导的神经架构搜索用于物理神经网络的鲁棒协同设计

Tyler King, Timothee Leleu

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

AI总结 提出UH-NAS框架,利用大语言模型作为进化算子,协同优化任务准确率和推理能耗,实现跨硬件平台的公平比较,在光学MZI硬件上发现更鲁棒的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08799 2026-06-10 stat.ML cs.LG 版本更新

Generalization in Nonlinear Least Squares via Learned Feature Geometry

非线性最小二乘中基于学习特征几何的泛化性

Ayub Kharel, Ilja Kuzborskij, Patrick Rebeschini, Yasin Abbasi-Yadkori

机构 * University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) Sapient Intelligence(智睿科技)

AI总结 通过算法稳定性分析岭正则化非线性最小二乘的泛化误差,利用经验雅可比Gram矩阵和残差曲率项定义数据依赖的有效维度,并证明其与内在维度而非参数数量相关。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08565 2026-06-10 cs.LG 版本更新

Finer is Better (with the Right Scaling)

更细粒度更好(配合正确的缩放)

Clemens Schaefer, Gil Tabak

机构 * Google LLC(谷歌公司) Mountain View, Ca(山景城,加利福尼亚)

AI总结 本文研究大语言模型低精度量化中的块大小悖论,发现细粒度块在正确缩放策略下能降低量化误差,并通过4-over-6方法等解决退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01248 2026-06-10 cs.LG 版本更新

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data

$S^3$-R1: 通过合成数据学习逐步检索与回答

Harsh Goel, Akhil Udathu, Susmija Jabbireddy, Pradnesh Kalkar, Atharva Parulekar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

AI总结 提出S^3-R1框架,通过合成数据生成和密集奖励信号,解决强化学习后训练中稀疏奖励和缺乏多跳问题数据的问题,提升模型搜索与问答能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26000 2026-06-10 cs.LG stat.ML 版本更新

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access

知情非对称Actor-Critic:利用超越全状态访问的特权信号

Daniel Ebi, Damien Ernst, Klemens Böhm, Gaspard Lambrechts

机构 * DeepMind(深度Mind) University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院) University of Geneva(日内瓦大学)

AI总结 提出知情非对称Actor-Critic框架,允许评论家基于任意状态相关特权信号进行条件化,并证明其产生无偏策略梯度估计;设计两种信息性准则选择最优信号,实验表明精选信号可匹配或超越全状态基线。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04119 2026-06-10 cs.LG q-bio.QM 版本更新

Synthesizable Molecular Generation via Soft-constrained GFlowNets with Rich Chemical Priors

通过具有丰富化学先验的软约束GFlowNets生成可合成分子

Hyeonah Kim, Minsu Kim, Celine Roget, Dionessa Biton, Louis Vaillancourt, Yves V. Brun, Yoshua Bengio, Alex Hernandez-Garcia

机构 * University of Toronto(多伦多大学) DeepMind(深度思维) University of Montreal(蒙特利尔大学)

AI总结 提出S3-GFN方法,通过软正则化序列GFlowNet,利用大规模SMILES语料库的化学先验,生成高奖励且可合成的分子,实验表明可合成率≥95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17251 2026-06-10 stat.ML cs.LG 版本更新

Risk Comparisons in Linear Regression: Implicit Regularization Dominates Explicit Regularization

线性回归中的风险比较:隐式正则化主导显式正则化

Jingfeng Wu, Peter L. Bartlett, Sham M. Kakade, Jason D. Lee, Bin Yu

机构 * University of California, Berkeley(加州大学伯克利分校) Alphabetical order Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

AI总结 本文通过实例比较线性回归中梯度下降、岭回归和随机梯度下降的有限样本风险,发现梯度下降优于岭回归,但与随机梯度下降不可比,且在某些问题中梯度下降可能更差。

Comments Accepted for presentation at the Conference on Learning Theory (COLT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14753 2026-06-10 cs.CV cs.LG 版本更新

Cost-Aware Routing for Efficient Text-To-Image Generation

面向文本到图像生成的高效路由:成本感知方法

Qinchan Li, Kenneth Chen, Changyue Su, Wittawat Jitkrittum, Qi Sun, Patsorn Sangkloy

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院) Google(谷歌) Eigen 4D Inc.(Eigen 4D公司)

AI总结 提出成本感知路由框架,根据提示复杂度自动选择不同去噪步数或模型,在保证高质量的同时降低计算成本,优于单一模型。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12486 2026-06-10 cs.LG cs.CL

The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws

训练过程至关重要:平均预训练参数计数统一了稀疏和密集的扩展规律

Tian Jin, Ahmed Imtiaz Humayun, Utku Evci, Suvinay Subramanian, Amir Yazdanbakhsh, Dan Alistarh, Gintare Karolina Dziugaite

机构 * MIT CSAIL(MIT 计算科学与人工智能实验室) Rice University(稻大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Google(谷歌) IST Austria(奥地利科学院)

AI总结 本文通过研究80种不同的剪枝计划,发现预训练过程中在25%和75%的计算量启动和结束剪枝可获得最佳评估损失,提出新的扩展规律统一了稀疏和密集预训练的扩展规律。

Comments 17 pages

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11517 2026-06-10 cs.CL cs.DC cs.LG

Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding

学习承诺:通过学习异步解码扩展语言模型解码并行性

Tian Jin, Ellie Y. Cheng, Zack Ankner, Nikunj Saunshi, Blake M. Elias, Amir Yazdanbakhsh, Jonathan Ragan-Kelley, Suvinay Subramanian, Michael Carbin

机构 * DeepMind, London, UK(深度思维公司,伦敦,英国) Google Research, New York, NY, USA(谷歌研究院,纽约,纽约州,美国) Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) University of Toronto, Toronto, Ontario, Canada(多伦多大学,多伦多,安大略省,加拿大) University of Washington, Seattle, WA, USA(华盛顿大学,西雅图,华盛顿州,美国)

AI总结 本文提出PASTA系统,通过学习使语言模型识别语义独立性,提升解码并行性,实验证明在解码速度和响应质量上优于现有方法。

Comments 15 pages

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27941-27956, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04680 2026-06-10 cs.CL cs.AI cs.LG

The Cost of Down-Scaling Language Models: Fact Recall Deteriorates before In-Context Learning

大语言模型降维的成本:事实回忆在内省学习之前恶化

Tian Jin, Nolan Clement, Xin Dong, Vaishnavh Nagarajan, Michael Carbin, Jonathan Ragan-Kelley, Gintare Karolina Dziugaite

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT Harvard University(麻省理工学院哈佛大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

AI总结 研究探讨了大语言模型参数数量缩放对核心能力的影响,发现模型规模缩减会显著降低事实回忆能力,但对内省信息处理影响较小。

Journal ref The Twelfth International Conference on Learning Representations (ICLR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.15621 2026-06-10 cs.CL 版本更新

Open Korean Corpora: A Practical Report

开放韩语语料库:一份实践报告

Won Ik Cho, Sangwhan Moon, Youngsook Song

机构 * AI Center, Samsung Electronics(三星电子AI中心) Google LLC(谷歌公司) Lablup Inc.(Lablup公司)

AI总结 本文梳理并评述了现有韩语开放语料库,涵盖机构级资源及各类任务数据集,并针对低资源语言提出了开源数据集构建与发布的建议。

Comments Published (v1) in NLP-OSS @EMNLP2020; May 2023 (v2) added with new datasets; June 2026 (v3) added analyses

详情

展开后加载摘要…

URL PDF HTML 收藏