arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-05-13 至 2026-05-13 共收录 17
2605.12421 2026-05-13 cs.AI

Formalize, Don't Optimize: The Heuristic Trap in LLM-Generated Combinatorial Solvers

形式化,而非优化:LLM生成组合求解器中的启发式陷阱

Haoyu Wang, Yuliang Song, Tao Li, Zhiwei Deng, Yaqing Wang, Deepak Ramachandran, Eldan Cohen, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) Oracle AI(Oracle人工智能)

AI总结 本文研究LLM生成组合求解器时形式化与优化的矛盾,通过CP-SynC-XL基准测试,发现Python+OR-Tools在正确性上最优,而MiniZinc+OR-Tools虽使用相同后端但覆盖度较低,启发式优化导致部分问题速度下降和正确性降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12419 2026-05-13 cs.CL cs.IR cs.LG

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12006 2026-05-13 cs.CV

Robust Promptable Video Object Segmentation

鲁棒可提示视频对象分割

Sohyun Lee, Yeho Gwon, Lukas Hoyer, Konrad Schindler, Christos Sakaridis, Suha Kwak

机构 * POSTECH Google(谷歌) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出鲁棒可提示视频对象分割方法MoGA,通过内存对象条件门控适应处理视频对象分割中的退化问题,提升在真实环境下的鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11908 2026-05-13 cs.LG

Delightful Gradients Accelerate Corner Escape

愉悦梯度加速角落逃脱

Jincheng Mei, Ian Osband

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文研究了Delightful Policy Gradient方法,通过优势与动作意外的乘积门控政策梯度项,解决了策略梯度在亚优角落的瞬态行为缓慢问题,证明其在带宽和表格MDP中以O(1/t)速率收敛。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11884 2026-05-13 cs.LG

Sobolev Regularized MMD Gradient Flow

Sobolev正则化最大均值差异梯度流

Chenyang Tian, Bharath K. Sriperumbudur, Arthur Gretton, Zonghao Chen

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University College London(伦敦大学学院) Google Deepmind(谷歌DeepMind)

AI总结 本文提出Sobolev正则化最大均值差异(SrMMD)梯度流,通过梯度惩罚改善MMD目标的非凸性,提供连续和离散时间下的全局收敛性保证,且无需依赖等周假设。该方法适用于生成建模和采样任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11519 2026-05-13 cs.AI cs.CL cs.LG

Controllable User Simulation

可控用户模拟

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier

机构 * Google Research(谷歌研究) Tel Aviv University(特拉维夫大学)

AI总结 本文提出将可控模拟视为因果推断问题,通过改进模拟器训练方法消除 lookahead 偏差,实现更稳定的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11513 2026-05-13 cs.CL cs.AI

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

针对大语言模型预训练的隐藏层蒸馏研究

Maxime Guigon, Lucas Dixon, Michaël E. Sander

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文研究了隐藏层蒸馏在大语言模型预训练中的应用,对比了蒸馏与基于输出logits的方法,发现蒸馏在某些配置下能提升困惑度,但未在下游任务中超越标准蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11260 2026-05-13 cs.LG cs.AI

Curriculum Learning-Guided Progressive Distillation in Large Language Models

基于课程学习的渐进蒸馏:大型语言模型中的知识蒸馏

Jincheng Cao, Fanzhi Zeng, Leqi Liu, Aryan Mokhtari

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google Research(谷歌研究)

AI总结 本文提出CLPD框架,通过结合数据难度与教师强度,改进知识蒸馏方法,实验证明其在推理任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11161 2026-05-13 cs.LG cs.AI

Interpretability Can Be Actionable

可解释性可以是可操作的

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegreffe, Eric Wong, Ian Tenney, Mor Geva

机构 * Kempner Institute at Harvard University(哈佛大学凯默纳研究所) University of Southern California(美国南加州大学) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) University of Oxford(牛津大学) Northeastern University(东北大学) Boston University(波士顿大学)

AI总结 本文探讨了可解释性研究的核心问题,提出应以可操作性作为评价标准,通过具体性和验证性两个维度分析阻碍实际应用的障碍,并提出五个领域和评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11086 2026-05-13 cs.CR cs.AI cs.LG

ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?

ExploitGym:AI代理能否将安全漏洞转化为实际攻击?

Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) UC Santa Barbara(加州大学圣巴巴拉分校) Arizona State University(亚利桑那州立大学) Anthropic(Anthropic公司) OpenAI Google(谷歌)

AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10973 2026-05-13 cs.LG cs.AI

Rotation-Preserving Supervised Fine-Tuning

保持旋转的监督微调

Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08083 2026-05-13 cs.CL

LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling

LLMs改进LLMs:测试时扩展的代理发现

Tong Zheng, Haolin Liu, Chengsong Huang, Huiwen Bao, Sheng Zhang, Rui Liu, Runpeng Dai, Ruibo Chen, Chenxi Liu, Tianyi Xiong, Xidong Wu, Hongming Zhang, Heng Huang

机构 * UMD(马里兰大学) UVA(弗吉尼亚大学) WUSTL(华盛顿大学) UNC(北卡罗来纳大学) Google(谷歌) Meta

AI总结 本文提出AutoTTS框架,通过环境驱动的方法自动发现测试时扩展策略,提升大语言模型性能,实验表明其在数学推理基准上的准确率与成本平衡优于人工设计基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06870 2026-05-13 cs.LG

Continuous First, Discrete Later: VQ-VAEs Without Dimensional Collapse

先连续后离散:无需维度坍缩的VQ-VAE

Xinyu Zhao, Nikita Karagodin, Hamed Hassani, Sinan Hersek, Paul Pu Liang, Yury Polyanskiy

机构 * MIT(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) Google(谷歌)

AI总结 本文探讨了VQ-VAE中维度坍缩问题,提出通过预训练无量化自编码器缓解该问题,提升表示维度和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02799 2026-05-13 cs.LG cs.AI

Joint Learning of Hierarchical Neural Options and Abstract World Model

层级神经选项与抽象世界模型的联合学习

Wasu Top Piriyakulkij, Wolfgang Lehrach, Kevin Ellis, Kevin Murphy

机构 * Cornell University(康奈尔大学) Google Deepmind(谷歌DeepMind)

AI总结 本文提出AgentOWL方法,通过高效样本学习抽象世界模型和层级神经选项,使智能体在Object-Centric Ataris游戏中以更少数据学习更多技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22334 2026-05-13 cs.LG

DP-λCGD: Efficient Noise Correlation for Differentially Private Model Training

DP-λCGD:用于差分隐私模型训练的高效噪声相关性

Nikita P. Kalinin, Ryan McKenna, Rasmus Pagh, Christoph H. Lampert

机构 * Institute of Science and Technology Austria(奥地利科学与技术研究所) University of Copenhagen(哥本哈根大学) Google(谷歌)

AI总结 本文提出DP-λCGD方法,通过仅与前一迭代相关联噪声并消除部分噪声,减少内存开销,实现高效差分隐私模型训练,实验显示其精度优于DP-SGD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08420 2026-05-13 cs.LG stat.ML

Regret minimization in Linear Bandits with offline data via extended D-optimal exploration

通过扩展D-最优探索实现线性老虎机中离线数据的后悔最小化

Sushant Vijayan, Arun Suggala, Karthikeyan Shanmugam, Soumyabrata Pal

机构 * School of Technology and Computer Science TIFR(技术与计算机科学学院 TIFR) Google Deepmind(谷歌DeepMind) Adobe Research(Adobe 研究)

AI总结 本文提出OOPE算法,利用扩展D-最优设计结合离线数据以降低在线老虎机的后悔,其有效问题维度衡量离线数据中未探索方向的数量,并在高维情况下进一步优化复杂度。

Comments Accepted to TMLR, with J2C certification, link: https://openreview.net/forum?id=4WcK8gKgCi

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00471 2026-05-13 stat.ME cs.LG

Dirichlet process mixtures of block $g$ priors for model selection and prediction in linear models

块g先验的狄利克雷过程混合用于线性模型中的模型选择和预测

Anupreet Porwal, Abel Rodriguez

机构 * Google Inc.(谷歌公司) Department of Statistics, University of Washington(华盛顿大学统计学系)

AI总结 本文提出块g先验的狄利克雷过程混合用于线性模型中的模型选择和预测,通过允许不同参数块的差异收缩并考虑预测变量的相关结构,实现了模型选择与连续收缩先验的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏