arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-06-02 至 2026-06-02 共收录 22
2606.02294 2026-06-02 cs.LG

Regularized Large Neighborhood Search

正则化大邻域搜索

Germain Vivier-Ardisson, Laurent Demonet, Axel Parmentier, Mathieu Blondel

机构 * Google DeepMind(谷歌DeepMind) CERMICS Paris, France(巴黎CERMICS研究所) ENPC, CNRS, IPP Marne-la-Vallée, France(巴黎-马恩拉瓦尔大学、国家科学研究中心、IPP马恩拉瓦尔分校) Google Research Paris, France(巴黎谷歌研究)

AI总结 提出正则化大邻域搜索(RLNS),将LNS启发式转化为MCMC采样器,实现无需全局求解器的端到端学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01672 2026-06-02 cs.LG

RDA: Reward Design Agent for Reinforcement Learning

RDA:用于强化学习的奖励设计智能体

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度Mind)

AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。

Comments Accepted to RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01213 2026-06-02 cs.CV cs.AI cs.CL

TECCI: Tricky Edits of Collected and Curated Images

TECCI:收集与策划图像的棘手编辑

Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

AI总结 提出TECCI基准,包含7550对图像与编辑指令,通过人工与自动评估揭示现有图像编辑模型在指令遵循、最小编辑和视觉质量方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00962 2026-06-02 cs.CR cs.AI

SS-ZKR: Spatial-Semantic Zero-Knowledge Routing for Privacy-Preserving Multi-Agent Collaboration

SS-ZKR:面向隐私保护多智能体协作的空间语义零知识路由

Hassan Touheed

机构 * Linux Foundation(Linux基金会) Google(谷歌) W3C(万维网联盟)

AI总结 提出SS-ZKR协议,通过差分隐私语义意图向量、自适应净化和空间到密码策略编译器三种机制,在不解密负载的情况下实现跨组织信任边界的内容感知语义路由。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00442 2026-06-02 cs.LG math.OC stat.ML

Exploiting weight-space symmetries for approximating curvature

利用权重空间对称性近似曲率

Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

机构 * DeepMind, London, UK(伦敦DeepMind)

AI总结 本文通过解析平均化保持损失不变的群作用,从单个梯度构建结构化的Hessian近似,从而利用权重空间对称性来近似损失函数的曲率。

Comments Published at ICML 2026. 35 pages, 11 figures. Code: https://github.com/mtkresearch/symm_opt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00439 2026-06-02 cs.CV

Physical Object Understanding with a Physically Controllable World Model

基于物理可控世界模型的物理对象理解

Rahul Venkatesh, Klemen Kotar, Lilian Naing Chen, Wanhee Lee, Gia Ancone, Seungwoo Kim, Luca Thomas Wheeler, Jared Watrous, Honglin Chen, Daniel Bear, Stefan Stojanov, Daniel LK Yamins

机构 * Stanford University(斯坦福大学) OpenAI(开放人工智能公司) Noetik Inc.(Noetik公司) Google(谷歌)

AI总结 提出一类概率世界模型,通过自回归序列建模高效训练,从视频中推断对象及其物理交互,实现对象发现、3D操控和物理关系计算。

Comments CVPR 2026 Highlight. Project page at: https://neuroailab.github.io/psi-website/blog.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00136 2026-06-02 cs.LG cs.AI cs.CL cs.CR cs.SI

Generative AI and Digital Ecosystem Resilience: A Proactive Lifecycle-Based Survey

生成式AI与数字生态系统韧性:基于生命周期的主动式综述

Jonghyun Chung, Rishabh Chaddha, Sanket Badhe, Debanshu Das, Nathan Huang, Amanpreet Kaur

机构 * Google LLC(谷歌有限公司)

AI总结 本文采用基于生命周期的C5交互模型,综合机器学习与社会科学方法,系统综述了针对生成式AI驱动的对抗性合成内容的主动检测技术,包括协调不真实行为分析、流行病学建模和霍克斯过程等,旨在构建更具韧性的信息生态系统。

Comments 14 pages, 3 figures, 3 tables. Accepted for publication in IEEE Access (May 2026)

Journal ref IEEE Access (2026) IEEE Access (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00131 2026-06-02 cs.SE cs.AI cs.LG cs.PL

AI-PROPELLER: Warehouse-Scale Interprocedural Code Layout Optimization with AlphaEvolve

AI-PROPELLER:基于AlphaEvolve的仓库规模过程间代码布局优化

Chaitanya Mamatha Ananda, Rajiv Gupta, Mircea Trofin, Aiden Grossman, Sriraman Tallam, Xinliang David Li, Amir Yazdanbakhsh

机构 * University of California, Riverside(加州大学河滨分校) Google(谷歌) DeepMind(深度思维)

AI总结 提出AI-PROPELLER系统,利用Magellan智能工作流将Propeller的编译器启发式方法演化为细粒度过程间优化器,并通过实际硬件执行评估布局变体,首次在工业仓库规模应用中实现细粒度过程间代码布局优化,性能提升0.23%至1.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00111 2026-06-02 eess.IV cs.CV cs.LG

ChWDTA: Channel-wise Wavelet-Domain Transformer Attention and Entropy Modeling for Learned Image Compression

ChWDTA:用于学习图像压缩的通道级小波域变换器注意力和熵建模

Haisheng Fu, Runyu Yang, Feng Ding, Siyu Zhu, Jie Liang, Xiaoxiao Li, Zhenman Fang, Jingning Han

机构 * Electrical and Computer Engineering Department, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) School of Engineering Science, Simon Fraser University(西蒙弗雷泽大学工程科学学院) School of Electronic Science and Technology, Eastern Institute of Technology(电子科学与技术学院,东部技术学院) Google LLC(谷歌公司)

AI总结 提出通道级小波域变换器注意力(ChWDTA)和通道级小波包分解,在混合CNN-Transformer图像压缩框架中提升率失真性能,在多个测试集上实现显著BD-rate降低。

Comments 13 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08193 2026-06-02 cs.CV cs.AI

Normalization Equivariance for Arbitrary Backbones, with Application to Image Denoising

任意骨干网络的归一化等变性及其在图像去噪中的应用

Youssef Saied, François Fleuret

机构 * University of Cambridge(剑桥大学) DeepMind

AI总结 提出无参数包装器WNE,通过输入归一化、任意骨干网络处理、输出反归一化实现归一化等变,在盲去噪中提升CNN和Transformer对噪声水平失配的鲁棒性且无GPU开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09883 2026-06-02 cs.CV cs.AI

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

笛卡尔捷径:在极坐标空间中重新评估视觉推理

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09474 2026-06-02 cs.LG

Online Learning in MDPs with Partially Adversarial Transitions and Losses

具有部分对抗性转移和损失的MDP中的在线学习

Ofir Schlisselberg, Tal Lancewicki, Yishay Mansour

机构 * Tel Aviv University(特拉维夫大学) Meta AI Google Research(谷歌研究院)

AI总结 研究转移函数在大多数步骤随机但在每回合固定Λ个步骤可对抗的MDP中的强化学习,提出条件占用度量并设计两种算法,分别处理任意对抗步骤和连续对抗步骤,并给出全对抗设置下的遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20806 2026-06-02 cs.AI

Safety Alignment of LMs via Non-cooperative Games

通过非合作博弈实现语言模型的安全对齐

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03554 2026-06-02 cs.LG cs.AI cs.CE cs.CL

When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs

当单一答案不够时:重新思考面向大语言模型的单步逆合成基准

Bogdan Zagribelnyy, Ivan Ilin, Maksim Kuznetsov, Nikita Bondarev, Mathieu Reymond, Roman Schutski, Thomas MacDougall, Rim Shayakhmetov, Zulfat Miftakhutdinov, Mikolaj Mizera, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * DeepMind, London, UK(伦敦英国深度思维公司)

AI总结 针对现有逆合成基准依赖单一真实答案的局限,提出基于化学合理性度量ChemCensor的新评估框架,并构建数据集CREED训练模型以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08038 2026-06-02 cs.CL cs.AI

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

AblationBench:评估实证AI研究中消融实验的自动规划

Talor Abramovich, Gal Chechik

机构 * Google Research(谷歌研究)

AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。

Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14364 2026-06-02 cs.CV

Unified Semantic Transformer for 3D Scene Understanding

统一语义Transformer用于3D场景理解

Sebastian Koch, Johanna Wald, Hidenobu Matsuki, Pedro Hermosilla, Timo Ropinski, Federico Tombari

机构 * Ulm University(乌尔姆大学) Google(谷歌) TU Vienna(维也纳技术大学) TU Munich(慕尼黑技术大学)

AI总结 提出UNITE,一个统一的语义Transformer,通过端到端训练从RGB图像直接预测多种密集语义属性,实现3D场景理解,并在多个任务上达到最先进性能。

Comments Accepted at TMLR. Project page: https://unite-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14904 2026-06-02 cs.CV cs.AI cs.LG

CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects

CaptionFormer:时空对象的统一分割、跟踪与描述

Gabriel Fiastre, Antoine Yang, Cordelia Schmid

机构 * Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学院、国家科学研究中心、巴黎综合理工研究所) Google DeepMind(谷歌DeepMind)

AI总结 提出 CaptionFormer 模型,通过利用 VLM 生成合成描述并扩展数据集,实现视频中对象轨迹的联合检测、分割、跟踪与描述,在三个基准上达到最优。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24078 2026-06-02 cs.CV

Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification

超越对象:面向细粒度分类的上下文合成数据生成

William Yang, Xindi Wu, Zhiwei Deng, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 提出BOB微调策略,通过提取并条件化类不可知属性(如场景背景和物体姿态)来缓解过拟合,提升细粒度分类中合成训练数据的质量,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05359 2026-06-02 cs.CV cs.AI cs.CY

Agricultural Landscape Understanding At Country-Scale

国家级农业景观理解

Radhika Dua, Aditi Agarwal, Aishwarya Jayagopal, Depanshu Sani, Alex Wilson, Hoang Tran, Ishan Deshpande, Bogdan Floristean, Neelabh Goyal, Ramya Cheruvu, Vishal Batchu, Yan Mayster, Gaurav Aggarwal, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌)

AI总结 提出首个国家级农业制图系统,通过新颖的后处理启发式方法实现田地、树木和水体的实例分割,并在全国范围内部署验证。

Comments 32 pages, 11 tables, 22 figs

详情

展开后加载摘要…

URL PDF HTML 收藏