arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-05-26 至 2026-05-26 共收录 16
2605.26111 2026-05-26 cs.CV cs.AI cs.GR cs.LG cs.MM

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

从多模态大语言模型中榨取能力用于主题驱动生成

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Adobe(Adobe公司) Google(谷歌公司)

AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。

Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21602 2026-05-26 cs.AI cs.SE

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

基准测试与改进LLMs中的分布外对齐失败监控器

Dylan Feng, Pragya Srivastava, Anca Dragan, Cassidy Laidlaw

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Haize Labs, New York, USA(Haize实验室) Google DeepMind, India(谷歌DeepMind)

AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17234 2026-05-26 cs.LG

Active Budget Allocation for Efficient Scaling Law Estimation via Surrogate-Guided Pruning

通过代理引导剪枝实现高效缩放定律估计的主动预算分配

Viktoria Schram, Markus Hiller, Daniel Beck, Trevor Cohn

机构 * The School of Computing and Information Systems, the University of Melbourne, Melbourne, Australia(墨尔本大学计算与信息系统学院) Royal Melbourne Institute of Technology, Melbourne, Australia(皇家墨尔本理工学院) Now at Google Australia(现就职于谷歌澳大利亚)

AI总结 提出结合连续减半与参数/非参数代理模型的主动预算分配方法,在显著降低计算成本(节省高达98.7%)的同时获得更优的损失-计算量前沿,实现精确的缩放定律估计。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15605 2026-05-26 cs.LG stat.ML

Autoregressive Language Models are Secretly Energy-Based Models: Insights into the Lookahead Capabilities of Next-Token Prediction

自回归语言模型实际上是能量模型:对下一个词元预测的预见能力的洞察

Mathieu Blondel, Michael E. Sander, Germain Vivier-Ardisson, Tianlin Liu, Vincent Roulet

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文通过建立自回归模型与能量模型之间的双射,揭示了自回归模型在下一个词元预测范式下具备预见能力,并提供了理论误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19065 2026-05-26 cs.CV cs.AI cs.LG

Understanding, Accelerating, and Improving MeanFlow Training

理解、加速和改进MeanFlow训练

Jin-Young Kim, Hyojun Go, Lea Bogensperger, Julius Erbach, Nikolai Kalischek, Federico Tombari, Konrad Schindler, Dominik Narnhofer

机构 * Yonsei University(延世大学) ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Max Planck ETH CLS(马克斯·普朗克ETH CLS) Google(谷歌)

AI总结 通过分析瞬时速度与平均速度的相互作用,提出一种加速瞬时速度形成并逐步转移训练重点的有效训练方案,实现更快的收敛和更优的少步生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03548 2026-05-26 cs.LG

Flat Minima and Generalization: Insights from Stochastic Convex Optimization

平坦极小值与泛化:来自随机凸优化的见解

Matan Schliserman, Shira Vansover-Hager, Tomer Koren

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(塔夫茨大学Blavatnik计算机科学与人工智能学院) Google Research(谷歌研究)

AI总结 本文在随机凸优化框架下研究平坦极小值与泛化的关系,发现平坦经验极小值可能产生Ω(1)的总体风险,而尖锐极小值泛化最优,并证明两种锐度感知算法(SA-GD和SAM)也可能泛化不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20025 2026-05-26 cs.AI

AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration

AutoResearchClaw: 基于人机协作的自我强化自主研究

Jiaqi Liu, Shi Qiu, Mairui Li, Bingzhou Li, Haonian Ji, Siwei Han, Xinyu Ye, Peng Xia, Zihan Dong, Meng Chen, Congyu Zhang, Letian Zhang, Guiming Chen, Haoqin Tu, Xinyu Yang, Lu Feng, Xujiang Zhao, Haifeng Chen, Jiawei Zhou, Xiao Wang, Weitong Zhang, Hongtu Zhu, Yun Li, Jieru Mei, Hongliang Fei, Jiaheng Zhang, Linjie Li, Linjun Zhang, Yuyin Zhou, Sheng Wang, Caiming Xiong, James Zou, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * Carnegie Mellon University(卡内基梅隆大学) Rutgers University(罗格斯大学) NEC Labs America(NEC美国实验室) Meta Stanford University(斯坦福大学) Google(谷歌公司) University of Washington(华盛顿大学)

AI总结 提出AutoResearchClaw多智能体自主研究系统,通过结构化辩论、自愈执行、可验证报告、七种人机协作模式和跨运行进化机制,在ARC-Bench基准上比AI Scientist v2提升54.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16778 2026-05-26 cs.LG cs.AI

Federation over Text: Insight Sharing for Multi-Agent Reasoning

文本上的联邦:多智能体推理的洞察共享

Dixi Yao, Tahseen Rabbani, Manzil Zaheer, Tian Li

机构 * University of Chicago(芝加哥大学) Google DeepMind(谷歌DeepMind)

AI总结 提出一种类似联邦学习的框架FoT,通过迭代聚合多个客户端的本地推理过程,构建跨任务元认知洞察库,无需共享问题实例或任务指令,显著提升推理效果和效率。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23164 2026-05-26 cs.LG

Stochastic Linear Bandits with Parameter Noise

带有参数噪声的随机线性赌博机

Daniel Ezer, Alon Peled-Cohen, Yishay Mansour

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

AI总结 研究带有参数噪声的随机线性赌博机模型,提出一种简单的探索-利用算法,实现了与下界匹配(对数因子内)的遗憾界,并揭示了与经典加性噪声模型不同的最优遗憾阶。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18508 2026-05-26 stat.ME cs.AI cs.SY eess.SP eess.SY

Selection-Induced Contraction of Innovation Statistics in Gated Kalman Filters

门控卡尔曼滤波中创新统计量的选择诱导收缩

Barak Or

机构 * metaor artificial intelligence(metaor人工智能) Google Reichman Tech School(谷歌Reichman技术学校) Reichman University(Reichman大学)

AI总结 本文证明在门控卡尔曼滤波中,经过门控后的创新统计量收敛于门控条件而非名义量,并推导了椭球门控下创新的一阶和二阶矩的精确表达式,揭示了门控引起的确定性协方差收缩,并扩展至最近邻关联分析。

Comments 9 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24381 2026-05-26 cs.LG cs.AI stat.AP stat.ML

Assessing the Operational Viability of Foundation Models for Time Series Forecasting

评估基础模型在时间序列预测中的操作可行性

Kavin Soni, Debanshu Das, Vamshi Guduguntla

机构 * Google, USA(谷歌公司,美国)

AI总结 通过对比基础模型与监督学习方法在四种操作场景下的性能,提出基于经验特征的复杂度路由器以实现精度与效率的平衡。

Comments 21 pages, 8 Figures, Code available at [https://github.com/kavin-soni/timeseries-zeroshot-eval]

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24357 2026-05-26 cs.LG

Refined Analysis of Entropy-Regularized Actor-Critic

熵正则化演员-评论家的精细化分析

Safwan Labbi, Paul Mangold, Daniil Tiapkin, Eric Moulines

机构 * CMAP, CNRS, École Polytechnique, Institut Polytechnique de Paris, 91120 Palaiseau, France(法国巴黎政治学院CMAP、国家科学研究中心、巴黎政治学院、巴黎理工学院、法国Palaiseau) Université Paris-Saclay, CNRS, LMO, 91405, Orsay, France. Now at Google DeepMind.(巴黎萨克雷大学、国家科学研究中心、LMO、法国Orsay、现就职于DeepMind) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学)

AI总结 本文精细化分析了熵正则化有限折扣环境中演员-评论家算法中评论家的作用,证明精确评论家可强方差缩减,使随机梯度演员-评论家达到与确定性策略梯度相同的样本复杂度,并指出评论家误差足够小时方差缩减和快速收敛得以保持,强调了准确评论家估计的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24278 2026-05-26 cs.LG

Fourier Feature Pyramids for Physics-Informed Neural Networks

面向物理信息神经网络的傅里叶特征金字塔

Brandon Zhao, Yixuan Wang, Jonathan T. Barron, Katherine L. Bouman, Dor Verbin, Pratul P. Srinivasan

机构 * Department of Computing and Mathematical Sciences, California Institute of Technology(计算与数学科学部,加州理工学院) Cahill Center for Astronomy and Astrophysics, California Institute of Technology(天文与天体物理中心,加州理工学院) Google DeepMind(谷歌DeepMind)

AI总结 提出一种名为beignet的多分辨率傅里叶特征金字塔架构,通过可训练的特征网格和傅里叶插值,结合链式法则与FFT高效计算空间导数,以更少的参数实现比现有PINN方法更高的求解精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22809 2026-05-26 cs.CV

Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

Sensor2Sensor: 自动驾驶的跨本体传感器转换

Jiahao Wang, Bo Sun, Yijing Bai, Vincent Casser, Songyou Peng, Zehao Zhu, Meng-Li Shih, Xander Masotto, Shih-Yang Su, Kanaad V Parvate, Tiancheng Ge, Linn Bieske, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

AI总结 提出Sensor2Sensor生成模型,将单目行车记录仪视频转换为多模态传感器数据(多视角相机图像和LiDAR点云),通过4D高斯泼溅重建和扩散架构解决无配对数据问题,为自动驾驶开发解锁外部数据源。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14180 2026-05-26 cs.CV

Spherical Voronoi: Directional Appearance as a Differentiable Partition of the Sphere

球面Voronoi:作为球面可微分划分的定向外观

Francesco Di Sario, Daniel Rebain, Dor Verbin, Marco Grangetto, Andrea Tagliasacchi

机构 * University of Torino(都灵大学) Simon Fraser University(西蒙弗雷泽大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind)

AI总结 提出球面Voronoi(SV)作为3D高斯泼溅中外观表示的统一框架,通过可学习区域划分实现视图依赖效果,在反射建模上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏