arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-03-31 至 2026-03-31 共收录 10
2603.28499 2026-03-31 cs.LG cs.AI cs.GT

Next-Token Prediction and Regret Minimization

下一个标记预测与后悔最小化

Mehryar Mohri, Clayton Sanford, Jon Schneider, Kiran Vodrahalli, Yifan Wu

机构 * Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Microsoft Research(微软研究院)

AI总结 研究探讨如何在对抗性在线决策环境中利用下一个标记预测算法,分析分布是否为低后悔分布,证明无界上下文窗口下总能实现亚线性后悔,而有界上下文窗口则存在Θ(1)距离的分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13044 2026-03-31 cs.CV cs.AI

SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion

SceneAdapt: 人类运动扩散的场景感知适应

Jungbin Cho, Minsu Kim, Jisoo Kim, Ce Zheng, Laszlo A. Jeni, Ming-Hsuan Yang, Youngjae Yu, Seonjoo Kim

机构 * Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind) Seoul National University(首尔国立大学)

AI总结 本文提出SceneAdapt框架,通过运动插值和场景感知插值生成语义丰富的场景感知人类运动,无需大规模配对文本-场景-运动数据。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27414 2026-03-31 math.ST cs.AI stat.TH

Multiple-Prediction-Powered Inference

多预测驱动推断

Charlie Cowen-Breen, Alekh Agarwal, Stephen Bates, William W. Cohen, Jacob Eisenstein, Amir Globerson, Adam Fisch

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

AI总结 本文提出多预测驱动推断框架,通过优化分配资源于不同数据源,实现统计高效估计。理论证明其最小最大最优性、有限样本性能和渐近正态性,并在三个大语言模型评估场景中验证了其优于现有基线的估计误差。

Comments ICLR 2026, 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27296 2026-03-31 cs.SE cs.AI

A Multi-agent AI System for Deep Learning Model Migration from TensorFlow to JAX

面向深度学习模型从TensorFlow到JAX迁移的多智能体AI系统

Stoyan Nikolov, Bernhard Konrad, Moritz Gronbach, Niket Kumar, Ann Yan, Varun Singh, Yaning Liang, Parthasarathy Ranganathan

机构 * Google(谷歌)

AI总结 本文提出一种多智能体AI系统,用于自动迁移TensorFlow深度学习模型至JAX,通过AI规划器、协调器和程序员的协作,显著提升迁移效率,减少6.4至8倍的时间消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26954 2026-03-31 cs.LG math.ST stat.TH

High dimensional theory of two-phase optimizers

双重相优化器的高维理论

Atish Agarwala

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文研究了双重相优化器在高维线性回归中的表现,揭示了LA在信号与噪声间的平衡优于SGD,并探讨了多工件版本通过超参数调整可减少噪声,SLA通过动量叠加实现加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01608 2026-03-31 cs.AI

Evaluating and Understanding Scheming Propensity in LLM Agents

评估和理解大语言模型代理中的谋略倾向

Mia Hopman, Jannes Elstner, Maria Avramidou, Amritanshu Prasad, David Lindner

机构 * LASR Labs(LASR实验室) Google DeepMind(谷歌DeepMind)

AI总结 本文通过分解谋略激励因素,研究大语言模型代理在复杂任务中的谋略行为,发现环境因素对谋略倾向影响显著,但实际部署中需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07530 2026-03-31 cs.LG cs.DS

Compact Conformal Subgraphs

紧凑的共形子图

Sreenivas Gollapudi, Kostas Kollias, Kamesh Munagala, Aravindan Vijayaraghavan

机构 * Google Research(谷歌研究院) Department of Computer Science, Duke University(杜克大学计算机科学系) Northwestern University(西北大学)

AI总结 本文提出基于图的共形压缩框架,通过选择最小子图保留统计有效性并减少结构复杂度,实现高效共形预测与图压缩的结合,同时揭示了新的算法 regime。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏