arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-05-29 至 2026-05-29 共收录 20
2605.30324 2026-05-29 cs.DS cs.AI cs.CL cs.LG stat.ML

On Language Generation in the Limit with Bounded Memory

有界记忆下的极限语言生成

Jon Kleinberg, Anay Mehrotra, Amin Saberi, Grigoris Velegkas

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学) Google Research(谷歌研究)

AI总结 研究有界记忆下语言生成的极限问题,通过组合界和滑动窗口分析记忆约束对可生成性、密度和识别的影响。

Comments The abstract has been shortened to fit within the arXiv limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30322 2026-05-29 cs.LG cs.AI

Gram: Assessing sabotage propensities via automated alignment auditing

Gram:通过自动化对齐审计评估破坏倾向

David Lindner, Victoria Krakovna, Sebastian Farquhar

机构 * Google(谷歌)

AI总结 提出Gram框架,通过模拟17种代理部署场景自动审计AI代理的破坏倾向,发现Gemini模型在约2-3%的轨迹中存在不当行为,并引入调查代理管道以识别驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30311 2026-05-29 cs.CV cs.AI

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30174 2026-05-29 cs.CV

LiveSVG: Zero-Shot SVG Animation via Video Generation

LiveSVG:通过视频生成的零样本SVG动画

Matan Levy, Ran Margolin, Bar Cavia, Dvir Samuel, Yael Pritch, Shmuel Peleg, Alex Rav Acha, Ariel Shamir, Dani Lischinski

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学) Reichman University(雷赫曼大学)

AI总结 提出LiveSVG方法,利用视频扩散模型直接拟合目标视频实现零样本SVG动画,无需骨架或类别先验,通过双层运动表示和球体填充重着色策略解决复杂运动与颜色歧义问题。

Comments Project Page: https://levymsn.github.io/LiveSVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30126 2026-05-29 cs.CV cs.AI cs.CL cs.LG

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

PARCEL: 基于池锚定的条件弹性查询重采样以实现高效视觉-语言理解

Selim Kuzucu, Alessio Tonioni, Vasile Lup, Bernt Schiele, Federico Tombari, Muhammad Ferjad Naeem

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所) Google(谷歌)

AI总结 提出PARCEL视觉分词架构,通过池锚定和条件弹性查询重采样解决视觉令牌压缩中的空间与查询表示冲突,在27个基准上提升性能-效率帕累托前沿。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29963 2026-05-29 cs.CR cs.AI cs.LG

Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

Honeyval: 基于LLM的HTTP蜜罐综合评估框架

Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Google DeepMind(谷歌DeepMind) AI Sequrity Company(AI安全公司) Independent(独立)

AI总结 提出Honeyval评估框架,通过16个后端应用、AI攻击代理、控制任务和可验证利用目标,系统评估LLM驱动的HTTP蜜罐,发现其相比规则基线能显著延长攻击交互、降低被前沿模型检测率,且保持成本优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29859 2026-05-29 eess.AS cs.CL

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

MELD: 基于梅尔频谱的离散潜变量语音语言建模

Sung-Lin Yeh, Wei Zhou, Gil Keren, Duc Le, Zhong Meng, Hao Tang, Jay Mahadeokar, Ozlem Kalinli, Alexandre Mourachko

机构 * University of Edinburgh(爱丁堡大学) Google DeepMind(谷歌DeepMind) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 提出一种在梅尔频谱上联合优化编码器和语音语言模型的离散潜变量模型,在零样本文本转语音和语音转文本任务上优于基于编解码器和其他梅尔频谱基线,并缓解了自回归建模中的长时间静音和单词遗漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29786 2026-05-29 cs.AI

Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations

Croissant Tasks:一种用于可重复机器学习评估的元数据格式

Omar Benjelloun, Leonardo Martins Bianco, Isabelle Guyon, Thanh Gia Hieu Khuong, Jonathan Lebensold, Sebastian Lobentanzer, Luis Oala, Benedictus Kent Rachmat, Ihsan Ullah, Peyman Vahidi, Joaquin Vanschoren

机构 * Google DeepMind(谷歌DeepMind) ChaLearn Université Paris-Saclay(巴黎-萨克雷大学) Jetty Mila, Quebec AI Institute(魁北克AI研究所) Inst. of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) German Center for Diabetes Research(德国糖尿病研究中心) School of CIT, TUM(技术大学 CIT 学校) Helmholtz AI(海德堡人工智能研究所) Brickroad Eindhoven Univ. of Technology(埃因霍温技术大学)

AI总结 提出Croissant Tasks元数据格式,通过声明式规范解耦任务问题与解决方案,结合自动化LLM管道实现概念可重复性,使自主代理能从零生成可复现的评估流水线。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29645 2026-05-29 cs.LG cs.AI stat.ML

The Sample Complexity of Multiclass and Sparse Contextual Bandits

多类别和稀疏上下文赌博机的样本复杂度

Liad Erez, Fan Chen, Alon Cohen, Tomer Koren, Yishay Mansour, Shay Moran, Alexander Rakhlin

机构 * Tel Aviv University(特拉维夫大学) Massachusetts Institute of Technology(麻省理工学院) Google Research Tel Aviv(谷歌研究特拉维夫) Technion—Israel Institute of Technology(技术学院—以色列理工学院)

AI总结 针对随机i.i.d.上下文赌博机,提出基于决策估计系数和低方差探索的算法,在稀疏奖励下实现接近最优的样本复杂度,并匹配下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29613 2026-05-29 eess.AS cs.SD

Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

基于扩散的ASR解码策略:基于置信度阈值的系统评估

Jeong Hun Yeo, Minsu Kim, Hyeongseop Rha, Yong Man Ro

机构 * KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

AI总结 本文系统评估了基于扩散语言模型的ASR中三种解码策略,提出使用基于负对数似然的不确定性度量来监控解码进度,发现基于阈值的策略在准确率和速度上均优于固定步数策略,其中静态阈值策略在匹配自回归解码准确率的同时具有更高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29505 2026-05-29 cs.CV

ESAM++: Efficient Online 3D Perception on the Edge

ESAM++:边缘上的高效在线3D感知

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco

机构 * Stanford University(斯坦福大学) Google(谷歌) UC San Diego(圣地亚哥大学)

AI总结 提出ESAM++,一种轻量级可扩展的在线3D场景感知方法,通过3D稀疏特征金字塔网络(SFPN)在边缘设备上实现高效、准确的3D实例分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-05-29 cs.SE cs.AI cs.HC

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29136 2026-05-29 cs.CV cs.LG

Eulerian Gaussian Splatting using Hashed Probability Pyramids

使用哈希概率金字塔的欧拉高斯溅射

Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

AI总结 提出一种基于概率溅射的辐射场框架,用梯度优化的体积概率密度替代启发式操作,通过多尺度哈希网格实现端到端优化,在mip-NeRF 360上达到SOTA重建质量并保持3DGS渲染速度。

Comments CVPR 2026. Project Page: https://euleriansplatting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28961 2026-05-29 stat.ML cs.LG math.OC

Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions

高维稀疏更新下随机动量的动力学

Katie Everett, Elliot Paquette

机构 * Google DeepMind & MIT(谷歌DeepMind及麻省理工学院) McGill University & Mila(麦吉尔大学及MILA)

AI总结 本文通过最小二乘和逻辑回归模型,理论分析了稀疏更新下动量的动力学,揭示了由动量保留时间尺度与学习时间尺度之比决定的相结构,并发现不同令牌稀疏度下的振荡动力学存在谱冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23993 2026-05-29 cs.CV cs.AI cs.LG

Nano World Models: A Minimalist Implementation of Future Video Prediction

纳米世界模型:未来视频预测的极简实现

Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Kaiwen Geng, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

机构 * DeepMind

AI总结 提出Nano World Models,一个基于扩散强迫的极简代码库,用于未来视频预测,支持可控研究世界模型的设计选择,并通过实验分析预测参数化、架构规模等因素对视频预测质量的影响。

Comments Project page: https://simchowitzlabpublic.github.io/nano-world-model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00377 2026-05-29 cs.LG

Improving Full Waveform Inversion in Large Model Era

在大模型时代改进全波形反演

Yinan Feng, Peng Jin, Yuzhe Guo, Yinpeng Chen, Youzuo Lin

机构 * School of Data Science and Society(数据科学与社会学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The Pennsylvania State University(宾夕法尼亚州立大学) Google DeepMind(谷歌DeepMind)

AI总结 提出通过协调缩放模型容量、数据多样性和训练策略,使十亿参数模型在简单合成数据上训练后能泛化到复杂地质结构,在OpenFWI等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24606 2026-05-29 cs.CL

Long-Context Modeling with Dynamic Hierarchical Sparse Attention for Memory-Constrained LLM Inference

基于动态层次稀疏注意力的内存受限大语言模型长上下文建模

Siheng Xiong, Joe Zou, Faramarz Fekri, Yae Jee Cho

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌)

AI总结 提出动态层次稀疏注意力(DHSA),通过在线预测注意力稀疏性并保持LLM骨干冻结,在内存受限下实现高效长上下文推理,精度接近密集注意力且速度提升显著。

Comments ICML26 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16060 2026-05-29 cs.LG cs.AI stat.ME stat.ML

Beyond Accuracy: Are Time Series Foundation Models Well-Calibrated?

超越准确性:时间序列基础模型是否良好校准?

Coen Adler, Yuxin Chang, Felix Draxler, Samar Abdi, Padhraic Smyth

机构 * Department of Computer Science(计算机科学系) Department of Statistics(统计学系) Google, Irvine(谷歌(伊文斯堡))

AI总结 本文系统评估了五个时间序列基础模型和两个基线的校准特性,发现基础模型校准优于基线且无系统性过度自信或信心不足。

Comments Published as a conference paper at ICLR 2026

Journal ref Proceedings of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07977 2026-05-29 cs.CV

Gaga: Group Any Gaussians via 3D-aware Memory Bank

Gaga: 通过3D感知记忆库分组任意高斯体

Weijie Lyu, Xueting Li, Abhijit Kundu, Yi-Hsuan Tsai, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) NVIDIA Research(英伟达研究) Google DeepMind(谷歌DeepMind) Atmanity Inc.(Atmanity公司)

AI总结 提出Gaga框架,利用零样本类别无关分割模型预测的不一致2D掩码,通过3D感知记忆库关联不同视角下的物体掩码,实现开放世界3D场景的重建与分割。

Comments TMLR Camera-Ready Version. Project Page: https://weijielyu.github.io/Gaga

详情

展开后加载摘要…

URL PDF HTML 收藏