arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-05-19 至 2026-05-19 共收录 17
2605.18365 2026-05-19 cs.CV

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18190 2026-05-19 cs.LG cs.CV

Dual-Rate Diffusion: Accelerating diffusion models with an interleaved heavy-light network

双速率扩散:通过交错重-轻网络加速扩散模型

Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans

机构 * Google DeepMind Amsterdam(谷歌深Mind阿姆斯特丹) Amsterdam University of Amsterdam(阿姆斯特丹大学)

AI总结 本文提出双速率扩散方法,通过交错执行高容量上下文编码器和轻量解噪模型,加速扩散模型推理,同时保持样本质量,在ImageNet基准上实现性能与计算成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12703 2026-05-19 cs.LG

SWING: Unlocking Implicit Graph Representations for Graph Random Features

SWING: 解锁隐式图表示用于图随机特征

Alessandro Manenti, Avinava Dubey, Arijit Sehanobish, Cesare Alippi, Krzysztof Choromanski

机构 * Google Research(谷歌研究) Independent Researcher(独立研究者) Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

AI总结 SWING通过在连续空间中进行行走而非在图节点上进行行走,实现了对隐式图表示(i-graphs)中图随机特征的高效计算,其核心方法是结合随机特征和重要性采样技术的定制Gumbel-softmax采样机制,从而在不需显式图结构的情况下,提高了计算效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03797 2026-05-19 cs.LG

Manifold Random Features

流形随机特征

Ananya Parashar, Derek Long, Dwaipayan Saha, Krzysztof Choromanski

机构 * Department of Industrial Engineering and Operations Research(工业工程与运筹学系) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出了一种新的方法,通过离散化流形和最近引入的图随机特征(GRFs)技术,学习流形上的连续场,从而近似一般流形上定义的双变量函数(特别是核函数)。该方法提供了正且有界的特征,对于准确且低方差的近似至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20857 2026-05-19 cs.CL cs.AI

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

Evo-Memory:通过自演化记忆基准测试LLM代理的测试时间学习

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng

机构 * Google DeepMind(谷歌DeepMind) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出Evo-Memory,一个用于评估LLM代理自演化记忆能力的综合流基准和框架,通过构建序列任务流数据集,要求LLM在每次交互后搜索、适应和演化记忆,并在10个多样化的多轮目标导向和单轮推理与问答数据集上评估了超过十种代表性的记忆模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26745 2026-05-19 cs.LG cs.AI cs.CL stat.ML

Deep sequence models tend to memorize geometrically; it is unclear why

深度序列模型倾向于记忆几何学;不清楚为何

Shahriar Noroozizadeh, Vaishnavh Nagarajan, Elan Rosenfeld, Sanjiv Kumar

机构 * Machine Learning Department \& Heinz College, Carnegie Mellon University, Pittsburgh, PA, USA Google Research, NY, USA

AI总结 研究探讨了深度序列模型中原子事实的存储机制,发现几何记忆能编码全局关系,即使在训练中未共现的实体间也能建立联系,挑战了传统关联记忆的观点。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16042 2026-05-19 cs.AI cs.LG cs.OS

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

OSWorld-Human: 评估计算机使用代理的效率基准

Reyna Abhyankar, Qi Qi, Yiying Zhang

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) ByteDance(字节跳动) Agent S2 GTA1 Lei Jedi

AI总结 本文研究了计算机使用代理在OSWorld基准上的时间性能,发现大模型调用导致高延迟,并构建了包含人类轨迹的OSWorld Human数据集,评估发现最佳代理仍需更多步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17672 2026-05-19 cs.CL

Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

停止当推理收敛:用于推理模型的语义保留早退出

Dehai Min, Giovanni Vaccarino, Huiyi Chen, Yongliang Wu, Gal Yona, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Google Research(谷歌研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Politecnico di Milano(米兰理工学院)

AI总结 本文提出PUMA框架,通过识别推理层面的语义冗余信号,实现语义保留的早退出,从而在保持准确性和推理链完整性的同时减少token消耗。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17653 2026-05-19 cs.LG cs.AI

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge: 多后端硬件感知的神经架构搜索与无限头注意力用于边缘语言模型

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Google Research(谷歌研究)

AI总结 本文提出LLMForge,一种多后端硬件感知的神经架构搜索框架,通过无限头注意力扩展了每层注意力配置空间,并结合Forge-Former和Forge-DSE实现了高效的边缘语言模型架构搜索,最终在不同硬件子系统上获得了不同形状的架构,展示了在不同性能指标上的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08704 2026-05-19 cs.CV cs.LG

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

重新思考生成图像预训练:我们离扩大下一步像素预测还有多远?

Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

机构 * Google Deepmind(谷歌DeepMind)

AI总结 本文研究了自回归下一步像素预测的扩展特性,探讨了统一视觉模型中简单且端到端但尚未充分探索的框架。通过在32x32分辨率的图像上训练Transformer模型,评估了三个目标指标:下一步像素预测目标、ImageNet分类准确率和基于生成的完成度(通过Fr'echet距离测量)。研究发现,最优扩展策略高度依赖任务,且随着图像分辨率的增加,模型大小必须比数据量增长得更快。通过预测发现,计算能力是主要瓶颈,而非训练数据量。随着计算能力每年增长四到五倍,预计在五年内可实现像素级图像建模。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16609 2026-05-19 cs.LG cs.AI cs.CC cs.DS

Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods

先验知识使其成为可能:从次线性图算法到LLM测试时方法

Avrim Blum, Daniel Hsu, Cyrus Rashtchian, Donya Saless

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

AI总结 本文研究了测试时增强方法中先验知识与外部信息交互的理论基础,通过将多步推理建模为知识图中的s-t连通性问题,揭示了在部分先验知识下,测试时增强步骤数量与图结构之间的关系,发现当知识图中存在小组件时,增强步骤数呈平方根增长,而当知识密度超过阈值形成大组件时,增强步骤数趋于常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17177 2026-05-19 math.OC cs.LG math.ST stat.ML stat.TH

High-dimensional Limit of SGD for Diagonal Linear Networks

SGD在对角线线性网络中的高维极限

Begoña García Malaxechebarría, Courtney Paquette, Maryam Fazel, Dmitriy Drusvyatskiy

机构 * University of Washington(华盛顿大学) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) University of Washington & Amazon Inc.(华盛顿大学与亚马逊公司) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了在高维情况下,SGD在对角线线性网络中的行为,通过推导随机微分方程来近似SGD的动力学,并推导了描述迭代状态和可观测统计量时间演化的偏微分方程,最终证明了在合适参数化下,SGD动态具有全局良好定义并以指数速度收敛到零风险。

Comments 91 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16748 2026-05-19 cs.GR cs.AI cs.CV cs.LG cs.MA cs.MM

Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation

Genflow Ad Studio:一种用于品牌一致、自我纠正视频生成的复合AI架构

Debanshu Das, Lavi Nigam, Sunil Kumar Jang Bahadur, Gopala Dhar

机构 * Google(谷歌)

AI总结 本文提出Genflow Ad Studio,一种复合AI架构,通过品牌DNA提取模块和对抗性多代理质量控制循环,提高了品牌一致的视频生成效率,将合规率从42%提升到89%。

Comments 6 pages, 2 figures, 2 tables. Accepted to the ACM Conference on AI and Agentic Systems (CAIS '26). Includes demo video and code repository links

Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14381 2026-05-19 cs.LG cs.CL

NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

NodeSynth: 为AI评估的社会协同合成数据

Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang, Yanzhou Pan, Erin van Liemt, Darlene Neal, Kshitij Pancholi, Jamila Smith-Loud

机构 * Google Research USA(谷歌研究美国分公司) Google USA(谷歌美国分公司) Google Deepmind USA(谷歌深Mind美国分公司)

AI总结 NodeSynth通过结合现实证据的细粒度分类扩展,生成社会相关合成查询,提升AI模型在敏感领域评估的准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12825 2026-05-19 cs.LG cs.AI

Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

Orthrus:通过双视角扩散实现内存高效的并行令牌生成

Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Google DeepMind(谷歌DeepMind) Adobe Research(Adobe研究)

AI总结 Orthrus结合自回归大语言模型的高保真生成与扩散模型的高速并行生成,通过双视角机制实现高效推理,提升速度7.8倍且内存开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16358 2026-05-19 cs.LG cs.AI

LEAF: A Living Benchmark for Event-Augmented Forecasting

LEAF:一个用于事件增强预测的活体基准

Mingtian Tan, Mihir Parmar, Palash Goyal, Chun-Liang Li, Nanyun Peng, Thomas Hartvigsen, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Virginia(弗吉尼亚大学)

AI总结 本文提出LEAF,首个用于事件增强预测的活体基准,通过递归检索代理系统和双代理交叉验证,提供全面相关文本辅助预测,评估LLM在复杂真实场景中的预测能力。

Comments 12 tables, 6 figures, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏