arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-10 至 2026-08-10 共收录 6
2608.07418 2026-08-10 cs.AI cs.CL 新提交

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06704 2026-08-10 cs.AI cs.HC 新提交

WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

WebRider:面向实时网络辅助的角色条件意图控制器

Zhi Li, Tao Zhou, Yeqing Li, Eugene Ie, Demetri Terzopoulos

机构 * Google(谷歌公司)

AI总结 WebRider提出角色条件意图控制器,将网络任务委托策略形式化为意图契约,通过分层架构实现,经RiderBench基准测试,提升实时网络智能体的策略遵守度与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05127 2026-08-10 cs.LG cs.AI stat.ML 版本更新

SSTQ:Privacy-Preserving Vector Quantization via Subsampled Stochastic TurboQuant

SSTQ:基于子采样随机 TurboQuant 的隐私保护向量量化

Adel Javanmard, David P. Woodruff, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究针对分布式优化中隐私保护与通信成本的矛盾,提出 SSTQ 框架,实现了更优的均方误差缩放,在联邦学习任务中展现出良好效用与通信效率。

Comments 42 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04754 2026-08-10 cs.LG 版本更新

Beyond Structural Symmetries: Linear Mode Connectivity via Neuron Identifiability

超越结构对称性:通过神经元可辨识性实现线性模式连通性

Vincent Bürgin, Daniel Herbst, Ya-Wei Eileen Lin, Stefanie Jegelka

机构 * DeepMind, London, UK(伦敦英国深Mind公司) University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过提出有效函数类理论框架并形式化神经元可辨识性,揭示了神经网络中即使结构不对称也存在大量近似等价解,并展示了神经元可辨识性如何无需先验对齐即可实现表示合并及线性低损失路径。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15422 2026-08-10 cs.LG 版本更新

DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts

DualKV: 面向高效RL训练的共享提示Flash注意力机制,支持大规模展开和长上下文

Jiading Gai, Shuai Zhang, Xiang Song, Bernie Wang, George Karypis

机构 * Amazon Web Services(亚马逊网络服务) Google(谷歌) University of Minnesota(明尼苏达大学)

AI总结 针对RL训练中共享提示重复计算问题,提出DualKV内核,通过融合CUDA前向/反向核和veRL数据流水线重排,消除提示复制,实现1.63-3.82倍策略更新加速。

详情

展开后加载摘要…

URL PDF HTML 收藏