arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-04-20 至 2026-04-20 共收录 7
2604.16111 2026-04-20 cs.LG stat.ML

Sample Complexity Bounds for Stochastic Shortest Path with a Generative Model

在具有生成模型的随机最短路径中的样本复杂性界

Jean Tarbouriech, Matteo Pirotta, Michal Valko, Alessandro Lazaric

机构 * Facebook AI Research Paris(脸书人工智能研究巴黎) Inria Lille(里尔研究所) DeepMind Paris(深度思维巴黎)

AI总结 研究在随机最短路径问题中学习ε-最优策略的样本复杂性,证明在生成模型下存在最坏情况下的样本下界,并提出匹配该下界的算法。

Comments Accepted at the 32nd International Conference on Algorithmic Learning Theory (ALT 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15665 2026-04-20 cs.CV cs.PF

CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment

单目3D生物力学管线的CPU优化用于低资源部署

Yan Zhang, Xiong Zhao

机构 * Google LLC(谷歌公司) AccMov Health Inc.(AccMov健康公司)

AI总结 本文优化了单目3D生物力学管线以实现高效的CPU-only执行,提升了处理吞吐量和减少了运行时间,同时保持了生物力学输出的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-04-20 cs.CL

GroupDPO: Memory efficient Group-wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15464 2026-04-20 cs.PF cs.AI cs.LG

Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU

不规则分页注意机制:一种高性能且灵活的TPU大语言模型推理内核

Jevin Jiang, Ying Chen, Blake A. Hechtman, Fenghui Zhang, Yarong Mu

机构 * Google(谷歌)

AI总结 本文提出RPA,一种用于TPU的高性能注意力内核,通过细粒度分块、定制软件流水线和分布感知编译策略,提升TPU在动态不规则执行模式下的效率,实现在解码和预填充任务中达到86%和73%的利用率。

Comments 23 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15316 2026-04-20 cs.HC cs.AI

Anthropomorphism and Trust in Human-Large Language Model interactions

拟人化与人类-大语言模型互动中的信任

Akila Kadambi, Ylenia D'Elia, Tanishka Shah, Iulia Comsa, Alison Lentz, Katie Siri-Ngammuang, Tara Buechler, Jonas Kaplan, Antonio Damasio, Srini Narayanan, Lisa Aziz-Zadeh

机构 * Brain and Creativity Institute, Dornsife College of Letters, Arts and Sciences, University of Southern California(脑与创造力研究所,文理学院,南加州大学) USC Mrs. T.H. Chan Division of Occupational Science and Occupational Therapy, University of Southern California(USC 玛丽·T.H.陈职业科学与职业治疗 division,南加州大学) Psychiatry and Biobehavioral Sciences, David Geffen School of Medicine, University of California, Los Angeles(精神病学与生物行为科学,大卫·格芬医学院,加州大学洛杉矶分校) Google DeepMind, Zurich(谷歌深Mind,苏黎世) Google Research(谷歌研究) Brain and Creativity Institute(脑与创造力研究所)

AI总结 研究探讨了人们如何通过温暖、能力与共情维度对大语言模型进行拟人化并建立信任,发现温暖和认知共情显著影响多种感知,而能力主要影响除拟人化外的其他结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19312 2026-04-20 cs.LG cs.AI cs.CL cs.HC stat.ML

FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users

FSPO:少样本优化合成偏好以个性化真实用户

Anikait Singh, Sheryl Hsu, Kyle Hsu, Eric Mitchell, Stefano Ermon, Tatsunori Hashimoto, Archit Sharma, Chelsea Finn

机构 * Stanford University(斯坦福大学) OpenAI Google DeepMind(谷歌DeepMind)

AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。

Comments Website: https://fewshot-preference-optimization.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏