arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-06-09 至 2026-06-09 共收录 9
2606.09758 2026-06-09 cs.RO cs.AI cs.LG 新提交

Difference-Aware Retrieval Policies for Imitation Learning

差异感知的模仿学习检索策略

Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Toyota Research Institute(丰田研究所) Google DeepMind(谷歌DeepMind) Mila

AI总结 提出DARP,一种半参数检索式模仿学习方法,通过基于k近邻的局部邻域结构重参数化,解决行为克隆的分布外泛化问题,在连续控制和机器人操作任务中性能提升15-46%。

Comments 12 pages, 7 figures, 3 tables. Accepted to ICLR 2026. Code and demos available at https://weirdlabuw.github.io/darp-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09748 2026-06-09 cs.AI cs.CL cs.LG 新提交

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

深度研究智能体在过程级反馈下的多轮评估

Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

机构 * Google DeepMind(谷歌DeepMind) OpenAI Perplexity AI LangChain AI

AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。

Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09408 2026-06-09 cs.CY cs.AI cs.HC 新提交

Can Data Work be Reparative?

数据工作能否具有修复性?

Srravya Chandhiramowuli, Ding Wang, Alex Taylor

机构 * University of Edinburgh(爱丁堡大学) Google Research(谷歌研究院)

AI总结 通过民族志研究,探讨公民科技倡议如何从女性主义视角协作构建安全数据集,旨在将数据工作重塑为修复与补救的场所,并分析其中遇到的挑战与张力。

Comments To be presented at ACM FAccT, Montréal, Canada, June 25 to June 28, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08969 2026-06-09 cs.CL cs.AI 新提交

CARE: A Conformal Safety Layer for Medical Summarization

CARE:面向医学摘要的保形安全层

Suhana Bedi, Bridget Lin, Anson Y. Zhou, Chloe O. Stanwyck, Jenelle A. Jindal, Sanmi Koyejo, David Stutz, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 提出CARE方法,通过保形风险控制为LLM医学摘要提供校准的遗漏和幻觉标记,在保证安全性的同时减少审查负担。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08777 2026-06-09 cs.LG cs.AI 新提交

How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects

需要多少反事实?通过电路和因果效应探究VLM幻觉

Abhivansh Gupta, Simardeep Singh, Advika Sinha, Shreyansh Modi, Akshat Tomar

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

AI总结 本文通过定义基于对数概率差异的因果影响度量,并利用电路发现技术,研究视觉语言模型幻觉输出的反事实鲁棒性,推导出检测不稳定所需的最小反事实样本数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08634 2026-06-09 cs.CV 新提交

SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders

SSAFE: 通过冻结视觉编码器实现简单而强大的AI生成图像检测

Seunghyun Lee, Byoungkwon Kim, Jaehyun Nam, Kyungmin Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Google Cloud AI(谷歌云AI)

AI总结 本文发现冻结的多模态视觉编码器在嵌入空间中自然分离真实与合成图像,通过线性分类器即可实现强检测性能,并提出一种表示感知的数据策展策略,仅用10K图像训练,在多个基准上表现优异。

Comments Preprint. 22 pages, 10 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08036 2026-06-09 cs.IR cs.AI cs.CL 新提交

GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

GIScholarBench: 在GIS研究中评估大语言模型的过度自信

Zongrng Li, Mingzheng Yang, Lei Zou, Hongxu Ma, Hao Tian, Siqi Zhou, Wenjing Gong, Kaili Zhang, Bingqian Chen, Mitch Zhang, Yifan Yang

机构 * Texas A&M University(德克萨斯理工大学) Google(谷歌) Department of Geography(地理系) Department of Landscape Architecture and Urban Planning(景观建筑与城市规划系)

AI总结 针对大语言模型在学术研究中的过度自信问题,构建了包含10865篇论文的GIScholarBench基准,通过元数据检索、文献链接和研究方向生成三项任务评估模型表现,发现所有模型均存在任务不变的过度自信现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07771 2026-06-09 astro-ph.IM astro-ph.GA cs.AI 新提交

Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model

超越点估计:在AION-1天文基础模型上基准测试不确定性量化方法

Karla Tame-Narvaez, Aleksandra Ćiprijanović, Shubhendu Trivedi

机构 * Scientific Computing Division Fermi National Accelerator Laboratory(费米国家加速器实验室科学计算部) Fermi National Accelerator Laboratory(费米国家加速器实验室) Department of Astronomy and Astrophysics University of Chicago(芝加哥大学天文学与天体物理学系) NSF and Simons SkAI Institute(国家科学基金会与Simons SkAI研究所) Google DeepMind(谷歌DeepMind)

AI总结 本文在AION-1基础模型嵌入上比较七种不确定性量化方法,发现共形预测(尤其是LVD框架)在星系属性回归中提供可靠的边际和局部覆盖,优于非共形基线。

Comments 7 pages, 1 table, 1 figure

Journal ref Contribution to Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07546 2026-06-09 cs.IR cs.AI cs.LG 新提交

Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling

超越视频ID:通过语义原生长序列建模实现短视频推荐规模化

Ruixiao Sun, Diego Uribe Mora, Zhimeng Jiang, Yuanzhen Lin, Jiarui Wang, Yuening Li, Danfeng Guo, Zhizhong Chen, Chuan He, Liang Liu

机构 * Google Mountain View, USA(谷歌山景城,美国)

AI总结 针对短视频推荐中序列长度受限于视频ID语义稀疏性和Transformer二次复杂度的问题,提出采用语义ID和全局感知压缩Transformer,实现十亿用户规模的超长行为序列建模,显著降低内存和计算开销,在线实验提升用户满意度和内容消费。

Comments this manuscript has been accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏