arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-04-03 至 2026-04-03 共收录 6
2604.02211 2026-04-03 cs.IR cs.AI cs.MA

Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges

多智能体视频推荐系统:演进、模式与开放挑战

Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha, Debanshu Das

机构 * Google LLC(谷歌公司)

AI总结 本文探讨多智能体视频推荐系统的演进、协作模式及挑战,分析了从早期MARL到LLM驱动架构的发展,并提出可扩展性、多模态理解等开放问题。

Comments Accepted for publication in The Nineteenth ACM International Conference on Web Search and Data Mining (WSDM Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01430 2026-04-03 cs.LG

Improving Latent Generalization Using Test-time Compute

通过测试时间计算提升潜在泛化能力

Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文研究如何通过测试时间计算('思考')提升语言模型的潜在泛化能力,利用强化学习训练模型生成长链思考以改进泛化,实验显示该方法在分布内知识和分布外知识上均有效,但对纯反转任务仍逊于上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21681 2026-04-03 cs.CV

Seeing without Pixels: Perception from Camera Trajectories

无需像素的感知:从相机轨迹进行感知

Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han

机构 * Google DeepMind(谷歌DeepMind) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文探讨通过相机轨迹而非像素感知视频内容的可能性,提出CamFormer框架,证明轨迹信息能有效用于视频内容理解及多种下游任务。

Comments Accepted by CVPR 2026, Project website: https://sites.google.com/view/seeing-without-pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03140 2026-04-03 cs.LG cs.CL

In-context Learning in Presence of Spurious Correlations

在存在虚假相关性时的上下文学习

Hrayr Harutyunyan, Rafayel Darbinyan, Samvel Karapetyan, Hrant Khachatrian

机构 * Google DeepMind(谷歌DeepMind) ServiceTitan YerevaNN Yerevan State University(埃里温国立大学)

AI总结 本文研究了在存在虚假特征时训练上下文学习器的可行性,提出了一种新方法,该方法在分类任务中表现优异,但泛化能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏