arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-12 至 2026-08-12 共收录 2
2608.10886 2026-08-12 cs.CV cs.RO 新提交

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

GESTO:面向动态场景推理的以人为中心的时空记忆

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) Google Research(谷歌研究院) TU Munich(慕尼黑工业大学)

AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10359 2026-08-12 cs.SD cs.CL 新提交

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

VoxSumm:用于联合摘要与翻译的多语言长篇口语新闻语料库

Yejin Jeon, Marie Maltais, Virginia Ceccatelli, Min Ma, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席项目)

AI总结 本研究针对长文档摘要与多语言语音翻译的研究缺口,提出联合语音摘要与翻译任务,构建首个多语言跨语言基准VoxSumm,并评估相关模型表现,为多语言语音处理系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏