arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-12 至 2026-08-12 共收录 4
2608.10886 2026-08-12 cs.CV cs.RO 新提交

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

GESTO:面向动态场景推理的以人为中心的时空记忆

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) Google Research(谷歌研究院) TU Munich(慕尼黑工业大学)

AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10359 2026-08-12 cs.SD cs.CL 新提交

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

VoxSumm:用于联合摘要与翻译的多语言长篇口语新闻语料库

Yejin Jeon, Marie Maltais, Virginia Ceccatelli, Min Ma, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席项目)

AI总结 本研究针对长文档摘要与多语言语音翻译的研究缺口,提出联合语音摘要与翻译任务,构建首个多语言跨语言基准VoxSumm,并评估相关模型表现,为多语言语音处理系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17441 2026-08-12 cs.HC cs.AI cs.CY 版本更新

Patients With Personality: Realistic Patient Simulation through Controlled Diversity and Selective Disclosure

具有个性的患者:通过受控多样性与选择性披露实现逼真的患者模拟

Moritz Schlager, Friederike Jungmann, Samuel Schmidgall, Philipp Raffler, Franziska Hartl, Eva Wende, Paula Roßmüller, Conrad Ketzer, Avinatan Hassidim, Dale R. Webster, Yossi Matias, Yun Liu, Daniel Rueckert, Mike Schaekermann, Paul Hager

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TUM University Hospital(慕尼黑技术大学医院) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Imperial College London(伦敦帝国学院)

AI总结 提出PatientsWithPersonality框架,通过HEXACO人格参数化控制患者对话风格、合作性和信息披露,生成逼真且多样化的虚拟患者,在临床评估中接近真实演员表现。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏