arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-05 至 2026-02-05 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2412.13462 2026-02-05 cs.SD cs.MM eess.AS 79%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03915 2026-02-05 cs.CV cs.AI cs.CE cs.LG 57%

Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Science

Phaedra: 学习高保真离散标记化以用于物理科学

Levi Lingsch, Georgios Kissas, Johannes Jakubik, Siddhartha Mishra

机构 * ETH AI Center(苏黎世联邦理工学院人工智能中心) IBM Research Europe(IBM欧洲研究院) Seminar for Applied Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学系) Swiss Data Science Center, ETH Zurich(瑞士数据科学中心,苏黎世联邦理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Phaedra通过结合经典形状增益量化和正交分解,改进了科学图像的高保真离散标记化,提升PDE数据的重建和泛化能力。

Comments 57 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏