arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-19 至 2026-01-19 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2601.11210 2026-01-19 cs.CR cs.CV 83%

VidLeaks: Membership Inference Attacks Against Text-to-Video Models

VidLeaks:针对文本到视频模型的成员推断攻击

Li Wang, Wenyu Chen, Ning Yu, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(山东大学网络科学与技术学院) Eyeline Labs(Eyeline实验室) State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(山东大学密码与数字经济安全国家重点实验室) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(山东省人工智能安全重点实验室)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 VidLeaks通过空间重建保真度和时间生成稳定性两种信号,首次系统研究了针对文本到视频模型的成员推断攻击,揭示了模型在稀疏和时间记忆方面的隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10781 2026-01-19 cs.CV 79%

Future Optical Flow Prediction Improves Robot Control & Video Generation

未来光流预测改进机器人控制与视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) Stony Brook University(石溪大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。

Comments Project Site (Code, Models, Demo): https://fofpred.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11194 2026-01-19 cs.CV 57%

ATATA: One Algorithm to Align Them All

ATATA:一切对齐的统一算法

Boyi Pang, Savva Ignatyev, Vladimir Ippolitov, Ramil Khafizov, Yurii Melnik, Oleg Voynov, Maksim Nakhodnov, Aibek Alanov, Xiaopeng Fan, Peter Wonka, Evgeny Burnaev

机构 * Harbin Institute of Technology(哈尔滨工业大学) Applied AI Institute(应用人工智能研究所) AXXX FusionBrain Lab(融合大脑实验室) MSU(莫斯科州立大学) Constructor University(建设大学) HSE University(高等经济大学) Peng Cheng Laboratory(鹏城实验室) HIT Suzhou Research Institute(哈尔滨工业大学苏州研究 institute) KAUST(科威特大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ATATA提出一种基于Rectified Flow模型的多模态算法,实现高效结构对齐的样本生成,提升图像、视频和3D生成的质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11087 2026-01-19 cs.CV 57%

PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models

PhysRVG: 基于物理的视频生成模型统一强化学习

Qiyuan Zhang, Biao Gong, Shuai Tan, Zheng Zhang, Yujun Shen, Xing Zhu, Yuyuan Li, Kelu Yao, Chunhua Shen, Changqing Zou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang Lab(浙江实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysRVG通过引入基于物理的强化学习范式,统一视频生成模型,直接在高维空间中强制物理碰撞规则,提升生成视频的物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 57%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏