arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-06 至 2026-01-06 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 9 篇

2601.02107 2026-01-06 cs.CV 83%

MagicFight: Personalized Martial Arts Combat Video Generation

MagicFight: 个性化武术战斗视频生成

Jiancheng Huang, Mingfu Yan, Songyan Chen, Yi Huang, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00943 2026-01-06 cs.CV 83%

PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education

PhyEduVideo: 一个用于评估物理教育中文本到视频模型的基准

Megha Mariam K. M, Aditya Arun, Zakaria Laskar, C. V. Jawahar

机构 * IIIT Hyderabad(印度海得拉巴理工学院) Adobe MDSR IISER Thiruvananthapuram(泰米尔纳德邦土著科学研究所)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 PhyEduVideo基准评估文本到视频模型在物理教育中的表现,揭示其在概念准确性与视觉质量间的差距,推动更精准的教育视频生成。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21059 2026-01-06 cs.CV 83%

VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation

VisionReward: 面向图像和视频生成的细粒度多维人类偏好学习

Jiazheng Xu, Yu Huang, Jiale Cheng, Yuanming Yang, Jiajun Xu, Yuan Wang, Wenbo Duan, Shen Yang, Qunlin Jin, Shurun Li, Jiayan Teng, Zhuoyi Yang, Wendi Zheng, Xiao Liu, Dan Zhang, Ming Ding, Xiaohan Zhang, Xiaotao Gu, Shiyu Huang, Minlie Huang, Jie Tang, Yuxiao Dong

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 VisionReward通过细粒度多维人类偏好学习框架,提升图像和视频生成的偏好对齐效果,实验显示其在准确性与胜率上均优于现有方法。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18281 2026-01-06 cs.CV 83%

MotionCharacter: Fine-Grained Motion Controllable Human Video Generation

MotionCharacter: 高精度可调控的人体视频生成

Haopeng Fang, Di Qiu, Binjie Mao, He Tang

机构 * Meituan(美团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MotionCharacter通过解耦动作类型与运动强度,实现高保真人体视频生成,提升细粒度运动控制与身份一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00996 2026-01-06 cs.CY cs.AI 78%

VEAT Quantifies Implicit Associations in Text-to-Video Generator Sora and Reveals Challenges in Bias Mitigation

VEAT量化文本到视频生成器Sora中的隐含关联并揭示缓解偏见的挑战

Yongxu Sun, Michael Saxon, Ian Yang, Anna-Maria Gueorguieva, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 VEAT量化Sora视频生成器中隐含的种族和性别关联,揭示去偏提示可能反噬的问题,强调T2V生成器需严格评估以避免代表性伤害。

Comments The International Association for Safe & Ethical AI (IASEAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI 74%

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 57%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04888 2026-01-06 cs.CV 57%

Training-Free Video Editing via Optical Flow-Enhanced Score Distillation

无需训练的视频编辑 via 光流增强的分数蒸馏

Lianghan Zhu, Yanqi Bao, Jing Huo, Jing Wu, Yu-Kun Lai, Wenbin Li, Yang Gao

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本研究提出基于预训练文本到视频模型的分数蒸馏方法,通过迭代优化和光流增强技术,解决无需训练视频编辑中的内容保留与时间连续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02125 2026-01-06 cs.RO cs.AI 50%

SingingBot: An Avatar-Driven System for Robotic Face Singing Performance

SingingBot: 一种由虚拟角色驱动的机器人面部歌唱表演系统

Zhuoxiong Xu, Xuanchen Li, Yuhao Cheng, Fei Xu, Yichao Yan, Xiaokang Yang

专题命中 视频生成 :video generation(abstract)

AI总结 SingingBot通过虚拟角色驱动框架实现机器人面部歌唱的丰富情感表达,提出情感动态范围指标评估情感广度,实验表明其在情感表现和同步性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏