arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-29 至 2026-01-29 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2601.20655 2026-01-29 cs.DC 50%

OnePiece: A Large-Scale Distributed Inference System with RDMA for Complex AI-Generated Content (AIGC) Workflows

OnePiece:一种基于RDMA的大型分布式推理系统,用于复杂AI生成内容(AIGC)工作流

June Chen, Neal Xu, Gragas Huang, Bok Zhou, Stephen Liu

专题命中 视频生成 :video generation(abstract)

AI总结 OnePiece通过RDMA优化和微服务分解,提升AIGC工作流的吞吐量和资源利用率,减少GPU资源消耗16倍。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20622 2026-01-29 cs.HC 50%

SketchDynamics: Exploring Free-Form Sketches for Dynamic Intent Expression in Animation Generation

SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达

Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu

专题命中 视频生成 :video generation(abstract)

AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。

Comments conditionally accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 5 篇

2601.20791 2026-01-29 cs.CV cs.AI 88%

FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models

FAIRT2V:无需训练的文本到视频扩散模型去偏框架

Haonan Zhong, Wei Song, Tingxu Han, Maurice Pagnucco, Jingling Xue, Yang Song

机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20499 2026-01-29 cs.CV 83%

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20857 2026-01-29 cs.CV 57%

FreeFix: Boosting 3D Gaussian Splatting via Fine-Tuning-Free Diffusion Models

FreeFix: 通过无微调扩散模型提升3D高斯散射

Hongyu Zhou, Zisen Shao, Sheng Miao, Pan Wang, Dongfeng Bai, Bingbing Liu, Yiyi Liao

机构 * Zhejiang University(浙江大学) University of Maryland, College Park(马里兰大学学院 park 分校) Huawei(华为)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FreeFix通过无微调扩散模型提升3D高斯散射,实现高质量视图合成与强泛化能力。

Comments Our project page is at https://xdimlab.github.io/freefix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05150 2026-01-29 cs.CV 57%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11497 2026-01-29 cs.CV 57%

QVGen: Pushing the Limit of Quantized Video Generative Models

QVGen:推动量化视频生成模型的极限

Yushi Huang, Ruihao Gong, Jing Liu, Yifu Ding, Chengtao Lv, Haotong Qin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港理工大学) Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院) Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 QVGen通过量化感知训练框架在极低比特下实现高性能视频生成模型,首次达到全精度质量并优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2601.20504 2026-01-29 cs.CV 57%

Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V

潜在时间差异作为运动先验:一种用于动态保真的损失加权策略

Meiqi Wu, Bingze Song, Ruimin Lin, Chen Zhu, Xiaokun Feng, Jiahong Wu, Xiangxiang Chu, Kaiqi Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) AMAP, Alibaba Group(阿里云实验室) Southeast University(东南大学) CRISE, Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于潜在时间差异的损失加权策略,用于提升动态保真度,通过引入运动先验来优化模型训练,从而在运动视频生成任务中取得显著性能提升。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2601.20540 2026-01-29 cs.CV 57%

Advancing Open-source World Models

推进开源世界模型

Robbyant Team, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, Yihang Chen, Jie Liu, Yansong Cheng, Yao Yao, Jiayi Zhu, Yihao Meng, Kecheng Zheng, Qingyan Bai, Jingye Chen, Zehong Shen, Yue Yu, Xing Zhu, Yujun Shen, Hao Ouyang

机构 * Robbyant Team(Robbyant 团队)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 LingBot-World是一个开源世界模拟器,具备高保真度、长期记忆和实时交互能力,旨在推动内容创作、游戏和机器人学习等领域的应用。

Comments Project page: https://technology.robbyant.com/lingbot-world; Code: https://github.com/robbyant/lingbot-world

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2601.20297 2026-01-29 cs.CV 79%

Artifact-Aware Evaluation for High-Quality Video Generation

面向高质量视频生成的缺陷感知评估

Chen Zhu, Jiashu Zhu, Yanxun Li, Meiqi Wu, Bingze Song, Chubin Chen, Jiahong Wu, Xiangxiang Chu, Yangang Wang

机构 * Southeast University(东南大学) AMAP, Alibaba Group(阿里云AMAP) CASIA

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DVAR框架,通过GenVID数据集实现对视频生成缺陷的细粒度检测与分类,提升缺陷识别准确率并有效过滤低质量内容。

详情

展开后加载摘要…

URL PDF HTML 收藏