arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-28 至 2025-08-28 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2508.18634 2025-08-28 cs.CV 57%

OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward

Chunlin Zhong, Qiuxia Hou, Zhangjun Zhou, Shuang Hao, Haonan Lu, Yanhao Zhang, He Tang, Xiang Bai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 9 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2503.21721 2025-08-28 cs.CV 79%

Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet Distance

Jaywon Koo, Jefferson Hernandez, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Added new video experiments and more image experiments to validate the method

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22141 2025-08-28 cs.CV cs.AI 57%

FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing

Guanwen Feng, Zhiyuan Ma, Yunan Li, Jiahao Yang, Junwei Jing, Qiguang Miao

机构 * Xi’an Key Laboratory of Big Data and Intelligent Vision, Xidian University, Xi’an 710071, China(西安大数据与智能视觉重点实验室,西安电子科技大学,西安710071,中国) Key Laboratory of Collaborative Intelligence Systems, Ministry of Education, Xidian University, Xi’an 710071, China(协同智能系统重点实验室,教育部,西安电子科技大学,西安710071,中国) School of Computer Science and Technology, Xidian University, Xi’an 710071, China(计算机科学与技术学院,西安电子科技大学,西安710071,中国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2508.15314 2025-08-28 cs.CV cs.AI cs.CR 86%

VideoEraser: Concept Erasure in Text-to-Video Diffusion Models

Naen Xu, Jinghuai Zhang, Changjiang Li, Zhi Chen, Chunyi Zhou, Qingming Li, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

Comments To appear in the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10568 2025-08-28 cs.CV cs.AI 74%

DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers

Lizhen Wang, Zhurong Xia, Tianshu Hu, Pengrui Wang, Pengfei Wei, Zerong Zheng, Ming Zhou, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17631 2025-08-28 cs.LG cs.AI 71%

ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion

Nima Kondori, Hanwen Liang, Hooman Vaseli, Bingyu Xie, Christina Luong, Purang Abolmaesumi, Teresa Tsang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)

专题命中 视频扩散模型 :video diffusion(title)

Comments Data Curation and Augmentation in Medical Imaging CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏