arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-24 至 2026-08-24 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2608.20749 2026-08-24 cs.CV 新提交 86%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 79%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-08-24 cs.CV 版本更新 70%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Yanfeng Zhang, Mingwei Sun, Zhen Dong, Xiaoxiao Long, Zengmao Wang, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20770 2026-08-24 cs.CV 新提交 57%

MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories

MotionPhys:基于光流轨迹物理一致性检测AI生成视频

Haojin He, Hao Tan, Zichang Tan, Ajian Liu, Jun Wan

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-24 cs.CV 版本更新 57%

Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: this https URL (https://yunpeng1998.github.io/Qwen-Video-Edit-Page) Code: this https URL (https://github.com/yunpeng1998/Qwen-Video-Edit) Model: this https URL (https://huggingface.co/yunpeng1998/Qwen-Video-Edit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-08-24 cs.CV 版本更新 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)

详情

展开后加载摘要…

URL PDF HTML 收藏