arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2608.09637 2026-08-11 cs.CV cs.AI 新提交 79%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08820 2026-08-11 cs.CV 新提交 79%

LogiShot: Logically Coherent Cross-Shot Video Generation

LogiShot:逻辑连贯的跨镜头视频生成

Shuai Guo, Yuhang Yang, Zeyu Zhang, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对跨镜头视频生成的内容脱节问题,提出LogiShot模型,通过联合编码与视觉记忆路径实现逻辑连贯,构建11万样本数据集及基准,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新 79%

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 79%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03084 2026-08-05 cs.CV 新提交 79%

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

SUV:将未来场景理解建模为视频生成的端到端驾驶

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。

Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03621 2026-08-05 cs.CV 版本更新 79%

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成

Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

机构 * Sun Yat-sen University(中山大学) ZYT Shenzhen Polytechnic University(深圳职业技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。

Comments Project page: https://recamdriving.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 79%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01944 2026-08-04 cs.CV 新提交 79%

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni

机构 * SJTU(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00617 2026-08-04 cs.CV 新提交 79%

Diagnosing Under-Development of Irreversible Processes in Video Generation

诊断视频生成中不可逆过程的欠发展问题

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) RIKEN AIP(理化学研究所 AIP) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01499 2026-08-03 cs.CV 版本更新 79%

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Anti-Prompt: 针对文本引导的图像到视频生成的图像保护

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

机构 * GIST(光州科学技术院) POSTECH(浦项科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18046 2026-07-31 cs.CV cs.AI 版本更新 79%

Enhancing Scene Transition Awareness in Video Generation via Post-Training

通过后训练增强视频生成中的场景转换意识

Hanwen Shen, Jiajie Lu, Yupeng Cao, Xiaonan Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26818 2026-07-30 cs.CV 新提交 79%

Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

Ripple:基于跨模态循环记忆的实时流音频-视频生成

Yanbo Ding, Zhizhi Guo, Quanyue Song, Yishan He, Zhixiang He, Yongxiang Li, Yali Wang

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 79%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24027 2026-07-28 cs.CV 新提交 79%

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Sol-Attn:通过即时注意力稀疏化加速视频生成推理

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 79%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22959 2026-07-28 cs.CV cs.AI 新提交 79%

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale

HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统

Aniket Sakpal, Yang Jiang, Rouzbeh Davoudi, Shayan Hassantabar, Mani Najmabadi

机构 * Expedia Group(亿客行集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 79%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12304 2026-07-24 cs.SD cs.AI cs.MM eess.AS 版本更新 79%

OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu

机构 * The University of Hong Kong(香港大学) Shanda AI Research Tokyo(Shanda AI东京研究所) XIntelligence Technology Co., Limited(XIntelligence技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。

Comments code: https://github.com/OmniCustom-project/OmniCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20174 2026-07-23 cs.CV cs.AI 新提交 79%

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

机构 * Kling AI Research(克林人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) National Cheng Kung University(国立成功大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。

Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 79%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03118 2026-07-22 cs.CV cs.LG 版本更新 79%

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1:一个实时交互式视频生成模型

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(生数科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07649 2026-07-22 cs.CV cs.AI 版本更新 79%

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 79%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 79%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14194 2026-07-17 cs.CV cs.LG 新提交 79%

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

文本到视频模型的推理时概念抑制和以视频为中心的评估

Wenxuan Chen, Wenjie Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频模型中可控去除目标概念的问题,提出无训练推理时框架SIRUS,通过定位目标相关提示证据抑制目标表达,引入视频导向评估框架,在多个概念上实验表现出色,能在不同骨干上泛化。

Comments 29 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13527 2026-07-16 cs.CV 新提交 79%

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

VGIF分数:视频生成中时空指令跟随的可解释性和诊断性评估

Songyu Xu, Xin Wang, Qiang Chen, Xinran Wang, Muxi Diao, Yuxuan Zhang, Kongming Liang, Rui Lin, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecommunications Group Co., Ltd.(中国电信集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究视频生成模型遵循长指令能力评估不足问题,提出VGIF-Score框架,含客观完成和主观满意度分支,能生成统一分数,在VGIF-Bench基准实验中对视频生成指令跟随提供可靠、可解释及有诊断作用的评估。

Comments Accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 79%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31946 2026-07-15 cs.CV 版本更新 79%

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10860 2026-07-14 cs.CV 新提交 79%

AU-Guided Synthetic Video Generation for Micro-Expression Recognition

用于微表情识别的基于动作单元引导的合成视频生成

Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan, Raphael C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University Malaysia(马来西亚莫纳什大学CyPhi人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有微表情识别数据集的局限,提出基于动作单元引导生成合成微表情数据集EquiME的方法,经实验其在跨数据集微表情识别任务中性能有竞争力,且在不同架构中变化低,为微表情识别研究提供了新资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02584 2026-07-14 cs.CV 版本更新 79%

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

RotateAttention:用于视频生成中INT4量化注意力的RoPE感知旋转与范围校正

Yaofu Liu, Wanli Lan, Jinxi Li, Binhang Yuan, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对基于DiT的视频生成模型中注意力机制的计算瓶颈,提出RotateAttention框架,采用选择性FP16回退,引入RoPE感知旋转和范围优化P量化技术,提升速度并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏