arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1448 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1448 篇

2602.01591 2026-08-07 cs.CV 版本更新 70%

Faster and Better Alignment for Flow Matching Models via Step-aware Advantages

Know Your Step: 通过步感知优势实现更快速和更优的流匹配模型对齐

Zhixiong Yue, Feiyang Ye, Zixuan Ni, Sheng Shen, Yu Zhang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究) Southern University of Science and Technology(南方科技大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TAFS GRPO通过步感知优势机制改进流匹配模型,实现更高效且更优的少步文本到图像生成与人类偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 70%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12753 2026-07-31 cs.CV 版本更新 70%

RFMSR: Residual Flow Matching for Image Super-Resolution

RFMSR:用于图像超分辨率的残差流匹配

Shuwei Huang, Tianyao Luo, Jicheng Liu, Pan Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对图像超分辨率,提出残差流匹配框架RFMSR,将源分布集中于LQ潜变量以减少传输距离并保留结构先验,采用两阶段训练策略,实验证明该方法相比SOTA实现了相当甚至更优的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06020 2026-07-29 cs.CV 版本更新 70%

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06757 2026-07-29 cs.CV 版本更新 70%

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。

Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新 70%

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23086 2026-07-13 cs.LG cs.CV 版本更新 70%

Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards

基于策略的自回归图像模型实例和分布级奖励调优

Orhun Bugra Baran, Melih Kandemir, Ramazan Gokberk Cinbis

机构 * Middle East Technical University (METU)(中东部技术大学) University of Southern Denmark(南部丹麦大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种轻量级强化学习框架,通过将基于标记的自回归合成视为马尔可夫决策过程,结合分布级LOO-FID奖励和实例级CLIP/HPSv2奖励,提升图像生成的质量和多样性。

Comments Accepted at the European Conference on Computer Vision (ECCV), 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16920 2026-07-10 cs.CV 版本更新 70%

DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution

DeltaDeno:通过Delta去噪归因实现零样本异常生成

Chaoran Xu, Chengkan Lv, Qiyu Chen, Yunkang Cao, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) CASI Vision Technology CO., LTD., Luoyang, China(CASI视觉科技有限公司) School of Artificial Intelligence and Robotics, Hunan University, Changsha, China(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究在无真实异常样本和训练情况下的零样本异常生成问题,提出DeltaDeno方法,通过对比两个扩散分支定位编辑缺陷,累积去噪增量生成掩码,经令牌级提示细化等操作提升性能,在公共数据集实验中效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21556 2026-07-09 cs.CV 版本更新 70%

ECHO: Ego-Centric modeling of Human-Object interactions

ECHO:人类-物体交互的以自我为中心建模

Ilya A. Petrov, Vladimir Guzov, Riccardo Marin, Emre Aksan, Xu Chen, Daniel Cremers, Thabo Beeler, Gerard Pons-Moll

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 ECHO首次提出统一框架,通过头和手腕追踪联合恢复人体姿态、物体运动和接触动力学,解决稀疏信号下的人类-物体交互建模难题。

Comments Accepted at ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31604 2026-07-07 cs.CV 版本更新 70%

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16239 2026-07-07 cs.CV 版本更新 70%

EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation

EM3M:用于微观结构分割与生成的电子显微镜图像数据集

Nan Wang, Zhiyi Xia, Yiming Li, Siyuan Zhang, Shi Tang, Zuxin Fan, Xi Fang, Haoyi Tao, Guolin Ke, Yanhui Hong

机构 * DP Technology(DP技术)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。

Comments 31 pages, 13 figures, Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08305 2026-06-23 cs.CV cs.AI 版本更新 70%

Retrieval-Augmented Anatomical Guidance for Text-to-CT Generation

检索增强的解剖引导用于文本到CT生成

Daniele Molino, Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma, Rome, Italy(人工智能与计算机系统单位,工程系,罗马生物医学大学,意大利罗马) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University, Umeå, Sweden(诊断与介入系,生物医学工程与放射物理,乌梅大学,瑞典乌梅)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出检索增强方法,通过检索相关临床案例的解剖标注作为结构代理,注入文本条件潜在扩散模型,实现文本到CT生成中语义与解剖信息的融合,提升图像保真度和临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24223 2026-06-16 cs.LG cs.CV stat.ML 版本更新 70%

Semantic Editing with Coupled Stochastic Differential Equations

耦合随机微分方程的语义编辑

Jianxin Zhang, Clayton Scott

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出耦合随机微分方程(coupled SDEs)引导预训练生成模型的采样过程,无需重新训练即可实现高提示保真度和近像素级一致性的语义编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12400 2026-06-15 math.CO cs.CV 版本更新 70%

Generation of Maximal Snake Polyominoes Using a Deep Neural Network

使用深度神经网络生成最大蛇形多联骨牌

Benjamin Gauthier, Alain Goupil, Fadel Toure

机构 * Université du Québec à Trois-Rivières(魁北克大学三河分校)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出结构化像素空间扩散模型,从数据驱动学习生成最大蛇形多联骨牌,无需显式编码约束,能泛化到更大矩形并接近当前计算极限。

Comments In Proceedings GASCom 2026, arXiv:2606.09910

Journal ref EPTCS 445, 2026, pp. 104-113

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09630 2026-06-08 cs.GR 版本更新 70%

CASteer: Cross-Attention Steering for Controllable Concept Erasure

CASteer:跨注意力转向用于可控概念擦除

Tatiana Gaintseva, Andreea-Maria Oncescu, Chengcheng Ma, Ziquan Liu, Martin Benning, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.GR

AI总结 CASteer通过动态转向向量实现无需训练的扩散模型概念擦除,精准抑制无关概念而不影响整体图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14614 2026-08-14 q-fin.MF 版本更新 67%

Pricing options on the cryptocurrency futures contracts

加密货币期货合约上的期权定价

Julia Kończal

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究针对加密货币期权市场特性,校准评估多种期权定价模型,发现Kou模型对BTC期权、Bates模型对ETH期权定价误差最低,凸显纳入跳跃与随机波动率的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08834 2026-08-05 cs.LG cs.AI stat.ML 版本更新 67%

Rex: A Family of Reversible Exponential (Stochastic) Runge-Kutta Solvers

Rex: 一族可逆指数(随机)龙格-库塔求解器

Zander W. Blasingame, Chen Liu

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Rex求解器族,通过Lawson方法将显式(随机)龙格-库塔格式转化为代数可逆形式,用于扩散ODE和SDE,实现近机器精度重建并提升流模型和扩散模型的性能。

Comments Accepted as an Oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01597 2026-08-05 cs.LG stat.AP stat.ML 版本更新 67%

Heteroscedasticity of Denoising Score Matching with Generalised Smooth Noise

带广义平滑噪声的去噪得分匹配的异方差性

Juyan Zhang, Rhys Newbury, Xinyang Zhang, Tin Tran, Dana Kulic, Michael Burke

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究指出去噪得分匹配(DSM)存在固有的异方差性,推导了理想加权函数并给出实用近似方案,为各向同性高斯扩散的启发式权重提供了理论依据,在多分布和高阶得分上验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-03 cs.LG cs.RO 版本更新 67%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03661 2026-07-31 cs.LG cs.AI 版本更新 67%

Dynamically Scaled Activation Steering

动态缩放的激活引导

Alex Ferrando, Xavier Suau, Jordi Gonzàlez, Pau Rodriguez

机构 * Apple(苹果公司) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 DSAS是一种动态缩放的激活引导框架,通过自适应调节引导强度,在生成过程中实现对特定概念的调控,同时提升模型的可解释性和性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23615 2026-07-09 cs.LG cs.AI 版本更新 67%

L-GTA: Latent Generative Modeling for Time Series Augmentation

L-GTA:用于时间序列增强的潜在生成建模

Luis Roque, Vitor Cerqueira, Carlos Soares, Luis Torgo

机构 * Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) Fraunhofer Portugal AICOS(德国弗劳恩霍夫葡萄牙AICOS研究所) University of Coimbra(科英布拉大学) Dalhousie University(达尔豪斯大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究针对时间序列分析中的数据增强问题,提出基于变分自编码器、双向LSTM和时间自注意力的L-GTA模型,通过定义等变性目标学习潜在表示并应用可控扰动,实验表明该模型在多方面优于其他方法,能有效降低预测误差。

Journal ref ECML PKDD 2026 Research Track, Naples, Italy, September 7-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20070 2026-06-23 cs.LG 版本更新 67%

Generative Modeling via Kernelized Stochastic Interpolants

基于核化随机插值的生成建模

Florentin Coeurdoux, Etienne Lempereur, Nathanaël Cuvelle-Magar, Stéphane Mallat, Eric Vanden-Eijnden

机构 * CCM, Flatiron Institute, New York, USA(CCM,Flatiron研究所,纽约,美国) Courant Institute of Mathematical Sciences, New York University, New York, USA(数学科学学院,纽约大学,纽约,美国)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出一种基于核方法的随机插值生成框架,用线性系统替代神经网络训练,通过求解与数据维度无关的线性系统得到生成SDE的漂移项,并处理扩散系数在t=0处的奇异性,适用于多种特征映射,在金融时间序列、湍流和图像生成中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01565 2026-06-19 cs.LG cs.DC 版本更新 67%

TetriServe: Efficiently Serving Mixed DiT Workloads

TetriServe: 高效服务混合DiT工作负载

Runyu Lu, Shiqi He, Wenxuan Tan, Shenggui Li, Ruofan Wu, Jeff J. Ma, Ang Chen, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对混合分辨率与截止时间的异构DiT工作负载,提出基于步骤级序列并行的TetriServe系统,通过轮次调度与自适应并行度,在保证图像质量下将SLO达成率提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 67%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21072 2026-06-11 cs.CR cs.AI cs.LG 版本更新 67%

Erased but Not Forgotten: How Backdoors Compromise Concept Erasure

擦除但未遗忘:后门如何破坏概念擦除

Tobias Braun, Jonas Henry Grebe, Marcus Rohrbach, Anna Rohrbach

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文揭示了一种名为擦除规避后门(EEB)的漏洞,攻击者将后门触发器绑定到待擦除概念上,使得该恶意链接在后续擦除后仍然存在,从而绕过多种概念擦除方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23489 2026-08-24 cs.GR cs.CV 版本更新 62%

MeshFlow: Mesh Generation with Equivariant Flow Matching

MeshFlow: 基于等变流匹配的网格生成

Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan, Qixing Huang, Alexander Rush, Leonidas Guibas, Gordon Wetzstein, Jing Liao, Guandao Yang

机构 * City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) The University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出MeshFlow,利用等变最优传输流匹配模型直接生成三角网格,避免序列化,通过改进扩散变压器架构实现等变性,推理速度提升约18倍。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-08-21 cs.GR cs.CV cs.HC 版本更新 62%

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18898 2026-08-18 cs.CV cs.GR 版本更新 62%

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM:基于隐式捷径的时空建模语音同步手势生成

Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 GestureLSM通过时空建模与改进的流匹配方法,在BEAT2数据集上实现了最优语音同步手势生成,同时大幅缩短推理时间,可用于增强数字人和具身智能体。

Comments Accepted to ICCV 2025. Project Page: https://andypinxinliu.github.io/GestureLSM

详情

展开后加载摘要…

URL PDF HTML 收藏