arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-07 至 2026-01-07 共收录 57 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 42 篇

2601.02709 2026-01-07 cs.CV 57%

GRRE: Leveraging G-Channel Removed Reconstruction Error for Robust Detection of AI-Generated Images

GRRE: 利用去通道重建误差以实现对AI生成图像的鲁棒检测

Shuman He, Xiehua Li, Xioaju Yang, Yang Xiong, Keqin Li

机构 * College of Cyber Science and Technology, Hunan University(湖南大学网络安全科学学院) Department of Computer Science, State University of New York at New Paltz(纽约州立大学新帕尔兹分校计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GRRE通过利用G通道移除后的重建误差差异,实现对AI生成图像的鲁棒检测,具有强泛化能力和高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03125 2026-01-07 cond-mat.soft 50%

An O(N) quasi-Ewald splitting method for nanoconfined electrostatics

一种O(N)的准埃瓦尔德分裂方法用于纳米受限静电学

Zecheng Gan, Xuanzhao Gao, Yuqing Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种O(N)的准埃瓦尔德分裂方法,用于高效模拟纳米受限系统中的静电相互作用,验证了其在准确性与效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02894 2026-01-07 math.AP math.FA 50%

Rational-Kernel Fractional Evolution Equations with Almost Sectorial Operators: A Resolvent Framework Unifying ABC and W Dynamics

有理核分数演化方程与几乎扇形算子:统一ABC和W动力学的解析框架

Mohamed Wakrim

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种统一ABC和W动力学的解析框架,通过有理核时间算子研究分数演化方程,揭示了非奇异记忆对衰减和光滑性质的影响。

Comments Preprint. 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02869 2026-01-07 cond-mat.soft physics.chem-ph 50%

Interplay of Structure and Dynamics in Solid Polymer Electrolytes: a Molecular Dynamics Study of LiPF6/polypropylene carbonate

固态聚合物电解质中结构与动力学的相互作用:LiPF6/聚丙烯碳酸酯的分子动力学研究

Amaury Coste, Thomas Meyer, Claire Villevielle, Fannie Alloin, Stefano Mossa, Benoit Coasne

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过分子动力学模拟探讨了固态聚合物电解质中结构与动力学的关系,发现离子相关性对电导率有重要影响,并揭示了在不同温度下离子迁移行为的变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02492 2026-01-07 math.NA cs.LG cs.NA 50%

Variational (Energy-Based) Spectral Learning: A Machine Learning Framework for Solving Partial Differential Equations

变分(能量基)谱学习:用于求解偏微分方程的机器学习框架

M. M. Hammad

专题命中 扩散模型 :diffusion(abstract)

AI总结 变分谱学习通过可微能量函数求解偏微分方程,结合谱展开和现代优化方法,实现高精度且鲁棒的求解

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15817 2026-01-07 stat.ML cs.LG 50%

Error analysis of a compositional score-based algorithm for simulation-based inference

基于组合评分的模拟推理算法误差分析

Camille Touron, Gabriel V. Cardoso, Julyan Arbel, Pedro L. C. Rodrigues

机构 * Univ. Grenoble Alpes, Inria CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学,法国国家信息与自动化技术研究所,格勒诺布尔理工学院,LJK实验室,法国) Geostatistics team, Centre for geosciences and geoengineering Mines Paris, PSL University, Fontaineableau, France(地质统计团队,矿物科学与地球工程中心,巴黎矿业学校,巴黎高等科学研究所,法国)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于组合评分的模拟推理算法的误差分析,推导了其均方误差的上界,并通过高斯示例验证了理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08627 2026-01-07 cs.RO 50%

Augmented Reality for RObots (ARRO): Pointing Visuomotor Policies Towards Visual Robustness

增强现实用于机器人(ARRO):通过视觉鲁棒性指向视觉策略

Reihaneh Mirjalili, Tobias Jülg, Florian Walter, Wolfram Burgard

机构 * Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(计算机科学与人工智能系,图恩堡技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 ARRO通过实时视觉屏蔽和虚拟引导提升机器人操作的视觉鲁棒性,减少对额外数据的依赖,适用于多种桌面任务和真实环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00900 2026-01-07 physics.bio-ph cond-mat.stat-mech nlin.AO 50%

Dynamical equivalence between resonant translocation of a polymer chain and diversity-induced resonance

共振传输聚合物链与多样性诱导共振之间的动力学等价性

Marco Patriarca, Stefano Scialla, Els Heinsalu, Marius E. Yamakou, Julyan H. E. Cartwright

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了异质振荡器网络中集体同步振荡与聚合物链共振传输之间的动力学等价性,通过机械类比解释共振现象的物理机制。

Comments 9 pages, 5 figures, 23 references

Journal ref Chaos 1 July 2025; 35 (7): 073115

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13119 2026-01-07 q-bio.QM 50%

Derivation from kinetic theory and 2-D pattern analysis of chemotaxis models for Multiple Sclerosis

从动力学理论和二维模式分析出发的多发性硬化症趋化模型推导

Marzia Bisi, Maria Groppi, Giorgio Martalò, Romina Travaglini

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文推导了多发性硬化症的反应扩散方程,通过动力学理论和二维模式分析探讨了图灵不稳定性及模式稳定性。

Journal ref J. Math. Biol. 91, 43 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11429 2026-01-07 math.PR q-bio.PE stat.CO stat.ME 50%

Filtering coupled Wright-Fisher diffusions

过滤耦合威特-费舍尔扩散

Chiara Boetti, Matteo Ruggiero

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用对偶方法推导耦合威特-费舍尔扩散的过滤和平滑分布,以实现参数推断。

Comments To appear on Journal of Mathematical Biology

Journal ref J. Math. Biol. 89, 64 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02848 2026-01-07 cs.SI cs.CY stat.AP 50%

Modeling ICD-10 Morbidity and Multidimensional Poverty as a Spatial Network: Evidence from Thailand

将ICD-10患病率与多维贫困建模为空间网络:泰国的实证研究

Pratana Kukieattikool, Kittiya Ku-kiattikun, Anukool Noymai, Navaporn Surasvadi, Jantakarn Makma, Pubodin Pornratchpum, Watcharakon Noothong, Chainarong Amornbunchornvej

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过空间网络模型分析泰国ICD-10患病率与多维贫困的相互作用,揭示空间依赖性和跨省溢出效应,为健康不平等和区域脆弱性提供新视角。

Comments First draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02750 2026-01-07 cs.IR 50%

Ahead of the Spread: Agent-Driven Virtual Propagation for Early Fake News Detection

提前传播:基于代理的虚拟传播用于早期虚假新闻检测

Bincheng Gu, Min Gao, Junliang Yu, Zongwei Wang, Zhiyi Liu, Kai Shu, Hongyu Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02558 2026-01-07 math.PR 50%

Lamperti scaling for fractional Gaussian processes with non-stationary increments

Lamperti缩放用于具有非平稳增量的分数高斯过程

Foad Shokrollahi, Saeed Vahdati

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了具有非平稳增量的分数高斯过程的Lamperti缩放,推导了协方差公式和渐进行为,并通过Langevin型过程展示了平稳高斯过程的重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02435 2026-01-07 quant-ph cs.FL 50%

Formal Modeling and Verification of Grover's Algorithm

Grover算法的正式建模与验证

H. Sun, Z. Shi, S. Chen, G. Wang, X. Li, Y. Guan, Q. Zhang, Z. Shao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文在HOL Light中形式化验证Grover算法,证明其核心属性并展示在整数分解中的应用价值。

Comments 18 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02388 2026-01-07 cond-mat.stat-mech physics.data-an 50%

Feedback Driven Convergence, Competition, and Entanglement in Classical Stochastic Processes

反馈驱动的收敛、竞争与纠缠在经典随机过程中的表现

Allen Lobo, Saravanan A

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出反馈驱动的随机原理,通过结果-结果反馈解释统计收敛、竞争和纠缠现象,并通过数值实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02367 2026-01-07 cs.CY cs.AI cs.CL cs.IR cs.LG cs.SI 50%

Cross-Platform Digital Discourse Analysis of the Israel-Hamas Conflict: Sentiment, Topics, and Event Dynamics

跨平台数字 discourse 分析:以色列-哈马斯冲突的 sentiment、主题和事件动态

Despoina Antonakaki, Sotiris Ioannidis

机构 * Institute of Computer Science, Foundation for Research and Technology(计算机科学研究所,研究与技术基金会) Technical University of Crete(克里特技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过跨平台分析,揭示了以色列-哈马斯冲突中情感、主题和事件动态的演变,提出多平台数据集及分析流程,探讨平台特性对冲突传播的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00879 2026-01-07 physics.optics cond-mat.dis-nn physics.app-ph physics.bio-ph 50%

Brownian spin-locking effect

布朗运动自旋锁定效应

Xiao Zhang, Peiyang Chen, Mei Li, Yuzhi Shi, Erez Hasman, Bo Wang, Xianfeng Chen

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在布朗介质中观察到光的大规模自旋锁定效应,揭示了纳米颗粒散射的自旋-轨道相互作用对辐射自旋场的影响,为宏观自旋行为研究提供新平台。

Comments 48 pages, 20 figures

Journal ref Nature Materials 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00701 2026-01-07 cond-mat.supr-con cond-mat.mtrl-sci 50%

Superconductivity at Pd/Bi$_2$Se$_3$ Interfaces Due to Self-Formed PdBiSe Interlayers

钯/铋硒界面的超导性源于自形成的钯铋硒中间层

Kaixuan Fan, Ze Hua, Siyao Gu, Peng Zhu, Guangtong Liu, Hechen Ren, Ruiwen Shao, Zhiwei Wang, Li Lu, Fan Yang

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过钯在铋硒表面的扩散形成钯铋硒中间层,实现钯/铋硒界面的超导性,为拓扑量子设备的发展提供新方法。

Journal ref Materials 2024, 17(22), 5460

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09396 2026-01-07 astro-ph.HE 50%

Extended Very-High-Energy Gamma-Ray Emission Surrounding PSR J0622 + 3749 Observed by LHAASO-KM2A

LHAASO-KM2A观测到PSR J0622+3749周围扩展的极高能伽马射线辐射

The LHAASO collabration, Zhen Cao, F. Aharonian, Y. X. Bai, Y. W. Bao, D. Bastieri, X. J. Bi, Y. J. Bi, W. Bian, A. V. Bukevich, C. M. Cai, W. Y. Cao, Zhe Cao, J. Chang, J. F. Chang, A. M. Chen, E. S. Chen, G. H. Chen, H. X. Chen, Liang Chen, Long Chen, M. J. Chen, M. L. Chen, Q. H. Chen, S. Chen, S. H. Chen, S. Z. Chen, T. L. Chen, X. B. Chen, X. J. Chen, Y. Chen, N. Cheng, Y. D. Cheng, M. C. Chu, M. Y. Cui, S. W. Cui, X. H. Cui, Y. D. Cui, B. Z. Dai, H. L. Dai, Z. G. Dai, Danzengluobu, Y. X. Diao, X. Q. Dong, K. K. Duan, J. H. Fan, Y. Z. Fan, J. Fang, J. H. Fang, K. Fang, C. F. Feng, H. Feng, L. Feng, S. H. Feng, X. T. Feng, Y. Feng, Y. L. Feng, S. Gabici, B. Gao, C. D. Gao, Q. Gao, W. Gao, W. K. Gao, M. M. Ge, T. T. Ge, L. S. Geng, G. Giacinti, G. H. Gong, Q. B. Gou, M. H. Gu, F. L. Guo, J. Guo, X. L. Guo, Y. Q. Guo, Y. Y. Guo, Y. A. Han, O. A. Hannuksela, M. Hasan, H. H. He, H. N. He, J. Y. He, X. Y. He, Y. He, S. Hernández-Cadena, B. W. Hou, C. Hou, X. Hou, H. B. Hu, S. C. Hu, C. Huang, D. H. Huang, J. J. Huang, T. Q. Huang, W. J. Huang, X. T. Huang, X. Y. Huang, Y. Huang, Y. Y. Huang, X. L. Ji, H. Y. Jia, K. Jia, H. B. Jiang, K. Jiang, X. W. Jiang, Z. J. Jiang, M. Jin, S. Kaci, M. M. Kang, I. Karpikov, D. Khangulyan, D. Kuleshov, K. Kurinov, B. B. Li, Cheng Li, Cong Li, D. Li, F. Li, H. B. Li, H. C. Li, Jian Li, Jie Li, K. Li, L. Li, R. L. Li, S. D. Li, T. Y. Li, W. L. Li, X. R. Li, Xin Li, Y. Li, Y. Z. Li, Zhe Li, Zhuo Li, E. W. Liang, Y. F. Liang, S. J. Lin, B. Liu, C. Liu, D. Liu, D. B. Liu, H. Liu, H. D. Liu, J. Liu, J. L. Liu, J. R. Liu, M. Y. Liu, R. Y. Liu, S. M. Liu, W. Liu, X. Liu, Y. Liu, Y. Liu, Y. N. Liu, Y. Q. Lou, Q. Luo, Y. Luo, H. K. Lv, B. Q. Ma, L. L. Ma, X. H. Ma, J. R. Mao, Z. Min, W. Mitthumsiri, G. B. Mou, H. J. Mu, A. Neronov, K. C. Y. Ng, M. Y. Ni, L. Nie, L. J. Ou, P. Pattarakijwanich, Z. Y. Pei, J. C. Qi, M. Y. Qi, J. J. Qin, A. Raza, C. Y. Ren, D. Ruffolo, A. Sáiz, D. Semikoz, L. Shao, O. Shchegolev, Y. Z. Shen, X. D. Sheng, Z. D. Shi, F. W. Shu, H. C. Song, Yu. V. Stenkin, V. Stepanov, Y. Su, D. X. Sun, H. Sun, Q. N. Sun, X. N. Sun, Z. B. Sun, N. H. Tabasam, J. Takata, P. H. T. Tam, H. B. Tan, Q. W. Tang, R. Tang, Z. B. Tang, W. W. Tian, C. N. Tong, L. H. Wan, C. Wang, G. W. Wang, H. G. Wang, J. C. Wang, K. Wang, Kai Wang, Kai Wang, L. P. Wang, L. Y. Wang, L. Y. Wang, R. Wang, W. Wang, X. G. Wang, X. J. Wang, X. Y. Wang, Y. Wang, Y. D. Wang, Z. H. Wang, Z. X. Wang, Zheng Wang, D. M. Wei, J. J. Wei, Y. J. Wei, T. Wen, S. S. Weng, C. Y. Wu, H. R. Wu, Q. W. Wu, S. Wu, X. F. Wu, Y. S. Wu, S. Q. Xi, J. Xia, J. J. Xia, G. M. Xiang, D. X. Xiao, G. Xiao, Y. L. Xin, Y. Xing, D. R. Xiong, Z. Xiong, D. L. Xu, R. F. Xu, R. X. Xu, W. L. Xu, L. Xue, D. H. Yan, T. Yan, C. W. Yang, C. Y. Yang, F. F. Yang, L. L. Yang, M. J. Yang, R. Z. Yang, W. X. Yang, Z. H. Yang, Z. G. Yao, X. A. Ye, L. Q. Yin, N. Yin, X. H. You, Z. Y. You, Q. Yuan, H. Yue, H. D. Zeng, T. X. Zeng, W. Zeng, X. T. Zeng, M. Zha, B. B. Zhang, B. T. Zhang, C. Zhang, F. Zhang, H. Zhang, H. M. Zhang, H. Y. Zhang, J. L. Zhang, Li Zhang, P. F. Zhang, P. P. Zhang, R. Zhang, S. R. Zhang, S. S. Zhang, W. Y. Zhang, X. Zhang, X. P. Zhang, Yi Zhang, Yong Zhang, Z. P. Zhang, J. Zhao, L. Zhao, L. Z. Zhao, S. P. Zhao, X. H. Zhao, Z. H. Zhao, F. Zheng, W. J. Zhong, B. Zhou, H. Zhou, J. N. Zhou, M. Zhou, P. Zhou, R. Zhou, X. X. Zhou, X. X. Zhou, B. Y. Zhu, C. G. Zhu, F. R. Zhu, H. Zhu, K. J. Zhu, Y. C. Zou, X. Zuo

专题命中 扩散模型 :diffusion(abstract)

AI总结 LHAASO观测到PSR J0622+3749附近扩展的极高能伽马射线源,揭示了脉冲星周围高能粒子扩散缓慢的特性。

Journal ref Physical Review Letters, 126, 241103 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2601.01045 2026-01-07 cs.LG 78%

Coarse-Grained Kullback--Leibler Control of Diffusion-Based Generative AI

粗粒度Kullback-Leibler控制的扩散基生成AI

Tatsuaki Tsuruyama

机构 * Department of Physics, Tohoku University(东大理学部) Department of Drug Discovery Medicine, Kyoto University(京都大学药学部)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出了一种基于V-delta势能的反向扩散方案,通过控制粗粒度量来提升生成图像的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02646 2026-01-07 cs.CV cs.AI 57%

DreamLoop: Controllable Cinemagraph Generation from a Single Photograph

DreamLoop:从单张照片生成可控的cinemagraph

Aniruddha Mahapatra, Long Mai, Cusuh Ham, Feng Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。

Comments Project Page: https://anime26398.github.io/dreamloop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2601.02392 2026-01-07 cs.CV cs.AI 57%

Self-Supervised Masked Autoencoders with Dense-Unet for Coronary Calcium Removal in limited CT Data

具有密集-UNet的自监督掩码自动编码器用于有限CT数据中的冠状动脉钙化去除

Mo Chen

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Dense-MAE,一种基于自监督学习的框架,用于在有限CT数据中有效去除冠状动脉钙化伪影,提升血管狭窄诊断准确性。

Comments 6 pages, in Chinese language, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2511.17005 2026-01-07 cs.CV cs.AI 70%

FLUID: Training-Free Face De-identification via Latent Identity Substitution

FLUID:无需训练的面部去标识化通过潜在身份替换

Jinhyeong Park, Shaheryar Muhammad, Seangmin Lee, Jong Taek Lee, Soon Ki Jung

机构 * Kyungpook National University(庆尚国立大学)

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 FLUID通过在预训练扩散模型的潜在空间中直接替换身份特征,实现了无需训练的面部去标识化,有效平衡了身份抑制与属性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2506.10963 2026-01-07 cs.CV cs.CL 85%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 图像生成评测 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2601.02594 2026-01-07 eess.IV cs.AI cs.CV 70%

Annealed Langevin Posterior Sampling (ALPS): A Rapid Algorithm for Image Restoration with Multiscale Energy Models

退火拉格朗日后验采样(ALPS):一种用于图像修复的多尺度能量模型快速算法

Jyothi Rikhab Chand, Mathews Jacob

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 ALPS通过多尺度能量模型和退火拉格朗日后验采样,提升图像修复和MRI重建的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 57%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23379 2026-01-07 cs.CV cs.AI 57%

SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation

SoulX-FlashTalk: 通过自校正双向蒸馏实现音频驱动的实时无限流式生成

Le Shen, Qian Qiao, Tan Yu, Ke Zhou, Tianhang Yu, Yu Zhan, Zhenjie Wang, Ming Tao, Shunshun Yin, Siyuan Liu

机构 * AIGC Team, Soul AI Lab, China(AIGC团队,Soul AI实验室,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SoulX-FlashTalk通过自校正双向蒸馏实现音频驱动的实时无限流式生成,首次达到亚秒启动延迟和32 FPS的高保真交互数字人合成标准。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏