arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-06 至 2026-02-06 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2506.01758 2026-02-06 cs.CV 79%

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

许多对许多:统一多个视频和图像生成与操控任务的训练

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * ByteDance(字节跳动) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出many-for-many框架,通过统一训练多个视频和图像生成与操控任务,提升视频生成性能并引入深度图条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15259 2026-02-06 cs.CV cs.AI 79%

Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation

从扩散模型中引入多样性以实现语义引导的面部资产生成

Yunxuan Cai, Sitao Xiang, Zongjian Li, Haiwei Chen, Yajie Zhao

机构 * University of Southern California, USC Institute for Creative Technologies(美国南加州大学,USC创意技术研究所) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种语义可控的生成网络,通过扩散模型生成高质量3D面部数据库,并开发了高效的GAN基生成器,用于创建和编辑高质量面部资产。

Comments Accepted Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 62%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06042 2026-02-06 cs.LG cs.CV 57%

Pseudo-Invertible Neural Networks

伪可逆神经网络

Yamit Ehrlich, Nimrod Berman, Assaf Shocher

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出伪可逆神经网络,用于解决非线性逆问题,通过非线性反向投影实现零样本逆向生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 57%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05534 2026-02-06 cs.CV 57%

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

SSG: 多尺度视觉自回归生成的缩放空间引导

Youngwoo Shin, Jiwan Hur, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SSG通过缩放空间引导方法,在无需训练的情况下提升多尺度视觉自回归生成的保真度和多样性,同时保持低延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05213 2026-02-06 cs.CV 57%

Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures

通过显式语义和隐式纹理实现超低比特率的双表示图像压缩

Chuqin Zhou, Xiaoyue Ling, Yunuo Chen, Jincheng Dai, Guo Lu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种融合显式语义和隐式纹理的图像压缩框架,通过无训练的方式提升超低比特率下的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05331 2026-02-06 math.AP 50%

Dynamics of a nonlocal epidemic model with a new free boundary condition, part 1: Spreading-vanishing dichotomy

非局部流行病模型的动力学研究:带有新自由边界条件的扩散-反应系统,第一部分:扩散-消失二元性

Yao Chen, Yihong Du, Wan-Tong Li, Rong Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种新的自由边界条件,研究非局部流行病模型的长期动力学行为,揭示了扩散与消失的二元性及其精确阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21200 2026-02-06 stat.ML cs.LG 50%

Provably Reliable Classifier Guidance via Cross-Entropy Control

通过交叉熵控制实现可证明可靠的分类器引导

Sharan Sahu, Arisina Banerjee, Yuchen Wu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过交叉熵控制证明了分类器引导扩散模型的可靠性,建立了分类器训练与引导对齐的理论联系。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11523 2026-02-06 math.OC 50%

An infinite horizon sufficient stochastic maximum principle for regime switching diffusions and applications

无限时间充分随机最大原理及其在 regime switching 扩散中的应用

Kai Ding, Xun Li, Siyu Lv, Xin Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种无限时间 horizon 的随机最大原理,用于 regime switching 扩散的最优控制问题,并通过线性二次生产计划问题展示了其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05207 2026-02-06 eess.AS cs.AI 50%

ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference

ARCHI-TTS: 一种基于流匹配的文本到语音模型,配备自监督语义对齐器和加速推理

Chunyat Wu, Jiajun Deng, Zhengxi Liu, Zheqi Dai, Haolin He, Qiuqiang Kong

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 ARCHI-TTS通过自监督语义对齐器和高效推理策略,实现了高效率的文本到语音合成,优于现有最先进系统。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏