arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-21 至 2026-01-21 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2601.14056 2026-01-21 cs.CV cs.AI 83%

POCI-Diff: Position Objects Consistently and Interactively with 3D-Layout Guided Diffusion

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21788 2026-01-21 cs.CV cs.AI 83%

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE:基于指令的低秩专家混合用于多条件图像生成

Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

机构 * ByteDance Inc.(字节跳动公司) Rutgers University(罗格斯大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 InstructMoLE通过指令引导的全局路由策略和输出空间正交损失,提升多条件图像生成任务的性能和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13245 2026-01-21 cs.CV 79%

CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation

CymbaDiff:基于结构化的空间扩散用于基于草图的3D语义城市场景生成

Li Liang, Bo Miao, Xinyu Wang, Naveed Akhtar, Jordan Vice, Ajmal Mian

机构 * The University of Western Australia(西澳大学) AIML, The University of Adelaide(阿德莱德大学) The University of Melbourne(墨尔本大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CymbaDiff通过结构化空间扩散提升基于草图的3D语义城市场景生成的语义一致性与空间真实性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 62%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11074 2026-01-21 cs.CV 57%

Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image

评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式

Matthias Humt, Ulrich Hillenbrand, Rudolph Triebel

机构 * German Aerospace Center(德国航空航天中心) TU Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。

Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09371 2026-01-21 astro-ph.SR 50%

Constraining the outer boundary condition for the Babcock-Leighton dynamo models

约束Babcock-Leighton动力学模型的外边界条件

Yukun Luo, Jie Jiang, Binghang Li, Zebin Zhang, Ruihui Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 提出零径向扩散外边界条件,使BL动力学模型与表面磁流输送模拟一致,再现太阳周期特性并更符合观测结果。

Comments 8 pages, 4 figures, 1 table, accepted by A&A

Journal ref A&A 705, A237 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01493 2026-01-21 cs.RO 50%

Floor Plan-Guided Visual Navigation Incorporating Depth and Directional Cues

结合深度和方向线索的平面图引导视觉导航

Weiqi Huang, Jiaxin Li, Zan Wang, Huijun Di, Wei Liang, Zhu Yang

机构 * Beijing Institute of Technology(北京理工大学) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 GlocDiff通过结合局部深度线索和全局方向指导,实现高效的平面图引导视觉导航。

详情

展开后加载摘要…

URL PDF HTML 收藏