arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-13 至 2026-02-13 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2510.11000 2026-02-13 cs.CV 70%

ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation

ContextGen: 基于情境布局锚定的多实例生成

Ruihang Xu, Dewei Zhou, Fan Ma, Yi Yang

机构 * ReLER Lab, CCAI, Zhejiang University(ReLER实验室、中国计算机学会、浙江大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 ContextGen通过情境布局锚定和身份一致性注意力机制,实现多实例生成中的布局控制与身份一致性,首次构建了IMIG-100K数据集并取得新突破。

Comments Project Page: https://nenhang.github.io/ContextGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11440 2026-02-13 cs.CV 70%

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

Ctrl&Shift: 视觉生成中高质量的几何感知物体操控

Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司) University of Electronic Science and Technology of China(电子科技大学) NVIDIA

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 57%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13757 2026-02-13 eess.IV cs.CV cs.LG 57%

Improving the Plausibility of Pressure Distributions Synthesized from Depth Image through Generative Modeling

通过生成模型提升从深度图像合成压力分布的可信度

Neevkumar Manavar, Hanno Gerd Meyer, Joachim Waßmuth, Barbara Hammer, Axel Schneider

机构 * Hochschule Bielefeld, Interaktion(比勒菲尔德应用科学大学,交互学院) CITEC, Bielefeld University(比勒菲尔德大学,CITEC研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过生成模型提升从深度图像合成压力分布的可信度,采用ILS和WOL增强物理一致性,对比实验显示其在性能和效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11579 2026-02-13 cond-mat.mtrl-sci 50%

Coupling Lattice Distortion and Cation Disorder to Control Li-ion Transport in Cation-Disordered Rocksalt Oxides

耦合晶格畸变与阳离子无序以控制阳离子在阳离子无序岩盐氧化物中的传输

Zichang Zhang, Lihua Feng, Jiewei Cheng, Peng-Hu Du, Chu-Liang Fu, Jian Peng, Shuo Wang, Dingguo Xia, Xueliang Sun, Qiang Sun

专题命中 可控生成 :diffusion(abstract)

AI总结 通过耦合晶格畸变与阳离子无序,研究发现晶格畸变可增强Li+渗透网络,设计的高熵氧化物实现71.9%的Li+渗透率,达到256.3 mAh/g容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11226 2026-02-13 cs.IT cs.LG math.IT 50%

Generative AI-Driven Phase Control for RIS-Aided Cell-Free Massive MIMO Systems

生成式AI驱动的RIS辅助大规模MIMO系统相位控制

Kalpesh K. Patel, Malay Chakraborty, Ekant Sharma, Sandeep Kumar Singh

机构 * Department of Electronics and Communication Engineering, Indian Institute of Technology, Roorkee(电子与通信工程系,印度理工学院,罗尔基)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出两种生成式AI方法用于优化RIS辅助cell-free mMIMO系统中的相位偏移,GCDM和GCDIM在提升频谱效率的同时显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏