arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-26 至 2025-11-26 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2511.20218 2025-11-26 cs.CV 79%

Text-guided Controllable Diffusion for Realistic Camouflage Images Generation

基于文本引导的可控扩散生成逼真伪装图像

Yuhang Qian, Haiyan Chen, Wentong Li, Ningzhong Liu, Jie Qin

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CT-CIG方法,通过文本引导和可控扩散生成逼真且逻辑合理的伪装图像,利用VLM和FIRM模块提升伪装图像质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16249 2025-11-26 cs.GR 79%

Controllable Layer Decomposition for Reversible Multi-Layer Image Generation

可控制的分层分解用于可逆的多层图像生成

Zihao Liu, Zunnan Xu, Shi Shu, Jun Zhou, Ruicheng Zhang, Zhenchao Tang, Xiu Li

专题命中 可控生成 :image generation(title);inpainting(abstract);分类 cs.GR

AI总结 本文提出CLD方法,通过可控分层分解实现多层图像的细粒度控制与精确生成,提升图像编辑的可控性和实用性。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23738 2025-11-26 cs.CV cs.GR 79%

How Animals Dance (When You're Not Looking)

动物跳舞(当你不在看的时候)

Xiaojuan Wang, Aleksander Holynski, Brian Curless, Ira Kemelmacher, Steve Seitz

机构 * University of Washington(华盛顿大学) Columbia University(哥伦比亚大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出了一种生成音乐同步且具有舞蹈意识的动物跳舞视频的框架,通过引入舞蹈模式和图优化问题实现高效舞蹈合成。

Comments Project page: https://how-animals-dance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19811 2025-11-26 cs.CV cs.CL cs.LG 70%

Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization

无需训练生成多样化且高保真的图像 via 提示语义空间优化

Debin Meng, Chen Jin, Zheng Gao, Yanran Li, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院) Centre for AI, AstraZeneca(AstraZeneca人工智能中心) University of Bedfordshire(贝德福德大学) Samsung AI Center(三星人工智能中心)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 57%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19919 2025-11-26 cs.CV 57%

HybriDLA: Hybrid Generation for Document Layout Analysis

HybriDLA:文档布局分析的混合生成

Yufan Chen, Omar Moured, Ruiping Liu, Junwei Zheng, Kunyu Peng, Jiaming Zhang, Rainer Stiefelhagen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HybriDLA通过结合扩散和自回归解码,实现文档布局分析的高精度区域预测,达到83.5%的mAP性能。

Comments Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19856 2025-11-26 cs.CV 57%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 57%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20174 2025-11-26 physics.chem-ph 50%

Bipotentiostatic Control Unlocks Flashing Ratchet Features in Ion Pumps

双电位控制解锁离子泵的闪烁马达特性

Eden Grossman, Alon Herman, Keren Shushan Alshochat, Dafna Amichay, Ilan Bijaoui, Gideon Segev

专题命中 可控生成 :diffusion(abstract)

AI总结 双电位控制解锁离子泵的闪烁马达特性,实现频率依赖的电流反转和设备不对称性调节,提升离子分离性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22565 2025-11-26 stat.ML cs.LG math.OC 50%

Adjoint Schrödinger Bridge Sampler

伴随施罗德inger桥采样器

Guan-Horng Liu, Jaemoo Choi, Yongxin Chen, Benjamin Kurt Miller, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR) Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ASBS是一种基于施罗德inger桥的新型扩散采样器,通过伴随匹配方法实现高效采样,无需估计目标样本,适用于多种能量函数和分子分布。

Comments NeurIPS 2025 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03068 2025-11-26 cs.LG cs.AI 50%

Domain Fusion Controllable Generalization for Cross-Domain Time Series Forecasting from Multi-Domain Integrated Distribution

多域集成分布下的领域融合可控泛化用于跨领域时间序列预测

Xiangkai Ma, Xiaobin Hong, Mingkai Lin, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出TimeControl模型,通过领域融合范式整合多领域时间序列信息,利用扩散模型实现跨领域时间序列预测的可控泛化。

Comments We have updated the abstract, introduction and related work. Additionally, we have incorporated the latest competitive baseline models

详情

展开后加载摘要…

URL PDF HTML 收藏