arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-25 至 2025-11-25 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2511.19268 2025-11-25 cs.CV 85%

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04726 2025-11-25 cs.CV cs.AI 85%

Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines

条件扩散中的后门:对负责任的合成数据管道的威胁

Raz Lapid, Almog Dubin

机构 * Raz Lapid Almog Dubin

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种针对ControlNet的模型污染攻击,通过后门生成攻击者指定内容,并提出CFT方法作为防御措施。

Comments Accepted at RDS @ AAAI 2026

Journal ref AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03596 2025-11-25 cs.CV 79%

ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning

ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成

Feng Han, Yang Jiao, Shaoxiang Chen, Junhao Xu, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) MiniMax

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18204 2025-11-25 cs.CV 70%

Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading

生成合成人类囊胚图像用于体外受精囊胚分级

Pavan Narahari, Suraj Rajendran, Lorena Bori, Jonas E. Malmsten, Qiansheng Zhan, Zev Rosenwaks, Nikica Zaninovic, Iman Hajirasouliha

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 DIA框架通过生成高保真的合成囊胚图像,解决体外受精中囊胚分级的数据稀缺和类别不平衡问题,提升AI评估工具的性能和标准化。

Comments The manuscript is 23 pages, with five main figures and one table. The supplemental material includes 23 pages with fourteen figures and four tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17273 2025-11-25 math.OC 50%

The LQR-Schr{ö}dinger Bridge

LQR-薛定谔桥

Marc Lambert

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于LQR成本的薛定谔桥问题求解方法,通过双Riccati方程系统闭式解,实现复杂高斯过程的构造与非均匀扩展。

Journal ref 64th IEEE Conference on Decision and Control, Dec 2025, Rio de Jaineiro, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17906 2025-11-25 cs.HC cs.AI 50%

AnimAgents: Coordinating Multi-Stage Animation Pre-Production with Human-Multi-Agent Collaboration

AnimAgents: 协调多阶段动画前期制作的人机多智能体协作

Wen-Fan Wang, Chien-Ting Lu, Jin Ping Ng, Yi-Ting Chiu, Ting-Ying Lee, Miaosen Wang, Bing-Yu Chen, Xiang 'Anthony' Chen

机构 * National Taiwan University(国立台湾大学) Google DeepMind(谷歌DeepMind) HCI Research, UCLA(人机交互研究, UCLA)

专题命中 可控生成 :image generation(abstract)

AI总结 AnimAgents通过人机多智能体协作系统,协调多阶段动画前期制作流程,提升协调性、一致性和信息管理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏