arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-26 至 2025-11-26 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2511.19811 2025-11-26 cs.CV cs.CL cs.LG 70%

Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization

无需训练生成多样化且高保真的图像 via 提示语义空间优化

Debin Meng, Chen Jin, Zheng Gao, Yanran Li, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院) Centre for AI, AstraZeneca(AstraZeneca人工智能中心) University of Bedfordshire(贝德福德大学) Samsung AI Center(三星人工智能中心)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 57%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19919 2025-11-26 cs.CV 57%

HybriDLA: Hybrid Generation for Document Layout Analysis

HybriDLA:文档布局分析的混合生成

Yufan Chen, Omar Moured, Ruiping Liu, Junwei Zheng, Kunyu Peng, Jiaming Zhang, Rainer Stiefelhagen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HybriDLA通过结合扩散和自回归解码,实现文档布局分析的高精度区域预测,达到83.5%的mAP性能。

Comments Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19856 2025-11-26 cs.CV 57%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 57%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20174 2025-11-26 physics.chem-ph 50%

Bipotentiostatic Control Unlocks Flashing Ratchet Features in Ion Pumps

双电位控制解锁离子泵的闪烁马达特性

Eden Grossman, Alon Herman, Keren Shushan Alshochat, Dafna Amichay, Ilan Bijaoui, Gideon Segev

专题命中 可控生成 :diffusion(abstract)

AI总结 双电位控制解锁离子泵的闪烁马达特性,实现频率依赖的电流反转和设备不对称性调节,提升离子分离性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22565 2025-11-26 stat.ML cs.LG math.OC 50%

Adjoint Schrödinger Bridge Sampler

伴随施罗德inger桥采样器

Guan-Horng Liu, Jaemoo Choi, Yongxin Chen, Benjamin Kurt Miller, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR) Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ASBS是一种基于施罗德inger桥的新型扩散采样器,通过伴随匹配方法实现高效采样,无需估计目标样本,适用于多种能量函数和分子分布。

Comments NeurIPS 2025 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03068 2025-11-26 cs.LG cs.AI 50%

Domain Fusion Controllable Generalization for Cross-Domain Time Series Forecasting from Multi-Domain Integrated Distribution

多域集成分布下的领域融合可控泛化用于跨领域时间序列预测

Xiangkai Ma, Xiaobin Hong, Mingkai Lin, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出TimeControl模型,通过领域融合范式整合多领域时间序列信息,利用扩散模型实现跨领域时间序列预测的可控泛化。

Comments We have updated the abstract, introduction and related work. Additionally, we have incorporated the latest competitive baseline models

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2505.16565 2025-11-26 cs.CV 83%

M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion

M2SVid:单目到立体视频转换的端到端修复与细化

Nina Shvetsova, Goutam Bhat, Prune Truong, Hilde Kuehne, Federico Tombari

机构 * Google(谷歌) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Goethe University Frankfurt(法兰克福歌德大学) MPI for Informatics, Saarland Informatics Campus(信息研究所,萨尔兰信息校区) Technical University of Munich(慕尼黑技术大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 M2SVid通过端到端修复和细化技术,实现单目到立体视频转换,生成高质量右视图并提升效率。

Comments To be published at 3DV 2026, project webpage https://m2svid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20202 2025-11-26 cs.CV 79%

Robust 3D Brain MRI Inpainting with Random Masking Augmentation

鲁棒的3D脑部MRI修补与随机掩码增强

Juexin Zhang, Ying Weng, Ke Chen

机构 * University of Nottingham Ningbo(诺丁汉大学宁波分校)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于U-Net和随机掩码增强的3D脑部MRI修补方法,在BraTS-Inpainting 2025挑战赛中取得第一名。

Comments Accepted by the International Brain Tumor Segmentation (BraTS) challenge organized at MICCAI 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2510.20820 2025-11-26 cs.CV 83%

LayerComposer: Multi-Human Personalized Generation via Layered Canvas

LayerComposer: 通过分层画布实现多人类个性化生成

Guocheng Gordon Qian, Ruihang Zhang, Tsai-Shien Chen, Yusuf Dalva, Anujraaj Argo Goyal, Willi Menapace, Ivan Skorokhodov, Meng Dong, Arpit Sahni, Daniil Ostashev, Ju Hu, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Inc. University of Toronto(多伦多大学) UC Merced(加州大学默塞德分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 个性化与一致性 :personalized generation(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LayerComposer通过分层画布实现多人类个性化生成,提供直观的人类注入和高效 scalable 的生成框架。

Comments 17 pages including appendix, preprint. Project page: https://snap-research.github.io/layercomposer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV 57%

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2511.20256 2025-11-26 cs.CV 79%

The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation

图像作为自身奖励:基于对抗性奖励的图像生成强化学习

Weijia Mao, Hao Chen, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Adv-GRPO框架,通过对抗性奖励提升图像生成质量,利用图像自身作为奖励,结合参考图像和基础模型,实现更高质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20513 2025-11-26 cs.CV cs.AI cs.CL cs.HC 70%

DesignPref: Capturing Personal Preferences in Visual Design Generation

DesignPref: 在视觉设计生成中捕捉个人偏好

Yi-Hao Peng, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 DesignPref通过引入包含20名专业设计师多级评分的12,000对UI设计比较数据集,研究个性化视觉设计评估,展示个性化模型在预测个体偏好上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20647 2025-11-26 cs.CV 57%

Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

多样视频生成与确定性点过程引导的策略优化

Tahira Kazimi, Connor Dunlop, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DPP-GRPO框架,结合DPP和GRPO理论,通过显式奖励提升视频生成的多样性,同时保持高质量和提示一致性。

Comments Project webpage: https://diverse-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 7 篇

2511.20549 2025-11-26 cs.CV cs.AI 79%

Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习

Guanjie Chen, Shirui Huang, Kai Liu, Jianchen Zhu, Xiaoye Qu, Peng Chen, Yu Cheng, Yifu Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20251 2025-11-26 cs.CV 79%

PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling

PromptMoG: 通过提示嵌入混合高斯采样增强长提示图像生成的多样性

Bo-Kai Ruan, Teng-Fang Hsiao, Ling Lo, Yi-Lun Wu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与蒸馏 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 PromptMoG通过混合高斯采样提升长提示图像生成的多样性,保持语义一致性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20410 2025-11-26 cs.CV 57%

Image-Free Timestep Distillation via Continuous-Time Consistency with Trajectory-Sampled Pairs

无图像时间步蒸馏:通过连续时间一致性与轨迹采样对偶

Bao Tang, Shuai Zhang, Yueting Zhu, Jijun Xiang, Xin Yang, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 TBCM通过直接提取教师模型生成轨迹的潜在表示,实现无训练数据依赖的时间步蒸馏,提升效率和简洁性,同时在生成质量与资源消耗上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19835 2025-11-26 cs.CV cs.AI 57%

Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation

校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。

Comments Code at https://github.com/BienLuky/Rectified-SpaAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17690 2025-11-26 cs.CV cs.AI cs.LG 57%

Segmentation-Aware Generative Reinforcement Network (GRN) for Tissue Layer Segmentation in 3-D Ultrasound Images for Chronic Low-back Pain (cLBP) Assessment

面向慢性低背痛(cLBP)评估的3D超声图像组织层分割的分割感知生成强化网络(GRN)

Zixue Zeng, Xiaoyan Zhao, Matthew Cartier, Tong Yu, Jing Wang, Xin Meng, Zhiyu Sheng, Maryam Satarpour, John M Cormack, Allison Bean, Ryan Nussbaum, Maya Maurer, Emily Landis-Walkenhorst, Dinesh Kumbhare, Kang Kim, Ajay Wasan, Jiantao Pu

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 GRN通过整合分割损失反馈,实现图像生成与分割的联合训练,显著减少标注数据需求,提升3D超声图像中组织层分割的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18165 2025-11-26 cs.LG cs.AI 50%

Non-equilibrium Annealed Adjoint Sampler

非平衡退火共轭采样器

Jaemoo Choi, Yongxin Chen, Molei Tao, Guan-Horng Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) FAIR at Meta(Meta的FAIR)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 非平衡退火共轭采样器通过引入退火参考动力学,提升扩散模型在学习控制的稳定性和效率,适用于多种采样任务。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19594 2025-11-26 astro-ph.IM 50%

Pixellated Posterior Sampling of Point Spread Functions in Astronomical Images

像素化的点扩散函数后验采样在天文学图像中

Connor Stone, Ronan Legin, Alexandre Adam, Nikolay Malkin, Gabriel Missael Barco, Laurence Perreaul-Levasseur, Yashar Hezaveh

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于生成扩散模型的像素级PSF后验采样方法,通过结合高斯似然与生成模型先验,实现对天文学图像中点扩散函数的高精度建模,提升后续分析的不确定性传播能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏