arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-12 至 2025-12-12 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 31 篇

2509.06120 2025-12-12 cs.LG stat.ML 50%

If generative AI is the answer, what is the question?

如果生成式AI是答案,那么问题又是什么?

Ambuj Tewari

机构 * University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨生成式AI的基础,分析其与预测、压缩和决策的关系,并介绍生成模型家族及社会负责任生成的关键问题。

Comments To appear as a book chapter in a Springer book titled "Statistical Foundations and Applications of Artificial Intelligence, Machine Learning and Deep Learning" and edited by S. Ejaz Ahmed, Pierre Alquier, Yi Li, Shuangge Ma

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19520 2025-12-12 math.NA cs.NA 50%

Lévy Score Function and Score-Based Particle Algorithm for Nonlinear Lévy--Fokker--Planck Equations

莱维分数函数与基于分数的粒子算法用于非线性莱维-福克-普朗克方程

Yuanfei Huang, Chengyu Liu, Xiang Zhou

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出莱维分数函数与基于分数的粒子算法,用于求解非线性莱维-福克-普朗克方程,解决了跳跃和不连续性问题,并通过数值实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09987 2025-12-12 astro-ph.GA 50%

Orbital migration and heating history of the Galactic disc: a transition between the bimodal discs

银河盘的轨道迁移和加热历史:从双峰盘的过渡

HanYuan Zhang, Vasily Belokurov, Jason L. Sanders, N. Wyn Evans, David Chemaly, Daisuke Kawata, Natsuki Funakoshi, Neige Frankel, Sarah G. Kane, Sergey E. Koposov

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过构建银河盘的 chrono-chemo-dynamical 模型,揭示了恒星迁移和加热历史,发现双峰盘的过渡与径向迁移效率变化相关,支持缩小场景。

Comments 12 pages, 9 figures, 3 appendices. Submitted to MNRAS. Comments welcome. Key results are shown in Figure 3 and 4

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2512.09954 2025-12-12 cs.CR 71%

Cross-Layer Isochronous Diffusion Protocol (CIDP): A Rigorous Information-Theoretic and Control-Theoretic Framework for Sovereign Tactical Anonymity

跨层等时扩散协议(CIDP):一种严格的信息论和控制论框架,用于主权战术匿名性

Pravin G

专题命中 可控生成 :diffusion(title)

AI总结 CIDP通过物理层熵注入和控制理论框架,实现强匿名性、低延迟和低带宽开销的平衡,适用于主权战术网络的JADC2部署。

Comments 11 pages, 4 figures, 4 tables, with full proofs and FPGA prototype evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 57%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 57%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08591 2025-12-12 cs.CV 57%

Joint2Human: High-quality 3D Human Generation via Compact Spherical Embedding of 3D Joints

Joint2Human: 通过紧凑的球面嵌入3D关节实现高质量3D人体生成

Muxin Zhang, Qiao Feng, Zhuo Su, Chao Wen, Zhou Xue, Kun Li

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) PICO IDL, ByteDance China(字节跳动中国PICO IDL) Li Auto(利亚德)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Joint2Human通过紧凑球面嵌入3D关节,结合2D扩散模型和多视角重绘策略,实现高质量3D人体生成,兼顾全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10654 2025-12-12 math.OC 50%

Strong Global Convergence of the Consensus-Based Optimization Algorithm

基于共识的优化算法的强全局收敛性

Sabrina Bonandin, Konstantin Riedl, Sara Veneruso

专题命中 可控生成 :diffusion(abstract)

AI总结 本文证明了基于共识的优化算法在特定条件下对全局极小值的强收敛性,并给出了超参数选择和收敛速率的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2511.12419 2025-12-12 cs.CV 79%

Seeing Through the Rain: Resolving High-Frequency Conflicts in Deraining and Super-Resolution via Diffusion Guidance

雨中透视:通过扩散引导解决去雨和超分辨率中的高频冲突

Wenjie Li, Jinglei Shi, Jin Han, Heng Guo, Zhanyu Ma

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DHGM模型,通过整合预训练扩散先验和高通滤波器,解决去雨和超分辨率中的高频冲突,实现高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10581 2025-12-12 cs.CV 57%

Unleashing Degradation-Carrying Features in Symmetric U-Net: Simpler and Stronger Baselines for All-in-One Image Restoration

释放携带退化特征的对称U-Net:适用于所有图像修复的更简单且更强的基线

Wenlong Jiao, Heyang Lee, Ping Wang, Pengfei Zhu, Qinghua Hu, Dongwei Ren

机构 * School of Mathematics, Tianjin University(天津大学数学学院) School of Cybersecurity, Tianjin University(天津大学网络安全学院) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SymUNet和SE-SymUNet,通过简单对称U-Net架构有效释放退化特征,实现高效且强大的图像修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09583 2025-12-12 cs.CV 57%

UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision

UnReflectAnything:通过渲染合成镜面监督实现仅RGB的高光去除

Alberto Rota, Mert Kiray, Mert Asim Karaoglu, Patrick Ruhkamp, Elena De Momi, Nassir Navab, Benjamin Busam

机构 * Politecnico di Milano(米兰理工学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ImFusion(ImFusion公司)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 UnReflectAnything通过渲染合成镜面监督,实现仅RGB图像的高光去除,适用于自然和手术领域。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2512.10949 2025-12-12 cs.CV cs.AI cs.CL 57%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10237 2025-12-12 cs.CV 57%

Multi-dimensional Preference Alignment by Conditioning Reward Itself

通过条件化奖励进行多维偏好对齐

Jiho Jang, Jinyoung Kim, Kyungjune Baek, Nojun Kwak

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 MCDPO通过条件化奖励解决多维偏好对齐问题,实现独立优化方向学习和动态控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 57%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 1 篇

2511.00090 2025-12-12 cs.CV cs.AI 79%

LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation

LeMiCa:基于词典极小极大路径缓存的高效扩散式视频生成

Huanlin Gao, Ping Chen, Fuyuan Shi, Chao Tan, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(数据科学与人工智能研究院,中国联合电信) Unicom Data Intelligence, China Unicom(中国联合电信数据智能中心)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 LeMiCa通过词典极小极大路径优化策略,提升扩散式视频生成的推理速度与生成质量,实现高效且高质量的视频合成。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2412.16326 2025-12-12 cs.CV cs.LG 57%

When Worse is Better: Navigating the compression-generation tradeoff in visual tokenization

当更差的是更好的:在视觉分块化中的压缩-生成权衡导航

Vivek Ramanujan, Kushal Tirumala, Armen Aghajanyan, Luke Zettlemoyer, Ali Farhadi

机构 * University of Washington(华盛顿大学) Meta FAIR

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CRT方法,通过正则化潜在空间提升生成性能,实现更高效的图像生成模型。

Comments Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏