arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-04 至 2026-02-04 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2602.03126 2026-02-04 cs.CV 79%

Flexible Geometric Guidance for Probabilistic Human Pose Estimation with Diffusion Models

基于扩散模型的灵活几何引导用于概率人体姿态估计

Francis Snelgar, Ming Xu, Stephen Gould, Liang Zheng, Akshay Asthana

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院) Seeing Machines

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的灵活几何引导方法,用于概率人体姿态估计,通过引导框架实现从2D图像中生成一致的3D姿态,无需配对数据训练,展示了在多个数据集上的高性能和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03826 2026-02-04 cs.CV cs.GR 62%

Continuous Control of Editing Models via Adaptive-Origin Guidance

通过自适应起源引导实现编辑模型的连续控制

Alon Wolf, Chen Katzir, Kfir Aberman, Or Patashnik

机构 * Tel Aviv University, Decart.ai(特拉维夫大学,Decart.ai) Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出AdaOr方法,通过自适应调整指导起源实现编辑模型的连续强度控制,提升编辑过程的平滑性和一致性。

Comments Project page at https://adaor-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03339 2026-02-04 cs.CV 57%

Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability

可组合的视觉标记生成器:无生成器诊断的可学习性

Bingchen Zhao, Qiushan Guo, Ye Wang, Yixuan Huang, Zhonghua Zhai, Yu Tian

机构 * University of Edinburgh(爱丁堡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CompTok通过训练可组合的视觉标记生成器,提升图像生成的组合性和语义编辑能力,同时引入两个度量标准评估标记空间的可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03314 2026-02-04 cs.CV 57%

PQTNet: Pixel-wise Quantitative Thermography Neural Network for Estimating Defect Depth in Polylactic Acid Parts by Additive Manufacturing

PQTNet:用于通过增材制造估计聚乳酸部件缺陷深度的像素级定量热成像神经网络

Lei Deng, Wenhao Huang, Chao Yang, Haoyuan Zheng, Yinbin Tian, Yue Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PQTNet通过像素级定量热成像神经网络,实现了对增材制造聚乳酸部件缺陷深度的高精度估计,具有高精度和鲁棒性的定量缺陷表征能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03105 2026-02-04 cs.CV 57%

Gromov Wasserstein Optimal Transport for Semantic Correspondences

Gromov Wasserstein最优传输用于语义对应关系

Francis Snelgar, Stephen Gould, Ming Xu, Liang Zheng, Akshay Asthana

机构 * Seeing Machines

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出使用 Gromov Wasserstein 最优传输算法替代传统方法,提升语义对应关系任务的性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13264 2026-02-04 physics.optics physics.atom-ph quant-ph 50%

High-Precision Phase Control of an Optical Lattice with up to 50 dB Noise Suppression

光学晶格高精度相位控制及50dB噪声抑制

Kendall Mehling, Murray Holland, Catie LeDesma

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出了一种高精度光学晶格相位控制方法,通过双频差锁技术实现50dB噪声抑制,支持高带宽调制,用于原子干涉仪的复杂相位操控。

Comments 8 pages, 4 figures

Journal ref Phys. Rev. Applied 25, 024008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏