arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-24 至 2026-02-24 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 6 篇

2602.18533 2026-02-24 cs.CV 88%

Morphological Addressing of Identity Basins in Text-to-Image Diffusion Models

文本到图像扩散模型中身份盆地的形态学分析

Andrew Fraser

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过形态学描述符和提示层面的音感结构,研究揭示了文本到图像扩散模型中身份盆地的系统性导航梯度,展示了身份稳定性和新视觉概念的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 83%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19254 2026-02-24 cs.CV 79%

RegionRoute: Regional Style Transfer with Diffusion Model

RegionRoute: 区域风格迁移与扩散模型

Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Dolby Laboratories, Inc.(杜比实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 70%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18752 2026-02-24 cs.CV cs.GR 62%

Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

多模态大模型中ID一致性优化:通过对齐、纠缠与解纠缠进行面部修复

Yuran Dong, Hang Dai, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 EditedID通过引入对齐、解纠缠和纠缠机制,提升多模态大模型中面部身份一致性的修复能力。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20113 2026-02-24 cs.SD cs.AI 50%

StyleStream: Real-Time Zero-Shot Voice Style Conversion

StyleStream: 实时零样本语音风格转换

Yisi Liu, Nicholas Lee, Gopala Anumanchipalli

机构 * UC Berkeley(伯克利大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 StyleStream通过Destylizer和Stylizer实现实时零样本语音风格转换,采用非自回归架构,端到端延迟仅1秒。

详情

展开后加载摘要…

URL PDF HTML 收藏