arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-03 至 2026-02-03 共收录 167 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 9 篇

2602.00627 2026-02-03 cs.CV 77%

FaceSnap: Enhanced ID-fidelity Network for Tuning-free Portrait Customization

FaceSnap: 增强的ID保真网络用于无调优的人像定制

Benxiang Zhai, Yifang Xu, Guofeng Zhang, Yang Li, Sidan Du

机构 * Vision AI System Lab, Nanjing University, Nanjing, China(南京大学视觉人工智能系统实验室) Research and Development Department, Wonxing Technology, Shanghai, China(Wonxing技术有限公司研发部)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FaceSnap通过引入面部属性混合器和地标预测器,实现无需微调的高保真人像定制生成。

Comments Accept by ICANN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01306 2026-02-03 cs.CV 70%

DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling

DeCorStory: 通过Gram-Schmidt提示嵌入去相关实现一致叙事

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔理工学院) Universiti Malaya(马来亚大学)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 DeCorStory通过Gram-Schmidt提示嵌入去相关和跨注意力机制,提升文本到图像叙事中的一致性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01305 2026-02-03 cs.CV 70%

StoryState: Agent-Based State Control for Consistent and Editable Storybooks

StoryState: 基于代理的状态控制用于一致且可编辑的故事书

Ayushman Sarkar, Zhenyu Yu, Wei Tang, Chu Chen, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20626 2026-02-03 cs.CV 70%

ConsiStyle: Style Diversity in Training-Free Consistent T2I Generation

ConsiStyle: 训练无一致性T2I生成中的风格多样性

Yohai Mazuz, Janna Bruner, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ConsiStyle提出一种训练无方法,首次实现不同风格下风格保持和主体一致性的联合优化,通过调整注意力矩阵和统计特性对齐,解耦风格与外观,实现高质量文本对齐图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00729 2026-02-03 cs.CV 57%

Supervised makeup transfer with a curated dataset: Decoupling identity and makeup features for enhanced transformation

带 curated 数据集的监督化妆转移:解耦身份和化妆特征以增强转换

Qihe Pan, Yiming Wu, Xing Zhao, Liang Xie, Guodao Sun, Ronghua Liang

机构 * School of Computer Science and Technology, Zhejiang University of Technology, Zhejiang, China(浙江工业大学计算机科学与技术学院) The University of Hong Kong(香港大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于 curated 数据集的监督化妆转移方法,通过解耦身份和化妆特征,提升化妆转换的保真度和可控性。

Comments This paper has been accepted for publication in the proceedings of 2026 IEEE ICASSP Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01908 2026-02-03 cs.SD 50%

LipSody: Lip-to-Speech Synthesis with Enhanced Prosody Consistency

LipSody:通过增强语调一致性进行唇到语音合成

Jaejun Lee, Yoori Oh, Kyogu Lee

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能跨学科项目,首尔国立大学) Artificial Intelligence Institute, Seoul National University, Republic of Korea(人工智能研究所,首尔国立大学,韩国)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 LipSody通过结合说话人身份、语言内容和情感上下文,提升唇到语音合成的语调一致性。

Comments This paper has been accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01437 2026-02-03 cs.LG stat.ML 50%

Theoretical Analysis of Measure Consistency Regularization for Partially Observed Data

对部分观测数据的度量一致性正则化的理论分析

Yinsong Wang, Shahin Shahrampour

机构 * H. Milton Stewart School of Industrial & Systems Engineering at Georgia Institute of Technology(佐治亚理工学院H.Milton Stewart工业与系统工程学院) Department of Mechanical and Industrial Engineering at Northeastern University(东北大学机械与工业工程系)

专题命中 个性化与一致性 :inpainting(abstract)

AI总结 本文通过理论分析探讨了度量一致性正则化在部分观测数据中的作用机制,并提出了一种新的训练协议以提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2602.01298 2026-02-03 cs.CV 57%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 57%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00249 2026-02-03 cs.CV cs.AI 57%

SANEval: Open-Vocabulary Compositional Benchmarks with Failure-mode Diagnosis

SANEval: 开放词汇组合评估基准与失败模式诊断

Rishav Pramanik, Ian E. Nielsen, Jeff Smith, Saurav Pandit, Ravi P. Ramachandran, Zhaozheng Yin

机构 * Stony Brook University(石溪大学) nd Set AI Corp.(第二集AI公司) Rowan University(罗文大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 SANEval提出一种开放词汇组合评估基准,结合大型语言模型和增强对象检测器,通过实验展示其在属性绑定、空间关系和数值任务上的评估效果优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01354 2026-02-03 cond-mat.mes-hall 50%

Quantum Metric Length as a Fundamental Length Scale in Disordered Flat Band Materials

量子度量长度作为无序平面波材料中的基本长度尺度

Chun Wang Chau, Tian Xiang, Shuai A. Chen, K. T. Law

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究通过一维李布晶格展示量子度量长度在无序平面波材料中作为基本长度尺度的重要性,揭示其在球形、扩散和局域化区域中的关键作用。

Comments This manuscript supersedes arXiv:2412.19056

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 6 篇

2512.11831 2026-02-03 cs.LG cs.CV 79%

On the Design of One-step Diffusion via Shortcutting Flow Paths

关于通过捷径流路径设计一步扩散模型

Haitao Lin, Peiyan Hu, Minsi Ren, Zhifeng Gao, Zhi-Ming Ma, Guolin ke, Tailin Wu, Stan Z. Li

机构 * Department of Artificial Intelligence, School of Engineering, Westlake University(人工智能系,工程学院,西湖大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学与系统科学学院,中国科学院) DP Technology, Beijing(北京DP技术)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种通用设计框架,用于改进捷径模型,使一步生成模型在无分类器指导设置下达到新的SOTA FID50k值。

Comments 10 pages of main body, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02390 2026-02-03 cs.GR cs.AI eess.IV 79%

F-scheduler: illuminating the free-lunch design space for fast sampling of diffusion models

F-scheduler: 探索扩散模型快速采样中的免费午餐设计空间

Zilai Li, Lujia Bai

机构 * Department of Mathematics, at Ruhr University Bochum in the group of Holger Dette, Germany(鲁尔大学博德姆数学系) Independent Researcher, Guangdong, China(独立研究者)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.GR

AI总结 F-scheduler通过优化ODE求解器与Free-U Net结合,实现扩散模型快速采样,提升图像生成质量与效率

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00107 2026-02-03 cs.CV cs.RO eess.IV 74%

Efficient UAV trajectory prediction: A multi-modal deep diffusion framework

高效无人机轨迹预测:一种多模态深度扩散框架

Yuan Gao, Xinyu Guo, Wenjing Xie, Zifan Wang, Hongwen Yu, Gongyang Li, Shugong Xu

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01814 2026-02-03 cs.CV 57%

GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation

GPD: 用于快速高质量视频生成的引导渐进蒸馏

Xiao Liang, Yunzhu Zhang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 GPD通过引导渐进蒸馏方法,减少视频生成的采样步骤,同时保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01140 2026-02-03 cs.LG 50%

Generalized Radius and Integrated Codebook Transforms for Differentiable Vector Quantization

通用半径与集成代码本变换用于可微向量量化

Haochen You, Heng Zhang, Hongyang He, Yuqi Li, Baojing Liu

机构 * Columbia University(哥伦比亚大学) South China Normal University(南方科技大学) University of Warwick(沃里克大学) The City College of New York(纽约城市学院) Hebei Institute of Communications(河北通信学院)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 GRIT-VQ通过统一的可微框架提升向量量化性能,实现稳定梯度和高效代码本利用。

Comments This paper has been accepted as a conference paper at CPAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00641 2026-02-03 stat.ML cs.LG stat.CO 50%

Sampling from multi-modal distributions on Riemannian manifolds with training-free stochastic interpolants

在黎曼流形上采样多模分布的无训练随机插值法

Alain Durmus, Maxence Noble, Thibaut Pellerin

机构 * CMAP, CNRS, Ecole polytechnique(CMAP、法国国家科学研究中心、巴黎高等师范学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种无训练的随机插值方法,用于在黎曼流形上高效采样多模分布,通过非平衡动力学和随机插值实现无需训练的高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏