arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1272 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1272 篇

2503.23951 2025-11-25 cs.CV 57%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18307 2025-11-25 cs.CV cs.AI cs.LG 57%

ScriptViT: Vision Transformer-Based Personalized Handwriting Generation

ScriptViT: 基于视觉变换器的个性化手写生成

Sajjan Acharya, Rajendra Baskota

机构 * Independent Researcher(独立研究者)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ScriptViT通过基于视觉变换器的风格编码器和交叉注意力机制,实现更准确且风格一致的个性化手写生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV 57%

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04482 2025-11-24 cs.CV 57%

A Training-Free Style-Personalization via SVD-Based Feature Decomposition

基于SVD特征分解的无训练风格个性化生成

Kyoungmin Lee, Jihun Park, Jongmin Gim, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Sunghoon Im

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于SVD特征分解的无训练风格个性化图像生成方法,通过主特征混合和结构注意力校正模块实现风格调控和结构一致性,提升生成效果与部署效率。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20084 2025-11-19 cs.CV 57%

UniVST: A Unified Framework for Training-free Localized Video Style Transfer

Quanjian Song, Mingbao Lin, Wengyi Zhan, Shuicheng Yan, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) Rakuten Asia Pte. Ltd. School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted by TPAMI 2025; Project Page: https://quanjiansong.github.io/projects/UniVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09977 2025-11-17 cs.CV 57%

STELLAR: Scene Text Editor for Low-Resource Languages and Real-World Data

Yongdeuk Seo, Hyun-seok Min, Sungchul Choi

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted to AAAI 2026 Workshop (Artificial Intelligence with Biased or Scarce Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01278 2025-11-12 cs.CV cs.AI cs.CC cs.LG 57%

fruit-SALAD: A Style Aligned Artwork Dataset to reveal similarity perception in image embeddings

Tillmann Ohm, Andres Karjus, Mikhail Tamm, Maximilian Schich

机构 * Tallinn University(塔林大学)

专题命中 个性化与一致性 :image synthesis(abstract);分类 cs.CV

Journal ref Scientific Data volume 12, 254 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07233 2025-11-11 cs.CV cs.LG 57%

Noise & pattern: identity-anchored Tikhonov regularization for robust structural anomaly detection

Alexander Bauer, Klaus-Robert Müller

机构 * Machine Learning Group, TU Berlin(柏林技术大学机器学习组) BIFOLD, Berlin, Germany(柏林BIFOLD) Dept. of AI, Korea University, Seoul, Republic of Korea(韩国大学人工智能系) MPI for Informatics, Saarbrücken, Germany(信息学Max Planck研究所)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01619 2025-11-05 cs.CV 57%

3DBonsai: Structure-Aware Bonsai Modeling Using Conditioned 3D Gaussian Splatting

Hao Wu, Hao Wang, Ruochong Li, Xuran Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00107 2025-11-04 cs.CV cs.AI cs.IR 57%

AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27364 2025-11-03 cs.CV cs.AI 57%

Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V

Meftun Akarsu, Kerem Catay, Sedat Bin Vedat, Enes Kutay Yarkan, Ilke Senturk, Arda Sar, Dafne Eksioglu

机构 * AI Yapım Hagia Labs Singapore(AI Yapım 赫亚实验室新加坡) AI Engineer Hagia Labs İstanbul(AI工程师 赫亚实验室伊斯坦布尔) Full Stack Engineer Hagia Labs İstanbul(全栈工程师 赫亚实验室伊斯坦布尔) Chief Creator Hagia Labs İstanbul(首席创作者 赫亚实验室伊斯坦布尔)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15743 2025-11-03 cs.CV 57%

SRAGAN: Saliency Regularized and Attended Generative Adversarial Network for Chinese Ink-wash Painting Style Transfer

Xiang Gao, Yuqi Zhang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Pattern Recognition, Volume 162, June 2025, 111344

Journal ref Pattern Recognition, 2025, 162: 111344

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22810 2025-10-28 cs.CV 57%

MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04705 2025-10-28 cs.CV 57%

Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Han Feng, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University, Tencent Youtu Lab(上海交通大学,腾讯云图实验室) Tencent Youtu Lab(腾讯云图实验室) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

Comments ACM Multimedia 2025; code URL: https://github.com/rain152/IPVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21857 2025-10-28 cs.CV cs.AI 57%

Poisson Flow Consistency Training

Anthony Zhang, Mahmut Gokmen, Dennis Hein, Rongjun Ge, Wenjun Xia, Ge Wang, Jin Chen

机构 * Pratt School of Engineering Duke University(普拉特工程学院 哥伦比亚大学) Biomedical Imaging Center Rensselaer Polytechnic Institute(生物医学成像中心 莱文森理工学院) Department of Computer Science University of Kentucky(计算机科学系 肯塔基大学) Department of Medicine Department of Biomedical Informations University of Alabama at Birmingham(医学系 生物医学信息学系 亚拉巴马大学伯明翰分校) School of Engineering Sciences Department of Physics KTH Royal Institute of Technology(工程科学学院 物理系 瑞典皇家理工学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21696 2025-10-27 cs.CV 57%

BachVid: Training-Free Video Generation with Consistent Background and Character

Han Yan, Xibin Song, Yifu Wang, Hongdong Li, Pan Ji, Chao Ma

机构 * MoE Key Lab of Artificial, AI Institute, Shanghai Jiao Tong University(人工智能研究院,上海交通大学) Vertex Lab(Vertex实验室) Australian National University(澳大利亚国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Project page: https://wolfball.github.io/bachvid

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19193 2025-10-24 cs.CV 57%

Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning

Takehiro Aoshima, Yusuke Shinohara, Byeongseon Park

机构 * LY Corporation(LY公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15277 2025-10-22 cs.CV 57%

Foundation Cures Personalization: Improving Personalized Models' Prompt Consistency via Hidden Foundation Knowledge

Yiyang Cai, Zhengkai Jiang, Yulong Liu, Chunyang Jiang, Wei Xue, Yike Guo, Wenhan Luo

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tencent Hunyuan(腾讯文元)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16332 2025-10-21 cs.CV 57%

TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement

Haiyue Sun, Qingdong He, Jinlong Peng, Peng Tang, Jiangning Zhang, Junwei Zhu, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15194 2025-10-20 cs.CV 57%

Salient Concept-Aware Generative Data Augmentation

Tianchen Zhao, Xuanbai Chen, Zhihua Li, Jun Fang, Dongsheng An, Xiang Xu, Zhuowen Tu, Yifan Xing

机构 * AWS DS3

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures, NeurIPS2025

Journal ref NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15021 2025-10-20 cs.CV 57%

Constantly Improving Image Models Need Constantly Improving Benchmarks

Jiaxin Ge, Grace Luo, Heekyung Lee, Nishant Malpani, Long Lian, XuDong Wang, Aleksander Holynski, Trevor Darrell, Sewon Min, David M. Chan

机构 * UC Berkeley(伯克利大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15671 2025-10-20 cs.CV 57%

CHROME: Clothed Human Reconstruction with Occlusion-Resilience and Multiview-Consistency from a Single Image

Arindam Dutta, Meng Zheng, Zhongpai Gao, Benjamin Planche, Anwesha Choudhuri, Terrence Chen, Amit K. Roy-Chowdhury, Ziyan Wu

机构 * University of California, Riverside(加州大学河滨分校) United Imaging Intelligence(联合影像智能)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14241 2025-10-17 cs.CV 57%

PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis

Soumyya Kanti Datta, Tanvi Ranga, Chengzhe Sun, Siwei Lyu

机构 * University at Buffalo, SUNY Buffalo, NY, USA(布法罗大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10497 2025-10-14 cs.CV 57%

Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking

Yuteng Ye, Zheng Zhang, Qinchuan Zhang, Di Wang, Youjia Zhang, Wenxiao Zhang, Wei Yang, Yuan Liu

机构 * Huawei, Media Innovation Lab(华为媒体创新实验室) Huazhong University of Science & Technology(华中科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 23 pages, 16 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18369 2025-10-13 cs.CV 57%

RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models

Yeongtak Oh, Dohyun Chung, Juhyeon Shin, Sangha Park, Johan Barthelemy, Jisoo Mok, Sungroh Yoon

专题命中 个性化与一致性 :personalized generation(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04450 2025-10-07 cs.CV 57%

REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization

Qiyuan He, Yicong Li, Haotian Ye, Jinghao Wang, Xinyao Liao, Pheng-Ann Heng, Stefano Ermon, James Zou, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 27 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18825 2025-10-07 cs.LG cs.CV 57%

How to build a consistency model: Learning flow maps via self-distillation

Nicholas M. Boffi, Michael S. Albergo, Eric Vanden-Eijnden

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02631 2025-10-06 cs.CV 57%

Deep Generative Continual Learning using Functional LoRA: FunLoRA

Victor Enescu, Hichem Sahbi

机构 * Sorbonne University(索邦大学) CNRS(法国国家科学研究中心) LIP6(LIP6研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00658 2025-10-02 cs.CV cs.AI cs.LG 57%

Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents

Beomsu Kim, Byunghee Cha, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00633 2025-10-02 cs.CV cs.LG 57%

Virtual Fashion Photo-Shoots: Building a Large-Scale Garment-Lookbook Dataset

Yannick Hauri, Luca A. Lanzendörfer, Till Aczel

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏