arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1272 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1272 篇

2403.10805 2024-03-19 cs.SD cs.AI cs.CV cs.GR cs.HC eess.AS 62%

Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference

Fan Zhang, Zhaohan Wang, Xin Lyu, Siyuan Zhao, Mengjian Li, Weidong Geng, Naye Ji, Hui Du, Fuxing Gao, Hao Wu, Shunman Li

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07952 2024-03-14 cs.CV cs.AI cs.MM 62%

AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production

Jiuniu Wang, Zehua Du, Yuyuan Zhao, Bo Yuan, Kexiang Wang, Jian Liang, Yaxi Zhao, Yihen Lu, Gengliang Li, Junlong Gao, Xin Tu, Zhenyu Guo

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.MM

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12903 2023-05-23 cs.CV cs.LG cs.MM 62%

DiffAVA: Personalized Text-to-Audio Generation with Visual Alignment

Shentong Mo, Jing Shi, Yapeng Tian

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06711 2023-04-14 cs.CV cs.GR 62%

DiffusionRig: Learning Personalized Priors for Facial Appearance Editing

Zheng Ding, Xuaner Zhang, Zhihao Xia, Lars Jebe, Zhuowen Tu, Xiuming Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2023. Project website: https://diffusionrig.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13508 2023-03-28 cs.CV cs.AI cs.GR 62%

DreamBooth3D: Subject-Driven Text-to-3D Generation

Amit Raj, Srinivas Kaza, Ben Poole, Michael Niemeyer, Nataniel Ruiz, Ben Mildenhall, Shiran Zada, Kfir Aberman, Michael Rubinstein, Jonathan Barron, Yuanzhen Li, Varun Jampani

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page at https://dreambooth3d.github.io/ Video Summary at https://youtu.be/kKVDrbfvOoA

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17272 2022-10-07 cs.CV cs.GR cs.LG 62%

MyStyle: A Personalized Generative Prior

Yotam Nitzan, Kfir Aberman, Qiurui He, Orly Liba, Michal Yarom, Yossi Gandelsman, Inbar Mosseri, Yael Pritch, Daniel Cohen-or

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH ASIA 2022, Project webpage: https://mystyle-personalized-prior.github.io/, Video: https://youtu.be/QvOdQR3tlOc

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02538 2022-05-06 cs.CV cs.MM 62%

Parametric Reshaping of Portraits in Videos

Xiangjun Tang, Wenxin Sun, Yong-Liang Yang, Xiaogang Jin

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV、cs.MM

Journal ref MM'21: Proceedings of the 29th ACM International Conference on MultimediaOctober 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10973 2022-04-26 cs.CV cs.MM 62%

Detecting Recolored Image by Spatial Correlation

Yushu Zhang, Nuo Chen, Shuren Qi, Mingfu Xue, Xiaochun Cao

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.MM

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.11427 2022-03-31 cs.CV cs.AI cs.GR cs.LG 62%

StyleSDF: High-Resolution 3D-Consistent Image and Geometry Generation

Roy Or-El, Xuan Luo, Mengyi Shan, Eli Shechtman, Jeong Joon Park, Ira Kemelmacher-Shlizerman

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

Comments Camera-Ready version. Paper was accepted as oral to CVPR 2022. Added discussions and figures from the rebuttal to the supplementary material (sections C & F). Project Webpage: https://stylesdf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01018 2021-09-03 cs.GR cs.CV 62%

Dynamic Scene Novel View Synthesis via Deferred Spatio-temporal Consistency

Beatrix-Emőke Fülöp-Balogh, Eleanor Tursman, James Tompkin, Julie Digne, Nicolas Bonneel

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accompanying video: https://youtu.be/RXK2iv980nU

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14338 2021-03-29 cs.CV cs.GR 62%

Few-Shot Human Motion Transfer by Personalized Geometry and Texture Modeling

Zhichao Huang, Xintong Han, Jia Xu, Tong Zhang

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07023 2018-11-20 cs.GR cs.CV cs.LG stat.ML 62%

An Infinite Parade of Giraffes: Expressive Augmentation and Complexity Layers for Cartoon Drawing

K. G. Greene

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18575 2026-04-21 cs.CV 61%

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

ReCap:轻量级指代 grounding 以实现连贯故事可视化

Aditya Arora, Akshita Gupta, Pau Rodriguez, Marcus Rohrbach

机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em

专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV

AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。

Comments Diffusion Models, Story Visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03604 2025-06-10 cs.CL cs.CV 61%

Modality-Specialized Synergizers for Interleaved Vision-Language Generalists

Zhiyang Xu, Minqian Liu, Ying Shen, Joy Rimchala, Jiaxin Zhang, Qifan Wang, Yu Cheng, Lifu Huang

机构 * Virginia Tech(弗吉尼亚理工大学) Intuit AI Research(Intuit AI研究院) Meta AI The Chinese University of Hong Kong(香港中文大学) University of California, Davis(加州大学戴维斯分校)

专题命中 个性化与一致性 :image generation(abstract,comments);分类 cs.CV

Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-08-24 cs.CV 版本更新 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 57%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16114 2026-08-18 cs.CV 版本更新 57%

Towards In-Context Tone Style Transfer with A Large-Scale Triplet Dataset

面向大规模三元数据集的上下文内调色风格迁移

Yuhai Deng, Huimin She, Wei Shen, Meng Li, Ruoxi Wu, Lunxi Yuan, Xiang Li

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) OPPO AI Center, OPPO Inc.(OPPO AI中心,OPPO公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ICTone框架,通过上下文内联合条件生成实现调色风格迁移,利用生成模型语义先验提升风格一致性和视觉质量。

Comments ECCV2026, https://dengyuhai.github.io/ICTone_Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07546 2026-08-18 cs.CV 版本更新 57%

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

PickStyle:基于上下文-风格适配器的视频到视频风格迁移

Soroush Mehraban, Vida Adeli, Jacob Rommann, Kyryl Truskovskyi, Harrison Sanborn, Babak Taati, Cole Clifford

机构 * Pickford AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 57%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 57%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 57%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 57%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08808 2026-08-10 cs.CV 57%

Identity-Preserving Aging and De-Aging of Faces in the StyleGAN Latent Space

Luis S. Luevano, Pavel Korshunov, Sebastien Marcel

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05213 2026-08-07 cs.CV 新提交 57%

StyleComposer: Training-Free Multi-Reference Style Composition

StyleComposer:无需训练的多参考风格合成

Sanghyeok Lee, Jihye Kang, Namhyuk Ahn

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对现有参考引导风格方法无法控制各属性来源与强度的问题,提出无需训练的StyleComposer,通过将各风格属性路由至最佳表示并协调去噪时间,实现更贴合多参考与提示的风格合成,且支持各属性强度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21138 2026-08-07 cs.CV 版本更新 57%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-08-04 cs.CV 新提交 57%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26976 2026-08-03 cs.CR cs.CV 版本更新 57%

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

InkShield:抵御未授权笔迹模仿的书写风格保护

Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27348 2026-07-31 cs.CV 新提交 57%

Bunraku: Turning a Single Illustration into an Editable Live2D Character

Bunraku:将单张插图转换为可编辑的Live2D角色

Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) SparcAI Inc.(SparcAI公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。

Comments Project page: https://bunraku-live2d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 57%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏