Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments 12 pages,
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments 12 pages,
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.MM
Comments 22 pages, 13 figures
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2023. Project website: https://diffusionrig.github.io
专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV、cs.GR
Comments Project page at https://dreambooth3d.github.io/ Video Summary at https://youtu.be/kKVDrbfvOoA
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.GR
Comments SIGGRAPH ASIA 2022, Project webpage: https://mystyle-personalized-prior.github.io/, Video: https://youtu.be/QvOdQR3tlOc
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV、cs.MM
Journal ref MM'21: Proceedings of the 29th ACM International Conference on MultimediaOctober 2021
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.MM
Comments 11 pages, 13 figures
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
Comments Camera-Ready version. Paper was accepted as oral to CVPR 2022. Added discussions and figures from the rebuttal to the supplementary material (sections C & F). Project Webpage: https://stylesdf.github.io/
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments Accompanying video: https://youtu.be/RXK2iv980nU
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
Comments CVPR 2021
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
ReCap:轻量级指代 grounding 以实现连贯故事可视化
机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em
专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV
AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。
Comments Diffusion Models, Story Visualization
机构 * Virginia Tech(弗吉尼亚理工大学) ; Intuit AI Research(Intuit AI研究院) ; Meta AI ; The Chinese University of Hong Kong(香港中文大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 个性化与一致性 :image generation(abstract,comments);分类 cs.CV
Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation
Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化
机构 * Northeastern University(东北大学) ; Snap Inc.(Snap公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。
Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)
BeyondMasks:评估视频对象移除中的因果与物理一致性
机构 * Bilkent University(毕尔肯大学) ; Koç University(科克大学) ; Hacettepe University(哈杰泰佩大学) ; KUIS AI Center(KUIS人工智能中心)
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV
AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。
Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/
面向大规模三元数据集的上下文内调色风格迁移
机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) ; OPPO AI Center, OPPO Inc.(OPPO AI中心,OPPO公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ICTone框架,通过上下文内联合条件生成实现调色风格迁移,利用生成模型语义先验提升风格一致性和视觉质量。
Comments ECCV2026, https://dengyuhai.github.io/ICTone_Project/
PickStyle:基于上下文-风格适配器的视频到视频风格迁移
机构 * Pickford AI ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops
基于视觉语言模型的图像传输个性化数字语义通信
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM
AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。
Comments Accepted by IEEE GLOBECOM 2026
CRAFT:无需组合目标的主题个性化的注意力微调约束奖励
机构 * DGIST(大邱科技研究院) ; Baidu, Inc.(百度公司) ; KAIST(韩国科学技术院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。
Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026
UniSwap:用于说话视频的流音频-视觉身份交换
机构 * The Chinese University of Hong Kong(香港中文大学) ; Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。
Wan-Animate-2:拓展角色动画的应用边界
机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。
Comments Project page: https://humanaigc.github.io/wan-animate-2/
机构 * Idiap Research Institute(Idiap研究机构)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025
StyleComposer:无需训练的多参考风格合成
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 针对现有参考引导风格方法无法控制各属性来源与强度的问题,提出无需训练的StyleComposer,通过将各风格属性路由至最佳表示并协调去噪时间,实现更贴合多参考与提示的风格合成,且支持各属性强度调节。
SEED: 用于可解释文本伪造检测的简单ViT与演化框架
机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV
AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。
面向以人为中心场景中AI生成图像检测的视觉证据定位与解释
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV
AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
InkShield:抵御未授权笔迹模仿的书写风格保护
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV
AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。
Bunraku:将单张插图转换为可编辑的Live2D角色
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; SparcAI Inc.(SparcAI公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。
Comments Project page: https://bunraku-live2d.github.io/
从合成到真实:迈向身份一致的化妆转移的合成与真实数据
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。