arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3280 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 76 篇

2606.10617 2026-06-10 cs.CV 新提交 79%

SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models

SSR-Merge: 面向扩散模型中免训练的LoRA合并的子空间信号路由

Zhengxuan Wei, Yi Dong, Zonghui Li, Xianhui Lin, Xing Liu, Hong Gu, Shaofeng Zhang, Wenbin Li, Qi Fan

机构 * Stanford University(斯坦福大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 提出子空间信号路由(SSR)方法,通过沿秩维度拼接LoRA构建统一子空间,利用逆相关矩阵去相关和方向引导矩阵分离信号,解决参数合并中的干扰问题,理论证明其等价于OLS最优解,并设计流式算法降低开销。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25750 2026-07-29 cs.LG cs.CY 新提交 78%

Detecting CSAM Text-to-Image LoRAs From Weights

从权重中检测用于生成儿童性虐待材料的文本到图像的LoRA

David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly Mai

专题命中 个性化与一致性 :text-to-image(title);image generation(abstract)

AI总结 研究如何从权重中检测用于生成CSAM的文本到图像的LoRA,利用LoRA更新的左上角奇异向量形成的指纹$u_1$,以人类主体年龄为代理,发现其能识别训练内容、跨模型泛化且对良性内容不判断,可直接从权重筛选有害LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07533 2026-07-09 cs.RO 新提交 78%

Generating Personalized Lower-Limb Kinematics Across Walking Speeds Using Subject-Conditioned Diffusion

使用受主体条件约束的扩散生成跨步行速度的个性化下肢运动学

Diya Dinesh, Adrian Krieger, Changseob Song, Dongho Park, Aaron J. Young, Inseung Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 研究针对个性化外骨骼辅助需特定用户步态数据收集难的问题,提出受主体条件约束的残差扩散框架,能从单一已知速度步态序列生成未知速度下的个性化下肢运动学,减少数据收集负担,提升跨速度步态合成精度。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24119 2026-06-24 cs.LG cs.CL 新提交 78%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08460 2026-08-11 cs.CV 新提交 77%

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

InstructionCrafter:生成一致且高保真的视觉指令

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

机构 * University of Tsukuba(筑波大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25648 2026-08-27 cs.CV 新提交 74%

MAMA-FLUX.2: Image-to-Image Synthesis of Post-Contrast Breast DCE-MRI for the MAMA-SYNTH Challenge

MAMA-FLUX.2:面向MAMA-SYNTH挑战赛的对比后乳腺动态对比增强MRI图像到图像合成

Kamil Kwarciak, Marek Wodzinski

机构 * AGH University of Krakow(克拉科夫AGH科技大学) Sano Centre for Computational Medicine(萨诺计算医学中心)

专题命中 个性化与一致性 :image synthesis(title);分类 cs.CV

AI总结 本研究针对MAMA-SYNTH挑战赛,提出MAMA-FLUX.2模型,采用LoRA微调及任务感知区域损失,实现对比前至对比后乳腺DCE-MRI的图像合成,在临床相关指标上取得最优平衡。

Comments 9 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07713 2026-08-11 cs.CV cs.LG 新提交 74%

Tokenizer Generator Coupling in Medical Image Generation

医疗图像生成中的分词器-生成器耦合

Liam Chalcroft

机构 * University College London(伦敦大学学院)

专题命中 个性化与一致性 :image generation(title);分类 cs.CV

AI总结 该研究针对64×64低分辨率医疗图像,发现分词器与生成器的分离不合理,提出邻域条件预测增益指标,调优D3PM和SE-D3PM后FID-192大幅下降,验证了分词器-生成器耦合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04448 2026-08-06 cs.CV cs.AI 新提交 70%

When does training on downscaled images yield the same gradients?

在降采样图像上进行训练何时能产生相同的梯度?

Seunghyun Ji

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究探究降采样图像训练的梯度一致性,推导梯度变化的两个项,发现特定噪声窗口内降采样梯度与原生梯度接近,据此训练LoRA适配器可减少14.6%训练时间且性能接近原生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03822 2026-08-05 cs.CV cs.AI 新提交 70%

FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis

FlowForm:融合流体物理与拓扑一致性的卫星洪水合成方法

Zhang Weihui, Wang Ruizhi, Xu Hongye, Wang Huiqiong, Sun Li, Song Mingli

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 FlowForm是融合流体物理与拓扑一致性的卫星洪水合成框架,通过FDM、TAA及FloodScape数据集,在洪水图像生成的视觉保真度、配对图像相似性等指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03708 2026-08-05 cs.CV 新提交 70%

MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding

MultiCompose:基于每个主体属性绑定的多概念个性化生成

Ruirui Zhang, Zhengkai Zhao, Pan Gao

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 MultiCompose是解耦多概念个性化与多主体推理的图像生成框架,通过语义保留正则化和两阶段推理解决主体身份退化与属性错位问题,引入的MSP-Bench可联合评估相关指标,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00674 2026-08-04 cs.CV 新提交 70%

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds

CopyCat:在数秒内提升主体到图像模型中的细粒度主体一致性

Peng Zheng, Ruiqi Liu, Rui Ma, Zuxuan Wu

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出轻量级模型精调框架CopyCat,通过附加FCLoRA在数秒内提升主体到图像模型的细粒度主体一致性,经DreamBench等实验验证,可适配多样未见过的主体与提示并取得持续效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交 70%

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13809 2026-06-15 cs.CV 新提交 70%

Compressing Image Style Training into a Single Model Forward

将图像风格训练压缩为单次模型前向传播

Zhongjie Duan, Yingda Chen

机构 * ModelScope Team, Alibaba Group(阿里巴巴集团 ModelScope 团队)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出i2L框架,通过单次前向传播预测LoRA权重,实现高效风格迁移,避免逐风格优化,在风格保真度、提示对齐和感知质量上超越现有基线。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10370 2026-07-14 cs.CV cs.GR 新提交 62%

Neural Motion Blending Across Arbitrary Character Topologies

跨任意角色拓扑的神经运动混合

Luca Cazzola, Giulia Martinelli, Nicola Conci

机构 * University of Trento(特伦托大学) CNIT(意大利国家信息与电信研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究针对角色动画运动混合,提出跨异构骨架的新框架,结合语义编码器与基于扩散的解码器,通过插值潜在表示实现混合运动,在Truebones Zoo数据集上训练评估,能在多样场景中实现平滑合理的运动混合。

Comments To appear in the proceedings of Computer Graphics International (CGI 2026). For references, please cite the official proceedings version. Paper website: https://mmlab-cv.github.io/neural_motion_blending/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27280 2026-08-28 cs.CV 新提交 57%

Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling

Sidecar:用于保持角色一致性的自由形式视觉叙事的无需训练的语义复用

Sibo Dong, Sarah Adel Bargal

机构 * Georgetown University(乔治城大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对自由形式视觉叙事中角色一致性难维持的问题,提出无需训练的即插即用语义增强模块Sidecar,可提升提示-图像对齐度与角色一致性,且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 57%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 57%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 57%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05213 2026-08-07 cs.CV 新提交 57%

StyleComposer: Training-Free Multi-Reference Style Composition

StyleComposer:无需训练的多参考风格合成

Sanghyeok Lee, Jihye Kang, Namhyuk Ahn

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对现有参考引导风格方法无法控制各属性来源与强度的问题,提出无需训练的StyleComposer,通过将各风格属性路由至最佳表示并协调去噪时间,实现更贴合多参考与提示的风格合成,且支持各属性强度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-08-04 cs.CV 新提交 57%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27348 2026-07-31 cs.CV 新提交 57%

Bunraku: Turning a Single Illustration into an Editable Live2D Character

Bunraku:将单张插图转换为可编辑的Live2D角色

Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) SparcAI Inc.(SparcAI公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。

Comments Project page: https://bunraku-live2d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26304 2026-07-30 cs.CV 新提交 57%

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

MoSAIC:用于局部部位动作迁移的对齐干预监督

Nazanin Amini, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MoSAIC是一种局部部位参考条件动作风格迁移的潜在扩散框架,通过对齐干预监督优化响应与保留的权衡,在评估中降低了误差并提升了选中区域响应与路由影响浓度。

Comments 23 pages, 6 figures, 11 tables. Project page: https://utsa-virlab.github.io/MoSAIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25842 2026-07-29 cs.CV cs.CR 新提交 57%

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

对抗性深度伪造生成与基于净化的对抗性检测研究

Junghyun Kim, Seunghyun Kim, Jiyoung Woo

机构 * Soonchunhyang University(顺天乡大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 该研究参与ImageCLEF 2026深度伪造检测与生成任务,图像生成采用FLUX.1-dev等方法,检测用SigLIP+DINOv2等组合。还自主研究基于净化的对抗性检测,发现特定信号可有效区分对抗与干净输入,反驳相关假设并揭示质量悬崖。

Comments Accepted at CLEF 2026, ImageCLEF-Deepfake task. Published in CEUR-WS CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21694 2026-07-27 cs.CV 新提交 57%

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Oxygen-TryOn:用于任意物品虚拟试穿的时尚原生基础模型

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

机构 * Oxygen AIGC Group(氧气AIGC集团) Joy Future Academy(京东探索研究院)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 研究提出时尚原生的Oxygen-TryOn基础模型,用于任意物品虚拟试穿。通过专用数据引擎和特定训练构建,重新定义试穿任务,设计三阶段训练方法,在单物品和多物品试穿中取得先进成果,超越多个系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21434 2026-07-24 cs.CV cs.AI 新提交 57%

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping

自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置

Logan Robbins

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交 57%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19947 2026-07-23 cs.CV 新提交 57%

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

ETPDesigner:用于交互式多模态电子剧院节目的多智能体编排

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University(武汉大学数学与人工智能研究院武汉人工智能学院)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对电子剧院节目设计难题,提出ETPDesigner多智能体框架,能从戏剧脚本合成高质量ETP,通过全局风格锚定机制保证一致性,还实现交互功能,经ETP-Pro基准测试验证了方法在多方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17279 2026-07-21 cs.CR cs.AI cs.MM 新提交 57%

Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models

在安全边界之间:利用时间一致性破解文本到视频生成模型

Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.MM

AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17120 2026-07-21 cs.CV 新提交 57%

The generator is the tracker: Multi-object tracking by painting persistent identity colours

生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪

Haiyu Yang, Miel Hostens

机构 * Cornell University(康奈尔大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12882 2026-07-15 cs.MM cs.IR 新提交 57%

What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval

你会点击什么?基于偏好感知高光检索的个性化视频缩略图生成

Zhiyu He, Zecheng Zhao, Tong Chen, Zi Huang, Yiqun Liu, Min Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 研究针对视频平台个性化视频缩略图生成问题,提出两阶段框架,先通过偏好感知检索选取视觉锚点,再经VLM引导的扩散管道生成缩略图,实验和用户研究证明该方法性能优且能提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏