arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1272 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1272 篇

2606.18753 2026-06-18 cs.CV 新提交 57%

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data

SMART:一种灵活、可解释且可扩展的高分辨率成像数据时空脑图谱

John Kalkhof, Boris Gutman, Emile d'Angremont, Daniel C. Alexander, Marco Lorenzi

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) University College London(伦敦大学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SMART框架,通过解耦全局疾病动态与患者特定解剖表现,学习连续疾病时间图谱,实现高分辨率3D医学图像中时空变化的灵活、可解释和可扩展建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18156 2026-06-17 cs.CV cs.AI 新提交 57%

ReAge3D: Re-Aging 3D Faces with View Consistency

ReAge3D:具有视角一致性的3D人脸回龄

Libing Zeng, Li Ma, Mingming He, Ning Yu, Paul Debevec, Nima Khademi Kalantari

机构 * Texas A&M University(德克萨斯农工大学) Netflix Eyeline Studios

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ReAge3D框架,通过2D扩散模型DiffReaging和中心向外编辑传播策略,实现多视角一致的3D人脸回龄,保持身份和细节,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 57%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 57%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 57%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10620 2026-06-10 cs.CV cs.AI 新提交 57%

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准

Xinrui Wu, Lichen Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08780 2026-06-09 cs.CV 新提交 57%

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

超越一致性:在零样本视频编辑中保留时间结构

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

机构 * Anhui University(安徽大学) University of Surrey(萨里大学) University of Warwick(华威大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种零样本视频编辑方法,通过自适应分割视频片段、选取锚帧和令牌合并策略,首次显式保留源视频的时间结构,平衡编辑保真度与计算效率。

Journal ref Pattern Recognition, Vol. 180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07185 2026-06-08 cs.CV 新提交 57%

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

AdaTok: 具有质量保持动态令牌的自预算图像令牌化

Xiaocheng Lu, Yuxi Chen, Jie Zhang, Jian Liu, Jingcai Guo, Fangqi Zhu, Tao Han, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出AdaTok,一种自预算离散一维令牌化器,通过表示-分配协同设计(优先表示学习和自适应令牌分配)实现图像自适应令牌数量,在保持重建质量的同时减少平均令牌数。

Comments Preprint; 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15287 2026-06-08 cs.CV 版本更新 57%

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04881 2026-06-04 cs.CV cs.AI 57%

DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance

DiverAge: 基于跨年龄身份关系引导的可靠多元人脸老化

Yueying Zou, Peipei Li, Qianrui Teng, Dianyan Xu, Zekun Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) School of Computer Science, University of California, Santa Barbara(计算机科学学院,加州大学圣芭芭拉分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散自编码的分层多元人脸老化框架DiverAge,通过随机扩散解码和年龄条件语义调制保持外观多样性,并引入跨年龄身份关系调节器(CARR)在推理时引导去噪,以提升序列级有序可靠性。

Comments 11 pages,10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04797 2026-06-04 cs.CV cs.LG 57%

Crafting Your Evolving Dreams: Concept-Incremental Versatile Customization

打造你不断演变的梦想:概念增量式多功能定制

Jiahua Dong, Wenqi Liang, Hongliu Li, Yang Cong, Duzhen Zhang, Hanbin Zhao, Henghui Ding, Yulun Zhang, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) University of Trento(特伦托大学) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程系) South China University of Technology(华南理工大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出持续可定制扩散模型(CCDM),通过属性解耦LoRA模块和相关性引导聚合策略解决灾难性遗忘,并结合可控区域上下文合成策略处理概念忽视,实现概念增量式多功能定制。

Comments Accepted to Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03420 2026-06-03 cs.CV 57%

PHAF-Personalized Hand Avatars in a Flash

PHAF-瞬间个性化手部化身

Meghana Shankar, Akanxit Upadhyay, Anmol Namdev, Green Rosh KS, Pawan Prasad BH

机构 * Samsung R&D Institue(三星研发机构)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 提出PHAF方法,从两张图像(手背和手掌)快速生成个性化逼真手部化身,通过语义引导网格对齐和密集纹理提取,结合视图修复网络,实现高质量多视角渲染,纹理生成速度比现有方法快30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV 57%

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02042 2026-06-02 cs.CV 57%

Normality-Preserving Continual Industrial Anomaly Detection via Orthogonal LoRA Banks

通过正交LoRA库保持正态性的持续工业异常检测

Weibai Fang, Haijun Che, Feiyang Ren, Qiancheng Lao

机构 * Yisu University(Yorkshire University)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于历史冻结正交LoRA库和分层新颖性自适应库增长模块的框架,解决扩散模型在持续工业异常检测中的历史正态先验漂移和灾难性遗忘问题。

Comments 33 pages,6 figures,Submitted to Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01079 2026-06-02 cs.CV 57%

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

Chameleon: 面向跨域对象合成的风格-内容解耦框架

Sukhun Ko, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang大学CMLab) Adobe Research(Adobe研究)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于大规模数据集ChameleonDataset的两阶段训练框架Chameleon,通过联合硬对比学习和时空注意力门控实现跨域对象合成的风格-内容解耦与自适应风格化。

Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/Chameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00673 2026-06-02 cs.CV 57%

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

T-CLIP:面向对比语言-图像预训练的热感知

Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee, Brejesh Lall

机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) NVIDIA AI Technology Center, India(NVIDIA AI技术中心) Jawaharlal Nehru University, India(贾瓦哈拉尔·尼赫鲁大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对CLIP无法对齐热图像与文本描述的问题,提出物理感知的热描述数据集IR-Cap和解耦双LoRA框架T-CLIP,实现场景级和对象级热理解,在跨模态检索任务上超越所有基线。

Comments 34pages (including references and appendix), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 57%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10362 2026-06-02 cs.LG cs.CV 57%

OP-LoRA: The Blessing of Dimensionality

OP-LoRA:维度的祝福

Piotr Teterwak, Kate Saenko, Bryan A. Plummer, Ser-Nam Lim

机构 * Boston University(波士顿大学) University of Central Florida(中央佛罗里达大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出OP-LoRA方法,通过额外MLP预测LoRA适配器权重以改善优化,训练后丢弃MLP,在零额外推理成本下提升性能并降低对学习率的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31033 2026-06-01 cs.CV 57%

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation

SlotMemory: 面向流式长视频生成的以对象为中心的KV记忆

Weijia Dou, Hui Li, Jiahao Cui, Lei Zhou, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Meta Superintelligence Labs(Meta超智能实验室) Baidu(百度)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SlotMemory,一种以对象为中心的键值记忆机制,通过将变换器的键值流形分解为离散语义槽,实现实体级持久性和提示感知检索,在60秒交互叙事中动态一致性相对提升22.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25778 2026-05-26 cs.CV 57%

OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance

OMGTex: 无需几何引导的一阶段多风格面部纹理重建

Zitong Xiao, Yuda Qiu, Zisheng Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能化重点实验室) FNii-Shenzhen(FNii-深圳)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出OMGTex,一种端到端的扩散框架,无需3D几何先验,直接从多风格面部图像重建高质量、可编辑的UV纹理,通过梯度引导推理和语义感知训练实现鲁棒重建与编辑。

Comments CVPR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00443 2026-05-26 cs.SD cs.MM eess.AS 57%

RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

RVCBench:现代音频生成模型中语音克隆鲁棒性的基准测试

Ruinan Jin, Xinting Liao, Hanlin Yu, Deval Pandya, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 提出RVCBench数据集和基准,通过18项鲁棒性评估、225个说话人和14370个话语,系统评估语音克隆模型在噪声、多语言、长文本、后处理和对抗扰动等现实场景下的鲁棒性。

Comments 65 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22996 2026-05-25 cs.CV 57%

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

CoMoGen: 基于掩码引导的视频生成的可控运动动力学与交互

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

机构 * Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMoGen框架,通过轻量级MaskAdapter将二进制掩码序列编码为潜在残差信号注入MMDiT模型,并利用LoRA微调运动层,实现从单张图像和掩码序列生成逼真的交互运动,在运动保真度和感知真实性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV 57%

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16406 2026-05-19 cs.CV 57%

Contrastive-SDXL: Annotation-Preserving Night-Time Augmentation for Pedestrian Detection

对比-SDXL:保留标注的夜间增强用于行人检测

Franky George, Muhammad Khalid, Adil Khan

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Contrastive-SDXL框架,利用SDXL-Turbo和LoRA微调,通过语义对比损失和对象一致性损失生成逼真夜间图像,提升行人检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15309 2026-05-18 cs.CV 57%

One Pass Is Not Enough: Recursive Latent Refinement for Generative Models

一次不够:生成模型的递归潜在细化

Mehdi Esmaeilzadeh, Alexia Jolicoeur-Martineau, Chirag Vashist, Ke Li

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出RTM方法,通过递归细化提升生成模型的多样性和覆盖范围,改进了FID指标下的精度和召回率,适用于多个数据集和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-05-15 cs.CV 57%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12138 2026-05-13 cs.CV cs.CL cs.IR 57%

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

专题命中 个性化与一致性 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12002 2026-05-13 cs.CV 57%

EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization

EDGER: 基于热图细化的边缘引导图像伪造定位

Minh-Khoa Le-Phan, Minh-Hoang Le, Minh-Triet Tran, Trong-Le Do

机构 * University of Science - VNU-HCM(越南国家大学-胡志明市大学) Vietnam National University(越南国家大学)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 EDGER通过边缘引导分割和合成热图分支,实现任意分辨率图像中伪造区域的精准定位,具备跨域泛化能力。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11927 2026-05-13 cs.CV 57%

RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation

RealDiffusion:用于多角色故事书生成的物理信息注意力

Qi Zhao, Jun Chen, Ivor Tsang, Guang Dai

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang Normal University(浙江师范大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RealDiffusion通过引入物理信息注意力机制,解决多角色故事生成中叙事动态与角色一致性之间的平衡问题,提升角色连贯性并保持叙事活力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏