arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-13 至 2026-01-13 共收录 91 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2601.00827 2026-01-13 eess.AS cs.AI cs.MM 85%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.MM

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07141 2026-01-13 cs.CR 78%

MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models

MacPrompt:基于马卡罗尼的文本到图像模型对抗攻击

Xi Ye, Yiwen Liu, Lina Wang, Run Wang, Geying Yang, Yufei Hou, Jiayi Yu

专题命中 文生图 :text-to-image(title,abstract)

AI总结 MacPrompt通过跨语言字符级重组有害术语,实现对文本到图像模型的安全机制的高效对抗,突破现有防御体系。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06574 2026-01-13 cs.CV 77%

APEX: Learning Adaptive Priorities for Multi-Objective Alignment in Vision-Language Generation

APEX: 为视觉-语言生成中的多目标对齐学习自适应优先级

Dongliang Chen, Xinlin Zhuang, Junjie Xu, Luojian Xie, Zehui Wang, Jiaxi Zhuang, Haolin Yang, Liang Dou, Xiao He, Xingjiao Wu, Ying Qian

机构 * East China Normal University(东华师范大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 APEX通过双阶段自适应归一化和P^3自适应优先级,提升视觉-语言生成中多目标对齐的稳定性与性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 75%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06368 2026-01-13 cs.CR cs.CV 74%

From Easy to Hard++: Promoting Differentially Private Image Synthesis Through Spatial-Frequency Curriculum

从易到难++:通过空间-频率课程促进差分隐私图像合成

Chen Gong, Kecen Li, Zinan Lin, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学) Microsoft Research(微软研究院)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 FETA-Pro通过引入频率特征作为训练捷径,提升差分隐私图像合成的保真度和实用性。

Comments Accepted at Usenix Security 2026; code available at https://github.com/2019ChenGong/Feta-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07293 2026-01-13 cs.CV 70%

Inference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples

推理时的缩放用于视觉自回归建模通过搜索代表性样本

Weidong Tang, Xinyan Wan, Siyu Li, Xiumei Wang

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出VAR-Scaling框架,通过搜索代表性样本解决VQ视觉自回归建模中的离散潜在空间问题,提升推理过程的生成质量。

Comments Accepted to PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06169 2026-01-13 cs.CV 70%

Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding

Think Bright, Diffuse Nice: 通过归纳偏置提示指令和查询对比解码增强T2I-ICL

Zhiyong Ma, Zhenpeng Li, Yuanjie Shi, Zhengping Li, Jiahao Chen, Qingyuan Chuai

机构 * Cao Tu Li (Guangzhou) Technology Co., Ltd(曹图利(广州)科技有限公司) South China University of Technology(华南理工大学) Washington State University(华盛顿州立大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 TBDN通过引入归纳偏置提示指令和查询对比解码,有效解决T2I-ICL中的合规性失败和先验主导幻觉问题,实现高效可靠的图像生成。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06642 2026-01-13 cs.CV cs.AI 57%

Boosting Overlapping Organoid Instance Segmentation Using Pseudo-Label Unmixing and Synthesis-Assisted Learning

通过伪标签解混和合成辅助学习提升重叠类器官实例分割

Gui Huang, Kangyuan Zheng, Xuan Cai, Jiaqi Wang, Jianjia Zhang, Kaida Ning, Wenbo Wei, Yujuan Zhu, Jiong Zhang, Mengting Liu

机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Peng Cheng Laboratory(鹏城实验室) The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2601.07219 2026-01-13 cs.CV 70%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06202 2026-01-13 cs.CV 57%

QwenStyle: Content-Preserving Style Transfer with Qwen-Image-Edit

QwenStyle: 保留内容的风格迁移与Qwen-Image-Edit

Shiwen Zhang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 QwenStyle通过课程持续学习框架,在保留内容的同时实现高质量风格迁移,达到最先进的性能。

Comments The codes and models are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 67 篇

2405.15468 2026-01-13 cs.CV cs.GR 84%

Semantic Aware Diffusion Inverse Tone Mapping

语义感知的扩散反色调映射

Abhishek Goswami, Aru Ranjan Singh, Francesco Banterle, Kurt Debattista, Thomas Bashford-Rogers

机构 * University of Warwick(沃里克大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种基于语义感知扩散的反色调映射方法,通过生成被剪裁区域的丢失细节,提升SDR图像至HDR,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07273 2026-01-13 cs.CV 83%

GenDet: Painting Colored Bounding Boxes on Images via Diffusion Model for Object Detection

GenDet:通过扩散模型在图像上绘制彩色边界框以实现目标检测

Chen Min, Chengyang Li, Fanjie Kong, Qi Zhu, Dawei Zhao, Liang Xiao

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 GenDet通过扩散模型将目标检测转化为图像生成任务,实现精确的边界框生成与语义标注,提升检测精度与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08309 2026-01-13 cs.CV cs.AI cs.GR cs.LG 82%

Terrain Diffusion: A Diffusion-Based Successor to Perlin Noise in Infinite, Real-Time Terrain Generation

地形扩散:一种基于扩散的继任者,用于无限实时地形生成

Alexander Goslin

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 Terrain Diffusion通过结合扩散模型的保真度与程序化噪声的特性,实现了高效且逼真的无限实时地形生成。

Comments Project website: https://xandergos.github.io/terrain-diffusion/ Code: https://github.com/xandergos/terrain-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06465 2026-01-13 eess.IV cs.CV cs.MM 81%

R$^3$D: Regional-guided Residual Radar Diffusion

R$^3$D: 基于区域引导的残差雷达扩散

Hao Li, Xinqi Liu, Yaoqing Jin

机构 * University of Arizona(亚利桑那大学) University of Hong Kong(香港大学) University of Stuttgart(斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 R3D通过区域引导残差雷达扩散框架,整合残差建模与sigma自适应引导,提升雷达点云质量,优于现有方法。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17806 2026-01-13 cs.CV cs.AI cs.LG eess.SP 80%

REXO: Indoor Multi-View Radar Object Detection via 3D Bounding Box Diffusion

REXO:基于3D边界框扩散的多视角室内雷达目标检测

Ryoma Yataka, Pu Perry Wang, Petros Boufounos, Ryuhei Takahashi

机构 * MERL ITC

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 REXO通过3D边界框扩散提升多视角室内雷达目标检测,利用先验知识减少参数并提升检测性能。

Comments 26 pages; Accepted to AAAI 2026; Code available at https://github.com/merlresearch/radar-bbox-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07287 2026-01-13 cs.CV 79%

Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models

焦点引导:从语义弱层中解锁视频扩散模型的可控性

Yuanyang Yin, Yufan Deng, Shenghai Yuan, Kaipeng Zhang, Xiao Yang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance China(字节跳动中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07253 2026-01-13 cs.CV cs.CR 79%

Universal Adversarial Purification with DDIM Metric Loss for Stable Diffusion

通用对抗净化与DDIM度量损失用于稳定扩散

Li Zheng, Liangbin Xie, Jiantao Zhou, He YiMin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UDAP通过DDIM度量损失去除稳定扩散中的对抗噪声,提升模型鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03030 2026-01-13 cs.CV cs.LG physics.comp-ph 79%

Flow Matching and Diffusion Models via PointNet for Generating Fluid Fields on Irregular Geometries

通过PointNet生成不规则几何上流场的流匹配与扩散模型

Ali Kashefi

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过PointNet生成不规则几何上流场的流匹配与扩散模型,提升流体预测精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17068 2026-01-13 cs.CV cs.AI 79%

ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion

ReBrain: 通过检索增强扩散模型从稀疏CT切片重建脑部MRI

Junming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReBrain通过检索增强扩散模型从稀疏CT切片重建脑部MRI,利用BBDM和ControlNet实现结构连续性,提升稀疏条件下的跨模态重建性能。

Comments 16 pages, 12 figures, 7 tables; Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06228 2026-01-13 cs.CV cs.AI 79%

Synthetic FMCW Radar Range Azimuth Maps Augmentation with Generative Diffusion Model

合成FMCW雷达距离方位图与生成扩散模型

Zhaoze Wang, Changxu Zhang, Tai Fei, Christopher Grimm, Yi Jin, Claas Tebruegge, Ernst Warsitz, Markus Gardill

机构 * 1HELLA GmbH \& Co. KGaA, Lippstadt, Germany 2Dortmund University of Applied Sciences

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于生成扩散模型的雷达数据合成方法,通过置信度图和几何感知条件生成逼真雷达图,提升模型在环境感知任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07347 2026-01-13 cs.CL 78%

DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models

DiffER: 用于扩散大语言模型中反转诅咒的扩散实体-关系建模

Shaokai He, Kaiwen Wei, Xinyi Zeng, Xiang Chen, Xue Yang, Zhenyang Li, Jiang Zhong, Yu Tian

机构 * Chongqing University(重庆大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiffER通过实体感知训练和平衡数据构建,解决扩散大语言模型中的反转诅咒问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07307 2026-01-13 cs.NI 78%

Low-Altitude Satellite-AAV Collaborative Joint Mobile Edge Computing and Data Collection via Diffusion-based Deep Reinforcement Learning

低空卫星-无人机协同联合移动边缘计算与数据采集 via 基于扩散的深度强化学习

Boxiong Wang, Hui Kang, Jiahui Li, Geng Sun, Zemin Sun, Jiacheng Wang, Dusit Niyato, Shiwen Mao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的深度强化学习方法,用于低空卫星-无人机协同联合移动边缘计算与数据采集,以提高效率和性能。

Comments 18 pages, 12 figures, accepted by IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07254 2026-01-13 eess.IV 78%

LaminoDiff: Artifact-Free Computed Laminography in Non-Destructive Testing via Diffusion Model

LaminoDiff:通过扩散模型实现无伪影的非破坏性检测 computed laminography

Tan Liu, Liu Shi, Binghuang Peng, Tong Jia, Xiaoling Xu, Baodong Liu, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LaminoDiff通过扩散模型与高保真先验结合,解决CL成像中的伪影问题,实现高精度电路结构重建与自动缺陷识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07120 2026-01-13 nucl-th 78%

Physics-Informed Neural Network for Solving the Diffusion Equation in the Expanding QCD Medium

用于求解膨胀QCD介质中重子扩散方程的物理信息神经网络

Wenhua Fan, Jiamin Liu, Huansang Yang, Baoyi Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用物理信息神经网络求解膨胀QCD介质中重子扩散方程,以研究重子演化及凝聚过程。

Comments 6 figures, 1 table, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05680 2026-01-13 cs.LG cs.AI 78%

Learning Design-Score Manifold to Guide Diffusion Models for Offline Optimization

学习设计-分数流形以指导扩散模型进行离线优化

Tailin Zhou, Zhilin Chen, Wenlong Lyu, Zhitang Chen, Danny H. K. Tsang, Jun Zhang

机构 * The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学(香港)) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出ManGO,一种基于扩散模型的框架,通过学习设计-分数流形指导离线优化,实现超越训练数据的泛化能力,并在多个领域中优于现有方法。

Comments This manuscript was accepted by npj AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06566 2026-01-13 q-fin.ST cs.LG q-fin.MF 78%

Diffusion Factor Models: Generating High-Dimensional Returns with Factor Structure

扩散因子模型:利用因子结构生成高维收益率

Minshuo Chen, Renyuan Xu, Yumin Xu, Ruixun Zhang

机构 * Department of Industrial Engineering and Management Sciences, Northwestern University(西北大学工业工程与管理科学系) Department of Management Science & Engineering, Stanford University(斯坦福大学管理科学与工程系) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Mathematical Sciences, Center for Statistical Science, Laboratory for Mathematical Economics and Quantitative Finance, and National Engineering Laboratory for Big Data Analysis and Applications, Peking University(北京大学数学科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出扩散因子模型,通过整合因子结构与生成扩散过程,解决高维金融模拟中的维度诅咒和数据稀缺问题,提供了一种在有限数据下生成高维收益率的系统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06849 2026-01-13 math.NA cs.NA 78%

Analysis and Efficient Sylvester-Based Implementation of a Dimension-Split ETD2RK Scheme for Multidimensional Reaction-Diffusion Equations

多维反应扩散方程中一种维度分割ETD2RK方案的分析与高效赛尔维斯特基实现

Ibrahim O. Sarumi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于多维反应扩散方程的高效ETD2RK-DS方案,通过维度分割和赛尔维斯特方程改写实现了高效的谱方法,显著降低了计算成本并验证了其精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06715 2026-01-13 math.ST cs.LG math.PR stat.ML stat.TH 78%

Diffusion Models with Heavy-Tailed Targets: Score Estimation and Sampling Guarantees

具有厚尾目标的扩散模型:分数估计与采样保证

Yifeng Yu, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了厚尾目标下基于分数的扩散模型,推导了分数估计的最小最大速率,并提供了采样保证,揭示了轻尾与多项式尾情况下不同的收敛特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06639 2026-01-13 cs.CR cs.AI 78%

Attack-Resistant Watermarking for AIGC Image Forensics via Diffusion-based Semantic Deflection

通过扩散基语义偏移实现对抗鲁棒的水印技术用于AIGC图像取证

Qingyu Liu, Yitao Zhang, Zhongjie Ba, Chao Shuai, Peng Cheng, Tianhang Zheng, Zhibo Wang

机构 * State Key Lab. of Blockchain and Data Security(区块链与数据安全国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PAI通过扩散基语义偏移技术实现对抗鲁棒的AIGC图像水印,提供版权验证、攻击检测和语义篡改定位功能,验证准确率达98.43%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 78%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏