arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-25 至 2026-08-25 共收录 66 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2601.05150 2026-08-25 cs.CR 版本更新 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-08-25 cs.CV 版本更新 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2606.24844 2026-08-25 cs.CV 版本更新 79%

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing

弥合流形差距:黎曼残差线搜索用于一步图像编辑

Hongzhu Yi, Zhongtian Luo, Tong Li, Yiyan Fan, Jungang Xu

机构 * UCAS(中国科学院大学) WashU(华盛顿大学) SHU(上海大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对一步扩散编辑中固定更新强度无法兼顾目标提示和源图像保真度的问题,提出黎曼残差线搜索方法,通过局部时间曲率估计和残差路径选择,在PIE-Bench++上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09130 2026-08-25 cs.GR cs.CV cs.MM 版本更新 67%

Reference-free Human-Object Interaction Editing

无参考的人机交互编辑

Jiun Tian Hoe, Weipeng Hu, Wei Zhou, Chao Xie, Ziwei Wang, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出InteractEdit框架,通过分解场景组件、结合选择性反转与SeRA策略实现无参考HOI编辑,引入IEBench基准及对应指标,实验显示其优于23种现有方法,为HOI编辑研究提供强基线。

Comments Website: this https URL (https://jiuntian.github.io/interactedit), Paper: this https URL (https://www.sciencedirect.com/science/article/abs/pii/S0925231226022678)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 49 篇

2509.04719 2026-08-25 cs.DC cs.CV 版本更新 83%

Spatio-Temporal Parallelism for Diffusion Model Inference on Heterogeneous Multi-GPU Systems

面向异构多GPU系统的扩散模型推理时空并行技术

Han Liang, Jiahui Zhou, Zicheng Zhou, Xiaoxi Zhang, Xu Chen

机构 * Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对异构多GPU环境下扩散模型并行推理的掉队者效应,提出Orchestra框架,通过时空细粒度并行平衡负载,使端到端延迟降低最多45%,提升资源利用率。

Comments 11 pages, 12 figures,accecpted by 2026 IEEE 46th International Conference on Distributed Computing Systems (ICDCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19567 2026-08-25 cs.CV 版本更新 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-08-25 cs.CV 版本更新 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17825 2026-08-25 cs.CV 版本更新 79%

Steering Video Diffusion Transformers with Massive Activations

通过大规模激活引导视频扩散变换器

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li

机构 * MBZUAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散变换器中大规模激活的作用,提出STAS方法通过引导首帧和边界token的激活值提升视频生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24013 2026-08-25 cs.CV 版本更新 79%

Ordinal Diffusion Models for Color Fundus Images

序数扩散模型用于彩色视网膜图像

Gustav Schmidt, Philipp Berens, Sarah Müller

机构 * Hertie Institute for AI in Brain Health, University of T\"ubingen, Germany

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出序数潜在扩散模型,用于生成具有连续严重程度结构的彩色视网膜图像,通过标量疾病表示实现相邻阶段的平滑过渡,提升了生成质量与临床一致性。

Comments MICCAI 2026 accepted manuscript (post-rebuttal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05575 2026-08-25 cs.CV 版本更新 79%

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

DiffSwap++:用于身份保留人脸交换的3D潜在控制扩散模型

Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

机构 * UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出DiffSwap++,一种融入3D人脸潜在特征的扩散人脸交换方法,可在保留源身份的同时维持目标姿态表情,在多数据集实验及评估中性能优于现有方法。

Comments IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20756 2026-08-25 cs.CV 版本更新 79%

StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation

StereoDiff:用于视频深度估计的立体-扩散协同框架

Haodong Li, Chen Wang, Jiahui Lei, Kostas Daniilidis, Lingjie Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 StereoDiff将立体匹配与视频深度扩散协同,针对视频静态和动态区域分别采用对应技术,在真实世界动态视频深度基准上实现了当前最优的零样本估计性能。

Comments We no longer wish this manuscript to stand as an active preprint and will not be maintaining or updating it further; we would prefer it not be cited as current work. It has not been published or accepted at any journal or conference, so the request is not motivated by publication elsewhere. We are requesting a standard withdrawal, not a full removal

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05389 2026-08-25 cs.CV cs.AI 版本更新 79%

Image-Conditional Diffusion Transformer for Underwater Image Enhancement

用于水下图像增强的图像条件扩散Transformer

Xingyang Nie, Caoliang Zhang, Xiaoyu Zhai, Fengzhong Qu, Biao Wang, Huilin Ge

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出基于图像条件扩散Transformer(ICDT)的水下图像增强方法,以Transformer替换DDPM的U-Net骨干,在水下ImageNet数据集上验证,其最大模型ICDT-XL/2实现了当前最优增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-25 stat.ML cs.LG math.OC 版本更新 78%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10983 2026-08-25 cs.IR cs.AI 版本更新 78%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05687 2026-08-25 cs.CL cs.AI 版本更新 78%

Answer First, Reason Later: When Commitment Order Costs Accuracy in Diffusion Language Models

先给出答案,后进行推理:扩散大语言模型中的承诺顺序

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Hwiyeong Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-08-25 cs.LG cs.AI 版本更新 78%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Si Wu, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

Comments Extended Version of ICML 2026 Fogen (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17774 2026-08-25 cs.RO 版本更新 78%

Learning Diffusion Policies for Robotic Manipulation of Timber Joinery under Fabrication Uncertainty

通过扩散策略学习实现建筑中的接触密集机器人装配

Salma Mozaffari (1), Daniel Ruan (1), William van den Bogert (2), Nima Fazeli (2), Sigrid Adriaenssens (1), Arash Adel (1) ((1) Princeton University, (2) University of Michigan)

机构 * Princeton University(普林斯顿大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了在建筑施工中使用扩散策略学习提升机器人装配的鲁棒性和精度,通过紧密契合的木构接合作为案例,证明扩散策略能通过接触感知控制补偿对齐误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16459 2026-08-25 cs.CL 版本更新 78%

DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning

DynHD: 通过去噪动态偏差学习检测扩散大语言模型的幻觉

Yanyu Qian, Yue Tan, Yixin Liu, Wang Yu, Shirui Pan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Griffith University, Australia(澳大利亚格里菲斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DynHD,通过空间和时间视角解决扩散大语言模型幻觉检测中的信息密度不均和去噪动态建模问题,采用语义感知证据构造模块和偏差检测器提升检测性能。

Comments Accepted by EMNLP 2026 Findings. 16 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-08-25 cs.CL 版本更新 78%

Adaptive Test-Time Compute Allocation for Block Diffusion Language Models in Complex Reasoning

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00612 2026-08-25 cs.CL 版本更新 78%

Lookahead-then-Verify: Reliable Constrained Decoding for Diffusion LLMs under Context-Free Grammars

前瞻性验证:用于扩散大语言模型在无上下文自由文法下的可靠约束解码

Yitong Zhang, Yongmin Li, Yuetong Liu, Jia Li, Xiaoran Jia, Zherui Li, Ge Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LAVE通过并行预测标记分布实现可靠的约束解码,提升扩散大语言模型在上下文无关文法下的生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01765 2026-08-25 cs.CR cs.AI 版本更新 78%

Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise Consistency

后门哨兵:通过时间噪声一致性检测和净化扩散模型中的后门

Bingzheng Wang, Xiaoyan Gu, Hongbo Xu, Hongcheng Li, Zimo Yu, Jiang Zhou, Weiping Wang, Wu Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TNC-Defense框架,通过时间噪声一致性检测和净化扩散模型中的后门,提升检测准确率并降低净化成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23182 2026-08-25 cs.CL 版本更新 78%

FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation

FourierSampler: 通过频率引导生成解锁扩散语言模型的非自回归潜力

Siyang He, Qiqi Wang, Xiaoran Liu, Hongnan Ma, Yiwei Shi, Yuerong Song, Ying Zhu, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FourierSampler通过频域滑动窗口机制,在扩散语言模型中实现非自回归生成,提升生成效果并超越自回归模型

Comments 15 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21242 2026-08-25 cs.LG cs.AI 版本更新 78%

Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks

通过基于比率的函数近似理解扩散模型与SignReLU网络

Luwei Sun, Dongrui Shen, Feng Chuanwen, Jianfe Li, Yulong Zhao, Han Feng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过基于比率的函数近似与SignReLU网络,研究扩散模型的理论框架,推导了生成模型的KL风险界限及收敛性保证。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01028 2026-08-25 cs.CL stat.ME 版本更新 78%

Syntax-Guided Diffusion Language Models with User-Integrated Personalization

带有用户集成个性化的语法引导扩散语言模型

Ruqian Zhang, Yijiao Zhang, Juan Shen, Zhongyi Zhu, Annie Qu

机构 * Department of Statistics and Data Science, Fudan University(复旦大学统计与数据科学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计与应用概率系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出语法引导扩散语言模型,结合结构监督与个性化条件,通过级联及非级联架构、共享表示机制,在多任务实验中展现出文本生成的流畅度、多样性与风格保真度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13529 2026-08-25 cs.LG cs.AI 版本更新 78%

Seismic Acoustic Impedance Inversion Framework Based on Conditional Latent Generative Diffusion Model

基于条件潜在生成扩散模型的地震声阻抗反演框架

Jie Chen, Hongling Chen, Jinghuai Gao, Chuangji Meng, Tao Yang, XinXin Liang

机构 * GeoAI-INV

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有扩散模型反演方法的局限,提出基于条件潜在生成扩散模型的地震声阻抗反演框架,通过小波模块与模型驱动采样策略提升精度、减少步骤,在合成与实际数据上均表现良好。

Comments Revised after peer review. Published in IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18494 2026-08-25 cs.LG 版本更新 78%

Learning in PINNs: Phase transition, diffusion equilibrium, and generalization

物理信息神经网络(PINNs)中的学习:相变、扩散平衡与泛化

Sokratis J. Anagnostopoulos, Juan Diego Toscano, Nikolaos Stergiopulos, George Em Karniadakis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过神经梯度信噪比识别出全连接神经网络的扩散平衡阶段,提出逐样本重加权方案提升残差同质性与泛化,基于PINNs实验表明梯度与残差有序可加快收敛、改善泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12197 2026-08-25 q-fin.CP nlin.CD 版本更新 71%

Emergence of Statistical Financial Factors by a Diffusion Process

由扩散过程涌现的统计金融因子

Jose Negrete Jr, Jaime Joel Ramos

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出基于网络的框架,通过资产间相互作用结构自然生成金融因子,而非统计方法。模型将市场视为耦合迭代映射系统,揭示非理性交易者影响及因子形成的结构视角。

Comments Accepted in Chaos: An Interdisciplinary Journal of Nonlinear Science. 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-25 cs.LG cs.CV 版本更新 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-25 cs.CV 版本更新 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Haoxuan Che, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-08-25 cs.CV cs.LG 版本更新 57%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: this https URL (https://primecai.github.io/mmm/)

详情

展开后加载摘要…

URL PDF HTML 收藏