arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 215 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2608.28909 2026-09-01 cs.CV 新提交 83%

Coarse to Fine: Iterative Adversarial Neural Cellular Automata for Medical Image Synthesis

从粗到细:用于医学图像合成的迭代对抗神经细胞自动机

Anh Thi Luu, Nick Lemke, Anirban Mukhopadhyay

机构 * Technical University of Darmstadt(达姆施塔特工业大学) ImFusion GmbH(ImFusion 有限公司)

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出首个基于NCA的轻量通用生成对抗网络StyleGANCA,在BloodMNIST和PathMNIST上以仅61.7万参数实现有竞争力的图像质量,支持多分类器训练,解决医学影像数据共享的隐私问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-09-01 cs.CV 版本更新 83%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29210 2026-09-01 cs.AI 新提交 82%

Imag-Eval: a language-grounded framework for interpretable Text-to-Image instruction following evaluation

Imag-Eval:一种基于语言的可解释文本到图像指令遵循评估框架

Ibrahim Mohamed Serouis, David Jaramillo Duque

机构 * Talan Research and Innovation Center(塔兰研究与创新中心)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对现有T2I模型评估的局限,提出Imag-Eval基准,通过独立调整实例数与规则组合区分语言复杂性与组合难度,经实验表明结构化技能的组合难度由规则数及绑定方式决定。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31073 2026-09-01 cs.CV eess.IV 新提交 79%

LISynSeg: Data-Centric Label-to-Image Synthesis for Cross-Modality Whole-Heart Segmentation

LISynSeg:以数据为中心的标签到图像合成用于跨模态全心分割

Jiacheng Wang, Ivana Isgum, Ipek Oguz

机构 * Vanderbilt University(范德堡大学) Mayo Clinic(梅奥诊所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 该研究提出以数据为中心的LISynSeg方法,通过标签到图像合成结合真实图像训练,在不改变nnU-Net架构的情况下改善跨模态全心分割,对MRI的提升更显著。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29589 2026-09-01 cs.AI 新提交 78%

Not Safe for All: Auditing the Dialect Penalty in Text-to-Image Safety Pipelines

并非对所有人安全:审计文本到图像安全流程中的方言惩罚

Minkyu Kim, Juhwan Choi, YoungBin Kim

机构 * Chung-Ang University(中央大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究发现文本到图像安全流程存在方言惩罚问题,五种英语方言的23080对提示实验显示,不同安全过滤器对不同方言的检测偏差显著,可通过组平衡重训练缓解。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-09-01 cs.CV 版本更新 70%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28773 2026-09-01 eess.IV cs.CV 新提交 57%

Medical Foundation Model Features as Perceptual Loss for Brain MRI Contrast Dose Simulation

医学基础模型特征作为感知损失用于脑部MRI对比度剂量模拟

Changsheng Fang, Dayang Wang, T. Campbell Arnold, Enhao Gong, Srivathsa Pasumarthi

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 该研究提出用医学基础模型RadImageNet的特征替代自然图像骨干网络,作为感知损失用于脑部MRI对比度剂量模拟,相关指标略有提升,视觉效果更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26861 2026-09-01 cs.IR cs.CL 版本更新 50%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2608.26956 2026-09-01 cs.CV 版本更新 85%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 图像编辑 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02290 2026-09-01 cs.CV 版本更新 77%

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集

Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Yan Li, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28802 2026-09-01 cs.CV cs.AI 新提交 70%

A Large-scale Evaluation of Text-guided Models for Facial Editing

文本引导的人脸编辑模型的大规模评估

Rahul Nair, Saurav Pandit, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Prelight Inc(普雷莱特公司)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本研究对6种文本引导模型开展首次大规模人脸编辑评估,构建含169个属性的Face-Edit-Attributes数据集,发现多数模型头发配饰编辑表现好但姿态编辑差,存在过度编辑及针对深色皮肤男性和老年面孔的偏差。

Comments ACM Multimedia (ACMMM) 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29925 2026-09-01 cs.CV 新提交 57%

Dior: Drawing the Light of Image via Material-Decoupled Illumination Representation

Dior:通过材料解耦光照表示绘制图像的光照

Xuanpu Zhang, Xuesong Niu, Haoxiang Cao, Ruidong Chen, Jianhao Zeng, Changqian Yu

机构 * Tianjin University(天津大学) KlingAI Research(KlingAI研究院) Deva Research(Deva研究院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对现有图像重光照方法无法在手绘涂鸦输入与结果间建立有效映射的问题,提出材料解耦光照表示Lumi Map,构建Dior-Light方法,提升了重光照精度与光照控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 158 篇

2603.00763 2026-09-01 cs.CV 版本更新 89%

Analyzing and Improving Fast Sampling of Text-to-Image Diffusion Models

分析和改进文本到图像扩散模型的快速采样

Zhenyu Zhou, Defang Chen, Siwei Lyu, Chun Chen, Can Wang

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Institute for Artificial Intelligence and Data Science(人工智能与数据科学研究院) University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出TORS调度策略,通过优化采样轨迹的几何变化,提升文本到图像扩散模型在有限采样步数下的生成质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12527 2026-09-01 cs.CV 版本更新 88%

Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models

文本到图像扩散模型中NSFW内容擦除的综合评估与分析

Die Chen, Zhiwen Li, Cen Chen, Yuexiang Xie, Xiaodan Li, Jinyan Ye, Yingda Chen, Yaliang Li

机构 * East China Normal University(华东师范大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对文本到图像扩散模型的NSFW内容问题,构建全流程工具包开展首次系统性评估,为相关概念擦除方法的应用提供指导,助力扩散模型内容安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16830 2026-09-01 cs.CL 版本更新 88%

PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models

PEPPER:基于感知的扰动用于文本到图像扩散模型的鲁棒后门防御

Oscar Chew, Po-Yi Lu, Jayden Lin, Kuan-Hao Huang, Hsuan-Tien Lin

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 PEPPER通过重写提示生成语义上不同但视觉上相似的描述,干扰输入提示中的触发器,提高文本到图像扩散模型的鲁棒性,尤其有效对抗基于文本编码器的攻击。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交 87%

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15132 2026-09-01 cs.CV 版本更新 86%

WiT: Waypoint Diffusion Transformers for Alleviating Trajectory Conflict in Pixel-Space Image Generation

WiT:通过轨迹冲突导航实现方式点扩散变换

Hainuo Wang, Mingjia Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出WiT,通过分解连续向量场中的语义方式点,解决像素空间中的轨迹冲突问题,提升扩散生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29809 2026-09-01 cs.CV 新提交 85%

RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation

RegionCache:面向高效多轮图像生成的语义感知区域复用

Peizheng Li, Xin Ai, Hanyuan Liu, Qiange Wang, Yanfeng Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 针对多轮图像编辑中现有DiT方法的冗余计算问题,提出RegionCache框架,通过语义感知的区域复用实现1.43-2.55倍端到端加速且保持图像质量。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29281 2026-09-01 cs.CV 新提交 83%

Elastic Token Compression for Pixel-Space Diffusion Transformers

像素空间扩散Transformer的弹性令牌压缩

Eduard Zamfir, Christian Reisswig, Zongwei Wu, Yongqin Xian, Radu Timofte

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对像素空间扩散Transformer的令牌冗余问题,提出Region Token Interface弹性令牌压缩方法,可在多压缩预算下提升效率,2.0倍速时达密集模型质量,2.6倍速时仍接近该质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交 83%

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28929 2026-09-01 cs.CR cs.CV 新提交 83%

Membership is Ownership: A Robust Ownership Verification Framework for Diffusion Models

成员即所有权:一种针对扩散模型的鲁棒所有权验证框架

Feng Jiang, Zuobin Xiong, An Huang, Zhipeng Cai, Yingshu Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出MiO框架,通过总体假设检验实现扩散模型所有权验证,未修改原模型,在窃后微调等对抗场景下鲁棒性优于水印方法,为AI模型IP保护提供了新方案。

Comments This paper has been accepted to the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28681 2026-09-01 cs.CV 新提交 83%

CARD: Calibration via Agreement in Reverse Diffusion for Out-of-Domain MRI Segmentation

CARD:基于反向扩散一致性的域外MRI分割校准方法

Jiaheng Dai, Weidong Guo, Qingbiao Li, Jie Xu, Yi Guo, Yuanyuan Wang, Zeju Li

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Faculty of Information Science and Computing, University of Macau(澳门大学信息科学与计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对域外MRI分割的域偏移导致概率校准失效的问题,提出基于反向扩散一致性的CARD方法,利用生成式形状先验的分歧实现像素级校准,显著降低了多器官MRI域偏移下的校准误差。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-09-01 cs.CV cs.AI 版本更新 83%

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 16pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30745 2026-09-01 cs.LG 新提交 82%

TDDM-Melatt: A Decoupled Memory and Diffusion Framework for Generalizable Encrypted Traffic Classification

TDDM-Melatt:用于通用加密流量分类的解耦内存与扩散框架

Ze Chen, Qiming Yu, Zijia Song, Guozheng Yang, Wei Yan

机构 * National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对加密流量分类的泛化性局限,研究提出TDDM-Melatt框架,结合解耦内存模型Melatt与流量去噪扩散模型TDDM,在4个公开数据集上的实验性能优于6种基础分类模型和6种SOTA表示学习模型。

Comments 18 pages, 13 figures, 9 tables, accepted at the 2026 ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29907 2026-09-01 cs.LG physics.app-ph physics.comp-ph 新提交 82%

Diffusion-Based Inverse Design of Dielectric Resonator Metasurfaces for Shaping Smart Electromagnetic Environments

基于扩散模型的介质谐振器超表面逆设计用于构建智能电磁环境

M. Tsukerman, K. Grotov, D. Vovchuk, P. Ginzburg

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出条件扩散框架用于介质谐振器超表面逆设计,可生成多个候选设计,其误差低于CMA-ES优化及确定性神经基线,推理效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21247 2026-09-01 stat.ML cs.LG math.DG physics.data-an 版本更新 82%

Accelerate Vector Diffusion Maps by Landmarks

通过地标加速向量扩散图

Sing-Yuan Yeh, Yi-An Wu, Hau-Tieng Wu, Mao-Pei Tsui

机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29048 2026-09-01 cs.CV cs.GR 新提交 81%

DReSG: Diffusion Residuals for Stylized Gaussian Splatting

DReSG:用于风格化高斯溅射的扩散残差

Zhongliang Liu, Wenjie Liu, Yang Li

机构 * School of Software Engineering, East China Normal University(华东师范大学软件工程学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 针对现有3D风格化方法的缺陷,提出DReSG框架,将扩散提议作为残差目标并通过多视图高斯反馈优化,实现稳定可控的参考引导风格化,更好保留场景结构与跨视图稳定性。

Comments Accepted to Pacific Graphics 2026 (Conference Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30603 2026-09-01 cs.CV cs.AI 新提交 79%

DiffSAC: Diffusion-guided Sampling for Consensus-based Robust Estimation

DiffSAC:用于基于共识的鲁棒估计的扩散引导采样

Chang Nie, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) Department of Engineering, Cambridge University(剑桥大学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对传统样本共识鲁棒估计采样效率低的问题,提出DiffSAC框架,通过扩散模型学习有效最小集分布,仅需几十个假设就实现最先进性能,可作为即插即用模块改进现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29820 2026-09-01 cs.CV 新提交 79%

Null-Space Diffusion Restoration with Adaptive Uncertainty-Guided Fusion for Ultrasound Speckle Reduction

用于超声散斑抑制的自适应不确定性引导融合的零空间扩散恢复

Juneyong Lee, Jaeyoung Choi

机构 * Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对超声B型成像的散斑噪声抑制问题,提出不确定性引导零空间扩散框架,在PICMUS等数据集上实现了散斑抑制与结构保留的平衡,达到了具竞争力的gCNR值。

Comments 14 pages, 4 figures, 5 tables. Accepted for publication in IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29549 2026-09-01 cs.SD cs.AI cs.MM 新提交 79%

PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation

PhysWave:用于可控空间音频生成的物理引导潜在扩散模型

Lingfeng Yao, Chenpei Huang, Xingke Yang, Ziye Geng, Changqing Luo, Hao Wang, Jiang Liu, Miao Pan

机构 * University of Houston(休斯顿大学) Stevens Institute of Technology(史蒂文斯理工学院) Waseda University(早稻田大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 PhysWave是一种物理引导潜在扩散模型,通过统一控制与加入声学先验,生成空间一致的文本到FOA音频,还构建了30万段FOA数据集,可用于推理时的空间优化。

Comments Accepted by EMNLP 2026 Main Conference. Project website: https://lingfengyao.github.io/PhysWave/

详情

展开后加载摘要…

URL PDF HTML 收藏