Diffusion-Based Quality Control of Medical Image Segmentations across Organs
基于扩散的质量控制用于跨器官医学图像分割
专题命中 可控生成 :diffusion(title,abstract)
AI总结 本文提出nnQC框架,通过扩散生成模型实现跨器官医学图像分割的质量控制,有效解决现有方法的通用性问题。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
基于扩散的质量控制用于跨器官医学图像分割
专题命中 可控生成 :diffusion(title,abstract)
AI总结 本文提出nnQC框架,通过扩散生成模型实现跨器官医学图像分割的质量控制,有效解决现有方法的通用性问题。
TIDAL: 时间交错扩散与动作循环用于高频VLA控制
机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) ; Tsinghua University, Beijing, China(清华大学,北京,中国) ; Nanyang Technological University, Singapore(南洋理工大学,新加坡)
专题命中 可控生成 :diffusion(title,abstract)
AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。
通过离散扩散实现可控口音标准化
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanjing University(南京大学) ; Tencent Ethereal Audio Lab(腾讯虚音频实验室) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 可控生成 :diffusion(title,abstract)
AI总结 提出DLM-AN系统,利用掩蔽离散扩散和自监督语音令牌,通过选择性重用源令牌控制口音强度,结合流匹配时长比预测器调整节奏,实现低词错误率和可解释的口音强度控制。
Comments Accepted to Interspeech 2026 as a long paper
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署
专题命中 可控生成 :image generation(title)
AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。
在均匀扰动的非光滑区域中具有诺伊曼边界条件的反应扩散方程全局吸引子的一致\(L^{\infty}\)有界性
专题命中 可控生成 :diffusion(title)
AI总结 研究一族在非光滑区域上具诺伊曼边界条件的半线性抛物方程,通过特定条件建立适定性与吸引子存在性,利用多种方法证明吸引子族\(L^\infty\)一致有界,且在区域体积收敛时关于强\(H^1\)拓扑在\(\mu = 0\)处上半连续。
Comments 27 pages
SQGen:基于潜变量调制量化张量列车的结构化量子图像生成
专题命中 可控生成 :image generation(title)
AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。
Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码
机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。
Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/
基于VGGT先验的几何基础密集语义匹配研究
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。
Comments ECCV 2026
BrainNormalizer:通过边缘引导控制网络从肿瘤MRI进行解剖学信息伪健康脑重建
机构 * University of Pittsburgh(匹兹堡大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cedars-Sinai Medical Center(西德萨斯医疗中心) ; Mayo Clinic Arizona(梅奥诊所亚利桑那分部)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 针对脑肿瘤致结构变形难区分肿瘤与解剖变异问题,提出BrainNormalizer框架,用两阶段训练学习解剖先验等,通过特定策略实现伪健康脑重建,实验表明其有优势。
ISAC:无需训练的实例到语义注意力控制用于多实例生成
机构 * OGQ ; Seoul National University(首尔大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。
Comments Accepted to ECCV 2026
AnimeAdapter: 细粒度且一致的零样本动漫人物生成
机构 * National University of Singapore, Singapore(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。
ShowFlow: 从鲁棒的单概念到无条件的多概念生成
机构 * University of Science(科学大学) ; Vietnam National University(越南国家大学) ; Monash University(墨尔本大学) ; University of Dayton(Dayton大学)
专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出ShowFlow框架,通过KronA-WED适配器和语义感知注意力正则化增强单概念生成,并利用SAMA和布局一致性指导实现无额外条件的多概念生成。
潜在颜色子空间:高维混沌中的涌现秩序
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。
Comments Accepted at ICML 2026
通过文本和语义定义的分割提示灵活控制3D CT生成
机构 * Boston University School of Engineering(波士顿大学工程学院) ; Stanford University(斯坦福大学) ; University of Pittsburgh Medical Center(匹兹堡大学医学中心) ; Boston University School of Medicine(波士顿大学医学院)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。
风格感知的光泽控制用于生成非照片实感渲染
机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。
Comments Published in Computers & Graphics journal
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NEC Labs America(NEC美国实验室) ; UC San Diego(加州大学圣迭戈分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。
Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)
生成现实:基于交互式视频生成的人本世界模拟
机构 * Stanford University(斯坦福大学) ; NYU Shanghai(纽约大学上海分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。
Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)
BulletTime: 分离时间与相机姿态的视频生成控制
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。
Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)
驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei Hilbert Research Center(华为希利伯特研究中心) ; Huawei Riemann Lab(华为里曼实验室) ; Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。
Comments Accepted to ACM MM 2026
将3D生成模型重新利用于自回归布局生成
机构 * School of Software, Beihang University(北航软件学院) ; Tsinghua University(清华大学) ; University of Hong Kong(香港大学) ; Tencent Hunyuan(腾讯文英) ; Peking University(北京大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。
Know3D: 通过视觉-语言模型的知识提示3D生成
机构 * Peking University(北京大学) ; Math Magic(数学魔术) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; Dalian University of Technology(大连理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。
Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/
通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差
机构 * York University(约克大学) ; University of Guelph(圭尔夫大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。
Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
TASE: 用于3D场景理解与编辑的截断感知语义嵌入
机构 * Bosch Research(博世研究院) ; Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) ; University of Bonn(波恩大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。
Comments Code: https://github.com/boschresearch/TASE
SceneNAT:基于语言引导的室内场景合成的掩码生成模型
机构 * Seoul National University(首尔国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。
Comments Under review. Project page: https://scenenat.github.io
UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架
机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。
ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。