Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution
重新审视基于空间-语义引导的超分辨率中的感知-失真权衡
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
重新审视基于空间-语义引导的超分辨率中的感知-失真权衡
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。
WonderVerse:基于视频生成模型的可扩展3D场景生成
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。
Comments Accepted at CVM 2026
多对象广告创意生成
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出CreativeAds系统,通过多产品广告生成管道解决大规模广告创作中的产品配对、布局生成和背景生成挑战,实现自动化高质量广告生成。
无人机在户外环境中实时单目场景分析
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Co-SemDepth模型,用于无人机在低空非结构化环境中实时预测深度和语义图。通过合成数据集TopAir和图像风格迁移技术提升泛化能力,并在海洋领域验证模型性能。
SAW:通过可控且可扩展的视频生成实现手术动作世界模型
机构 * Johns Hopkins University(约翰霍普金斯大学) ; NVIDIA
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。
Comments The manuscript is under review
MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。
Comments Accepted by IEEE TCSVT
SLICE: 通过 compartmentalized 编码的语义潜在注入实现图像水印
机构 * University of New South Wales(新南威尔士大学) ; Griffith University(格里菲斯大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SLICE通过将图像语义分解为四个因素并精确锚定到初始高斯噪声区域,实现鲁棒的语义水印验证,有效检测和定位语义篡改,实验表明其在对抗攻击中表现优异。
从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Adobe Research(Adobe研究实验室) ; Stanford University(斯坦福大学) ; Shanghai Innovation Institute(上海创新研究院) ; CPII under InnoHK Project(InnoHK项目下的CPII)
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。
CalliMaster:通过布局引导的空间规划掌握页面级中文书法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) ; Xiamen University(厦门大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。
Motion Dreamer:基于物理一致视频生成的边界条件运动推理
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。
Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions
DVD:利用生成先验的确定性视频深度估计
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。
Comments Project: https://dvd-project.github.io/
EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Microsoft Corporation(微软公司)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。
PolyCrysDiff: 可控生成三维可计算多晶材料结构
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 PolyCrysDiff通过条件潜在扩散框架实现了可计算的多晶材料三维微结构可控生成,有效提升了晶粒属性控制精度,为多晶材料的优化设计提供新方法。
语义感知的重建误差用于检测AI生成图像
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出语义感知的重建误差(SARE)用于检测AI生成图像,通过分析图像与描述词引导重建间的语义差异,提升跨生成模型的检测鲁棒性。
UniCom: 通过压缩的连续语义表示实现统一多模态建模
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。
OmniVTON++: 无需训练的通用虚拟试衣系统 with 主要姿态引导
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 OmniVTON++是一种无需训练的通用虚拟试衣系统,通过协调结构化服装变形、主要姿态引导和连续边界缝合,实现跨数据集和服装类型的高性能虚拟试衣。
UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。
Comments 29 pages, 9 figures, 33 tables
RoboPCA:基于姿态的从人类示范中学习空间可及性的方法用于机器人操作
机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboPCA通过联合预测接触区域和姿态,提升机器人操作中从人类示范中学习空间可及性的性能。
Comments Accepted to ICRA 2026
UniUGG: 通过几何-语义编码实现统一的3D理解与生成
机构 * Fudan University(复旦大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。
语义噪声初始化能否从图像迁移到视频?一项配对诊断研究
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。
Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond
ReDepth Anything: 通过自监督重照明进行测试时深度细化
机构 * Bielefeld University(比勒菲尔德大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。
Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything
EffectMaker:统一推理与生成以实现定制化视觉效果创建
机构 * Tencent Hunyuan(腾讯文言) ; City University of Hong Kong(香港城市大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。
Comments Project page: https://effectmaker.github.io
InnoAds-Composer: 电商海报生成中的高效条件组合
机构 * JD.com, Inc.(京东公司) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。
Comments Accepted by CVPR2026
Cog2Gen3D: 三维语义-几何认知雕刻用于三维生成
机构 * School of Artificial and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; School of Computing, Macquarie University(麦考瑞大学计算机学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Cog2Gen3D通过结合语义和绝对几何信息,提出了一种三维认知引导的扩散框架,以实现可控的三维生成。
UniTS:面向遥感的统一时空生成模型
机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) ; Department of Geography, the University of Hong Kong(香港大学地理系) ; School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) ; Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) ; Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。
PoI: 一种从新视角提取感兴趣像素的滤波器用于场景坐标回归
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 PoI通过像素级过滤策略提升场景坐标回归的定位精度,结合扩散模型和重投影误差优化新视角合成效果。
FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值
机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。
Comments ICASSP2026
UFO-4D:从两幅图像中进行无约束前馈4D重建
机构 * Google(谷歌) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 UFO-4D通过统一的前馈框架,从两幅图像中高效重建密集4D表示,实现3D几何、运动和相机姿态的联合估计,提升4D重建精度与效率。
Comments ICLR 2026, Project page: https://ufo-4d.github.io/
TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。
Comments Accepted to ICCV 2025
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121
NOVA:无配对视频编辑的稀疏控制与密集合成
机构 * Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; WeChat, Tencent(微信、腾讯) ; The University of Hong Kong(香港大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。
Comments Accepted by CVPR 2026