InstanceAnimator: Multi-Instance Sketch Video Colorization
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; NUS(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; NUS(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
统一的相机位置编码用于受控视频生成
机构 * Monash University(莫纳什大学) ; Building 4.0 CRC(4.0建筑CRC) ; VAST(VAST研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。
Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE
FG-Portrait: 基于3D流的可编辑肖像动画
机构 * National University of Singapore(新加坡国立大学) ; University of Warwick(沃里克大学) ; Imperial College London(伦敦帝国理工学院) ; University of Surrey(萨里大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出FG-Portrait,通过3D流引导的方法实现高质量的肖像动画生成,结合3D几何信息和扩散模型,提升驱动运动与源肖像的对应精度,并支持用户对表情和头部姿态的编辑。
Comments CVPR 2026
面向任务的数据合成与控制-校正采样用于遥感语义分割
机构 * Sun Yat-Sen University(中山大学) ; Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。
Comments Accepted by CVPR 2026
通用正态嵌入
机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出通用正态嵌入假设,通过实验验证编码器和生成模型共享的高斯潜在空间,展示其在属性预测和可控编辑中的应用。
Comments Accepted to CVPR 2026
3DSceneEditor: 基于高斯散射的可控3D场景编辑
机构 * D Optical Metrology unit, Fondazione Bruno Kessler(3D光学测绘单元,布鲁诺·凯斯勒基金会) ; Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出3DSceneEditor,通过高斯散射实现高效精准的3D场景编辑,整合实例分割模型与CLIP实现语义对齐,支持对象添加、重定位等操作,实验表明其在精度和效率上优于现有方法。
Comments Accepted by WACV 2026, Project Page: https://ziyangyan.github.io/3DSceneEditor
机器人控制中的因果世界建模
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出LingBot-VA框架,通过视频世界建模与视觉语言预训练结合,实现机器人学习的新基础。模型包含共享潜在空间、闭环回滚机制和异步推理流程,提升了长周期操作和数据效率。
Comments Project page: https://technology.robbyant.com/lingbot-va Code: https://github.com/robbyant/lingbot-va
HUG-VAS:一种基于层次NURBS的生成模型用于主动脉几何合成与可控编辑
机构 * Department of Aerospace and Mechanical Engineering, University of Notre Dame(notre dame 大学航空航天与机械工程系) ; Sibley School of Mechanical and Aerospace Engineering, Cornell University(cornell 大学机械与航空航天工程学院) ; Department of Applied and Computational Mathematics and Statistics, University of Notre Dame(notre dame 大学应用与计算数学与统计学系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 HUG-VAS通过结合NURBS参数化与层次扩散模型,实现主动脉几何的精细合成与可控编辑,支持零样本生成与临床应用。
Comments 64 pages, 9 figures, 6 supplementary figures
通过模块化身体部位相控实现可控的文本到运动生成
机构 * Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; HKUST(香港科技大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。
迈向高保真视觉重建:从基于EEG的条件生成到联合模态引导重建
机构 * Beijing University of Technology, Beijing(北京理工大学) ; Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing(北京计算智能与智能系统重点实验室)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出联合模态视觉重建框架,通过独立学习EEG和文本信息,提升EEG特征的重建能力,结合多尺度编码和图像增强,实现高保真视觉重建。
SeeClear: 通过生成性消透明实现可靠的透明物体深度估计
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SeeClear通过生成性消透明技术,将透明物体转换为几何一致的不透明图像,从而提升单目深度估计的稳定性与准确性。
Comments Project page: https://heyumeng.com/SeeClear-web/. 19 pages, 12 figures
SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐
机构 * Baidu(百度) ; Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。
Comments 24 pages, 12 figures
R&D: 在语义分割中平衡可靠性与多样性以合成数据增强
机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。
Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448
LICA:图形设计研究的分层图像组成标注
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。
Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。
Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/
Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制
机构 * Intel Corporation(英特尔公司)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。
Comments 14 pages, 9 figures
无需训练的生成视频检测方法:时空似然方法
机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。
Comments Accepted to CVPR 2026
立体世界模型:基于摄像头的立体视频生成
机构 * The University of Hong Kong(香港大学) ; VAST ; ByteDance Pico(字节跳动Pico)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。
Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/
MosaicMem: 用于可控视频世界模型的混合空间记忆
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; The University of Osaka(大阪大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Mujin Inc.(Mujin公司) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Taiyuan University of Technology(太原本科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。
Comments Project Page: https://mosaicmem.github.io/mosaicmem/
S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型
机构 * The Hong Kong University of Science ; Technology (Guangzhou) Huawei Foundation Model Department
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。
M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Migu Beijing Research Institute(咪咕北京研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。
Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/
WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示
机构 * Adobe Research(Adobe研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。
Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/
语义一维分词器用于图像重建与生成
机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) ; Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。
Comments 18 pages,12 figures
$D^3$-RSMDE:40倍更快且高保真度的遥感单目深度估计
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出$D^3$-RSMDE框架,结合ViT快速生成初步深度图并利用轻量级U-Net进行细节优化,实现高效高保真度的遥感单目深度估计,比现有方法快40倍且LPIPS指标降低11.85%。
ECHO:边缘-云计算人形机器人语言到动作控制
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) ; Shandong University(山东大学) ; Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。
引导注视的手-物体交互合成:数据集与方法
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出 gaze-guided 手-物体交互合成任务,引入首个捕捉 gaze、手和物体交互的 GazeHOI 数据集,并提出 GHO-Diffusion 模型以解决高一致性与物理合理性问题。
Comments Accepted by IEEE Transactions on Multimedia (TMM), 2026. Project Page: https://takiee.github.io/gaze-hoi/
学习可控的单图像照明代理
机构 * HKUST(香港科技大学) ; HKPolyU(香港理工大学) ; CUHK(香港中文大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。
Comments Accepted by CVPR2026
通过外观和几何属性编辑评估语义分割模型
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。
Comments Accepted to IEEE TPAMI 2026
ConsistCompose:统一的多模态布局控制用于图像合成
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。
Comments Accepted to CVPR 2026; 23 pages, 17 figures
通过PRISM:科学图像的复合与可控恢复
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 PRISM通过结合复合感知监督和加权对比度解纠缠目标,实现科学图像中复杂退化的同时恢复,支持通过自然语言提示选择性修复,提升下游科学准确性。