MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control
MultiCube:具有部件级语义与空间控制的组合式三维生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
MultiCube:具有部件级语义与空间控制的组合式三维生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。
MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。
Comments 14 pages, 6 figures
基于稀疏直接飞行时间传感器的密集度量深度补全
机构 * KAIST(韩国科学技术院) ; USTC(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
用于稳健合成图像源归属的混合语义与频谱集成
机构 * Chittagong University of Engineering and Technology(吉大港工程技术大学)
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 针对文本到图像模型发展带来的合成图像源归属问题,提出融合语义深度学习与数学取证特征提取的双分支集成框架,经实验验证准确率高且计算高效,突出数学取证在实际部署中的优势。
Comments Peer-reviewed and accepted to the DLMMDD Challenge Workshop at the 35th International Conference on Artificial Neural Networks (ICANN 2026). 7 pages, 1 figures
RegHead:通过前馈配准生成非拟人头部混合形状
机构 * UCSC(加州大学圣克鲁兹分校) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAUST(阿卜杜拉国王科技大学) ; Snap Inc.(Snap公司)
专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR
AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。
Token-to-Token对齐的文本嵌入用于语义融合
机构 * Tel Aviv University(特拉维夫大学) ; BRIA AI
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。
晚学习,早引导:用于公平人脸生成的时间步解耦语义引导
机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) ; Indian Institute of Technology Bombay(印度理工学院孟买分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。
InteractGesture:用于连续流协同语音手势控制的渐进式分块引导
机构 * Meta ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。
Comments ECCV 2026 Workshop - Interactive Social Avatars
4DStreamCtrl:基于在线4D控制的交互式视频生成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。
Comments 23 pages
GLOSS:用于忠实参考引导纹理填充的几何局部自相似性学习
专题命中 可控生成 :inpainting(abstract);分类 cs.GR
AI总结 本研究提出GLOSS模型,利用几何局部自相似性,以数据需求低、可控性强的方式实现忠实参考引导的纹理填充,在3D纹理生成任务中表现优于或媲美基线模型,且作为Blender插件获专业人员认可。
Comments 22 pages, 17 figures, project page https://chenyuecai.github.io/gloss-page/
FixAnything:基于视频生成先验的3D一致性渲染优化
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。
Comments Appearing in ECCV 2026. Project page: https://fix-anything.github.io
VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。
Comments 10 pages, 8 figures, 5 tabels, supplementary material: https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf
SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成
机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) ; Shenzhen University(深圳大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。
Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages
SemanticSlider3D:无需训练的3D物体连续语义编辑
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。
Comments UIST 2026
MSEditor:面向一致性多镜头视频编辑
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。
Comments ECCV 2026
SplatGuide:用于无姿态新视图合成的3D高斯几何先验
机构 * Aalto University(阿尔托大学) ; Deep Render(深度渲染公司) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Nokia Technologies(诺基亚技术公司) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。
SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成
机构 * Kuaishou Technology(快手科技)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。
Comments 9 pages, 5 figures
时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡
机构 * East China Normal University(华东师范大学) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) ; School of Statistics, East China Normal University(华东师范大学统计学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。
ES3D:将语义嵌入3D空间以实现组件感知编辑
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
有限资源下自监督图像与视频预训练的对照研究
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。
SeFaR:面向深度神经网络的语义特征感知鲁棒性测试
机构 * University of Virginia(弗吉尼亚大学) ; KBR Inc.(KBR公司) ; NASA Ames(美国国家航空航天局艾姆斯研究中心) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。
SynVAR:在视觉自回归模型中协同空间与语义对齐
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Western University(西安大略大学) ; JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。
Comments Accepted by ECCV 2026
NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。
Comments 21 pages, 6 figures
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
EmoWorld:用于可控情感视频生成的解耦情感场
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。
Vorch-Omni:视觉与听觉的多任务编排
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。
Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/
VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。
DAC-Pose:用于姿态引导人体生成的双智能体协作框架
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。
Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose