RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
TASE: 用于3D场景理解与编辑的截断感知语义嵌入
机构 * Bosch Research(博世研究院) ; Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) ; University of Bonn(波恩大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。
Comments Code: https://github.com/boschresearch/TASE
SceneNAT:基于语言引导的室内场景合成的掩码生成模型
机构 * Seoul National University(首尔国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。
Comments Under review. Project page: https://scenenat.github.io
UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架
机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。
ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。
MetaView:基于尺度感知隐式几何先验的单目新视图合成
机构 * Nanyang Technological University(南洋理工大学) ; Kolors Team, Kuaishou Technology(快手科技色彩团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。
Comments accepted to ECCV 2026
视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件
机构 * Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Sun Yat-sen University(中山大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。
Comments 14 pages, 5 figures
大基础模型时代的手物交互:重建、生成与具身迁移
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。
3D场景自适应轨迹可控的人体图像动画与相机运动
机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) ; Ministry of Education(教育部) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; University of Warwick(沃林格大学) ; Zhejiang Yuexiu University(浙江越秀大学) ; University of Surrey(萨里大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)
CompoSE:通过部分感知控制进行3D形状的组合合成与编辑
机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) ; Adobe Research(Adobe研究)
专题命中 可控生成 :diffusion(abstract);分类 cs.GR
AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。
ActionParty:生成视频游戏中的多主体动作绑定
机构 * Snap Research(Snap研究院) ; University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。
Comments ECCV 2026 - Project page: https://action-party.github.io/
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/
BrainG3N:用于可控3D脑MRI生成的双用途分词器
机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) ; Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) ; Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出基于3D掩码自编码器的分词器,解耦编码器与解码器,在23项线性探测任务中21项超越SOTA,并支持条件生成和纵向预测。
前馈3D编辑从语义部分变换中学习
机构 * Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。
Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/
3D 中的疼痛:生成用于自动疼痛评估的可控合成面部
机构 * Vector Institute(向量研究所) ; KITE Research Institute(KITE研究机构) ; University Health Network(大学健康网络) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) ; Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。
OmniMotion-X:通用多模态全身运动生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。
Comments Accepted to CVPR 2026 Findings
CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位
机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) ; University of Pisa(比萨大学) ; University of Trento(特伦托大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。
Elastic3D:基于引导潜解码的可控立体视频转换
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对沉浸式3D内容需求,提出Elastic3D方法,基于(条件)潜扩散,用引导VAE解码器确保高质量立体视频输出,能让用户在推理时控制立体效果强度,实验表明其优于传统及现有基线。
Comments Project page: elastic3d.github.io
PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) ; East China Normal University(华东师范大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。
Comments Accepted by ECCV 2026
通过修补UV空间高斯建模的一次前馈360度可动画化头像
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。
Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/
TabletopGen: 桌面场景生成与机器人操作的交互式仿真
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) ; D-Robotics ; Horizon Robotics
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV
AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。
Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/
ForAug: 通过受控图像组合缓解图像分类中的偏差
机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 提出ForAug方法,通过将训练图像分解为前景和背景并重新组合,显式控制物体位置、尺度和背景,打破前景-背景相关性,在ImageNet上提升最高6%准确率,并减少捷径学习行为。
Comments v2: DeiT, ablation vs simple copy-paste, v4: more augmentation pipelines, robustness benchmarks, mask quality analysis
绝对尺度下的场景生成:利用文本的语义和几何引导实现精确且可解释的3D室内场景生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出GuidedSceneGen框架,通过文本预测全局3D布局并利用全景扩散模型和视频扩散模型生成绝对尺度的室内场景,实现高一致性、可导航的3D重建。
通过高级模态条件与交互驯服文本到发声视频生成
机构 * Renmin University of China(中国人民大学) ; Apple(苹果公司)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。
Comments The 19th European Conference on Computer Vision -- ECCV 2026
VideoSketcher:利用视频模型先验的序列草图生成
机构 * MIT(麻省理工学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。
iTryOn: 通过空间-语义引导掌握交互式视频虚拟试穿
机构 * Shenzhen Campus of Sun Yat-sen University ; Taobao \& Tmall Group of Alibaba
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出iTryOn框架,通过空间-语义引导解决交互式视频虚拟试穿中的语义模糊和复杂服装变形问题,实现了更动态可控的虚拟试穿体验。
Comments Project Page: https://zhengjun-ai.github.io/itryon-page. Accepted by ICML 2026
TextMesh4D: 零样本文本到4D网格生成
机构 * National University of Defense Technology(国防科技大学) ; Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, 211135, China(中国科学院工业人工智能研究所,南京,211135,中国) ; Jiangsu Key Laboratory of AI for Industries Institute of AI for Industries, Chinese Academy of Sciences(江苏省人工智能工业关键实验室 中国科学院工业人工智能研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出TextMesh4D框架,通过雅可比变形场和局部-全局语义正则化,实现零样本文本到动态网格生成,解决扩散引导与网格拓扑约束的冲突,达到高时间一致性和几何保真度。
基于多任务潜在空间目标的自监督学习
机构 * ESAT-PSI, KU Leuven, Belgium(KU莱顿大学ESAT-PSI实验室) ; VIB.AI, KU Leuven, Belgium(KU莱顿大学VIB.AI实验室) ; CVL, ETH Zürich, Switzerland(苏黎世联邦理工学院CVL实验室) ; INSAIT, Sofia University, Bulgaria(保加利亚索菲亚大学INSAIT研究所) ; TRACE vzw(TRACE非营利组织)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 提出自预测孪生SSL的多任务公式,通过为每种空间变换分配专用预测器解决多裁剪训练失败问题,提升线性评估3.8-4%,并引入非对称裁剪视图实现语义修复预训练。
UniADC:统一异常检测与分类框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; China University of Mining(中国矿业大学) ; VinUniversity(文理大学)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 提出UniADC模型,通过无训练可控修复网络和隐式正态判别器,同时实现异常区域检测与类别识别,在少样本甚至零样本下超越现有方法。