MSEditor: Toward Consistent Multi-Shot Video Editing
MSEditor:面向一致性多镜头视频编辑
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。
Comments ECCV 2026
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
MSEditor:面向一致性多镜头视频编辑
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。
Comments ECCV 2026
SplatGuide:用于无姿态新视图合成的3D高斯几何先验
机构 * Aalto University(阿尔托大学) ; Deep Render(深度渲染公司) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Nokia Technologies(诺基亚技术公司) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。
SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成
机构 * Kuaishou Technology(快手科技)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。
Comments 9 pages, 5 figures
时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡
机构 * East China Normal University(华东师范大学) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) ; School of Statistics, East China Normal University(华东师范大学统计学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。
ES3D:将语义嵌入3D空间以实现组件感知编辑
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
有限资源下自监督图像与视频预训练的对照研究
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。
SeFaR:面向深度神经网络的语义特征感知鲁棒性测试
机构 * University of Virginia(弗吉尼亚大学) ; KBR Inc.(KBR公司) ; NASA Ames(美国国家航空航天局艾姆斯研究中心) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。
SynVAR:在视觉自回归模型中协同空间与语义对齐
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Western University(西安大略大学) ; JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。
Comments Accepted by ECCV 2026
NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。
Comments 21 pages, 6 figures
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
EmoWorld:用于可控情感视频生成的解耦情感场
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。
Vorch-Omni:视觉与听觉的多任务编排
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。
Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/
VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。
DAC-Pose:用于姿态引导人体生成的双智能体协作框架
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。
Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose
UniWorld-Design:从像素生成到层原生设计
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。
Comments Project page: https://rabbitvis.rabbitpre.com/blog
VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。
Comments ACM MM 2026
代理化身与低秩缓存结合:实时单样本情感可控肖像动画
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出结合代理化身与低秩缓存的级联框架,解决音频驱动肖像动画的实时性与情感控制问题,实现了情感表达、身份保留及推理效率的提升。
G-Skin:学习结合生成式视觉先验的3D高斯绑定方法
机构 * City University of Hong Kong(香港城市大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院) ; Central South University(中南大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文针对3D高斯资产绑定的难题,提出生成式蒙皮框架G-Skin,利用2D视觉基础模型提炼运动先验构建优化流程,可灵活泛化并优于现有方法。
几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。
Comments 17 pages, 11 figures
检索驱动的无训练AI生成视频溯源
机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) ; Purple Mountain Laboratories(紫金山实验室) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 针对现有视觉溯源方法泛化性不足的问题,本文提出检索驱动的无训练AI生成视频溯源范式,基于生成指纹的流程在GenVidBench上实现优于SOTA的检测与溯源性能。
超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。
Comments Accepted to ACM MM 2026
CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; China Telecom(中国电信) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。
统一多模态模型是否在同一空间中思考?通过跨分支引导的视角
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。
fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架
机构 * Fudan University(复旦大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Xmov(未提及通用中文名,可音译为艾莫夫)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。
智能设计师:用于结构感知室内布局生成的渐进式多智能体协作
机构 * Guangdong University of Technology(广东工业大学) ; South China University of Technology(华南理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。
Comments TPAMI 2026
通过语义不变自蒸馏学习语义鲁棒的变化检测
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究针对遥感图像变化检测中模型特征易受非语义变化干扰的问题,提出SCDistill框架,通过语义不变自蒸馏策略和扩散扰动模拟管道,增强语义一致性并扩展数据,提升变化检测性能,在多基准测试中达最优,泛化能力强。
Comments Accepted by ECCV2026
学习用于视频生成的显式物理参数控制和基准测试
机构 * Beihang University(北京航空航天大学) ; Alibaba Group(阿里巴巴集团)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究针对图像到视频生成中物理参数控制问题,引入含密集物理参数化的数据集PhyParam-Dataset,提出物理引导的扩散模型PhyParam,建立基准PhyParam-Bench,通过实验证明该模型能在保持视觉保真度时提升物理一致性。
Comments 23 pages, 11 figures
TAP-RAG:用于长文档多模态问答的任务感知策略控制
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; The International Joint Institute of Tianjin University(天津大学国际联合学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。
Comments 18 pages, 6 figures, 9 tables