arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3223 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 213 篇

2608.20448 2026-08-24 cs.GR cs.CV 新提交 62%

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube:具有部件级语义与空间控制的组合式三维生成

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 62%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交 62%

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22808 2026-07-28 cs.CV cs.AI cs.GR eess.IV 新提交 62%

Hybrid Semantic and Spectral Ensemble for Robust Synthetic Image Source Attribution

用于稳健合成图像源归属的混合语义与频谱集成

Md. Ajwad Hossain

机构 * Chittagong University of Engineering and Technology(吉大港工程技术大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像模型发展带来的合成图像源归属问题,提出融合语义深度学习与数学取证特征提取的双分支集成框架,经实验验证准确率高且计算高效,突出数学取证在实际部署中的优势。

Comments Peer-reviewed and accepted to the DLMMDD Challenge Workshop at the 35th International Conference on Artificial Neural Networks (ICANN 2026). 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12206 2026-07-15 cs.CV cs.GR 新提交 62%

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

RegHead:通过前馈配准生成非拟人头部混合形状

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, James Davis, Jian Wang

机构 * UCSC(加州大学圣克鲁兹分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) Snap Inc.(Snap公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24021 2026-06-24 cs.CV cs.GR 新提交 62%

Token-to-Token Alignment of Text Embeddings for Semantic Blending

Token-to-Token对齐的文本嵌入用于语义融合

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) BRIA AI

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25862 2026-08-27 cs.CV 新提交 57%

Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation

晚学习,早引导:用于公平人脸生成的时间步解耦语义引导

Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R. S. Sengar, Swati Hiremath

机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25734 2026-08-27 cs.CV 新提交 57%

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

InteractGesture:用于连续流协同语音手势控制的渐进式分块引导

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

机构 * Meta University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。

Comments ECCV 2026 Workshop - Interactive Social Avatars

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交 57%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25461 2026-08-27 cs.GR 新提交 57%

GLOSS: Geometric Local Self-Similarity Learning for Faithful Reference-Guided Texture Fill

GLOSS:用于忠实参考引导纹理填充的几何局部自相似性学习

Chenyue Cai, Anita Hu, James Lucas, Szymon Rusinkiewicz, Masha Shugrina

专题命中 可控生成 :inpainting(abstract);分类 cs.GR

AI总结 本研究提出GLOSS模型,利用几何局部自相似性,以数据需求低、可控性强的方式实现忠实参考引导的纹理填充,在3D纹理生成任务中表现优于或媲美基线模型,且作为Blender插件获专业人员认可。

Comments 22 pages, 17 figures, project page https://chenyuecai.github.io/gloss-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交 57%

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: https://fix-anything.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22828 2026-08-25 cs.CV 新提交 57%

VeCAS: Vessel-Focused Contrast-Free Angiogram Synthesis for Vascular Interventions

VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成

De-Xing Huang, Chen-Yu Wang, Hao Liang, Xiao-Hu Zhou, Mei-Jiang Gui, Tian-Yu Xiang, Qin-Yi Zhang, Chen Wang, Xiao-Liang Xie, Shi-Qi Liu, Ming-Yuan Liu, Zhen-Chang Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。

Comments 10 pages, 8 figures, 5 tabels, supplementary material: https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-08-25 cs.CV 新提交 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-08-20 cs.HC cs.CV 新提交 57%

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17559 2026-08-19 cs.CV 新提交 57%

MSEditor: Toward Consistent Multi-Shot Video Editing

MSEditor:面向一致性多镜头视频编辑

Kunyu Feng, Yue Ma, Bingyuan Wang, Yuefeng Wang, Zhiyuan Qin, Hao Cheng, Hao Li, Qifeng Chen, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交 57%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16220 2026-08-18 cs.SD cs.CV 新提交 57%

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交 57%

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15749 2026-08-18 cs.CV 新提交 57%

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

ES3D:将语义嵌入3D空间以实现组件感知编辑

Xuancheng Jin, Rengan Xie, Jiayuan Lu, Wenting Zheng, Rui Wang, Yuchi Huo, Lincheng Li, Yingfeng Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14530 2026-08-17 cs.CV cs.AI 新提交 57%

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

Marionette:预测世界状态、渲染几何、绘制外观

Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。

Comments Project page: https://alayalab.github.io/Marionette/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 57%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 57%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07948 2026-08-11 cs.CV 新提交 57%

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

SynVAR:在视觉自回归模型中协同空间与语义对齐

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Western University(西安大略大学) JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07541 2026-08-11 cs.CV cs.AI cs.MA 新提交 57%

NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages

NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程

Yiyao Chen, Yucheng Li, Jungong Tong, Shaoqi Wang, Kunhao Zhou, Ziquan Wei, Monica Murea, Marissa DiPiero, Tingting Dan, Guorong Wu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 57%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06231 2026-08-07 cs.CV 新提交 57%

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

EmoWorld:用于可控情感视频生成的解耦情感场

Bingyuan Wang, Baistan Zhyldyzbekov, Kunyu Feng, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05069 2026-08-06 cs.CV cs.AI 新提交 57%

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏