arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2420 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2420 篇

2607.02508 2026-07-03 cs.CV 新提交 57%

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

从SRA到Self-Flow:数据增强还是自监督?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过提出注意力分离方法,发现Self-Flow中双时间调度的性能提升主要源于噪声维度的数据增强,而非token间交互,并验证了该设计在ImageNet上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02045 2026-07-03 cs.CV 新提交 57%

PWM-ArtGen: Part World Model for Articulated Object Generation

PWM-ArtGen: 面向铰接物体生成的部分世界模型

Wentao Zheng, Ancong Wu

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(计算机科学与工程学院,中山大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出部分世界模型PWM-ArtGen,通过联合学习视觉动态和运动学参数,利用无标注数据协同训练,实现从单张图像生成铰接3D物体,在静止状态和零样本泛化上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01825 2026-07-03 cs.CV 新提交 57%

Rethinking Conditional Generation for Underwater Salient Object Detection

重新思考水下显著性目标检测的条件生成

Hua Li, Yongjie Weng, Yutong Li, Zhiyuan Li, Runmin Cong, Sam Kwong

机构 * School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) Key Laboratory of Machine Intelligence and System Control, Ministry of Education, Shandong University(山东大学机器智能与系统控制教育部重点实验室) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像低对比度、不均匀光照和颜色失真问题,提出退化感知条件生成网络(DCGNet),通过动态多粒度模块、水下物理先验模块和空间高斯模块,结合扩散变压器,显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01768 2026-07-03 cs.CV 新提交 57%

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

JointHOI:联合生成接触图增强手物交互生成

Mingyeong Song, Jungbin Cho, Jisoo Kim, Ananya Bal, Kartik Sharma, Youngjae Yu, Laszlo A. Jeni, Junhyug Noh

机构 * Ewha Womans University(梨花女子大学) Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出单阶段扩散框架JointHOI,联合生成3D手物运动与距离接触图,通过接触引导采样提升时间稳定性和物理合理性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 57%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01555 2026-07-03 cs.CV 新提交 57%

Boosting Infrared Small Target Detection via Logit-Domain Contrast and Adaptive Shape Refinement

通过Logit域对比与自适应形状细化提升红外小目标检测

Handong Zeng, Zhengeng Yang, Shuai Zhang, Shikai Chen, Hongshan Yu

机构 * College of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对红外小目标检测中弱目标辨别难和边界模糊问题,提出AC-SLSIoU损失函数,通过Logit域边界约束增强弱目标辨别,自适应边界抑制细化轮廓,并引入假警报聚焦损失,无需额外推理开销即可提升检测精度与形状质量。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 57%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 57%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01176 2026-07-02 cs.CV 新提交 57%

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction

高维嵌入先验用于噪声k空间域MRI重建

Yu Guan, Tianjia Huang, Qinrong Cai, Qiuyun Fan, Dong Liang, Qiegen Liu

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Mathematics and Computer Science, Nanchang University(南昌大学数学与计算机科学学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Academy of Medical Engineering and Translational Medicine, Medical School, Faculty of Medicine, Tianjin University(天津大学医学部医学工程与转化医学研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对噪声k空间MRI重建,提出高维嵌入框架增强扩散模型表示能力,在多种噪声和欠采样条件下提升重建质量,尤其在高噪声场景效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00975 2026-07-02 cs.CV cs.AI 新提交 57%

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling

TRCGL-Net:基于生成式数据增强和标签共现建模的长尾多标签胸部X光分类框架

Tong Shao, Hongshun Ling, Li Zhang, Jinjing Wu, Junke Wang, Yuan Gao, Fang Wang

机构 * School of Biomedical Engineering, South-Central Minzu University(中南民族大学生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对胸部X光多标签分类中的长尾分布问题,提出TRCGL-Net,利用可学习文本引导扩散模型生成尾部类样本、通道重加权和类别注意力机制增强特征,以及基于标签共现的图卷积网络建模类别关系,在PadChest数据集上尾部类mAP达0.4904。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00486 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

PAPA: Online Personalized Active Preference Alignment

PAPA:在线个性化主动偏好对齐

Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PAPA方法,无需参数化奖励模型,通过实时用户反馈直接优化扩散模型,实现高效的偏好对齐,并基于理论提出加速微调的EPAPA策略。

Comments Accepted to ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32033 2026-07-01 cs.CV 新提交 57%

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

SpheRoPE:基于球形RoPE的零样本无优化360度全景生成

Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim

机构 * Amazon Prime Video(亚马逊Prime Video) Tel-Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出零样本、无训练、无优化的框架,通过向预训练扩散Transformer注入球形先验,直接生成360度全景图像和视频,无需微调或多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31777 2026-07-01 cs.CV 新提交 57%

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

Mesh BDF: 用于原生3D网格生成的重心支配场

Gaochao Song, Haohan Weng, Luo Zhang, Zibo Zhao, Shenghua Gao

机构 * HKU(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯混元3D) NTU(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出重心支配场(BDF),一种在三角网格表面上定义的连续表示,将顶点拓扑连接编码为连续信号,弥合离散网格拓扑与连续扩散生成模型之间的差距,使扩散模型能生成高质量、可扩展且鲁棒的原生网格。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31574 2026-07-01 cs.CV cs.AI cs.LG 新提交 57%

Temperature Field Reconstruction of Tungsten Monoblock Divertor on EAST using Physics-aware Neural Operator Transformer

基于物理感知神经算子Transformer的EAST钨单体偏滤器温度场重建

Zikang Yan, Xiao Wang, Qingquan Yang, Zhendong Yang, Gaoting Chen, Zehua Chen, Bo Jiang, Jin Tang, Guosheng Xu

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Institute of Plasma Physics, Chinese Academy of Sciences(中国科学院等离子体物理研究所) Tongling University(铜陵学院) College of Physics, Donghua University(东华大学物理学院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对偏滤器温度场实时重建需求,提出物理感知神经算子Transformer(PNOT),通过图注意力捕捉空间物理依赖、物理感知算子聚合相似物理条件点、梯度约束Sobolev正则化保持物理一致性,实现高精度快速重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31018 2026-07-01 cs.CV 新提交 57%

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30968 2026-07-01 cs.CV 新提交 57%

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

PhotoQuilt: 通过引导式分块去噪实现无训练任意分辨率的光马赛克

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Samsung Research(三星研究院) KITE Research Institute(KITE研究所) Queen’s University(女王大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhotoQuilt框架,通过引导式分块去噪过程,在无需训练的情况下生成任意分辨率的光马赛克,兼顾全局结构与局部细节,并避免二次注意力成本。

Comments 17 pages, 9 figures. Project page: https://kooroshrh.github.io/photo-quilt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30849 2026-07-01 cs.CV cs.SD eess.AS 新提交 57%

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

SyncCache: 利用非对称动力学实现快速音频驱动肖像动画

Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shanghai AI Laboratory(上海人工智能实验室) Tencent Hunyuan(腾讯混元) vivo

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30807 2026-07-01 cs.RO cs.CR cs.CV 新提交 57%

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations

脱轨:利用违反安全的对抗扰动劫持生成式端到端驾驶规划器的评分头

Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对生成式端到端自动驾驶规划器中评分头的攻击面,提出Derail对抗框架,通过安全违规目标扰动使轨迹选择从安全候选翻转为不安全候选,评分下降39-80%,碰撞率高达50%。

Comments 23 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 57%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15305 2026-07-01 cs.CV 新提交 57%

CoMNet: A MedNeXt-CorrDiff Framework for Multi-Site Brain Tumor Segmentation

CoMNeT: 一种用于体积脑肿瘤分割的MedNeXt-CorrDiff框架

Michael L. Evans, MD Fayaz Bin Hossen, MD Shibly Sadique, Walia Farzana, Khan M. Iftekharuddin

机构 * Old Dominion University(欧道明大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMNeT框架,结合3D卷积分割模型MedNeXt与校正扩散后处理CorrDiff,通过集成学习提升胶质瘤分割精度,在UTSW-Glioma数据集上取得优于基线模型的Dice分数。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27364 2026-06-26 cs.CV 新提交 57%

PhysiFormer: Learning to Simulate Mechanics in World Space

PhysiFormer: 在世界空间中学习模拟力学

Yiming Chen, Yushi Lan, Andrea Vedaldi

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。

Comments Project page: https://yimingc9.github.io/physiformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27277 2026-06-26 cs.AI cs.CV 新提交 57%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26916 2026-06-26 cs.CV 新提交 57%

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26898 2026-06-26 cs.CV cs.LG 新提交 57%

Tractography-Driven Synthetic Data Generation for Fiber Bundle Segmentation in Tracer Histology

基于纤维束成像的示踪组织学纤维束分割合成数据生成

Kyriaki-Margarita Bintsi, Sparsh Makharia, Yaël Balbastre, Joselyn Romero Avila, Julia F. Lehman, Suzanne N. Haber, Anastasia Yendiki

机构 * Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital and Harvard Medical School(马萨诸塞总医院和哈佛医学院 Athinoula A. Martinos 生物医学影像中心) Krea University(Krea 大学) Department of Experimental Psychology, University College London(伦敦大学学院实验心理学系) Universidad Nacional Mayor de San Marcos(国立圣马科斯大学) Department of Pharmacology and Physiology, University of Rochester School of Medicine(罗切斯特大学医学院药理学与生理学系) McLean Hospital(麦克莱恩医院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出利用离体dMRI纤维束成像作为生成先验合成2D图像块,结合真实背景和域随机化训练U-Net,实现猕猴示踪组织学中纤维束的自动分割,在减少3倍标注数据下达到与现有方法相当的性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26507 2026-06-26 cs.HC cs.CV 新提交 57%

DanceDuo: Bridging Human Movement and AI Choreography

DanceDuo:连接人类动作与AI编舞

Gia-Cat Bui-Le, Tuong-Vy Truong-Thuy, Hai-Dang Nguyen, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国家大学胡志明市分校) Vietnam National University(越南国家大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出DanceDuo平台,利用扩散模型生成与多种音乐同步的AI编舞,并集成人体姿态估计支持用户与AI舞蹈对比,提升舞蹈练习体验。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26087 2026-06-25 cs.CV 新提交 57%

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。

Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25907 2026-06-25 cs.CV 新提交 57%

In-context Region-based Drag: Drag Any Region to Any Shape

基于上下文区域的拖拽:将任意区域拖拽至任意形状

Jiacheng Sui, Tianyu Hao, Bingjie Gao, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ICRDrag方法,通过上下文学习框架和两种注意力正则化,实现区域级拖拽编辑,在精度和视觉保真度上显著优于现有方法。

Comments Accepted by ECCV 2026. Dataset, code, and model are available at https://github.com/bcmi/ICRDrag-Region-Drag-Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25548 2026-06-25 cs.CV cs.LG 新提交 57%

Concept Removal for Frontier Image Generative Models

前沿图像生成模型的概念移除

Aditya Kumar, Pierre Joly, Adam Dziedzic, Franziska Boenisch

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种针对前沿扩散和自回归模型(如SD3.5、Flux、Infinity)的概念移除方法,通过将内部瓶颈层替换为转码器来选择性禁用概念相关信号,实现高效概念移除并保持生成质量。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏