arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1448 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1448 篇

2607.12358 2026-07-17 cs.CV 版本更新 57%

ACID: Adaptive Caching for vIDeo generation

ACID:用于视频生成的自适应缓存

Om Agrawal, Saurabh Agarwal, Aditya Akella

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29059 2026-07-17 cs.CV cs.AI 版本更新 57%

Flow Matching in Feature Space for Stochastic World Modeling

特征空间中的流匹配用于随机世界建模

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

机构 * FAIR at Meta(Meta的FAIR)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出FlowWM,在预训练特征空间中直接进行流匹配,通过可微一步投影机制实现高效训练,在合成和真实基准上提升感知性能、模式覆盖和时域鲁棒性。

Comments 24 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01140 2026-07-17 cs.CV 版本更新 57%

Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers

教师引导的因果干预用于图像去噪:视觉变换器中的正交内容-噪声解构

Kuai Jiang, Zhaoyan Ding, Guijuan Zhang, Dianjie Lu, Zhuoran Zheng

机构 * China University of Mining and Technology(中国矿业大学) Shandong Normal University(山东师范大学) Qilu University of Technology(青岛科技大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 教师引导的因果解构网络通过正交解构提升图像去噪的鲁棒性和效率。

Comments 15 pages, 5 figures, and 5 tables. Revised manuscript. Kuai Jiang and Zhaoyan Ding contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 57%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13421 2026-07-15 cs.LG cs.CV 版本更新 57%

Generalization and Memorization in Rectified Flow

修正流中的泛化与记忆化

Mingxing Rao, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究修正流模型的记忆行为,通过成员推断攻击测试统计量揭示其记忆机制,并提出复杂度校准指标,提升攻击性能并抑制记忆化以保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09925 2026-07-15 cs.CV 版本更新 57%

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS:基于高斯的稀疏多视图捕获逆渲染

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta

机构 * University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) College of William & Mary(威廉与玛丽学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对稀疏视图设置下基于高斯的逆渲染精度下降问题,提出GAINS两阶段逆渲染框架,利用基础模型先验稳定几何和材质估计,经实验验证其在提升材质参数精度等方面效果显著,尤其在稀疏视图下优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新 57%

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13840 2026-07-14 cs.CV 版本更新 57%

MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

MoLingo:用于文本到运动生成的运动-语言对齐

Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Imperial College London(伦敦帝国理工学院) Zuse School ELIZA(Zuse ELIZA 学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MoLingo模型,通过在连续潜在空间中去噪生成逼真的人体运动。研究如何构建语义对齐的潜在空间和最佳注入文本条件以提高运动真实性与描述一致性。

Comments Accepted by CVPR 2026. Project page: https://hynann.github.io/molingo/MoLingo.html. Title type fixed, content unchanged

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recogn. (CVPR), 2026, pp. 38387-38398

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11928 2026-07-13 astro-ph.IM cs.CV 版本更新 57%

AS-Bridge: A Bidirectional Generative Framework Bridging Next-Generation Astronomical Surveys

AS-Bridge:一种连接下一代天文学巡天的双向生成框架

Dichang Zhang, Yixuan Shao, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AS-Bridge 通过双向生成模型连接 LSST 和 Euclid 巡天,实现跨巡天的联合分析,提升科学发现能力。

Comments Accepted at KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19480 2026-07-10 cs.CV 版本更新 57%

Deep Sprite-based Image Models: An Analysis

基于深度精灵的图像模型:一种分析

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM研究所、国家科学研究中心、巴黎理工大学、ENPC、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文分析了基于精灵的图像分解模型,提出了一种深度方法,在CLEVR基准上与最新无监督类感知分割方法相当,线性扩展对象数量并明确识别对象类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 57%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05044 2026-07-09 cs.CV 版本更新 57%

Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation

通过密集轨迹生成实现几何感知单图像4D合成

Yanran Zhang, Ziyi Wang, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像4D合成挑战,提出MoGe4D框架,通过密集轨迹生成实现几何感知合成。引入数据集,构建4D-STraG及4D-ViSM。实验证明该方法能生成高质量4D场景,具强时空连贯性和几何感知一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01220 2026-07-07 cs.CV 版本更新 57%

Visual Implicit Autoregressive Modeling

基于隐式平衡层的视觉隐式自回归建模

Pengfei Jiang, Jixiang Luo, Luxi Lin, Zhaohong Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VIAR模型,通过隐式平衡层和可调节的计算控制,在保持生成质量的同时降低内存和提升效率,优于现有自回归基线和扩散模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 57%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08029 2026-07-07 cs.LG cs.CV 版本更新 57%

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08982 2026-07-07 cs.CV 版本更新 57%

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01878 2026-07-07 cs.CV 版本更新 57%

CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection

CTForensics:用于人工智能生成的CT图像检测的综合数据集和方法

Yiheng Li, Zichang Tan, Guoqing Xu, Yichun Yeh, Yang Yang, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究中心) Sangfor Technologies Inc.(深信服技术有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对人工智能生成CT图像检测难题,介绍含75990张二维CT图像的CTForensics数据集及十种生成模型样本,提出ESF-CTFD框架,实验表明该框架性能优且抗干扰强。

Comments under review, repo: https://github.com/liyih/CTForensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00205 2026-07-07 eess.IV cs.AI cs.CV 版本更新 57%

Efficient Flow Matching for Sparse-View CT Reconstruction

用于稀疏视图CT重建的高效流匹配

Jiayang Shi, Lincen Yang, Zhong Li, Tristan van Leeuwen, Daniel M. Pelt, K. Joost Batenburg

机构 * Centrum Wiskunde en Informatica(数学与信息学研究中心) LIACS, Leiden University(莱顿大学LIACS) Great Bay University(大湾大学) Mathematical Institute, Utrecht University(乌得勒支大学数学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究利用流匹配(FM)模型进行CT重建,因其确定性与数据一致性操作天然兼容。提出基于FM的CT重建框架及高效变体,通过重用预测速度场减少神经网络函数评估次数,提高推理效率,实验证明效果良好。

Journal ref MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 57%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20446 2026-07-07 cs.CV 版本更新 57%

Learning to Generate Human-Human-Object Interactions from Textual Descriptions

从文本描述中学习生成人与人-物体交互

Jeonghyeon Na, Sangwon Baik, Inhee Lee, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出建模两人与物体共享交互相关性的问题,通过新数据集和数据合成方法,利用分数扩散模型训练文本到人和物体交互及人和人交互模型,构建统一框架,可扩展到多人交互场景。

Comments Project Page: https://tlb-miss.github.io/hhoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09423 2026-07-07 cs.CV 版本更新 57%

FunPhase: A Periodic Functional Autoencoder for Motion Generation via Phase Manifolds

FunPhase:通过相位流形进行运动生成的周期性功能自动编码器

Marco Pegoraro, Evan Atherton, Bruno Roy, Aliasghar Khani, Arianna Rampini

机构 * Autodesk Research(Autodesk研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究因空间几何与时间动态强耦合导致的自然人体运动学习难题。核心方法为引入FunPhase,用函数空间公式替代离散时间解码。主要贡献是统一运动预测与生成,泛化能力强,支持下游任务,重建误差低。

Comments Accepted at ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 57%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 57%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19226 2026-07-03 cs.CV 版本更新 57%

Under One Sun: Multi-Object Generative Perception of Materials and Illumination

同一太阳下:材质与光照的多物体生成式感知

Nobuo Yoshii, Xinran Nicole Han, Ryo Kawahara, Todd Zickler, Ko Nishino

机构 * Kyoto University(京都大学) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MultiGP生成式逆渲染方法,利用同一场景物体共享光照的共识,从单张图像中随机采样反射率、纹理和光照,通过级联架构、协调调度、轴向注意力和纹理提取控制网络实现解耦。

Comments ECCV2026. Project page: https://vision.ist.i.kyoto-u.ac.jp/research/onesun/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10083 2026-07-03 cs.CV 版本更新 57%

A locally statistical active contour model for SAR image segmentation can be solved by denoising algorithms

一种可由去噪算法求解的局部统计活动轮廓模型用于SAR图像分割

Guangming Liu

机构 * Yantai Science and Technology Association(烟台科技协会)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于I散度-TV去噪模型的局部统计活动轮廓模型,融合GAC和ACWE模型,用于分割乘性伽马噪声图像,并通过反应扩散方程和ROF模型转化实现快速求解。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 57%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 57%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19570 2026-07-02 cs.CV 版本更新 57%

RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

RF-HiT:校正流分层变换器用于通用医学图像分割

Ahmed Marouane Djouamaa, Abir Belaala, Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Cosimo Distante, Abdenour Hadid

机构 * Computer Science department Mohamed Khider University Biskra, Algeria ISASI, CNR \& University of Salento 73100 Lecce, Italy AI University of the Basque Country (UPV/EHU), Spain Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RF-HiT通过整合hourglass变换器骨干和多尺度分层编码器,实现高效的医学图像分割,在保持精度的同时提升效率,达到91.27%的Dice系数。

详情

展开后加载摘要…

URL PDF HTML 收藏