arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1827 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1402 篇

2606.10135 2026-07-27 cs.CV cs.AI 版本更新 57%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06064 2026-07-27 cs.CV 版本更新 57%

PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers

PersonaGesture: 单参考共语手势个性化用于未见说话人

Xiangyue Zhang, Yiyi Cai, Kunhang Li, Kaixing Yang, You Zhou, Zhengqing Li, Xuangeng Chu, Jiaxu Zhang, Haiyang Liu

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所) Nanyang Technological University(南洋理工大学) Renmin University(中国人民大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PersonaGesture,一种基于扩散的管道,用于未见说话人的单参考共语手势个性化。通过编码参考视频并分离身份证据与残差统计修正,提升未见说话人的个性化效果。

Comments Needs to be improved

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05394 2026-07-27 cs.CV 版本更新 57%

Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability

深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性

Shizhan Liu, Xinran Deng, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Jie Tang

机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新 57%

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新 57%

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03819 2026-07-24 cs.GR cs.AI 版本更新 57%

CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation

CGGS:用于以自我为中心的3D场景生成的一致性增强几何高斯点云渲染

Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 针对以自我为中心的3D场景生成难题,提出CGGS框架。通过微调多视图潜在扩散模型生成2D内容,利用光流等估计深度产生点云,再经几何细化器优化3D高斯重建,提升视觉质量与几何结构。

Comments Update format

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 7670-7684, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14595 2026-07-23 cs.CV 版本更新 57%

MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation

MagicPrompt:用于视频生成的超轻量级提示调整

Yinhan Zhang, Dingwei Tan, Xianghao Kong, Yue Ma, Yeying Jin, Anyi Rao

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对大规模视频扩散模型下游任务微调计算成本高的问题,提出MagicPrompt轻量级框架。采用注意力嵌入提示调整和双空间奖励反馈优化,在可训练参数不到1%时达竞争性能,显著降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15273 2026-07-22 cs.CV cs.LG 版本更新 57%

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

MeanFlowNFT:将前向过程强化学习引入平均速度生成器

Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究将强化学习应用于MeanFlow生成器的问题,核心方法是引入MeanFlowNFT,受MeanFlow恒等式启发构建预测器并应用DiffusionNFT目标,主要贡献是改进基线,在多数指标上超越现有方法,少步采样时能超越多步强化学习调整的扩散模型。

Comments Project Page: https://harahan.github.io/meanflownft-project-page/, GitHub: https://github.com/Harahan/MeanFlowNFT, Hugging Face: https://huggingface.co/Harahan/MeanFlowNFT, Demo: https://huggingface.co/spaces/Harahan/meanflownft-fewstep-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12035 2026-07-22 cs.AR cs.CV 版本更新 57%

Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space

Timeripple:通过理解潜在空间中的时空相关性加速视频扩散变换器

Wenxuan Miao, Yulin Sun, Aiyue Chen, Jing Lin, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qizhi Institute(上海启智研究院) Huawei Technologies Co.,Ltd(华为技术有限公司) Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频生成中vDiT模型推理延迟问题,利用潜在空间时空相关性,提出轻量级自适应重用策略,通过重用相关令牌部分注意力分数近似计算,相比现有技术计算节省85%,且视频质量损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 57%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22394 2026-07-21 cs.CV 版本更新 57%

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

曲率自适应一致性流匹配:基于强化学习的自主轨迹优化

Songtao Tian, Guhan Chen, Bohan Li, Jingyi Ma, Zixiong Yu

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30994 2026-07-21 cs.MM 版本更新 57%

Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis

动态交互感知与因果解耦的多模态情感分析框架

Guangyuan Dong, Ziwei Hong, Shenghao Liu, Chenyu Wu, Yuanyuan Fang, Zihao Li, Xudong Zhang, Bingchen Liu, Yuchen Zhang, Haitao Ding, Zhenzhou Zhou, Ziyu Song

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 提出动态多模态因果解耦与自适应融合框架(MCAF),通过因果干预模块解耦语言模态的偏见,动态路由器实时评估交互状态并自适应融合,以及条件扩散去噪模块过滤噪声,在CMU-MOSI和CMU-MOSEI上取得最优分类性能。

Comments This preprint is withdrawn for unauthorized posting and incorrect author metadata.It was uploaded without full consent of all co-authors, with wrong name and affiliation information. We withdraw it to avoid copyright disputes. This corrects submission irregularities only, not academic content or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09581 2026-07-20 cs.CV cs.SD 版本更新 57%

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

万舞者:一种用于分钟级连贯音乐到舞蹈生成的分层框架

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Ruoshi Zhang, Yi Lu, Gang Cheng, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对从音乐生成舞蹈视频的挑战,提出万舞者分层框架,解耦过程为全局关键帧规划和局部时间细化,利用音乐上下文确保连贯,通过动态帧率自适应等创新,突破时长限制,在多舞蹈类型上表现出色,达新的技术水平。

Comments project: https://humanaigc.github.io/wan-dancer-project/, code: https://github.com/Wan-Video/Wan-Dancer, modelscope: https://www.modelscope.cn/models/Wan-AI/Wan-Dancer-14B, huggingface: https://huggingface.co/Wan-AI/Wan2.2-Animate-14B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12358 2026-07-17 cs.CV 版本更新 57%

ACID: Adaptive Caching for vIDeo generation

ACID:用于视频生成的自适应缓存

Om Agrawal, Saurabh Agarwal, Aditya Akella

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29059 2026-07-17 cs.CV cs.AI 版本更新 57%

Flow Matching in Feature Space for Stochastic World Modeling

特征空间中的流匹配用于随机世界建模

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

机构 * FAIR at Meta(Meta的FAIR)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出FlowWM,在预训练特征空间中直接进行流匹配,通过可微一步投影机制实现高效训练,在合成和真实基准上提升感知性能、模式覆盖和时域鲁棒性。

Comments 24 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01140 2026-07-17 cs.CV 版本更新 57%

Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers

教师引导的因果干预用于图像去噪:视觉变换器中的正交内容-噪声解构

Kuai Jiang, Zhaoyan Ding, Guijuan Zhang, Dianjie Lu, Zhuoran Zheng

机构 * China University of Mining and Technology(中国矿业大学) Shandong Normal University(山东师范大学) Qilu University of Technology(青岛科技大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 教师引导的因果解构网络通过正交解构提升图像去噪的鲁棒性和效率。

Comments 15 pages, 5 figures, and 5 tables. Revised manuscript. Kuai Jiang and Zhaoyan Ding contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 57%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13421 2026-07-15 cs.LG cs.CV 版本更新 57%

Generalization and Memorization in Rectified Flow

修正流中的泛化与记忆化

Mingxing Rao, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究修正流模型的记忆行为,通过成员推断攻击测试统计量揭示其记忆机制,并提出复杂度校准指标,提升攻击性能并抑制记忆化以保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09925 2026-07-15 cs.CV 版本更新 57%

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS:基于高斯的稀疏多视图捕获逆渲染

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta

机构 * University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) College of William & Mary(威廉与玛丽学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对稀疏视图设置下基于高斯的逆渲染精度下降问题,提出GAINS两阶段逆渲染框架,利用基础模型先验稳定几何和材质估计,经实验验证其在提升材质参数精度等方面效果显著,尤其在稀疏视图下优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新 57%

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13840 2026-07-14 cs.CV 版本更新 57%

MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

MoLingo:用于文本到运动生成的运动-语言对齐

Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Imperial College London(伦敦帝国理工学院) Zuse School ELIZA(Zuse ELIZA 学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MoLingo模型,通过在连续潜在空间中去噪生成逼真的人体运动。研究如何构建语义对齐的潜在空间和最佳注入文本条件以提高运动真实性与描述一致性。

Comments Accepted by CVPR 2026. Project page: https://hynann.github.io/molingo/MoLingo.html. Title type fixed, content unchanged

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recogn. (CVPR), 2026, pp. 38387-38398

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11928 2026-07-13 astro-ph.IM cs.CV 版本更新 57%

AS-Bridge: A Bidirectional Generative Framework Bridging Next-Generation Astronomical Surveys

AS-Bridge:一种连接下一代天文学巡天的双向生成框架

Dichang Zhang, Yixuan Shao, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AS-Bridge 通过双向生成模型连接 LSST 和 Euclid 巡天,实现跨巡天的联合分析,提升科学发现能力。

Comments Accepted at KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19480 2026-07-10 cs.CV 版本更新 57%

Deep Sprite-based Image Models: An Analysis

基于深度精灵的图像模型:一种分析

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM研究所、国家科学研究中心、巴黎理工大学、ENPC、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文分析了基于精灵的图像分解模型,提出了一种深度方法,在CLEVR基准上与最新无监督类感知分割方法相当,线性扩展对象数量并明确识别对象类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 57%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05044 2026-07-09 cs.CV 版本更新 57%

Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation

通过密集轨迹生成实现几何感知单图像4D合成

Yanran Zhang, Ziyi Wang, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像4D合成挑战,提出MoGe4D框架,通过密集轨迹生成实现几何感知合成。引入数据集,构建4D-STraG及4D-ViSM。实验证明该方法能生成高质量4D场景,具强时空连贯性和几何感知一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01220 2026-07-07 cs.CV 版本更新 57%

Visual Implicit Autoregressive Modeling

基于隐式平衡层的视觉隐式自回归建模

Pengfei Jiang, Jixiang Luo, Luxi Lin, Zhaohong Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VIAR模型,通过隐式平衡层和可调节的计算控制,在保持生成质量的同时降低内存和提升效率,优于现有自回归基线和扩散模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏