arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3080 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2359 篇

2608.20489 2026-08-24 cond-mat.quant-gas physics.atm-clus physics.atom-ph 新提交 67%

Self-limiting electrostriction of a single ion in an ultracold polar gas: From mesoscopic ions to crystalline molecular rings

超冷极性气体中单个离子的自限电致伸缩:从介观离子到结晶分子环

Ruiren Shi, Saajid Chowdhury, Leon Karpa, Jesús Pérez-Ríos

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究探究超冷极性气体中单个离子周围极性分子的自组装,结合全局优化与扩散蒙特卡洛方法,揭示了离子结合极性分子团簇的特殊结构与稳定性,为研究量子浴中带电杂质提供新途径。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16964 2026-08-19 eess.IV 新提交 67%

Technically Plausible but Clinically Misleading? Expert Evaluation of Patient-Personalized Synthetic Prostate MRI

技术上可行但临床误导?患者个性化合成前列腺MRI的专家评估

Gabriel Paulo Maglalang Israel, Sol Gedde, Alvaro Fernandez-Quilez

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 本研究用3D扩散模型合成患者个性化前列腺MRI,验证其技术可行性后开展专家研究,发现其虽技术可行但存在误导解读风险,提示需评估其临床应用安全性。

Comments To appear in SCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17164 2026-08-19 cs.LG 新提交 67%

SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version

SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版

Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu

机构 * VinUniversity FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) VNU University of Engineering and Technology(VNU工程技术大学) Aalborg University(奥尔堡大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。

Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16143 2026-08-18 cs.GR cs.CV cs.MM cs.SD 新提交 67%

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

AnyTalk:利用视频生成模型实现任意角色的语音动画

Kwan Yun, Serin Yoon, Sunjin Jung, Jung Eun Yoo, Inyup Lee, Junyong Noh

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 AnyTalk是一种无需动画数据、利用视频扩散模型的新方法,可生成任意角色的3D语音动画,还能蒸馏出实时版本,降低了人工与数据需求。

Comments accepted to TVCG, Project page at https://serin-yoon.github.io/projects/anytalk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 67%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05970 2026-08-07 cs.RO cs.AI 新提交 67%

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03330 2026-08-05 cs.AI 新提交 67%

Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving

自动驾驶中基于多项式表示的长期交通场景预测

Yue Yao

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究提出基于多项式表示的自动驾驶交通场景预测模型,结合理论分析与实证验证,在标准基准上接近最优准确率,提升分布偏移下的泛化能力,生成更合理的多智能体场景,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 67%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 67%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 67%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14984 2026-07-17 cs.AI 新提交 67%

Demographically-Conditioned Synthetic Medical Images for Bias Mitigation and Bias Detection in Disease Classifiers

用于减轻疾病分类器偏差和检测偏差的人口统计学条件合成医学图像

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院数据科学研究所) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院高级计算科学系) VITO(比利时弗拉芒技术研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究医学图像分类器亚组公平性审计的样本量问题,提出用人口统计学条件合成生成器减轻训练偏差、检测评估偏差。以COVID-19胸部CT分类为例,发现其在偏差减轻和检测上的作用,如预训练效果好、能再现亚组排名等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10504 2026-07-14 cs.RO 新提交 67%

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

SUREFlow:用于鲁棒机器人操作的状态空间不确定性感知残差流匹配

Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆尚国立大学电子与电气工程学院)

专题命中 扩散模型 :diffusion(abstract);generative vision(abstract)

AI总结 研究针对机器人操作策略在复杂条件下的不稳定性问题,提出SUREFlow框架,基于Mamba主干联合预测动作速度与残差不确定性,能选择性细化动作维度,在LIBERO等平台实验中取得良好效果,提升了机器人操作的鲁棒性与效率。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots & Systems (IROS) 2026, Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 67%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交 67%

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 67%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07665 2026-07-09 cs.LG cs.NA math.NA 新提交 67%

Guidance Breaks the Fitted Operator: A Terminal-Fitted Repair for Classifier-Free Guidance

引导打破拟合算子:无分类器引导的终端拟合修复

Shiheng Zhang

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究无分类器引导(CFG)在大引导时的问题,通过数值分析发现引导使判别子空间异常硬化致DDIM不再拟合。提出单系数零额外NFE修复方法,经实验验证该方法能稳定高引导,减少残差放大饱和,提升FID并保持精度,但也有其局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 67%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 67%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24025 2026-06-24 cs.LG 新提交 67%

Information-Theoretic Classifier-Free Guidance with Adaptive Schedule Optimization

信息论分类器自由引导与自适应调度优化

Haobo Chen, Xiangxiang Xu, Yuheng Bu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Rochester(罗彻斯特大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 针对扩散模型中分类器自由引导(CFG)导致的多样性-覆盖权衡问题,提出基于信息论的CFG调度优化框架,通过清洁端点参考优化实际分布,在ImageNet-512和COCO上实现竞争性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23872 2026-06-24 cs.LG cs.AI 新提交 67%

MGI: Member vs Generated Inference

MGI:成员与生成推断

Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对生成模型输出与训练样本难以区分的问题,提出MGI任务,并设计数据断路器(DCB)方法,结合自编码器和潜在生成器的互补信号,有效区分训练成员与生成样本。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21960 2026-06-23 cs.LG 新提交 67%

A Standard Processing Pipeline for High-accuracy Measurement of Few-shot Regression on Laser Induced Breakdown Spectroscopy

激光诱导击穿光谱小样本回归高精度测量的标准处理流程

Hao Li

机构 * University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 提出集成扩散去噪、注意力自编码器降维、组混洗数据增强和普通最小二乘回归的标准流程,在LIBS小样本回归中实现平均RMAE 0.2847,较基线提升37.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17090 2026-06-17 cs.PL cs.AI cs.MS 新提交 67%

ANEForge: Python for direct computation on the Apple Neural Engine

ANEForge: 用于直接在Apple Neural Engine上进行计算的Python工具

Spencer H. Bryngelson

机构 * School of Computational Science \& Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 ANEForge是一个Python包,通过编译惰性张量图直接编程Apple Neural Engine,无需CoreML,支持推理和训练,性能接近引擎硬件极限。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13191 2026-06-12 cs.LG 新提交 67%

The Geometry of Phase Transitions in Generative Dynamics via Projection Caustics

生成动力学中相变的几何:投影焦散视角

Ryosuke Sakamoto, Kotaro Sakamoto

机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19055 2026-08-20 cs.CV cs.GR cs.SD 新提交 62%

Generalized Audio-Driven Synthesis of Precise Drummer Motion

音频驱动的精确鼓手动作的广义合成

Álvaro G. Iñesta, Mattia Ryffel, Amit H. Bermano, Robert W. Sumner, Martin Guay

机构 * DisneyResearch|Studios(迪士尼研究工作室) The Blavatnik School of Computer Science and AI, Tel-Aviv University(特拉维夫大学布拉瓦尼克计算机科学与人工智能学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出带双目标损失函数的生成式扩散框架,结合自有数据集与新指标,实现从音频生成厘米级精度的逼真打鼓动作,泛化能力优于现有方法。

Comments Best Paper Award at the 25th ACM SIGGRAPH / Eurographics Symposium on Computer Animation (SCA 2026). For Supplementary Video, see https://studios.disneyresearch.com/2026/08/18/generalized-audio-driven-synthesis-of-precise-drummer-motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13929 2026-08-17 cs.CV cs.GR 新提交 62%

RGBX-Next: Towards Realistic Generative Rendering from G-Buffers

RGBX-Next:基于G-buffers的真实感生成式渲染

Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) NVIDIA(英伟达公司) University of California, San Diego(加利福尼亚大学圣迭戈分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出RGBX-Next框架,将扩散Transformer(DiT)微调为正向与反向渲染器,可从图像等估算G-buffers或从G-buffers渲染真实感内容,在相关任务中表现优异,将公开模型并推动领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09110 2026-08-11 cs.CV cs.GR 新提交 62%

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

适用于视图一致的2D到3D生成的视图自适应渲染器

U-Chae Jun, Jaeeun Ko, Jiwoo Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。

Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交 62%

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19437 2026-07-23 eess.IV cs.CV cs.MM 新提交 62%

Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling

潜在组:通过掩码潜在生成建模实现极端比特率下的感知视频压缩

Shaokang Wang, Jinchang Xu, Peidong Jia, Zhijian Hao, Siyuan Qian, Fei Zhao, Rui Ma, Xiaozhu Ju, Jian Tang, Xiaodong Xie, Shanghang Zhang, Huizhu Jia

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国) State Key Discipline Laboratory of Wide Band-Gap Semiconductor Technology, School of Microelectronics, Xidian University, Xi'an, China(宽带隙半导体技术重点学科实验室,微电子学院,西安电子科技大学,西安,中国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对极低比特率视频压缩未充分探索的问题,提出统一生成框架,通过潜在组策略、深度压缩模块和统一潜在去噪模块,在极低比特率下实现高感知质量,有丰富空间细节和强大时间一致性,达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 62%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交 62%

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏