arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4771
2601.13132 2026-07-14 cs.CV 版本更新

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09329 2026-07-13 cs.CV cs.GR 新提交

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

用于增强材质-光照分解的动态逆渲染

Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen, Eddy Ilg

机构 * University of Technology Nuremberg(纽伦堡工业大学) Intel(英特尔公司) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息园)

AI总结 研究逆渲染中材质-光照分解的不适定问题,提出结合物体跟踪、重建与逆渲染的方法,利用刚性运动物体的多样光-表面相互作用解决模糊性,实验证明该方法在合成数据和真实视频中均有优势。

Comments Accepted at ECCV 2026. Project page: https://razayunus.github.io/DIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09193 2026-07-13 cs.CV 新提交

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

YeTI:仅需两张噪声图像即可生成真实世界的sRGB噪声

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门)

AI总结 针对真实世界sRGB图像去噪难题,提出YeTI框架,仅从同一场景两张噪声图像学习,利用重构自编码器和条件扩散Transformer分离场景与噪声特征,生成逼真噪声,经实验验证其有效性及在下游去噪任务中的实用价值。

Comments Accepted to ECCV 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09138 2026-07-13 cs.RO 新提交

BeyondSight: Object Permanence for End-to-End Autonomous Driving

超越视野:端到端自动驾驶中的物体持久性

Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

机构 * University of Toronto(多伦多大学) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对自动驾驶中物体易被遮挡问题,提出超越视野框架,通过维持持久物体假设解耦物体存在与可观测性,引入nuScenes - Permanence用于训练评估,实验证明该框架显著提升遮挡推理能力,凸显物体持久性对自动驾驶的重要性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09081 2026-07-13 cs.CV 新提交

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

用于动作分割数据集压缩的自适应潜在轨迹锚定

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 该研究针对动作分割数据集压缩问题,提出利用去噪扩散隐式模型,将动作段表示为噪声流形中由稀疏潜在点锚定连续轨迹的方法,并引入自适应分配机制。实验表明,该框架显著优于现有方法,在保持低压缩率时实现与真实数据训练相当的性能。

Comments 16 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23086 2026-07-13 cs.LG cs.CV 版本更新

Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards

基于策略的自回归图像模型实例和分布级奖励调优

Orhun Bugra Baran, Melih Kandemir, Ramazan Gokberk Cinbis

机构 * Middle East Technical University (METU)(中东部技术大学) University of Southern Denmark(南部丹麦大学)

AI总结 本文提出一种轻量级强化学习框架,通过将基于标记的自回归合成视为马尔可夫决策过程,结合分布级LOO-FID奖励和实例级CLIP/HPSv2奖励,提升图像生成的质量和多样性。

Comments Accepted at the European Conference on Computer Vision (ECCV), 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18822 2026-07-13 cs.CV 版本更新

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13907 2026-07-13 cs.CV 版本更新

White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation

用于少样本3D点云语义分割的白色聚合与恢复

Jiyun Im, SuBeen Lee, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(全州大学)

AI总结 研究少样本3D点云语义分割,针对现有方法问题,提出基于注意力机制的白色聚合与恢复模块(WARM),解决分布差距,生成有效原型,在多个数据集上取得良好性能,证明其在确定性原型生成中的有效性。

Comments Accepted to ECCV 2026. 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08772 2026-07-10 cs.CV 新提交

Wat3R: Underwater 3D Geometry Learning without Annotations

Wat3R:无需标注的水下3D几何学习

Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对水下3D几何估计难题,提出跨域半监督学习框架Wat3R,基于师生架构,无需标注水下数据,利用未标注视频学习,设计跨视图一致性损失,构建Water3D数据集,实验证明其在水下多视图深度估计和点云重建上性能优于现有方法。

Comments Accepted to ECCV 2026. The dataset and code are available at https://github.com/LSXI7/Wat3R

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08771 2026-07-10 cs.CV 新提交

ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

ZipDepth:在任何设备上随时随地实现轻量级零样本单目深度估计

Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia

机构 * University of Bologna(博洛尼亚大学)

AI总结 研究单目深度估计难题,提出ZipDepth轻量级网络,结合可重新参数化编码器-解码器与知识蒸馏,在多域训练集训练,参数仅610万,能在多设备实时运行,在五个基准测试中平衡零样本精度与部署效率,向高精度基础模型迈进。

Comments ECCV 2026. Code: https://github.com/fabiotosi92/ZipDepth - Project page: https://zipdepth.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08688 2026-07-10 cs.CV 新提交

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

SAM-MT:实时交互式多目标视频分割

Ruiqi Shen, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 研究针对多目标视频分割中帧率随目标数增加而降低的问题,基于SAM2提出SAM-MT。通过显式查询、解耦掩码注意力等方法,实现延迟与目标数解耦,保持分割性能,达到与单目标基线相当的实时速度。

Comments ECCV 2026, Project Page: https://henghuiding.com/SAM-MT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08537 2026-07-10 cs.CV 新提交

Whareformer: Learning to Track What is Where in Long Egocentric Videos

Whareformer:学习在长时间的第一人称视角视频中追踪物体位置

Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus

机构 * University of Bristol(布里斯托大学) NAVER LABS Europe(NAVER欧洲实验室)

AI总结 针对第一人称视角视频的OSNOM任务,提出基于Transformer的Whareformer模型,通过可更新内存和轨迹分配模块联合推理物体外观与位置,在小数据集训练后在多数据集长测试视频上达SOTA,性能显著优于先前工作。

Comments Accepted at ECCV 2026. Project Webpage: https://jacobchalk.github.io/Whareformer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08398 2026-07-10 cs.GR cs.CV 新提交

HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations

HoloTetSphere:用于物理模拟的统一四面体网格重建

YaQiao Dai, Renjiao Yi, Zhirui Gao, Wei Chen, Kai Xu, Chenyang Zhu

机构 * National University of Defense Technology, Changsha, China(国防科技大学,中国长沙) Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, China(产业人工智能研究所,中国科学院,中国南京)

AI总结 研究针对物理模拟的3D重建问题,提出通过耦合高斯球与四面体元素、联合最小化网格平滑能量和多视图高斯渲染误差等方法,构建统一且拓扑连贯的四面体网格,优于现有技术,简化物理模拟。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08203 2026-07-10 cs.CV 新提交

Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks

指标还是幻影?结肠镜息肉分割基准中评估不一致性的审查

Aisha Urooj, Zain Ul Abdien, Neelu Madan

机构 * Lunit, South Korea RPTU Kaiserslautern, Germany Aalborg University \& Pioneer Center, Denmark

AI总结 研究针对结肠镜息肉分割基准评估不一致性问题,审查27篇论文发现存在省略豪斯多夫距离、训练/测试分割协议不兼容、无统计显著性检验等问题,通过重新评估模型揭示问题严重性,进而提出息肉分割报告清单进行纠正。

Comments Submitted to ECCV Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08201 2026-07-10 cs.CV cs.AI 新提交

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割

Hyeonseop Song, Seokhun Choi, Hoseok Do

机构 * LG Electronics(LG电子)

AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。

Comments Accepted to ECCV 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03330 2026-07-10 cs.CV 新提交

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth

GrowFields:用于拓扑变化植物生长的组合式4D神经场

Joaquin Gajardo, Michele Volpi, Marko Mihajlovic, Siyu Tang, Lukas Roth, Sergey Prokudin

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Data Science Center(瑞士数据科学中心) Martin-Luther-Universität Halle-Wittenberg(马丁-路德-哈雷-维滕贝格大学)

AI总结 针对从稀疏纵向3D观测量化植物生长动力学的难题,提出GrowFields,将植物分解为器官并对齐到规范坐标系,学习共享神经变形场,在植物器官跟踪中表现优于现有表示。

Comments ECCV 2026 paper (main conference). v2 corrects the vertical guide lines in supplementary Figures 5-7. Project page and code available at https://joaquin-gajardo.github.io/growfields/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26687 2026-07-10 cs.CV 新提交

DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection

DeCoFlow: 用于持续异常检测的归一化流结构分解

Hun Im, Jungi Lee, Subeen Cha, Pilsung Kang

机构 * Seoul National University(首尔国立大学)

AI总结 针对工业环境中新产品类别顺序到达且无法访问旧数据的持续异常检测问题,提出DeCoFlow方法,通过将子网络分解为冻结通用基和任务特定低秩适配器来隔离参数更新,并引入任务特定对齐、辅助耦合层和尾感知损失,在MVTec-AD和VisA数据集上达到最先进性能且零遗忘。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01204 2026-07-10 cs.CV cs.AI cs.GR cs.LG 版本更新

Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction

基于神经谐波纹理的高质量基于原始体的神经重建

Jorge Condor, Nicolas Moenne-Loccoz, Merlin Nimier-David, Piotr Didyk, Zan Gojcic, Qi Wu

机构 * NVIDIA(英伟达) Università della Svizzera italiana(瑞士意大利语区大学)

AI总结 本文提出神经谐波纹理,通过虚拟框架锚定潜在特征向量,实现高效实时视图合成,融合原始体与神经场方法,提升高频细节建模能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01388 2026-07-10 cs.CV 版本更新

LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

LESV: 语言嵌入稀疏体素融合用于开放词汇3D场景理解

Fusang Wang, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Fabien Moutarde

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) CAOR, Mines Paris-PSL, France(法国巴黎高科矿业学院CAOR实验室)

AI总结 本文提出LESV框架,通过稀疏体素 rasterization 解决3D场景理解中空间和语义模糊问题,利用AM-RADIO实现密集对齐,提升细粒度查询性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-07-10 cs.CV cs.LG 版本更新

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏