arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

2025-12-02 至 2025-12-02 共收录 8
2411.18011 2025-12-02 cs.CV

Manual-PA: Learning 3D Part Assembly from Instruction Diagrams

Manual-PA: 从指令图中学习3D部件组装

Jiahao Zhang, Anoop Cherian, Cristian Rodriguez, Weijian Deng, Stephen Gould

机构 * The Australian National University(澳大利亚国立大学) Mitsubishi Electric Research Labs(三菱电机研究实验室) The Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 Manual-PA通过利用图示手册中的线索,将家具组装问题分为离散和连续阶段,利用对比学习框架实现3D部件的语义对齐和姿态预测,显著提升了组装性能并实现了对现实家具的泛化。

Comments Accepted to ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00084 2025-12-02 cs.CV cs.LG

A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation

一种快速且高效的基于现代BERT的文本条件扩散模型用于医学图像分割

Venkata Siddharth Dhara, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, 500032, India(国际信息科技学院,海得拉巴)

AI总结 本文提出FastTextDiff,利用ModernBERT提升医学图像分割的效率和准确性,通过整合文本注释和多模态注意力机制改进传统扩散模型。

Comments 15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19622 2025-12-02 cs.CV

Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning

增强时刻检索:零依赖两阶段学习

Zhengxuan Wei, Jiajin Tang, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

AI总结 本文提出AMR框架,通过两阶段训练解决时刻检索中的数据稀缺、边界模糊和细粒度语义区分问题,提升模型在真实场景下的泛化能力。

Comments This work is accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18151 2025-12-02 cs.GR cs.AI cs.CV

WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions

WonderPlay:从单张图像和动作生成动态3D场景

Zizhang Li, Hong-Xing Yu, Wei Liu, Yin Yang, Charles Herrmann, Gordon Wetzstein, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Utah(犹他大学)

AI总结 WonderPlay通过结合物理模拟与视频生成,实现从单张图像和动作生成多样化动态3D场景。

Comments ICCV 2025 (Highlight). The first two authors contributed equally. Project website: https://kyleleey.github.io/WonderPlay/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00983 2025-12-02 cs.GR cs.AI cs.CV

WorldScore: A Unified Evaluation Benchmark for World Generation

WorldScore: 一个用于世界生成的统一评估基准

Haoyi Duan, Hong-Xing Yu, Sirui Chen, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 WorldScore提出一个统一评估基准,用于评估不同世界生成方法,涵盖3D、4D场景生成及视频生成,通过可控性、质量和动态性三个维度评估19种模型。

Comments ICCV 2025. Project website: https://haoyi-duan.github.io/WorldScore/ The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16177 2025-12-02 cs.GR cs.CV

OccluGaussian: Occlusion-Aware Gaussian Splatting for Large Scene Reconstruction and Rendering

OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术

Shiyong Liu, Xiao Tang, Zhihao Li, Yingfan He, Chongjie Ye, Jianzhuang Liu, Binxiao Huang, Shunbo Zhou, Xiaofei Wu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) The University of Hong Kong(香港大学) Huawei Embodied Intelligence Lab(华为具身智能实验室)

AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。

Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏