arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

2026-01-01 至 2026-01-01 共收录 3
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22731 2026-01-01 cs.MM

GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation

GestureHYDRA: 通过混合模态扩散变换器和级联同步检索增强生成进行语义同步手势合成

Quanwei Yang, Luying Huang, Kaisiyuan Wang, Jiazhi Guan, Shengyi He, Fengguo Li, Hang Zhou, Lingyun Yu, Yingying Li, Haocheng Feng, Hongtao Xie

AI总结 GestureHYDRA通过混合模态扩散变换器和级联同步检索增强生成技术,实现具有明确语义的手势合成,提升手势生成的准确性和效率。

Comments 10 pages, 5 figures, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21414 2026-01-01 cs.CV

Adapting In-Domain Few-Shot Segmentation to New Domains without Source Domain Retraining

在新领域中无需源领域再训练即可适应领域内少样本分割

Qi Fan, Kaiqi Liu, Nian Liu, Hisham Cholakkal, Rao Muhammad Anwer, Wenbin Li, Yang Gao

机构 * Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出ISA方法,通过在推理过程中学习领域特征,适应已训练的FSS模型结构,无需源领域再训练,提升跨领域少样本分割性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏