COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
COMET:面向视频多模态大语言模型的对比运动增强时序推理
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-Sen University(中山大学) ; Pingan Technology(平安科技)
AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)