Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。
Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge