Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合
AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。
Comments CVPR Accepted
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合
AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。
Comments CVPR Accepted
追踪飞行:探索分析平原斑马(Equus quagga)逃逸反应的计算框架
AI总结 本研究评估三种计算机视觉方法,将最优者应用于44匹平原斑马逃逸的无人机视频,提取轨迹并识别逃逸行为模式,为动物集体行为研究提供有效工具。
Comments Accepted to the CV4Animals workshop at CVPR 2025; v2: corrected Fig. 3