TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos
TellTale:融合多实例LoRA文本编码器和零样本大语言模型判断器用于视频中的矛盾/犹豫识别
机构 * Sheffield Hallam University(谢菲尔德哈勒姆大学) ; Yarmouk University(亚尔穆克大学) ; The University of Jordan(约旦大学)
专题命中 指令微调 :LLM(title,abstract);分类 cs.AI
AI总结 TellTale旨在解决视频中矛盾/犹豫识别问题,它融合多实例LoRA文本编码器和零样本大语言模型判断器,结合三个概率流,在BAH数据集上取得优异成绩,相比官方基于视觉的基线有显著提升。