VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents
VideoFDB: 评估对话代理中的全双工视觉-语音能力
机构 * NVIDIA ; David AI
AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。
Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/