A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents
全双工语音智能体的LALM音频评判的可靠性评估
机构 * Salesforce Applied AI Research(Salesforce应用人工智能研究院)
AI总结 研究评估Gemini模型作为全双工语音智能体音频评判的可靠性,以Gemini 2.5 Flash为基准与人类评分者对比,测试多个维度,发现其在一些维度表现良好,不同模型有差异,确定部署需谨慎领域,为LALM部署提供实证依据。
Comments 28 pages total (12 main body, 1 reference, 15 appendix). In main body: 2 diagrams, 3 table, 2 charts