ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
ChronosAudio: 用于评估音频大语言模型的综合长音频基准
机构 * Nanyang Technological University(南洋理工大学) ; Independent Researcher(独立研究者) ; United Arab Emirates University(阿联酋大学) ; North China Electric Power University(华北电力大学) ; Southwest Jiaotong University(西南交通大学) ; Squirrel AI Learning(Squirrel AI学习)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 提出首个针对音频大语言模型长音频理解的多任务基准ChronosAudio,包含6大任务类别和36000个测试实例,实验发现模型存在长上下文崩溃、注意力稀释等问题,现有缓解策略仅恢复50%性能。