Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace
我们能否解读音频大语言模型的思维?一个可解读的多语言中间层工作空间
机构 * Amazon AGI Foundations(亚马逊AGI基金会) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过logit lens分析Qwen3-Omni模型,发现其中间层可在输出前清晰呈现音频问题答案,揭示了音频模型推理的特性与信号分布,为解读音频大语言模型内部思维提供了定性依据。