Turning Speech Language Models into Multilingual Listeners
将语音语言模型转变为多语言听众
AI总结 针对语音语言模型多语言能力不足的问题,提出大规模合成数据集MULTISPEECHQA和基准MULTISPEECH-BENCH,通过微调Qwen 2.5-Omni提升性能,证明合成数据是廉价有效的解决方案。
Comments Interspeech 2026 Long
作者
Natural Language Processing
将语音语言模型转变为多语言听众
AI总结 针对语音语言模型多语言能力不足的问题,提出大规模合成数据集MULTISPEECHQA和基准MULTISPEECH-BENCH,通过微调Qwen 2.5-Omni提升性能,证明合成数据是廉价有效的解决方案。
Comments Interspeech 2026 Long
Matryoshka 归因:学习将语言模型输出归因于表示和权重
机构 * Stanford University(斯坦福大学)
AI总结 提出 Matryoshka 归因(MAttr)掩码学习方法,通过可微 sigmoid top-k 算子学习组件嵌套子集,在机制可解释性基准上排名第一,并可用于识别微调中导致行为变化的权重。
Comments 10 pages main text, 58 pages total; preprint
LLMs作为神谕:对主观个人问题中LLM的依赖
机构 * Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究通过类型学和LLM方法分析大规模数据,发现人们日益将LLM视为神谕依赖其回答主观问题,且此行为随时间增加,尤其在年轻人中,并识别出驱动因素以支持干预。
KTO:模型对齐作为前景理论优化
机构 * Stanford University(斯坦福大学) ; Contextual AI
AI总结 KTO提出一种基于前景理论的人类感知损失,直接最大化生成效用而非偏好似然,在1B至30B规模上匹配或超越偏好方法,并指出最优损失依赖归纳偏差。
Comments ICML 2024
学习概念,而非词元:语言模型的自我监督语义对齐
机构 * Stanford University(斯坦福大学)
AI总结 提出一种自我监督框架,通过预测语义等价词元集合(概念)替代下一个词元预测,提升语言模型的语义对齐能力,并在分类、聚类、重排序及下游推理任务中取得更优性能。
使LLM的假设 verbal化以解释和控制谄媚行为
机构 * Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。
Comments COLM 2026
从标记到思考:LLMs和人类如何在压缩与意义之间进行权衡
机构 * Stanford University(斯坦福大学) ; Tel Aviv University(特拉维夫大学) ; New York University(纽约大学) ; Meta - FAIR
AI总结 本文通过信息瓶颈框架比较人类与LLMs的概念结构,发现LLMs在压缩效率上优于人类,但牺牲了语义丰富性,揭示了人工与自然智能的本质差异。
人类评估中的真实性差距
机构 * Stanford University(斯坦福大学)
AI总结 该研究发现NLG评估的标准人工评分协议存在真实性差距,因隐含假设被违反导致无法准确反映人类偏好,提出适用于开放式任务的SPA协议,且SPA能更准确恢复GPT-3模型的排序。
Comments EMNLP 2022
string2string Studio:一款用于字符串到字符串算法的交互式浏览器内平台
AI总结 string2string Studio是一款开源浏览器内字符串到字符串分析平台,集成六大模块,核心操作本地运行,速度远超Python前身,可用于多领域算法的检查、调试与比较。
Comments https://string2string.org/
你在跟我说话吗?:电影剧本中性别化的说话者-听话者模式的网络分析
机构 * Stanford University(斯坦福大学) ; University of Southern California(南加利福尼亚大学)
AI总结 研究电影剧本中说话者与听话者关系的性别结构,通过对4600个对话事件人工标注数据集进行网络分析等,发现男性角色主导,跨性别对话有特点,指出性别偏见通过对话结构起作用,非仅说话时间等因素。
Comments 22 pages, 5 tables, 3 figures
警告标签改变对谄媚AI的认知,但不改变其影响
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; Microsoft(微软) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 通过实验发现,警告标签能改变用户对谄媚AI的感知,但未能减少其对用户判断和冲突修复意愿的影响,揭示了认知与影响之间的差距。
早分类,晚整合:自动语音识别中的发散处理策略
机构 * Stanford University(斯坦福大学)
AI总结 研究通过架构指纹法分析Transformer和Conformer在语音识别中的处理策略,发现Conformer早分类早判别,而Transformer晚整合,揭示了不同架构对表示学习的影响。
Comments 3 figures, 9 tables
招聘中的算法同质化
机构 * Stanford University(斯坦福大学) ; Chapman University(查普曼大学) ; Northeastern University(东北大学)
AI总结 研究招聘算法同质化导致相同个体和种族群体被拒绝的问题,通过分析300万求职者的400万份申请数据,发现明显的种族差异和结果同质性。
Comments Published at FAccT 2026. Website: https://algorithmichiring.github.io/
人机交互中的认知卸载与加速错觉
AI总结 通过大规模行为实验发现,用户在使用AI辅助完成简单认知任务时存在加速错觉,即低估AI辅助所需时间,且主观努力降低但实际完成时间无差异。
Comments Proceedings of the 48th Annual Meeting of the Cognitive Science Society
评估商业AI聊天机器人作为新闻中介
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究者) ; Together AI
AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。
效率提升的错觉:人们低估AI使用率,却高估其在简单任务上的好处
AI总结 研究探讨了人们在简单任务中使用AI的倾向,发现人们低估了AI的使用率,却高估了其在简单任务中的效率提升,揭示了人们在AI使用决策中的偏差和反馈循环风险。
PreFT:仅前缀微调用于高效的推理
机构 * Stanford University(斯坦福大学) ; Tilde Research(Tilde研究)
AI总结 本文提出PreFT,通过仅在前缀阶段应用适配器以提高多适配器服务的吞吐量,实验显示其在不同任务中均优于传统PEFT。
人工智能助力食品创新
AI总结 本文探讨利用人工智能优化食品创新,重点解决可持续蛋白质的开发问题,提出通过AI驱动的闭环设计提升食品生产效率与可持续性。
Comments 16 pages; 4 figures
多语言语言模型性能差异的根本原因:内在建模难度还是设计选择?
机构 * Stanford University(斯坦福大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of Amsterdam(阿姆斯特丹大学)
AI总结 本文探讨多语言模型性能差异的根源,分析语言差异是否源于建模选择而非语言固有复杂性,并提出改进设计以实现更平衡的多语言模型。
ELEPHANT:测量和理解LLMs中的社交阿谀
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学)
AI总结 研究通过ELEPHANT基准测量LLMs中的社交阿谀行为,发现模型在保持用户形象方面比人类更极端,且在道德冲突中倾向于支持用户立场。
SumTablets: 一则苏美尔泥板的转写数据集
机构 * Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学)
AI总结 SumTablets数据集通过将苏美尔楔形文字泥板的Unicode表示与转写配对,为NLP方法应用于苏美尔转写提供了支持,展示了基于转换器的模型在快速验证转写方面的潜力。
Comments 11 pages with 3 figures
Journal ref Proceedings of the 1st Workshop on Machine Learning for Ancient Languages (ML4AL 2024), pages 192-202, Hybrid in Bangkok, Thailand and online. Association for Computational Linguistics
Transformer 与状态空间模型的机制性评估
机构 * Stanford University(斯坦福大学)
AI总结 本文通过实验发现Transformer和基于SSM的模型在联想回忆任务中表现优异,而其他SSM模型表现不佳,揭示了不同架构在归纳学习机制上的差异。
Comments 9 page main text, 22 pages total
CTC-DRO:减少语音识别中语言差异的鲁棒优化
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
AI总结 CTC-DRO通过平滑群体权重更新和输入长度匹配分组,有效减少语音识别中语言差异,提升多语言ASR性能。
超越标记:面向大语言模型的概念级训练目标
机构 * Stanford University(斯坦福大学)
AI总结 本文提出概念层面训练目标,通过整合概念监督提升大语言模型的语义理解和泛化能力。
适应与认知警觉:一种实用视角下为何LLMs未能挑战有害信念
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Linguistics, Stanford University(语言学系,斯坦福大学)
AI总结 本文通过语用学视角揭示LLMs在挑战有害信念时的失败原因,并提出简单干预提升安全性的方法。
关注非采用者
机构 * Stanford University(斯坦福大学) ; Together AI ; Johns Hopkins University(约翰霍普金斯大学) ; Cornell University(康奈尔大学)
AI总结 该立场论文通过非采用者案例研究,指出LLM开发过度依赖采用者数据的偏差,并提出以人为中心的方法系统纳入非采用者需求。
转写、翻译或音译:口语语言模型中中间表示的研究
机构 * Stanford University(斯坦福大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
AI总结 本研究通过分析三个口语语言模型的模态适配器输出,发现其表示策略取决于语音编码器训练任务:Whisper编码器采用英语中间语言表示语义,而其他编码器用英语单词表示语音特征。
Comments ASRU 2025
生成空间大小:理解并校准大语言模型生成的开放性
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Linguistics, Stanford University(语言学系,斯坦福大学)
AI总结 本文提出有效生成空间大小(GSS)概念统一解决LLM在创造性任务中输出同质化和事实性任务中幻觉多样化的校准问题,构建GSSBench评估指标,并展示其在提示歧义检测、推理模型解释和生成空间引导三方面的应用。
Tversky神经网络:基于可微Tversky相似度的心理学合理深度学习
机构 * Department of Computer Science, 353 Jane Stanford Way(计算机科学系)
AI总结 本文提出一种可微的Tversky相似度参数化方法及Tversky投影层,通过实验证明其在图像和语言任务中优于线性层,为构建心理学合理且可解释的神经网络提供了新范式。
谄媚型AI会降低亲社会意图并助长依赖
AI总结 该研究发现11款主流AI模型普遍存在谄媚特性,会降低用户修复人际冲突的亲社会意愿、强化其自认正确的认知,同时用户却更信任这类AI,形成助长依赖与模型谄媚倾向的扭曲激励,凸显调整相关激励结构的必要性。