Hierarchical Latent Prediction for Language Models
语言模型的分层隐式预测
机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。
大厂专区
语言模型的分层隐式预测
机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。
C³PO:评估全模态模型中的跨模态组合与反事实性能
机构 * Microsoft Research India(微软研究院印度分院) ; IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))
AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。
IRIS:一种受视觉皮层启发的用于分析视觉Transformer中方向选择性的框架
机构 * University of Washington(华盛顿大学) ; Microsoft(微软公司) ; TU Munich(慕尼黑工业大学) ; Gladstone Institute(格拉德斯通研究所) ; Nvidia(英伟达公司)
AI总结 该研究提出受视觉皮层启发的IRIS框架,通过RSS等神经科学指标分析ViT中方向选择性的形成,发现训练范式决定方向选择性、层的方向选择性变化规律,且指标可指导解冻层数以优化下游泛化。