Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining
超越单一提取器:重新思考用于LLM预训练的HTML到文本提取
机构 * Apple(苹果公司) ; Stanford(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。
高校专区
超越单一提取器:重新思考用于LLM预训练的HTML到文本提取
机构 * Apple(苹果公司) ; Stanford(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。
回环记忆校正:用于稳定声带开合定位的主动记忆校正
机构 * University of Washington(华盛顿大学) ; Ajou University School of Medicine(全州大学医学院) ; Harborview Medical Center(Harborview医疗中心) ; Airlift Northwest
AI总结 本文提出CL-MC框架,通过主动记忆校正提升声带开合定位的稳定性,显著降低漂移和遗漏率。
Comments Accepted to Medical Imaging with Deep Learning (MIDL) 2026
学习多步检索个人情境以实现个性化问答
机构 * University of Washington(华盛顿大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 PR2通过强化学习框架结合推理与检索,提升个性化问答的准确性和用户特定偏好对齐度。
谄媚型聊天机器人会导致妄想螺旋,即使在理想贝叶斯理性者中
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; University of Washington, Seattle(华盛顿大学) ; MIT Department of Brain & Cognitive Sciences(麻省理工学院脑科学与认知科学系)
AI总结 本文研究了聊天机器人谄媚性导致用户产生妄想螺旋的现象,揭示了即使理性用户也易受其影响,并探讨了缓解措施的局限性。
ODESteer: 一种基于常微分方程的统一激活引导框架用于大语言模型对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northwestern University(西北大学) ; William & Mary(威廉与玛丽学院) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 ODESteer通过基于常微分方程的理论框架,统一了激活引导方法,实现了在大语言模型对齐中的显著性能提升。
Comments Accepted by ICLR 2026 (Camera Ready Version)
买还是建一个大语言模型:政府的决策框架
机构 * National University of Singapore(新加坡国立大学) ; AI Singapore(AI新加坡) ; Salesforce AI Research(Salesforce AI研究) ; EPFL(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 本文提出政府在大语言模型决策中应考虑主权、安全、成本等因素的框架,帮助确定购买或建设更适合其需求的方法。
Comments The short version of this document is published as an ACM TechBrief at https://dl.acm.org/doi/epdf/10.1145/3797946, and this document is published as an ACM Technology Policy Council white paper at https://www.acm.org/binaries/content/assets/public-policy/buildvsbuyai.pdf
Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准
机构 * Shenzhen Technology University(深圳技术大学) ; Shenzhen University of Information Technology(深圳信息科技学院) ; University of Washington(华盛顿大学) ; Foundation Model Team, Meituan(美团基础模型团队) ; National University of Singapore(新加坡国立大学) ; Tongji University(同济大学)
AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。
通过样本一致性校准大型语言模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 通过样本一致性方法提升大型语言模型的校准效果,改进其预测置信度评估和性能表现。
Comments AAAI 2024
从损失平坦性到压缩神经表示的简单联系
机构 * Department of Applied Mathematics(应用数学系) ; Computational Neuroscience Center(计算神经科学中心) ; University of Washington(华盛顿大学) ; Technion, Israel Institute of Technology(技术离子以色列理工学院)
AI总结 本文通过引入局部体积比、最大局部敏感度和局部维度等度量,揭示了损失平坦性与神经表示压缩之间的关系,为理解锐度与泛化能力的关系提供了新的理论框架。
通过主动重建学习检测语言模型训练数据
机构 * University of Washington(华盛顿大学) ; Cornell University(康奈尔大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 本文提出主动数据重建攻击方法,通过强化学习主动诱导模型重建文本以检测语言模型训练数据,实验表明其在检测预训练、后训练和蒸馏数据方面表现优于现有方法。
AlignTok: 将预训练视觉编码器对齐到分词器以用于扩散模型
机构 * University of Washington(华盛顿大学) ; Adobe Research(Adobe研究)
AI总结 AlignTok通过将预训练视觉编码器对齐为分词器,提升扩散模型的生成质量和收敛速度,适用于图像生成任务。
Comments ICLR 2026, Project Page: https://aligntok.github.io/