Acoustic Word Embeddings for Untranscribed Target Languages with Continued Pretraining and Learned Pooling
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG
Comments Accepted to Interspeech 2023
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG
Comments Accepted to Interspeech 2023
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
Comments CVPR 2023. Code/models: https://github.com/facebookresearch/omnivore
专题命中 预训练与数据 :language model(title);分类 cs.AI、cs.LG
Comments Accepted to CVPR 2023
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI
Comments NeurIPS 2022
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
Comments Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2022, November 28th, 2022, New Orleans, United States & Virtual, http://www.ml4h.cc, 9 pages
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
Comments Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS 2022)
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
Comments Accepted at ICML 2022 Workshop on Pre-training: Perspectives, Pitfalls, and Paths Forward, source code is available at https://github.com/facebookresearch/ppuda
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI
Comments *SEM 2022
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
Comments 12 pages, 4 figures
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI
Journal ref In Proceedings of the 3rd Workshop on Research in Computational Typology and Multilingual NLP of the 20th Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technologies in 2021
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
Comments NAACL 2021
专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG
Comments 7 pages, 1 figure, to be published in 25th International Conference on Pattern Recognition, ICPR 2020
专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG
Comments 5 pages, 2019 19th International Conference on Control, Automation and Systems (ICCAS 2019)
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI
Comments 17 pages, 20 figures and/or tables
叠加产生稳健的神经扩展
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现表示叠加是神经扩展定律的核心驱动因素,揭示了损失与模型规模之间的反比关系。
Comments Best Paper Runner-up at NeurIPS 2025
Journal ref Advances in Neural Information Processing Systems 38 (2025) 159269--159305
深度delta学习
机构 * Princeton University(普林斯顿大学) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出深度delta学习,通过选择性重写残差内容提升语言模型性能,改进了Transformer残差流的更新机制。
Comments Project Page: https://github.com/yifanzhang-pro/deep-delta-learning
分词器代价:量化并解释印度语言子词分词的跨语言成本
机构 * Sirena Ai India(印度Sirena人工智能公司)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究量化印度语言子词分词跨语言成本,测量六种分词器在十四种语言上的分词丰富度,揭示字节对合并失败是高代价主因,多语言分词器可降低代价,还发现分词与阅读理解性能关联受语言资源可用性影响。
大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。
XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型
机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) ; School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) ; State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。
Comments Accepted to ICML2026 as Oral
教大语言模型一种低资源语言:增强Pharo中的代码补全
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究将基于大语言模型的代码补全引入低资源语言Pharo,介绍结合特定数据处理、预训练与微调的端到端流程,引入基准测试,实证表明专用模型性能超越原模型及更大模型。
状态-预测分离假说
机构 * Cornell University(康奈尔大学) ; Harvard University(哈佛大学)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出状态-预测分离假说,通过双流Transformer解耦状态存储与下一词预测,在预训练中提升数据与计算效率,下游任务平均提升2-3个百分点。
Comments Preprint
DocArena:将原始文档转化为可控的训练环境用于文档搜索代理
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Adobe Research(Adobe研究院)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)
AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。
Comments search agent for documents
使用大语言模型进行Qiskit代码迁移
专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。
从统计视角重新思考跨语言差距
机构 * Google DeepMind(谷歌DeepMind)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出跨语言差距源于目标语言响应方差,通过形式化偏差和无偏误差,并采用推理时集成方法降低方差,使跨语言迁移得分提升8%-50%以上。
Comments 30 pages
ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Datadog
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。
MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成
专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)
AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。