When Being Unseen from mBERT is just the Beginning: Handling New Languages With Multilingual Language Models
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted at NAACL-HLT 2021
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted at NAACL-HLT 2021
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted at NAACL 2021
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments Accepted at NAACL2021
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 10 pages, 6 figures
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 10 pages, 1 figure, COLING 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to EMNLP 2020, short paper
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments ACL-SRW 2019 (camera-ready)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments EMNLP 2020, main conference
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Findings in EMNLP 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 17 pages, 6 tables, 2 figures. AK and LK contributed equally
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 9 pages
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to ICLR 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments accepted at EMNLP 2019
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments NAACL 2019
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted in CICLing 2019
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Journal ref Blackbox NLP Workshop, EMNLP 2018
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL
Comments EMNLP'01, Pittsburgh; 8 pages
Journal ref EMNLP/NAACL 2001 Conference Proceedings
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL
Comments 4 pages + 2 pages of ERRATA
Journal ref Proceedings of NLDB'99, Klagenfurt, Austria
小实验,更经济的决策:微预训练中分阶段提升的案例研究
机构 * Hewlett Packard Enterprise(慧与科技公司)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究微预训练中分阶段提升协议,通过固定预算筛选配置,在Windows A100和Linux L40S上验证,发现早期排名不稳定,但最终协议以144 GPU小时找到最优配置,成本低于全量筛选。
Comments 14 pages, 5 figures; 12-hour dual-host micro-pretraining promotion study; source package includes curated ancillary artifacts
理解语言模型中转向向量的不可靠性:几何预测器与线性近似的局限性
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;foundation model(comments)
AI总结 该研究探讨了语言模型中转向向量的可靠性问题,发现训练数据和行为表示对转向效果有显著影响,提出几何预测器和非线性近似方法以提升稳定性。
Comments Master's Thesis, University of Tübingen. 89 pages, 34 figures. Portions of this work were published at the ICLR 2025 Workshop on Foundation Models in the Wild (see arXiv:2505.22637)
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Vanderbilt University(范德比尔特大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)
Comments Accepted by MIDL 2025. Code available at https://github.com/junyuchen245/Pretraining_Image_Registration_DNNs
斯里兰卡议会辩论的三语主题建模
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对斯里兰卡议会三语辩论语料库因多语言特性难以处理的问题,提出基于LLM的文本提取结合多语言嵌入与密度聚类的端到端框架,辅以BiTopic方法,成功识别三种语言的30个宏观主题,其时间轨迹与重大国家事件吻合,且性能优于传统LDA。