MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差
Zhenpeng Su, Xing Wu, Xue Bai, Zijia Lin, Hui Chen, Guiguang Ding, Wei Zhou, Songlin Hu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
;
Kuaishou Technology(快手科技)
;
Tsinghua University(清华大学)
专题命中
预训练与数据
:language model(title,abstract);large language model(title);分类 cs.CL
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
开放证明语料库:大规模研究LLM生成的数学证明
Jasper Dekoninck, Ivo Petrov, Kristian Minchev, Mislav Balunovic, Martin Vechev, Miroslav Marinov, Maria Drencheva, Lyuba Konova, Milen Shumanov, Kaloyan Tsvetkov, Nikolay Drenchev, Lazar Todorov, Kalina Nikolova, Nikolay Georgiev, Vanesa Kalinkova, Margulan Ismoldayev
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里德斯基")
;
Institute of Mathematics and Informatics, Bulgarian Academy of Sciences(保加利亚科学院数学与信息学研究所)
;
Massachusetts Institute of Technology(麻省理工学院)
专题命中
预训练与数据
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs
用于解释大语言模型 verbalized 自信心的有影响力训练数据检索
Yuxi Xia, Loris Schoenegger, Benjamin Roth
机构
*
Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系)
;
UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院)
;
Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)
专题命中
预训练与数据
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus
PMOA-TTS:引入PubMed开放获取文本时间序列语料库
Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss
机构
*
Machine Learning Department, School of Computer Science(计算机科学系机器学习部门)
;
Heinz College of Information Systems and Public Policy(信息系统与公共政策学院)
;
National Library of Medicine(国家医学图书馆)
On the origin of neural scaling laws: from random graphs to natural language
神经缩放定律的起源:从随机图到自然语言
Maissam Barkeshli, Alberto Alfarano, Andrey Gromov
机构
*
Meta Superintelligence Labs, FAIR(Meta超智能实验室,FAIR)
;
Department of Physics, University of Maryland, College Park(大学物理系,马里兰大学College Park分校)
;
Joint Quantum Institute(联合量子研究所)