SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments accepted to NAACL 2024 Industry Track
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments accepted to NAACL 2024 Industry Track
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);instruction tuning(abstract)
Comments Accepted to NAACL 2024. Project page: https://poison-llm.github.io
超出界限:评估LLM训练数据中极端主义言论的流行程度与内容
机构 * University of Manchester(曼彻斯特大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本研究针对LLM训练数据的极端主义言论问题,以Dolma语料库为对象,经多步骤提取得出其含数十万份极端主义文档的下限,并探讨相关数据整理与预训练影响。
Comments Accepted to the CPSS workshop @ KONVENS 2026
测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移
机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) ; University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)
专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。
通过LLM引导的视频拼接进行手语翻译的语料增强
机构 * Peter Pazmany Catholic University, Faculty of Information Technology and Bionics(彼得·帕兹马尼天主教大学信息科技与仿生学院) ; DeepSign Technologies Ltd.(DeepSign科技有限公司)
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.LG
AI总结 提出一种无需额外标注或生成模型的手语翻译语料增强方法,利用CTC强制对齐提取手语片段,通过LLM生成句子并拼接视频,在GFSLT-VLP基线上提升BLEU-4达2.92,并发现合成数据对视觉-语言预训练有害但可提升下游任务。
谁写了这本书?检测与归因LLM代笔作者
机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息学院) ; School of Computing, FSE, Macquarie University, Australia(麦考瑞大学计算学院)
专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 提出GhostWriteBench数据集和TRACE指纹方法,用于检测和归因LLM生成的长文本,在跨域和未见模型上达到SOTA性能。
Comments WIP
AlphaOPT: 利用自改进LLM经验库构建优化问题
机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Florida(佛罗里达大学) ; Northeastern University(东北大学) ; Singapore Management University(新加坡管理学院)
专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。
多语言社会中的语言意识形态:基于LLM的卢森堡语新闻评论分析
机构 * University of Luxembourg(卢森堡大学) ; University of Oslo(奥斯陆大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文探讨了利用大语言模型检测语言意识形态的潜力,通过手动标注卢森堡语评论并评估不同提示条件下的模型表现,发现尽管LLM在多类意识形态标注上尚未完全优化,但仍能有效识别语言意识形态内容。
评估大型语言模型用于焦虑、抑郁和压力检测:提示策略和合成数据的见解
机构 * Lua Health(Lua健康)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL
AI总结 本研究评估了大型语言模型在焦虑、抑郁和压力检测中的性能,发现Distil-RoBERTa和XLNet在不同任务中表现优异,合成数据有效缓解类别不平衡,但需注意精度校准。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.AI
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL
义务缺口:大语言模型与义务的模态语言
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究发现大语言模型的义务情态使用模式与当代人类存在缺口,其情态使用反映训练的正式书面资源,少用标记即时人际义务的情态结构。
基于大语言模型的混凝土材料信息学自动化数据提取
机构 * Department of Civil and Environmental Engineering, Rice University(Rice大学土木与环境工程系) ; Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) ; Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) ; Independent researcher(独立研究员)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出一种基于大语言模型的自动化数据提取方法,用于从非结构化科学文献中提取混凝土材料数据,构建了最大的开放实验室数据库,提升了材料信息学的数据基础设施发展。
Comments 21 pages, 5 figures, 1 table
LLM在硬件设计的RTL编码中如何失败与泛化?
机构 * NVIDIA Research(英伟达研究院)
专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 提出基于问题可解性的错误分类法,揭示LLM在RTL编码中受限于预训练知识,对齐技术仅教会编译,而推理能力才是关键瓶颈。
Comments Preview, under submission for EMNLP 2026
大型语言模型中涌现的重分词对称性:现象学与应用
机构 * Department of Physics, Emory University(埃默里大学物理系)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)
AI总结 研究发现大型语言模型在训练中部分涌现出重分词对称性,通过重分词实验探测模型对语义等价输入表示的敏感性和鲁棒性,并提出一种新的推理时采样策略。
基于大语言模型的时间序列事件建模中的时间标记策略
机构 * Capital One ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文研究了大语言模型中时间序列事件建模的时间标记策略,通过对比不同编码方法发现,标记器需与数据统计特性匹配才能提升预测性能。
空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性
机构 * Russian Federation(俄罗斯联邦)
专题命中 预训练与数据 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)
AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。
Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248
Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804
从锚点到监督:基于记忆图的无语料去学习框架
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Shanghai University of Electric Power(上海电力大学) ; School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出MAGE框架,通过用户提供的轻量锚点识别目标实体,利用记忆图恢复相关记忆并生成监督,实现无语料的去学习,有效提升隐私保护和审计能力。
Comments 15 pages, appendix included
基于 Scaffold 的偏好三元组用于大语言模型可控分子优化
机构 * National Key Laboratory of Parallel and Distributed Processing(平行与分布式处理国家重点实验室) ; College of Computer Science and Technology(计算机科学与技术学院) ; National University of DefenseTechnology(国防科技大学) ; DP Technology(DP科技)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出 Scaffold-Conditioned Preference Triplets (SCPT) 方法,通过构建约束三元组实现可控分子优化,提升分子性质改进的同时保持 Scaffold 相似性,优于传统方法。
回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 预训练与数据 :LLM(title,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。
Comments Preprint and under review
在Aurora超级计算机上可扩展地预训练大型专家混合语言模型
机构 * Parallel Computing Lab (India) Intel Corporation(英特尔公司印度并行计算实验室)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本文在Aurora超级计算机上展示了大规模预训练大型语言模型,开发了Optimus训练库,预训练了多个MoE模型,并通过定制GPU内核和新型EP-Aware分片优化器提升了训练效率。
DataFlex: 一种统一的以数据为中心的大型语言模型动态训练框架
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; OriginHub Technology ; LLaMA-Factory Team(LLaMA-Factory团队) ; Zhongguancun Academy(中关村学院) ; OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室OpenDataLab) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
AI总结 DataFlex 提供了一种统一的以数据为中心的动态训练框架,支持样本选择、领域混合调整和样本再加权,提升了大型语言模型的训练效率和可重复性。
控制幻觉:大型语言模型中指令层级的失效
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)
AI总结 研究探讨了大型语言模型中指令层级机制的有效性,发现模型在处理简单格式冲突时难以保持一致的优先级,且系统/用户提示分离方法无法建立可靠层级,社会层级框架对模型行为影响更大。
Comments Accepted to AAAI-26 Main Technical Track Proceedings
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(36): 30816-30824, 2026
LabelFusion:融合大型语言模型与Transformer编码器以实现稳健的金融新闻分类
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文提出LabelFusion架构,结合提示工程的LLM与微调的RoBERTa编码器,通过轻量MLP投票层提升金融新闻分类性能,在低数据环境下LLM单独使用表现更优。
通过基于模型的数据选择增强多语言大语言模型预训练
机构 * EPFL(苏黎世联邦理工学院)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出了一种基于模型的数据选择框架,通过提高多语言大语言模型预训练的效果,实现了在较少训练数据下达到基线分数并提升其他基准测试的表现。
Comments NeurIPS 2025 Track on Datasets and Benchmarks
为密集和稀疏大语言模型推广缩放定律
机构 * Department of Computer Science(计算机科学系) ; Iowa State University(爱荷华州立大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
AI总结 本文提出了一种通用缩放定律,适用于密集和稀疏大语言模型,通过比较实验验证了其在大规模模型中的有效性。
Comments 8 pages, 8 figures
大语言模型能否捕捉视频游戏参与度?
机构 * Institute of Digital Games, University of Malta Msida, Malta(马耳他大学数字游戏研究所)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文研究了大语言模型在多模态输入下预测视频游戏参与度的能力,发现尽管LLMs在多个领域表现优异,但其在连续情绪标注上仍无法超越人类注释。
Comments This work has been submitted to the IEEE for publication
金融基础模型的数据效率前沿:从持续预训练中获得的扩展定律
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了金融基础模型在持续预训练中的数据效率,发现通过较小的词预算可实现有效的领域适应,且大模型规模仍具可行性。
Comments 8 pages, 4 figures, 1 table