arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2601.09100 2026-01-16 cs.AI 88%

DScheLLM: Enabling Dynamic Scheduling through a Fine-Tuned Dual-System Large language Model

DScheLLM:通过微调双系统大语言模型实现动态调度

Lixiang Zhang, Chenggong Zhao, Qing Gao, Xiaoke Zhao, Gengyi Bai, Jinhu Lv

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 DScheLLM通过微调双系统大语言模型,首次在动态环境中应用大语言模型解决作业车间调度问题,展示其在智能调度优化中的潜力。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19631 2026-01-16 cs.AI 88%

Leveraging Open-Source Large Language Models for encoding Social Determinants of Health using an Intelligent Router

利用开源大型语言模型对健康社会决定因素进行编码的方法

Akul Goel, Surya Narayanan Hari, Belinda Waltman, Matt Thomson

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于开源LLM的智能路由系统,用于高准确率提取SDOH相关医疗记录信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19531 2026-01-16 cs.CL 86%

MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models

MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差

Zhenpeng Su, Xing Wu, Xue Bai, Zijia Lin, Hui Chen, Guiguang Ding, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 MiLe Loss通过熵加权机制减轻大语言模型在学习困难方面的偏差,提升模型对难学标记的关注度,从而在下游任务中取得更好的表现。

Comments This paper has been accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21621 2026-01-16 cs.CL cs.AI 86%

The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs

开放证明语料库:大规模研究LLM生成的数学证明

Jasper Dekoninck, Ivo Petrov, Kristian Minchev, Mislav Balunovic, Martin Vechev, Miroslav Marinov, Maria Drencheva, Lyuba Konova, Milen Shumanov, Kaloyan Tsvetkov, Nikolay Drenchev, Lazar Todorov, Kalina Nikolova, Nikolay Georgiev, Vanesa Kalinkova, Margulan Ismoldayev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里德斯基") Institute of Mathematics and Informatics, Bulgarian Academy of Sciences(保加利亚科学院数学与信息学研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 开放证明语料库通过大规模研究LLM生成的数学证明,探索自动化证明生成中的关键问题,包括自然语言与形式证明的性能差距、最终答案准确性与完整证明有效性之间的差异,以及最佳n选择对证明质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10018 2026-01-16 cs.HC cs.AI 85%

Empowering Older Adults in Digital Technology Use with Foundation Models

通过基础模型赋能老年人数字技术使用

Hasti Sharifi, Homaira Huda Shomee, Sourav Medya, Debaleena Chattopadhyay

机构 * Department of Computer Science University of Illinois Chicago(计算机科学系伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过基础模型解决老年人在数字技术使用中的沟通障碍,开发了OATS数据集,提高了解决方案的准确性和用户信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 82%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09733 2026-01-16 cs.CL cs.AI 82%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10645 2026-01-16 cs.CL 77%

Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs

用于解释大语言模型 verbalized 自信心的有影响力训练数据检索

Yuxi Xia, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TracVC通过追踪训练数据来解释LLMs表达自信心的来源,揭示了模型可能依赖无关数据模仿自信,而非真实内容基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05459 2026-01-16 cs.CR 75%

PrivCode: When Code Generation Meets Differential Privacy

PrivCode: 当代码生成遇见差分隐私

Zheng Liu, Chen Gong, Terry Yue Zhuo, Kecen Li, Weichen Yu, Matt Fredrikson, Tianhao Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PrivCode是一种专门设计用于代码数据集的差分隐私合成器,通过两阶段框架提升隐私和效用,生成高效用代码并保护敏感数据。

Comments Accepted at NDSS 2026; code available at https://github.com/Liuzzyg/PrivCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10510 2026-01-16 cs.LG stat.ML 70%

MixMin: Finding Data Mixtures via Convex Minimization

MixMin: 通过凸优化寻找数据混合

Anvith Thudi, Evianne Rovers, Yangjun Ruan, Tristan Thrush, Chris J. Maddison

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MixMin通过凸优化方法改进数据混合,提升了语言模型和化学任务的性能,且在不同规模模型上均有效。

Comments Proceedings of the 42nd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24626 2026-01-16 cs.CL 70%

Relative Scaling Laws for LLMs

大语言模型的相对扩展定律

William Held, David Hall, Percy Liang, Diyi Yang

机构 * Stanford University(斯坦福大学) OpenAthena(开放阿塔纳) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出相对扩展定律,通过分析不同测试分布在规模变化下的性能差异,揭示大语言模型在扩展过程中并非普遍均衡器,强调了鲁棒性挑战的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10684 2026-01-16 cs.LG cond-mat.dis-nn cs.AI stat.ML 62%

On the origin of neural scaling laws: from random graphs to natural language

神经缩放定律的起源:从随机图到自然语言

Maissam Barkeshli, Alberto Alfarano, Andrey Gromov

机构 * Meta Superintelligence Labs, FAIR(Meta超智能实验室,FAIR) Department of Physics, University of Maryland, College Park(大学物理系,马里兰大学College Park分校) Joint Quantum Institute(联合量子研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了从随机图到自然语言的神经缩放定律起源,发现即使在无幂律结构的数据中,简化设置也能产生缩放定律,并展示了语言复杂性降低时缩放指数的单调变化。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10264 2026-01-16 eess.SP cs.LG 57%

Sim2Real Deep Transfer for Per-Device CFO Calibration

面向异构软件定义无线电平台的Sim2Real深度迁移用于每设备载波频率偏移校准

Jingze Zheng, Zhiguo Shi, Shibo He, Chaojie Gu

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) College of Control Science and Engineering(控制科学与工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种Sim2Real深度迁移框架,通过模拟驱动预训练和轻量级接收机适应,实现异构SDR平台中每设备CFO校准,显著提升CFO估计性能。

Comments Accepted by Globecom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09732 2026-01-16 cs.CL 57%

Benchmarking Cross-Lingual Semantic Alignment in Multilingual Embeddings

在多语言嵌入中评估跨语言语义对齐的基准测试

Wen G. Gong

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本研究提出语义亲和力指标,评估多语言嵌入的跨语言语义对齐,发现训练目标而非规模决定对齐效果,强调显式翻译监督的重要性。

Comments 20 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25677 2026-01-16 cs.CR cs.CL 57%

ZK-SenseLM: Verifiable Large-Model Wireless Sensing with Selective Abstention and Zero-Knowledge Attestation

ZK-SenseLM:基于选择性回避和零知识证明的可验证大模型无线传感

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 ZK-SenseLM通过选择性回避和零知识证明提升无线传感的安全性和可验证性,实现高精度和鲁棒性。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏