arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2505.12546 2026-07-21 cs.CL cs.CY cs.LG 86%

Extracting memorized pieces of (copyrighted) books from open-weight language models

从开放式语言模型中提取记忆中的(受版权保护)书籍

A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Cornell University(康奈尔大学) West Virginia University(西弗吉尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过测量书籍在语言模型中的记忆程度,发现大多数模型不完整记忆书籍,但部分模型如Llama 3.1 70B能完整记忆某些书籍,对版权案件有重要影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01171 2026-07-17 cs.CL cs.AI 版本更新 86%

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

言语化采样:如何减轻模式坍塌并释放大语言模型的多样性

Jiayi Zhang, Simon Yu, Derek Chong, Anthony Sicilia, Michael R. Tomz, Christopher D. Manning, Weiyan Shi

专题命中 预训练与数据 :LLM(title,abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究发现偏好数据中的典型性偏差致大语言模型模式坍塌,引入言语化采样策略。该策略能促使模型说出响应概率分布,经实验验证可显著提升创意写作等多方面性能,为模式坍塌提供新视角及实用补救方法。

Comments 83 pages, 31 figures, 44 tables. Code is available at https://github.com/CHATS-lab/verbalize-sampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24890 2026-07-14 cs.CL cs.AI cs.CY 版本更新 86%

Small edits, large models: How Wikipedia advocacy shapes LLM values

小编辑,大模型:维基百科倡导如何塑造LLM价值观

Jasmine Brazilek, Maria Navas, Alexa Gnauck

机构 * Compassion Aligned Machine Learning (CaML)(慈悲对齐机器学习实验室) Independent researcher(独立研究者) Pro-Animal Wikipedians (PAW)(亲动物维基人组织)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过梯度归因和反事实影响估计,发现维基百科上一个小型倡导组织的编辑活动显著影响了语言模型在动物福利话题上的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01973 2026-06-17 cs.CL cs.LG 版本更新 86%

Learn-To-Learn on Arbitrary Textual Conditioning: A Hypernetwork-Driven Meta-Gated LLM

在任意文本条件下学习:一种超网络驱动的元门控大语言模型

Luo Ji, Qi Qin, Ningyuan Xi, Teng Chen, Qingqing Gu, Hongyan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 提出一种超网络驱动的元门控机制,通过动态调整SwiGLU块中的β参数,使LLM适应不同文本条件,优于微调和元学习基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11127 2026-06-10 cs.CL cs.AI 新提交 86%

Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation

基于来源的门控与自适应恢复在合成后训练数据筛选中的应用

Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs

专题命中 预训练与数据 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究合成后训练数据筛选中的来源证据门控与样本自适应恢复,提出结合故障诊断与定向再生成的自适应恢复流水线,提高产量、恢复率和注入召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03635 2026-06-08 cs.AI cs.CL 版本更新 86%

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律

Xinyi Wang, Shawn Tan, Shenbo Xu, Mingyu Jin, William Yang Wang, Rameswar Panda, Yikang Shen

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Tokyo(东京大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23032 2026-05-25 cs.CL cs.AI q-bio.NC 86%

Brain-LLM Alignment Tracks Training Data, Not Typology

大脑-大语言模型对齐追踪训练数据,而非语言类型学

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 通过分析英语、中文和法语的fMRI数据及多种大语言模型,发现训练语言主导性而非英语本身驱动大脑-模型对齐模式,且类型学距离独立影响对齐退化。

Comments Accepted to CoNLL 2026. 9 pages main content + 4 pages references + 6 pages appendix; 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04674 2026-04-13 cs.SI cs.AI cs.CL 86%

Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility

夸大态度,忽视网络:LLM在模拟虚假信息易感性中的偏见

Eun Cheol Choi, Lindsay E. Young, Emilio Ferrara

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在模拟虚假信息易感性中的偏见,发现其夸大信念与分享的关联,忽视网络特征,建议LLM模拟更适用于诊断而非替代人类判断。

Comments Accepted to ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06499 2026-04-13 cs.CL cs.AI 86%

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Webscale-RL: 用于将强化学习数据扩展到预训练水平的自动化数据管道

Zhepeng Cen, Haolin Chen, Shiyu Wang, Zuxin Liu, Zhiwei Liu, Jielin Qiu, Ding Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(赛富时人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Webscale-RL数据管道,通过系统性地将大规模预训练文档转换为数百万个多样化的可验证问题-答案对,解决RL数据瓶颈问题,并展示基于该数据集的模型在多个基准测试中表现优于传统预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01833 2026-04-06 cs.CV cs.CL cs.LG 86%

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

语言预训练引入的偏差:一种强大的基础视觉任务通用性基础

Yaxin Luo, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出随机标签桥梁训练方法,通过模态适应学习有效对齐大语言模型参数与视觉任务,揭示部分桥梁训练在视觉任务中的优势。

Comments Main manuscript: 13 pages, 9 figures. Appendix: 8 pages, 5 figures. Accepted in Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 86%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22459 2026-03-27 cs.CL cs.AI 86%

LLM-guided headline rewriting for clickability enhancement without clickbait

基于大语言模型的引导性标题重写以增强点击率而不产生标题党

Yehudit Aperstein, Linoy Halifa, Sagiv Bar, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿菲卡工程学院智能系统系) School of Computer Science, Faculty of Sciences, HIT-Holon Institute of Technology(霍隆理工学院理学院计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引导性标题重写框架,通过控制生成过程中的语言属性,在保持语义忠实的前提下提升标题吸引力,避免产生误导性内容。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18019 2026-03-26 cs.CL cs.AI 86%

Is Multilingual LLM Watermarking Truly Multilingual? Scaling Robustness to 100+ Languages via Back-Translation

多语言大语言模型水印是否真的多语言?通过回译扩大到100多种语言的鲁棒性

Asim Mohamed, Martin Gubri

机构 * African Institute for Mathematical Sciences Parameter Lab(非洲数学科学研究所参数实验室)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有多语言水印方法在中低资源语言中鲁棒性不足,提出STEAM方法通过回译恢复水印强度,提升跨语言水印鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14751 2026-03-26 cs.LG cs.AI 86%

Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries

超越多令牌预测:通过未来摘要预训练语言模型

Divyat Mahajan, Sachin Goyal, Badr Youbi Idrissi, Mohammad Pezeshki, Ioannis Mitliagkas, David Lopez-Paz, Kartik Ahuja

机构 * Carnegie Mellon University(卡内基梅隆大学) FAIR at Meta(Meta的FAIR)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出未来摘要预测(FSP)方法,通过训练辅助头预测紧凑的长期未来表示,提升长形式生成能力,在数学、推理和编码基准测试中优于NTP和MTP。

Comments Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22186 2026-03-24 cs.CL cs.AI 86%

Enhancing Document-Level Machine Translation via Filtered Synthetic Corpora and Two-Stage LLM Adaptation

通过过滤后的合成语料库和两阶段LLM适应增强文档级机器翻译

Ireh Kim, Tesia Sker, Chanwoo Kim

机构 * 1 Department of Artificial Intelligence Korea University, Seoul, South Korea

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过过滤后的合成语料库和两阶段LLM适应方法,解决文档级机器翻译中平行数据稀缺和生成幻觉问题,提升翻译质量。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21415 2026-03-24 cs.AI cs.CR cs.LG 86%

Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures

指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据

Gregory M. Ruddell

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。

Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14712 2026-03-17 cs.CL cs.LG 86%

Towards Next-Generation LLM Training: From the Data-Centric Perspective

迈向下一代大语言模型训练:从数据导向的视角

Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weinan E, Wentao Zhang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文从数据导向视角出发,探讨了大语言模型训练中的数据准备瓶颈问题,提出构建自动数据准备系统和统一的数据-模型交互训练系统,以提升数据利用效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 86%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20666 2026-03-03 cs.CL cs.AI 86%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05408 2026-03-02 cs.CL cs.LG 86%

Steering Language Models with Weight Arithmetic

通过权重算术引导语言模型

Constanza Fierro, Fabien Roger

机构 * Department of Computer Science University of Copenhagen(计算机科学系 拉丁大学) Anthropic

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 通过权重算术引导方法提升语言模型在分布外行为控制中的性能,同时减少趋炎附势和偏差。

Comments ICLR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 86%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 86%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14295 2026-02-17 cs.LG cs.AI 86%

Machine Learning as a Tool (MLAT): A Framework for Integrating Statistical ML Models as Callable Tools within LLM Agent Workflows

机器学习作为工具(MLAT):一种将统计机器学习模型作为可调用工具集成到LLM代理工作流中的框架

Edwin Chen, Zulekha Bibi

机构 * Legacy AI LLC

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MLAT框架通过将统计机器学习模型作为可调用工具集成到LLM代理工作流中,实现快速生成专业提案的自动化流程。

Comments Submitted to the Google Gemini 3 Hackathon

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14921 2026-02-13 cs.CL cs.CR cs.LG 86%

The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text

知更鸟的回声:审计大语言模型生成合成文本的隐私风险

Matthieu Meeus, Lukas Wutschitz, Santiago Zanella-Béguelin, Shruti Tople, Reza Shokri

机构 * Imperial College London(帝国理工学院伦敦分校) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过设计具有分布内前缀和高困惑度后缀的知更鸟,提高基于数据的MIAs的威力,以更准确评估LLM生成合成数据的隐私风险。

Comments 42nd International Conference on Machine Learning (ICML 2025)

Journal ref Proc. Mach. Learn. Res. 267 (2025) 43557-43580

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09067 2026-02-12 q-bio.GN cs.AI cs.CE cs.CL 86%

AntigenLM: Structure-Aware DNA Language Modeling for Influenza

AntigenLM: 用于流感的结构感知DNA语言模型

Yue Pei, Xuebin Chi, Yu Kang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Beijing Institute of Genomics, Chinese Academy of Sciences(中国科学院北京基因组研究所) China National Center for Bioinformation(中国生物信息学国家中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 AntigenLM通过结构感知的DNA语言模型预测流感抗原变异,优于传统方法,同时在亚型分类中表现优异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00884 2026-02-10 cs.LG cs.CL 86%

Towards Active Synthetic Data Generation for Finetuning Language Models

面向微调语言模型的主动合成数据生成

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. Ash

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过主动学习方法生成合成数据以提升语言模型微调效果,验证了简单筛选标准在数学和逻辑推理任务中的有效性。

Comments 14 figures, 37 pages. Website and code: https://iterative-sd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03702 2026-02-04 cs.LG cs.AI math.OC stat.ML 86%

Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging

任意时间预训练:无时间范围的学习率调度与权重平均

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学凯默纳研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种无需时间范围的学习率调度方法,通过权重平均实现与余弦调度相当的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03690 2026-02-04 cs.LG cs.AI 86%

LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization

受大语言模型启发的小数据、大规模优化的预训练-微调方法

Zishi Zhang, Jinhui Han, Ming Hu, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种受大语言模型启发的预训练-微调方法,用于解决小数据下的大规模决策优化问题,通过预训练注入领域知识并利用合成数据,微调提升与真实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15370 2026-01-29 cs.LG cs.AI physics.chem-ph q-bio.BM 86%

Tokenization for Molecular Foundation Models

分子基础模型的标记化

Alexius Wadell, Anoushka Bhutani, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan 48109, United States(机械工程系,密歇根大学,安娜堡,密歇根州48109,美国)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Smirk和Smirk-GPE两种新的分子标记器,以全面覆盖OpenSMILES规范,提升分子属性预测的准确性。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06920 2026-01-27 cs.CR cs.AI cs.CL cs.CY 86%

An Ethically Grounded LLM-Based Approach to Insider Threat Synthesis and Detection

基于伦理的LLM方法用于内部威胁合成与检测

Haywood Gelman, John D. Hastings, David Kenley

机构 * Beacom College of Computer \& Cyber Sciences Dakota State University Madison, SD, USA College of Arts \& Sciences Dakota State University Madison, SD, USA

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于伦理的LLM方法,利用Claude Sonnet 3.7动态生成syslog消息以检测内部威胁,实验显示其在减少误报和提高检测准确性方面优于GPT-4o。

Comments 6 pages, 5 figures, 5 tables

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏