arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-31 至 2025-10-31 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2510.25947 2025-10-31 cs.CL cs.AI cs.LG 90%

Revisiting Multilingual Data Mixtures in Language Model Pretraining

Negar Foroutan, Paul Teiletche, Ayush Kumar Tarun, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25804 2025-10-31 cs.CL 88%

Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data

Haoran Deng, Yingyu Lin, Zhenghao Lin, Xiao Liu, Yizhou Sun, Yi-An Ma, Yeyun Gong

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18125 2025-10-31 cs.LG cs.CL 86%

TabSTAR: A Tabular Foundation Model for Tabular Data with Text Fields

Alan Arazi, Eilam Shapira, Roi Reichart

机构 * Technion - IIT(技术学院-理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 84%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26345 2025-10-31 cs.CL cs.AI cs.LG 80%

MisSynth: Improving MISSCI Logical Fallacies Classification with Synthetic Data

Mykhailo Poliakov, Nadiya Shvai

机构 * National University of Kyiv-Mohyla Academy(基辅-莫希拉学院国家大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26336 2025-10-31 cs.CL cs.AI 79%

From Amateur to Master: Infusing Knowledge into LLMs via Automated Curriculum Learning

Nishit Neema, Srinjoy Mukherjee, Sapan Shah, Gokul Ramakrishnan, Ganesh Venkatesh

机构 * Cerebras Systems(Cerebras系统)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16325 2025-10-31 cs.CL 77%

This Candidate is [MASK]. Prompt-based Sentiment Extraction and Reference Letters

Fabian Slonimczyk

机构 * International College of Economics and Finance, HSE(俄罗斯经济金融国际学院,俄罗斯)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24817 2025-10-31 cs.CL cs.AI cs.LG 75%

Towards a Method for Synthetic Generation of Persons with Aphasia Transcripts

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16629 2025-10-31 cs.LG 70%

On the Impossibility of Retrain Equivalence in Machine Unlearning

Jiatong Yu, Yinghui He, Anirudh Goyal, Sanjeev Arora

机构 * Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 预训练与数据 :LLM(abstract);post-training(abstract);分类 cs.LG

Comments Code available at https://princeton-pli.github.io/impossibility-unlearning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12549 2025-10-31 cs.CL cs.AI cs.LG 67%

Memorization: A Close Look at Books

Iris Ma, Ian Domingo, Alberto Krone-Martins, Pierre Baldi, Cristina V. Lopes

机构 * School of Information and Computer Sciences University of California, Irvine(信息与计算机科学学院 加州大学伊维奇分校)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025 L2M2 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25788 2025-10-31 cs.LG cond-mat.mtrl-sci 57%

SHA-256 Infused Embedding-Driven Generative Modeling of High-Energy Molecules in Low-Data Regimes

Siddharth Verma, Alankar Alankar

机构 * Department of Mechanical Engineering(机械工程系) Center for Machine Intelligence and Data Science (CMInDS)(机器智能与数据科学中心)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08188 2025-10-31 cs.CR cs.CL 57%

GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors

Wenlong Meng, Shuguo Fan, Chengkun Wei, Min Chen, Yuwei Li, Yuanchao Zhang, Zhikun Zhang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Vrije Universiteit Amsterdam(荷兰自由大学) National University of Defense Technology(国防科技大学) Mybank, Ant Group(蚂蚁集团Mybank)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

Comments Accepted by USENIX Security'25; Update badges and Artifact Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11331 2025-10-31 cs.CL cs.MM 57%

Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis

Hao Liu, Lijun He, Jiaxi Liang, Zhihan Ren, Haixia Bi, Fan Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏