arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2409.12695 2024-09-20 cs.CL cs.IR 88%

Exploring Large Language Models for Product Attribute Value Identification

Kassem Sabeh, Mouna Kacimi, Johann Gamper, Robert Litschko, Barbara Plank

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00454 2024-09-18 cs.CL 88%

Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability

Ryokan Ri, Shun Kiyono, Sho Takase

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06120 2024-09-06 cs.CL 88%

Exploring Group and Symmetry Principles in Large Language Models

Shima Imani, Hamid Palangi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17024 2024-09-04 cs.CL 88%

InkubaLM: A small language model for low-resource African languages

Atnafu Lambebo Tonja, Bonaventure F. P. Dossou, Jessica Ojo, Jenalea Rajab, Fadel Thior, Eric Peter Wairagala, Anuoluwapo Aremu, Pelonomi Moiloa, Jade Abbott, Vukosi Marivate, Benjamin Rosman

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09552 2024-08-16 cs.CL 88%

Large Language Models are Few-Shot Training Example Generators: A Case Study in Fallacy Recognition

Tariq Alhindi, Smaranda Muresan, Preslav Nakov

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07975 2024-08-16 cs.RO cs.CL cs.CV 88%

Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models

Tianyu Wang, Haitao Lin, Junqiu Yu, Yanwei Fu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by IROS 2024. 8 pages, 5 figures. See https://star-uu-wang.github.io/Polaris/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03524 2024-08-08 cs.CL 88%

EgyBERT: A Large Language Model Pretrained on Egyptian Dialect Corpora

Faisal Qarah

专题命中 预训练与数据 :language model(title,abstract);large language model(title);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03506 2024-08-08 cs.CL 88%

1.5-Pints Technical Report: Pretraining in Days, Not Months -- Your Language Model Thrives on Quality Data

Calvin Tan, Jerome Wang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);LLM(abstract);分类 cs.CL

Comments Technical Report for 1.5-Pints

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18897 2024-07-29 cs.LG cs.NE q-bio.QM 88%

Small Molecule Optimization with Large Language Models

Philipp Guevorguian, Menua Bedrosian, Tigran Fahradyan, Gayane Chilingaryan, Hrant Khachatrian, Armen Aghajanyan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13657 2024-07-19 cs.CL 88%

FuLG: 150B Romanian Corpus for Language Model Pretraining

Vlad-Andrei Bădoiu, Mihai-Valentin Dumitru, Alexandru M. Gherghescu, Alexandru Agache, Costin Raiciu

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12580 2024-07-18 cs.CL cs.CV cs.IR 88%

E5-V: Universal Embeddings with Multimodal Large Language Models

Ting Jiang, Minghui Song, Zihan Zhang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang, Deqing Wang, Fuzhen Zhuang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Code and models are available at https://github.com/kongds/E5-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09250 2024-07-15 cs.NI cs.LG 88%

FedsLLM: Federated Split Learning for Large Language Models over Communication Networks

Kai Zhao, Zhaohui Yang, Chongwen Huang, Xiaoming Chen, Zhaoyang Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07263 2024-07-11 cs.CL 88%

Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models

Jupinder Parmar, Sanjev Satheesh, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03611 2024-07-08 cs.SE cs.AI 88%

An Empirical Study on Capability of Large Language Models in Understanding Code Semantics

Thu-Trang Nguyen, Thanh Trong Vu, Hieu Dinh Vo, Son Nguyen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01911 2024-07-03 cs.CL cs.HC cs.SD eess.AS 88%

Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model

Yu-Kuan Fu, Cheng-Kuang Lee, Hsiu-Hsuan Wang, Hung-yi Lee

专题命中 预训练与数据 :language model(title,abstract);foundation model(title,abstract);分类 cs.CL

Comments submitted to interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11385 2024-06-28 cs.CL 88%

MetaGPT: Merging Large Language Models Using Model Exclusive Task Arithmetic

Yuyan Zhou, Liang Song, Bingning Wang, Weipeng Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11725 2024-06-19 cs.CL cs.CR cs.CY 88%

How Susceptible are Large Language Models to Ideological Manipulation?

Kai Chen, Zihao He, Jun Yan, Taiwei Shi, Kristina Lerman

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08718 2024-06-14 cs.CL 88%

Enhancing Psychotherapy Counseling: A Data Augmentation Pipeline Leveraging Large Language Models for Counseling Conversations

Jun-Woo Kim, Ji-Eun Han, Jun-Seok Koh, Hyeon-Tae Seo, Du-Seong Chang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments IJCAI 2024 AI4Research workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00159 2024-06-10 cs.CL 88%

Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Luca Soldaini, Rodney Kinney, Akshita Bhagia, Dustin Schwenk, David Atkinson, Russell Authur, Ben Bogin, Khyathi Chandu, Jennifer Dumas, Yanai Elazar, Valentin Hofmann, Ananya Harsh Jha, Sachin Kumar, Li Lucy, Xinxi Lyu, Nathan Lambert, Ian Magnusson, Jacob Morrison, Niklas Muennighoff, Aakanksha Naik, Crystal Nam, Matthew E. Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A. Smith, Hannaneh Hajishirzi, Iz Beltagy, Dirk Groeneveld, Jesse Dodge, Kyle Lo

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments Accepted at ACL 2024; Dataset: https://hf.co/datasets/allenai/dolma; Code: https://github.com/allenai/dolma

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02100 2024-06-05 cs.CL 88%

Exploring Mathematical Extrapolation of Large Language Models with Synthetic Data

Haolong Li, Yu Ma, Yinqi Zhang, Chen Ye, Jie Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accept by Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01375 2024-06-04 cs.CL 88%

D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models

Haoran Que, Jiaheng Liu, Ge Zhang, Chenchen Zhang, Xingwei Qu, Yinghao Ma, Feiyu Duan, Zhiqi Bai, Jiakai Wang, Yuanxing Zhang, Xu Tan, Jie Fu, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15370 2024-05-27 cs.CL 88%

Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection

Jun Liu, Chaoyun Zhang, Jiaxu Qian, Minghua Ma, Si Qin, Chetan Bansal, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06640 2024-05-13 cs.CL 88%

Linearizing Large Language Models

Jean Mercat, Igor Vasiljevic, Sedrick Keh, Kushal Arora, Achal Dave, Adrien Gaidon, Thomas Kollar

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06510 2024-05-13 cs.AI 88%

UniDM: A Unified Framework for Data Manipulation with Large Language Models

Yichen Qian, Yongyi He, Rong Zhu, Jintao Huang, Zhijian Ma, Haibin Wang, Yaohua Wang, Xiuyu Sun, Defu Lian, Bolin Ding, Jingren Zhou

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments MLSys24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16461 2024-04-29 cs.CL 88%

Large Language Models Perform on Par with Experts Identifying Mental Health Factors in Adolescent Online Forums

Isabelle Lorge, Dan W. Joyce, Andrey Kormilitzin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14772 2024-04-24 cs.CL 88%

Simulating Task-Oriented Dialogues with State Transition Graphs and Large Language Models

Chris Samarinas, Pracha Promthaw, Atharva Nijasure, Hansi Zeng, Julian Killingback, Hamed Zamani

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07647 2024-04-12 cs.CL 88%

Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck

Nathan Godey, Éric de la Clergerie, Benoît Sagot

专题命中 预训练与数据 :language model(title,abstract);small language model(title);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05428 2024-04-09 cs.CL 88%

Language Models on a Diet: Cost-Efficient Development of Encoders for Closely-Related Languages via Additional Pretraining

Nikola Ljubešić, Vít Suchomel, Peter Rupnik, Taja Kuzman, Rik van Noord

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16248 2024-03-27 cs.CL 88%

Large Language Models Offer an Alternative to the Traditional Approach of Topic Modelling

Yida Mu, Chun Dong, Kalina Bontcheva, Xingyi Song

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15230 2024-03-25 cs.SE cs.LG 88%

An Exploratory Investigation into Code License Infringements in Large Language Model Training Datasets

Jonathan Katzy, Răzvan-Mihai Popescu, Arie van Deursen, Maliheh Izadi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Accepted to FORGE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏