arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2412.20602 2024-12-31 cs.CL 70%

NLP-based Regulatory Compliance -- Using GPT 4.0 to Decode Regulatory Documents

Bimal Kumar, Dmitri Roussinov

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments accepted for presentation at Georg Nemetschek Institute Symposium & Expo on Artificial Intelligence for the Built World - Munich, Germany. 12 Sept 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24159 2024-12-31 cs.CL 70%

GPT or BERT: why not both?

Lucas Georges Gabriel Charpentier, David Samuel

机构 * University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments 22 pages; submission to the BabyLM Challenge 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18111 2024-12-25 cs.AI 70%

AIGT: AI Generative Table Based on Prompt

Mingming Zhang, Zhiqing Xiao, Guoshan Lu, Sai Wu, Weiqiang Wang, Xing Fu, Can Yi, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18061 2024-12-25 cs.SD cs.CL cs.HC eess.AS 70%

Lla-VAP: LSTM Ensemble of Llama and VAP for Turn-Taking Prediction

Hyunbae Jeon, Frederic Guintu, Rayvant Sahni

机构 * Emory University(埃默里大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16335 2024-12-24 cs.LG cs.CY 70%

Improving Equity in Health Modeling with GPT4-Turbo Generated Synthetic Data: A Comparative Study

Daniel Smolyak, Arshana Welivita, Margrét V. Bjarnadóttir, Ritu Agarwal

机构 * University of Maryland, College Park(马里兰大学学院公园校区) Johns Hopkins University(约翰斯·霍普金斯大学) Center for Digital Health and Artificial Intelligence(数字健康与人工智能中心) Robert H. Smith School of Business(罗伯特·H·史密斯商学院) Carey Business School(凯瑞商学院)

专题命中 预训练与数据 :LLM(abstract);prompting(abstract);分类 cs.LG

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13486 2024-12-24 cs.CL 70%

naab: A ready-to-use plug-and-play corpus for Farsi

Sadra Sabouri, Elnaz Rahmati, Soroush Gooran, Hossein Sameti

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref Journal of Artificial Intelligence, Applications and Innovations (2024) 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15593 2024-12-23 cs.CL econ.GN q-fin.EC 70%

News Deja Vu: Connecting Past and Present with Semantic Search

Brevin Franklin, Emily Silcock, Abhishek Arora, Tom Bryan, Melissa Dell

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13716 2024-12-19 q-bio.GN cs.LG 70%

Model Decides How to Tokenize: Adaptive DNA Sequence Tokenization with MxDNA

Lifeng Qiao, Peng Ye, Yuchen Ren, Weiqiang Bai, Chaoqi Liang, Xinzhu Ma, Nanqing Dong, Wanli Ouyang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Sydney(悉尼大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13660 2024-12-19 cs.CL 70%

PsyDT: Using LLMs to Construct the Digital Twin of Psychological Counselor with Personalized Counseling Style for Psychological Counseling

Haojie Xie, Yirong Chen, Xiaofen Xing, Jingkai Lin, Xiangmin Xu

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Pazhou Lab(琶洲实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11653 2024-12-17 cs.CL 70%

Self-Adaptive Paraphrasing and Preference Learning for Improved Claim Verifiability

Amelie Wührl, Roman Klinger

机构 * University of Stuttgart(斯图加特大学) University of Bamberg(班贝格大学)

专题命中 预训练与数据 :language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Under review at ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10348 2024-12-16 cs.CV cs.AI 70%

A dual contrastive framework

Yuan Sun, Zhao Zhang, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09247 2024-12-13 cs.CL 70%

Make Satire Boring Again: Reducing Stylistic Bias of Satirical Corpus by Utilizing Generative LLMs

Asli Umay Ozturk, Recep Firat Cekinel, Pinar Karagoz

机构 * Middle East Technical University (METU)(中东技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to BUCC2025 Workshop @COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13173 2024-12-13 cs.IR cs.AI 70%

Writing Style Matters: An Examination of Bias and Fairness in Information Retrieval Systems

Hongliu Cao

机构 * Amadeus(Amadeus公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.AI

Comments In Proceedings of the Eighteenth ACM International Conference on Web Search and Data Mining (WSDM 25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07112 2024-12-11 cs.CV cs.CL 70%

Maya: An Instruction Finetuned Multilingual Multimodal Model

Nahid Alam, Karthik Reddy Kanjula, Surya Guthikonda, Timothy Chung, Bala Krishna S Vegesna, Abhipsha Das, Anthony Susevski, Ryan Sze-Yin Chan, S M Iftekhar Uddin, Shayekh Bin Islam, Roshan Santhosh, Snegha A, Drishti Sharma, Chen Liu, Isha Chaturvedi, Genta Indra Winata, Ashvanth. S, Snehanshu Mukherjee, Alham Fikri Aji

机构 * Cohere For AI Community(Cohere 人工智能社区) Indiana University Bloomington(印第安纳大学伯明顿分校) Imperial College London(伦敦帝国学院) Georgia Institute of Technology(佐治亚理工学院) The Alan Turing Institute(艾伦·图灵研究所) Bangladesh University of Engineering and Technology(孟加拉工程技术大学) University of Pennsylvania(宾夕法尼亚大学) IIT Bombay(印度理工学院孟买分校) TU Darmstadt(达姆施塔特工业大学) IIT Dhanbad(印度理工学院丹巴德分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Cisco Meraki(思科 Meraki) Articul8 AI(Articul8 人工智能公司) Capital One(第一资本金融公司)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07111 2024-12-11 cs.CL 70%

Predictable Emergent Abilities of LLMs: Proxy Tasks Are All You Need

Bo-Wen Zhang, Yan Yan, Boxiang Yang, Yifei Xue, Guang Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI)) China University of Mining and Technology Beijing(中国矿业大学(北京)) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05466 2024-12-10 cs.LG cs.CV 70%

Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data

Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, Richard Jiang

机构 * Lancaster University(兰开斯特大学) University of Surrey(萨里大学) UFMG(米纳斯吉拉斯联邦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04092 2024-12-06 cs.CL 70%

GEITje 7B Ultra: A Conversational Model for Dutch

Bram Vanroy

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03160 2024-12-05 cs.CL 70%

Byte BPE Tokenization as an Inverse string Homomorphism

Saibo Geng, Sankalp Gambhir, Chris Wendler, Robert West

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08688 2024-12-05 cs.CV cs.AI 70%

Chain-of-Restoration: Multi-Task Image Restoration Models are Zero-Shot Step-by-Step Universal Image Restorers

Jin Cao, Deyu Meng, Xiangyong Cao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments code: https://github.com/toummHus/Chain-of-Restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00657 2024-12-03 cs.IR cs.AI 70%

Improving Vietnamese Legal Document Retrieval using Synthetic Data

Son Pham Tien, Hieu Nguyen Doan, An Nguyen Dai, Sang Dinh Viet

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17607 2024-12-03 cs.CL cs.SD eess.AS 70%

Scaling Speech-Text Pre-training with Synthetic Interleaved Data

Aohan Zeng, Zhengxiao Du, Mingdao Liu, Lei Zhang, Shengmin Jiang, Yuxiao Dong, Jie Tang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04885 2024-12-02 cs.LG 70%

TimeGPT in Load Forecasting: A Large Time Series Model Perspective

Wenlong Liao, Fernando Porte-Agel, Jiannong Fang, Christian Rehtanz, Shouxiang Wang, Dechang Yang, Zhe Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 10 pages. It was published in Applied Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18807 2024-12-02 cs.CV cs.CL 70%

Reconstructing Animals and the Wild

Peter Kulits, Michael J. Black, Silvia Zuffi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 12 pages; project page: https://raw.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15143 2024-11-26 cs.SE cs.AI cs.PL 70%

dafny-annotator: AI-Assisted Verification of Dafny Programs

Gabriel Poesia, Chloe Loughridge, Nada Amin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07921 2024-11-26 cs.CL 70%

AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs

Zeyi Liao, Huan Sun

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published as a conference paper at COLM 2024 (https://colmweb.org/index.html)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13653 2024-11-22 cs.AI stat.ML 70%

No Free Delivery Service: Epistemic limits of passive data collection in complex social systems

Maximilian Nickel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments To appear in NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13534 2024-11-21 cs.CL 70%

Predictive Insights into LGBTQ+ Minority Stress: A Transductive Exploration of Social Media Discourse

S. Chapagain, Y. Zhao, T. K. Rohleen, S. M. Hamdi, S. F. Boubrahimi, R. E. Flinn, E. M. Lund, D. Klooster, J. R. Scheer, C. J. Cascalheira

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments This paper is accepted in 2024 IEEE 11th International Conference on Data Science and Advanced Analytics (DSAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22587 2024-11-19 cs.CL 70%

Toxicity of the Commons: Curating Open-Source Pre-Training Data

Catherine Arnett, Eliot Jones, Ivan P. Yamshchikov, Pierre-Carl Langlais

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13800 2024-11-18 cs.CV cs.AI 70%

Dense Connector for MLLMs

Huanjin Yao, Wenhao Wu, Taojiannan Yang, YuXin Song, Mengxi Zhang, Haocheng Feng, Yifan Sun, Zhiheng Li, Wanli Ouyang, Jingdong Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 27 pages, NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08719 2024-11-14 cs.LG 70%

Balancing Speed and Stability: The Trade-offs of FP8 vs. BF16 Training in LLMs

Kazuki Fujii, Taishi Nakamura, Rio Yokota

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 2 pages,extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏