arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2305.02555 2023-06-21 cs.LG cs.AI cs.CY cs.HC 73%

Should ChatGPT and Bard Share Revenue with Their Data Providers? A New Business Model for the AI Era

Dong Zhang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 8 figures, 2 tables, Published in Advances in Artificial Intelligence and Machine Learning, minor revision made

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09594 2023-06-19 cs.CL cs.AI 73%

CMLM-CSE: Based on Conditional MLM Contrastive Learning for Sentence Embeddings

Wei Zhang, Xu Chen

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07790 2023-06-14 cs.CL cs.AI 73%

NoCoLA: The Norwegian Corpus of Linguistic Acceptability

Matias Jentoft, David Samuel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published at NoDaLiDa 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04835 2023-06-12 cs.CL cs.AI 73%

How Do In-Context Examples Affect Compositional Generalization?

Shengnan An, Zeqi Lin, Qiang Fu, Bei Chen, Nanning Zheng, Jian-Guang Lou, Dongmei Zhang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2023 main conference, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04787 2023-06-09 cs.CL cs.LG 73%

Absformer: Transformer-based Model for Unsupervised Multi-Document Abstractive Summarization

Mohamed Trabelsi, Huseyin Uzunalioglu

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments ICDAR 2023 International Workshop on Machine Learning (WML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02978 2023-06-06 cs.CL cs.AI 73%

Which Argumentative Aspects of Hate Speech in Social Media can be reliably identified?

Damián Furman, Pablo Torres, José A. Rodríguez, Diego Letzen, Vanina Martínez, Laura Alonso Alemany

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 Pages plus reference and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09865 2023-06-06 cs.CL cs.AI 73%

Z-ICL: Zero-Shot In-Context Learning with Pseudo-Demonstrations

Xinxi Lyu, Sewon Min, Iz Beltagy, Luke Zettlemoyer, Hannaneh Hajishirzi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages; 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18623 2023-05-31 cs.LG cs.CL 73%

Alfred: A System for Prompted Weak Supervision

Peilin Yu, Stephen H. Bach

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments ACL 2023 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12740 2023-05-30 cs.LG cs.AI 73%

Masked Autoencoding for Scalable and Generalizable Decision Making

Fangchen Liu, Hao Liu, Aditya Grover, Pieter Abbeel

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06358 2023-05-12 cs.AI cs.CL 73%

Accessible Instruction-Following Agent

Kairui Zhou

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08810 2023-05-11 cs.PL cs.CL cs.LG cs.SE 73%

GAP-Gen: Guided Automatic Python Code Generation

Junchen Zhao, Yurun Song, Junlin Wang, Ian G. Harris

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics: Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15259 2023-05-10 cs.LG cs.AI cs.CR 73%

On the Impossible Safety of Large AI Models

El-Mahdi El-Mhamdi, Sadegh Farhadkhani, Rachid Guerraoui, Nirupam Gupta, Lê-Nguyên Hoang, Rafael Pinot, Sébastien Rouault, John Stephan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13518 2023-03-24 cs.CV cs.AI cs.LG 73%

Three ways to improve feature alignment for open vocabulary detection

Relja Arandjelović, Alex Andonian, Arthur Mensch, Olivier J. Hénaff, Jean-Baptiste Alayrac, Andrew Zisserman

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12860 2023-03-24 cs.CL cs.AI 73%

Salient Span Masking for Temporal Understanding

Jeremy R. Cole, Aditi Chaudhary, Bhuwan Dhingra, Partha Talukdar

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments 5 pages 1 figure, to appear in EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15162 2023-03-10 cs.CL cs.LG 73%

Linearly Mapping from Image to Text Space

Jack Merullo, Louis Castricato, Carsten Eickhoff, Ellie Pavlick

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Accepted at ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.09697 2023-03-09 cs.LG cs.CL 73%

Effects of Parameter Norm Growth During Transformer Training: Inductive Bias from Gradient Descent

William Merrill, Vivek Ramanujan, Yoav Goldberg, Roy Schwartz, Noah Smith

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Appeared at EMNLP 2021. March 7, 2023: Removed irreproducible numbers reported in a footnote with erratum note

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03915 2023-03-08 cs.CL cs.AI 73%

The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset

Hugo Laurençon, Lucile Saulnier, Thomas Wang, Christopher Akiki, Albert Villanova del Moral, Teven Le Scao, Leandro Von Werra, Chenghao Mou, Eduardo González Ponferrada, Huu Nguyen, Jörg Frohberg, Mario Šaško, Quentin Lhoest, Angelina McMillan-Major, Gerard Dupont, Stella Biderman, Anna Rogers, Loubna Ben allal, Francesco De Toni, Giada Pistilli, Olivier Nguyen, Somaieh Nikpoor, Maraim Masoud, Pierre Colombo, Javier de la Rosa, Paulo Villegas, Tristan Thrush, Shayne Longpre, Sebastian Nagel, Leon Weber, Manuel Muñoz, Jian Zhu, Daniel Van Strien, Zaid Alyafeai, Khalid Almubarak, Minh Chien Vu, Itziar Gonzalez-Dios, Aitor Soroa, Kyle Lo, Manan Dey, Pedro Ortiz Suarez, Aaron Gokaslan, Shamik Bose, David Adelani, Long Phan, Hieu Tran, Ian Yu, Suhas Pai, Jenny Chim, Violette Lepercq, Suzana Ilic, Margaret Mitchell, Sasha Alexandra Luccioni, Yacine Jernite

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2022, Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03988 2023-02-27 cs.SE cs.AI cs.LG 73%

SantaCoder: don't reach for the stars!

Loubna Ben Allal, Raymond Li, Denis Kocetkov, Chenghao Mou, Christopher Akiki, Carlos Munoz Ferrandis, Niklas Muennighoff, Mayank Mishra, Alex Gu, Manan Dey, Logesh Kumar Umapathi, Carolyn Jane Anderson, Yangtian Zi, Joel Lamy Poirier, Hailey Schoelkopf, Sergey Troshin, Dmitry Abulkhanov, Manuel Romero, Michael Lappert, Francesco De Toni, Bernardo García del Río, Qian Liu, Shamik Bose, Urvashi Bhattacharyya, Terry Yue Zhuo, Ian Yu, Paulo Villegas, Marco Zocca, Sourab Mangrulkar, David Lansky, Huu Nguyen, Danish Contractor, Luis Villa, Jia Li, Dzmitry Bahdanau, Yacine Jernite, Sean Hughes, Daniel Fried, Arjun Guha, Harm de Vries, Leandro von Werra

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05055 2023-02-20 cs.LG cs.CL cs.CV 73%

Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints

Aran Komatsuzaki, Joan Puigcerver, James Lee-Thorp, Carlos Riquelme Ruiz, Basil Mustafa, Joshua Ainslie, Yi Tay, Mostafa Dehghani, Neil Houlsby

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10481 2023-02-07 cs.CL cs.LG 73%

FewShotTextGCN: K-hop neighborhood regularization for few-shot learning on graphs

Niels van der Heijden, Ekaterina Shutova, Helen Yannakoudakis

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 8 pages, 4 figures, EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.15101 2022-12-23 cs.CL cs.LG cs.NE 73%

Compositional generalization in semantic parsing with pretrained transformers

A. Emin Orhan

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments v3 adds one reference, adds further discussion, slightly changes formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15212 2022-11-28 cs.CL cs.IR cs.LG 73%

COCO-DR: Combating Distribution Shifts in Zero-Shot Dense Retrieval with Contrastive and Distributionally Robust Learning

Yue Yu, Chenyan Xiong, Si Sun, Chao Zhang, Arnold Overwijk

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2022 (Main Conference). The code and Model can be found at https://github.com/OpenMatch/COCO-DR

Journal ref EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01780 2022-11-04 cs.LG cs.CL cs.PL 73%

CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning

Hung Le, Yue Wang, Akhilesh Deepak Gotmare, Silvio Savarese, Steven C. H. Hoi

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments An earlier version of the work was accepted to NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12574 2022-10-25 cs.CL cs.LG 73%

The Curious Case of Absolute Position Embeddings

Koustuv Sinha, Amirhossein Kazemnejad, Siva Reddy, Joelle Pineau, Dieuwke Hupkes, Adina Williams

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Accepted at EMNLP 2022 Findings; 5 pages and 15 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06423 2022-10-20 cs.LG cs.CL cs.CV 73%

Foundation Transformers

Hongyu Wang, Shuming Ma, Shaohan Huang, Li Dong, Wenhui Wang, Zhiliang Peng, Yu Wu, Payal Bajaj, Saksham Singhal, Alon Benhaim, Barun Patra, Zhun Liu, Vishrav Chaudhary, Xia Song, Furu Wei

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02833 2022-10-07 cs.IR cs.CL cs.LG cs.SD eess.AS 73%

Matching Text and Audio Embeddings: Exploring Transfer-learning Strategies for Language-based Audio Retrieval

Benno Weck, Miguel Pérez Fernández, Holger Kirchhoff, Xavier Serra

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 5 pages, 2 figures. Accepted at Detection and Classification of Acoustic Scenes and Events 2022 (DCASE2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00278 2022-09-02 cs.CL cs.AI 73%

Enhancing Semantic Understanding with Self-supervised Methods for Abstractive Dialogue Summarization

Hyunjae Lee, Jaewoong Yun, Hyunjin Choi, Seongho Joe, Youngjune L. Gwon

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 3 figures, INTERSPEECH 2021

Journal ref Proc. Interspeech 2021, 796-800 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00399 2022-08-17 cs.CL cs.AI 73%

Neural Knowledge Bank for Pretrained Transformers

Damai Dai, Wenbin Jiang, Qingxiu Dong, Yajuan Lyu, Qiaoqiao She, Zhifang Sui

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05607 2022-07-14 cs.LG cs.AI 73%

Online Decision Transformer

Qinqing Zheng, Amy Zhang, Aditya Grover

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2022 (Long Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.01094 2022-07-13 eess.AS cs.CL cs.LG cs.SD 73%

RescoreBERT: Discriminative Speech Recognition Rescoring with BERT

Liyan Xu, Yile Gu, Jari Kolehmainen, Haidar Khan, Ankur Gandhe, Ariya Rastrow, Andreas Stolcke, Ivan Bulyko

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICASSP 2022

Journal ref Proc. IEEE ICASSP, May 2022, pp. 6617-6121

详情

展开后加载摘要…

URL PDF HTML 收藏