arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2312.17581 2024-01-09 cs.CL cs.AI 73%

Action-Item-Driven Summarization of Long Meeting Transcripts

Logan Golia, Jugal Kalita

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted into the 7th International Conference on Natural Language Processing and Information Retrieval (NLPIR 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14977 2023-12-27 cs.LG cs.AI 73%

Diffusion Models for Generative Artificial Intelligence: An Introduction for Applied Mathematicians

Catherine F. Higham, Desmond J. Higham, Peter Grindrod

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08836 2023-12-12 cs.CL cs.AI cs.CY 73%

Bias and Fairness in Chatbots: An Overview

Jintang Xue, Yun-Cheng Wang, Chengwei Wei, Xiaofeng Liu, Jonghye Woo, C. -C. Jay Kuo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04318 2023-12-08 cs.AI cs.LG 73%

MIMo: A Multi-Modal Infant Model for Studying Cognitive Development

Dominik Mattern, Pierre Schumacher, Francisco M. López, Marcel C. Raabe, Markus R. Ernst, Arthur Aubret, Jochen Triesch

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 8 figures. Submitted to IEEE Transactions on Congnitive and Developmental Systems (TCDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02431 2023-12-06 cs.CL cs.AI 73%

Visually Grounded Language Learning: a review of language games, datasets, tasks, and models

Alessandro Suglia, Ioannis Konstas, Oliver Lemon

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Preprint for JAIR before copyediting

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11845 2023-11-28 cs.CL cs.AI cs.CV q-fin.CP 73%

Multimodal Document Analytics for Banking Process Automation

Christopher Gerling, Stefan Lessmann

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments A Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05317 2023-11-14 cs.CL cs.AI 73%

Task-Adaptive Tokenization: Enhancing Long-Form Text Generation Efficacy in Mental Health and Beyond

Siyang Liu, Naihao Deng, Sahand Sabour, Yilin Jia, Minlie Huang, Rada Mihalcea

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at the main conference of The 2023 Conference on Empirical Methods in Natural Language Processing; 8 pages

Journal ref The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13169 2023-11-14 cs.CL cs.LG 73%

A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity

Shayne Longpre, Gregory Yauney, Emily Reif, Katherine Lee, Adam Roberts, Barret Zoph, Denny Zhou, Jason Wei, Kevin Robinson, David Mimno, Daphne Ippolito

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20280 2023-11-03 cs.LG cs.AI 73%

AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data

Santosh Palaskar, Vijay Ekambaram, Arindam Jati, Neelamadhav Gantayat, Avirup Saha, Seema Nagar, Nam H. Nguyen, Pankaj Dayama, Renuka Sindhgatta, Prateeti Mohapatra, Harshit Kumar, Jayant Kalagnanam, Nandyala Hemachandra, Narayan Rangaraj

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted in the Thirty-Sixth Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19420 2023-10-31 cs.CL cs.LG 73%

Mean BERTs make erratic language teachers: the effectiveness of latent bootstrapping in low-resource settings

David Samuel

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments submission to the BabyLM shared at CoNLL (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18262 2023-10-31 cs.LG cs.AI 73%

Beyond Confidence: Reliable Models Should Also Consider Atypicality

Mert Yuksekgonul, Linjun Zhang, James Zou, Carlos Guestrin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Published at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16999 2023-10-31 cs.CV cs.AI cs.LG 73%

Three Towers: Flexible Contrastive Learning with Pretrained Image Models

Jannik Kossen, Mark Collier, Basil Mustafa, Xiao Wang, Xiaohua Zhai, Lucas Beyer, Andreas Steiner, Jesse Berent, Rodolphe Jenatton, Efi Kokiopoulou

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18076 2023-10-30 cs.CL cs.AI 73%

Knowledge Corpus Error in Question Answering

Yejoon Lee, Philhoon Oh, James Thorne

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14777 2023-10-24 cs.CL cs.LG 73%

Geographical Erasure in Language Generation

Pola Schwöbel, Jacek Golebiowski, Michele Donini, Cédric Archambeau, Danish Pruthi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02239 2023-10-24 cs.CL cs.AI 73%

The Benefits of Label-Description Training for Zero-Shot Text Classification

Lingyu Gao, Debanjan Ghosh, Kevin Gimpel

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted at the EMNLP 2023 main conference (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14108 2023-10-24 cs.LG cs.AI cs.CV 73%

CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement

Mohammadreza Salehi, Mehrdad Farajtabar, Maxwell Horton, Fartash Faghri, Hadi Pouransari, Raviteja Vemulapalli, Oncel Tuzel, Ali Farhadi, Mohammad Rastegari, Sachin Mehta

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13006 2023-10-23 cs.SE cs.AI cs.IR cs.LG 73%

Software Metadata Classification based on Generative Artificial Intelligence

Seetharam Killivalavan, Durairaj Thenmozhi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments FIRE Track: Information Retrieval in Software Engineering (IRSE), 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11649 2023-10-19 cs.RO cs.AI cs.CL cs.FL 73%

Grounding Complex Natural Language Commands for Temporal Tasks in Unseen Environments

Jason Xinyu Liu, Ziyi Yang, Ifrah Idrees, Sam Liang, Benjamin Schornstein, Stefanie Tellex, Ankit Shah

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Conference on Robot Learning 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16424 2023-09-29 cs.CL cs.AI cs.SI 73%

Prompt-and-Align: Prompt-Based Social Alignment for Few-Shot Fake News Detection

Jiaying Wu, Shen Li, Ailin Deng, Miao Xiong, Bryan Hooi

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to CIKM 2023 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14091 2023-09-29 cs.CL cs.AI 73%

Revisiting Acceptability Judgements

Hai Hu, Ziyin Zhang, Weifang Huang, Jackie Yan-Ki Lai, Aini Li, Yina Patterson, Jiahui Huang, Peng Zhang, Chien-Jer Charles Lin, Rui Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05668 2023-09-13 cs.CL cs.AI 73%

Studying the impacts of pre-training using ChatGPT-generated text on downstream tasks

Sarthak Anand

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10802 2023-09-06 cs.CR cs.CL cs.LG 73%

Combing for Credentials: Active Pattern Extraction from Smart Reply

Bargav Jayaraman, Esha Ghosh, Melissa Chase, Sambuddha Roy, Wei Dai, David Evans

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00638 2023-09-06 q-fin.TR cs.AI cs.LG q-fin.CP 73%

Generative AI for End-to-End Limit Order Book Modelling: A Token-Level Autoregressive Generative Model of Message Flow Using a Deep State Space Network

Peer Nagy, Sascha Frey, Silvia Sapora, Kang Li, Anisoara Calinescu, Stefan Zohren, Jakob Foerster

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13517 2023-08-28 cs.CL cs.AI 73%

ChatGPT as Data Augmentation for Compositional Generalization: A Case Study in Open Intent Detection

Yihao Fang, Xianzhi Li, Stephen W. Thomas, Xiaodan Zhu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref Proceedings of the Joint Workshop of the 5th Financial Technology and Natural Language Processing (FinNLP) and 2nd Multimodal AI For Financial Forecasting (Muffin), Macao, August 20, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07240 2023-08-25 cs.CV cs.AI cs.LG 73%

Test-Time Adaptation for Visual Document Understanding

Sayna Ebrahimi, Sercan O. Arik, Tomas Pfister

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted at TMLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.01066 2023-08-15 cs.CL cs.LG 73%

What Can Transformers Learn In-Context? A Case Study of Simple Function Classes

Shivam Garg, Dimitris Tsipras, Percy Liang, Gregory Valiant

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12820 2023-08-09 cs.CL cs.AI 73%

MultiTabQA: Generating Tabular Answers for Multi-Table Question Answering

Vaishali Pal, Andrew Yates, Evangelos Kanoulas, Maarten de Rijke

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL-2023

Journal ref In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2023, pages 6322-6334, Toronto, Canada. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15818 2023-08-01 cs.RO cs.CL cs.CV cs.LG 73%

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn, Pete Florence, Chuyuan Fu, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Kehang Han, Karol Hausman, Alexander Herzog, Jasmine Hsu, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Lisa Lee, Tsang-Wei Edward Lee, Sergey Levine, Yao Lu, Henryk Michalewski, Igor Mordatch, Karl Pertsch, Kanishka Rao, Krista Reymann, Michael Ryoo, Grecia Salazar, Pannag Sanketi, Pierre Sermanet, Jaspiar Singh, Anikait Singh, Radu Soricut, Huong Tran, Vincent Vanhoucke, Quan Vuong, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Jialin Wu, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, Brianna Zitkovich

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Website: https://robotics-transformer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02486 2023-07-20 cs.CL cs.LG 73%

LongNet: Scaling Transformers to 1,000,000,000 Tokens

Jiayu Ding, Shuming Ma, Li Dong, Xingxing Zhang, Shaohan Huang, Wenhui Wang, Nanning Zheng, Furu Wei

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10444 2023-06-21 cs.CL cs.AI 73%

Universal Information Extraction with Meta-Pretrained Self-Retrieval

Xin Cong. Bowen Yu, Mengcheng Fang, Tingwen Liu, Haiyang Yu, Zhongkai Hu, Fei Huang, Yongbin Li, Bin Wang

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏