arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2109.02966 2021-09-16 cs.CL 74%

FH-SWF SG at GermEval 2021: Using Transformer-Based Language Models to Identify Toxic, Engaging, & Fact-Claiming Comments

Christian Gawron, Sebastian Schmidt

专题命中 预训练与数据 :language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01797 2021-06-15 cs.CL 74%

TVDIM: Enhancing Image Self-Supervised Pretraining via Noisy Text Data

Pengda Qin, Yuhong Li, Kefeng Deng, Qiang Wu

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.10213 2021-05-24 cs.LG 74%

GAN pretraining for deep convolutional autoencoders applied to Software-based Fingerprint Presentation Attack Detection

Tobias Rohrer, Jascha Kolberg

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.11098 2021-05-04 cs.CL 74%

Mechanisms for Handling Nested Dependencies in Neural-Network Language Models and Humans

Yair Lakretz, Dieuwke Hupkes, Alessandra Vergallito, Marco Marelli, Marco Baroni, Stanislas Dehaene

专题命中 预训练与数据 :language model(title);分类 cs.CL

Journal ref Lakretz et al. (2021), Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14899 2021-05-03 cs.IR cs.AI 74%

Improving Conversational Recommendation System by Pretraining on Billions Scale of Knowledge Graph

Chi-Man Wong, Fan Feng, Wen Zhang, Chi-Man Vong, Hui Chen, Yichi Zhang, Peng He, Huan Chen, Kun Zhao, Huajun Chen

专题命中 预训练与数据 :pretraining(title);分类 cs.AI

Comments Paper is accepted by ICDE2021 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10661 2021-04-22 cs.CL 74%

Towards Automated Psychotherapy via Language Modeling

Houjun Liu

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01572 2021-04-06 cs.CL 74%

TransfoRNN: Capturing the Sequential Information in Self-Attention Representations for Language Modeling

Tze Yuang Chong, Xuyang Wang, Lin Yang, Junjie Wang

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments INTERSPEECH 2021 (under reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02049 2021-04-01 cs.CV cs.LG cs.NE 74%

FBNetV3: Joint Architecture-Recipe Search using Predictor Pretraining

Xiaoliang Dai, Alvin Wan, Peizhao Zhang, Bichen Wu, Zijian He, Zhen Wei, Kan Chen, Yuandong Tian, Matthew Yu, Peter Vajda, Joseph E. Gonzalez

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01988 2021-03-08 cs.CV cs.AI 74%

Self-supervised Pretraining of Visual Features in the Wild

Priya Goyal, Mathilde Caron, Benjamin Lefaudeux, Min Xu, Pengchao Wang, Vivek Pai, Mannat Singh, Vitaliy Liptchinsky, Ishan Misra, Armand Joulin, Piotr Bojanowski

专题命中 预训练与数据 :pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01032 2021-03-02 cs.CL cs.SD eess.AS q-bio.NC 74%

Inductive biases, pretraining and fine-tuning jointly account for brain responses to speech

Juliette Millet, Jean-Remi King

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09681 2021-02-22 cs.CL cs.IR 74%

WebRED: Effective Pretraining And Finetuning For Relation Extraction On The Web

Robert Ormandi, Mohammad Saleh, Erin Winter, Vinay Rao

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.12401 2020-10-26 cs.CL 74%

Pretraining and Fine-Tuning Strategies for Sentiment Analysis of Latvian Tweets

Gaurish Thakkar, Marcis Pinnis

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09144 2020-10-12 cs.CL 74%

PTT5: Pretraining and validating the T5 model on Brazilian Portuguese data

Diedre Carmo, Marcos Piau, Israel Campiotti, Rodrigo Nogueira, Roberto Lotufo

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02016 2020-09-22 cs.CL 74%

A Hierarchical Network for Abstractive Meeting Summarization with Cross-Domain Pretraining

Chenguang Zhu, Ruochen Xu, Michael Zeng, Xuedong Huang

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments Accepted in Empirical Methods in Natural Language Processing (EMNLP), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.03979 2020-08-12 cs.CL 74%

KR-BERT: A Small-Scale Korean-Specific Language Model

Sangah Lee, Hansol Jang, Yunmee Baik, Suzi Park, Hyopil Shin

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.01912 2020-06-04 cs.CL 74%

On the Predictive Power of Neural Language Models for Human Real-Time Comprehension Behavior

Ethan Gotlieb Wilcox, Jon Gauthier, Jennifer Hu, Peng Qian, Roger Levy

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments To Appear at CogSci 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.14613 2020-06-01 cs.CL cs.IR 74%

Using Large Pretrained Language Models for Answering User Queries from Product Specifications

Kalyani Roy, Smit Shah, Nithish Pai, Jaidam Ramtej, Prajit Prashant Nadkarn, Jyotirmoy Banerjee, Pawan Goyal, Surender Kumar

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.13525 2020-03-31 cs.CV cs.LG 74%

Improving out-of-distribution generalization via multi-task self-supervised pretraining

Isabela Albuquerque, Nikhil Naik, Junnan Li, Nitish Keskar, Richard Socher

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10169 2019-12-24 cs.CL 74%

A Comparison of Architectures and Pretraining Methods for Contextualized Multilingual Word Embeddings

Niels van der Heijden, Samira Abnar, Ekaterina Shutova

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.00111 2019-09-04 cs.CL 74%

Quantity doesn't buy quality syntax with neural language models

Marten van Schijndel, Aaron Mueller, Tal Linzen

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments Accepted for presentation at EMNLP-IJCNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.02265 2019-08-07 cs.CV cs.CL 74%

ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks

Jiasen Lu, Dhruv Batra, Devi Parikh, Stefan Lee

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.02062 2018-11-07 cs.CL cs.SD eess.AS 74%

End-to-End Monaural Multi-speaker ASR System without Pretraining

Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments submitted to ICASSP2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.02076 2017-10-06 cs.CL 74%

On the Effective Use of Pretraining for Natural Language Inference

Ignacio Cases, Minh-Thang Luong, Christopher Potts

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments This manuscript dates from late Winter 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.04565 2017-08-22 cs.CL 74%

Neural Paraphrase Identification of Questions with Noisy Pretraining

Gaurav Singh Tomar, Thyago Duque, Oscar Täckström, Jakob Uszkoreit, Dipanjan Das

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.08702 2017-01-31 cs.CL 74%

Bangla Word Clustering Based on Tri-gram, 4-gram and 5-gram Language Model

Dipaloke Saha, Md Saddam Hossain, MD. Saiful Islam, Sabir Ismail

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26194 2026-08-28 cs.CL cs.AI cs.IR 新提交 73%

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

用于协调异构语音和文本检索器的重排序器

Inho Kim, Sumyeong Ahn

机构 * Korea Institute of Energy Technology(韩国能源技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态RAG数据库场景,提出STeReO重排序器,构建专用数据集训练后,可有效聚合异构检索结果,显著提升下游问答性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26163 2026-08-28 cs.CL cs.AI cs.HC cs.MA cs.SD 新提交 73%

From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents

从声音到症状:面向对话式医疗智能体的实时呼吸信号理解

Tanmay Laud, Herprit Mahal, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出面向对话式医疗智能体的HealthCUES系统,可实时检测分析咳嗽等呼吸信号,经内部与外部数据集评估及医疗人员验证,性能优异且具临床实用性。

Comments Accepted for publication at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-27 cs.CL cs.LG 版本更新 73%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-08-27 cs.CL cs.LG 版本更新 73%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23391 2026-08-26 cs.CL cs.AI 版本更新 73%

Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data

无域内训练数据的跨域多任务数据到文本生成

Yifei Song, Kun Efimov-Zhang, Claire Gardent

机构 * CNRS/LORIA(法国国家科学研究中心/洛林计算机科学与应用实验室) Université de Lorraine(洛林大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出数据驱动知识蒸馏(DDKD)及保结构增强方法,在无域内训练数据的跨域多任务数据到文本生成任务中,17亿参数的DDKD性能优于零样本推理与微调,且构建了QUINTD-5数据集。

Comments Accepted by EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏