arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2312.15316 2024-01-18 cs.CL eess.AS 89%

Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue

Guan-Ting Lin, Prashanth Gurunath Shivakumar, Ankur Gandhe, Chao-Han Huck Yang, Yile Gu, Shalini Ghosh, Andreas Stolcke, Hung-yi Lee, Ivan Bulyko

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ICASSP 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02033 2023-12-21 cs.LG cs.DB cs.DC 89%

Data-Juicer: A One-Stop Data Processing System for Large Language Models

Daoyuan Chen, Yilun Huang, Zhijian Ma, Hesen Chen, Xuchen Pan, Ce Ge, Dawei Gao, Yuexiang Xie, Zhaoyang Liu, Jinyang Gao, Yaliang Li, Bolin Ding, Jingren Zhou

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 20 Pages, 10 figures, 9 tables. The system, data recipes, and demos are continuously maintained at https://github.com/alibaba/data-juicer

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11920 2023-12-20 cs.CL 89%

External Knowledge Augmented Polyphone Disambiguation Using Large Language Model

Chen Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02969 2023-12-06 cs.CL cs.IR 89%

Rank-without-GPT: Building GPT-Independent Listwise Rerankers on Open-Source Large Language Models

Xinyu Zhang, Sebastian Hofstätter, Patrick Lewis, Raphael Tang, Jimmy Lin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13240 2023-11-23 cs.CL 89%

On the Calibration of Large Language Models and Alignment

Chiwei Zhu, Benfeng Xu, Quan Wang, Yongdong Zhang, Zhendong Mao

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments to be published in findings of EMNLP-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04134 2023-10-18 cs.AI cs.NE 89%

Artificial Neuropsychology: Are Large Language Models Developing Executive Functions?

Hernan Ceferino Vazquez

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments The article on ArXiv is a translation of the original Spanish work. Upon review, we realized that crucial nuances and details were lost or misrepresented in the translation, affecting the results and conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05126 2023-10-10 cs.CV cs.AI 89%

UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model

Jiabo Ye, Anwen Hu, Haiyang Xu, Qinghao Ye, Ming Yan, Guohai Xu, Chenliang Li, Junfeng Tian, Qi Qian, Ji Zhang, Qin Jin, Liang He, Xin Alex Lin, Fei Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10428 2023-10-10 cs.CL 89%

GPT-NER: Named Entity Recognition via Large Language Models

Shuhe Wang, Xiaofei Sun, Xiaoya Li, Rongbin Ouyang, Fei Wu, Tianwei Zhang, Jiwei Li, Guoyin Wang

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13963 2023-09-27 eess.AS cs.CL cs.SD 89%

Connecting Speech Encoder and Large Language Model for ASR

Wenyi Yu, Changli Tang, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14991 2023-09-13 cs.SE cs.AI 89%

Multilingual Code Co-Evolution Using Large Language Models

Jiyang Zhang, Pengyu Nie, Junyi Jessy Li, Milos Gligoric

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments FSE 2023 (camera ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06507 2023-08-15 cs.CL 89%

AutoConv: Automatically Generating Information-seeking Conversations with Large Language Models

Siheng Li, Cheng Yang, Yichun Yin, Xinyu Zhu, Zesen Cheng, Lifeng Shang, Xin Jiang, Qun Liu, Yujiu Yang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to ACL 2023 Main Conference (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09814 2023-06-19 eess.AS cs.CL 89%

Investigating the Utility of Surprisal from Large Language Models for Speech Synthesis Prosody

Sofoklis Kakouros, Juraj Šimko, Martti Vainio, Antti Suni

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at SSW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07899 2023-06-14 cs.CL cs.CY 89%

Artificial Artificial Artificial Intelligence: Crowd Workers Widely Use Large Language Models for Text Production Tasks

Veniamin Veselovsky, Manoel Horta Ribeiro, Robert West

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04980 2023-06-09 cs.CL cs.SD eess.AS 89%

Assessing Phrase Break of ESL Speech with Pre-trained Language Models and Large Language Models

Zhiyi Wang, Shaoguang Mao, Wenshan Wu, Yan Xia, Yan Deng, Jonathan Tien

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by InterSpeech 2023. arXiv admin note: substantial text overlap with arXiv:2210.16029

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03809 2023-06-07 cs.CY cs.AI 89%

Can large language models democratize access to dual-use biotechnology?

Emily H. Soice, Rafael Rocha, Kimberlee Cordova, Michael Specter, Kevin M. Esvelt

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 6 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07830 2023-05-23 cs.CL 89%

Prompting Language Models for Linguistic Structure

Terra Blevins, Hila Gonen, Luke Zettlemoyer

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13047 2023-05-19 cs.CL 89%

AugESC: Dialogue Augmentation with Large Language Models for Emotional Support Conversation

Chujie Zheng, Sahand Sabour, Jiaxin Wen, Zheng Zhang, Minlie Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

Comments Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09268 2023-02-21 cs.CL 89%

Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE

Qihuang Zhong, Liang Ding, Keqin Peng, Juhua Liu, Bo Du, Li Shen, Yibing Zhan, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

Comments Technical report. arXiv admin note: text overlap with arXiv:2212.01853

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06710 2023-01-24 cs.CL 89%

Large Language Models are few(1)-shot Table Reasoners

Wenhu Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01853 2022-12-06 cs.CL 89%

Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE

Qihuang Zhong, Liang Ding, Yibing Zhan, Yu Qiao, Yonggang Wen, Li Shen, Juhua Liu, Baosheng Yu, Bo Du, Yixin Chen, Xinbo Gao, Chunyan Miao, Xiaoou Tang, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);foundation model(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12302 2022-10-25 cs.CL 89%

What do Large Language Models Learn beyond Language?

Avinash Madasu, Shashank Srivastava

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments Accepted at the Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10841 2022-10-21 cs.CL cs.CV 89%

Prompting through Prototype: A Prototype-based Prompt Learning on Pretrained Vision-Language Models

Yue Zhang, Hongliang Fei, Dingcheng Li, Tan Yu, Ping Li

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03905 2022-04-25 cs.CL 89%

BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Hongyi Yuan, Zheng Yuan, Ruyi Gan, Jiaxing Zhang, Yutao Xie, Sheng Yu

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted by BioNLP 2022, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 89%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20630 2026-07-24 cs.DB cs.AI cs.CL 新提交 89%

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。

Comments Accepted by VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00274 2026-07-02 cs.CL cs.AI 新提交 89%

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

SEFORA:学生论文反馈语料库及LLM反馈评估框架

Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。

Comments Under review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22079 2026-06-23 cs.CL cs.LG 新提交 89%

Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining

信号在哪里?医学编码器预训练的网页数据配方

Bofeng Huang, Jacques Sun, Diane Bouchacourt, Nicolas Barascud, Fajwel Fogel

机构 * Doctolib

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对医学领域编码器预训练数据稀缺问题,提出医学术语密度过滤和信号放大改写两种互补方法,在法语医学NLP上构建FineMed语料库和DoctoBERT编码器,性能优于现有方法。

Comments Code, models, and data: https://github.com/doctolib-lab/doctobert

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22108 2026-06-15 cs.LG cs.AI 版本更新 89%

Learning What to Predict: Downstream-Guided Task Design for Continued Pretraining

学习预测什么:下游引导的持续预训练任务设计

Shuqi Ke, Giulia Fanti

机构 * Department of ECE(电子工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 89%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27379 2026-05-29 cs.AI cs.CL 89%

Soro: A Lightweight Foundation Model and Chatbot for Tajik

Soro: 一种轻量级塔吉克语基础模型与聊天机器人

Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shoymardonov, Shuhratjon Khalilbekov, Bonu Boboeva

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对塔吉克斯坦计算和连接受限环境,提出基于Gemma 3的塔吉克语专用对话大语言模型Soro,通过持续预训练和监督微调,在塔吉克语基准测试上显著优于同尺寸基线,并支持量化部署。

详情

展开后加载摘要…

URL PDF HTML 收藏