arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2302.09268 2023-02-21 cs.CL 89%

Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE

Qihuang Zhong, Liang Ding, Keqin Peng, Juhua Liu, Bo Du, Li Shen, Yibing Zhan, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

Comments Technical report. arXiv admin note: text overlap with arXiv:2212.01853

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06710 2023-01-24 cs.CL 89%

Large Language Models are few(1)-shot Table Reasoners

Wenhu Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01853 2022-12-06 cs.CL 89%

Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE

Qihuang Zhong, Liang Ding, Yibing Zhan, Yu Qiao, Yonggang Wen, Li Shen, Juhua Liu, Baosheng Yu, Bo Du, Yixin Chen, Xinbo Gao, Chunyan Miao, Xiaoou Tang, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);foundation model(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12302 2022-10-25 cs.CL 89%

What do Large Language Models Learn beyond Language?

Avinash Madasu, Shashank Srivastava

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments Accepted at the Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10841 2022-10-21 cs.CL cs.CV 89%

Prompting through Prototype: A Prototype-based Prompt Learning on Pretrained Vision-Language Models

Yue Zhang, Hongliang Fei, Dingcheng Li, Tan Yu, Ping Li

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03905 2022-04-25 cs.CL 89%

BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Hongyi Yuan, Zheng Yuan, Ruyi Gan, Jiaxing Zhang, Yutao Xie, Sheng Yu

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted by BioNLP 2022, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 89%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20630 2026-07-24 cs.DB cs.AI cs.CL 新提交 89%

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。

Comments Accepted by VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00274 2026-07-02 cs.CL cs.AI 新提交 89%

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

SEFORA:学生论文反馈语料库及LLM反馈评估框架

Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。

Comments Under review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22079 2026-06-23 cs.CL cs.LG 新提交 89%

Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining

信号在哪里?医学编码器预训练的网页数据配方

Bofeng Huang, Jacques Sun, Diane Bouchacourt, Nicolas Barascud, Fajwel Fogel

机构 * Doctolib

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对医学领域编码器预训练数据稀缺问题,提出医学术语密度过滤和信号放大改写两种互补方法,在法语医学NLP上构建FineMed语料库和DoctoBERT编码器,性能优于现有方法。

Comments Code, models, and data: https://github.com/doctolib-lab/doctobert

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22108 2026-06-15 cs.LG cs.AI 版本更新 89%

Learning What to Predict: Downstream-Guided Task Design for Continued Pretraining

学习预测什么:下游引导的持续预训练任务设计

Shuqi Ke, Giulia Fanti

机构 * Department of ECE(电子工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 89%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27379 2026-05-29 cs.AI cs.CL 89%

Soro: A Lightweight Foundation Model and Chatbot for Tajik

Soro: 一种轻量级塔吉克语基础模型与聊天机器人

Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shoymardonov, Shuhratjon Khalilbekov, Bonu Boboeva

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对塔吉克斯坦计算和连接受限环境,提出基于Gemma 3的塔吉克语专用对话大语言模型Soro,通过持续预训练和监督微调,在塔吉克语基准测试上显著优于同尺寸基线,并支持量化部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 89%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12452 2026-05-13 cs.CL cs.AI cs.CY 89%

The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

算法漫画:在危机事件中审计LLM生成的政治言论

Gunjan, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD), Division of Science, Computer Science Department(纽约大学(NYUAD),科学学院,计算机科学系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比真实与生成的政治言论,发现生成内容在情感强度、结构规律性和词汇框架上不如真实言论真实,提出了'漫画差距'作为评估生成内容社会真实性的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08875 2026-05-12 cs.LG cs.AI 89%

When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation

表格泄露:攻击基于大语言模型的表格数据生成中的字符串记忆化

Joshua Ward, Bochao Gu, Chi-Hua Wang, Guang Cheng

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的表格数据生成中字符串记忆化带来的隐私风险,提出LevAtt攻击方法并设计防御策略,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05227 2026-05-08 cs.LG cs.AI 89%

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

重新思考大语言模型训练中的数据整理:在线重加权优于离线方法

Wanru Zhao, Yihong Chen, Yuzhi Tang, Wentao Ma, Shengchao Hu, Shell Xu Hu, Alex Iacob, Abhinav Mehrotra, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) OATML, University of Oxford(牛津大学OATML实验室) University of Toronto(多伦多大学) Shanghai Jiao Tong University(上海交通大学) Samsung AI Center(三星人工智能中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出ADAPT框架,通过动态在线重加权提升模型泛化能力,实验显示其在指令微调和大规模预训练中优于传统离线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23475 2026-04-28 cs.LG cs.CL 89%

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

超节点和光环:LLM前馈层中的损失关键枢纽

Audrey Cherilyn, Houman Safaai

机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 89%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16423 2026-04-21 cs.LG cs.AI 89%

Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity

梯度偏移:理解防御性训练方法如何保护语言模型完整性

Satchel Grant, Victor Gillioz, Jake Ward, Thomas McGrath

机构 * Stanford University(斯坦福大学) MATS

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04781 2025-09-08 cs.CY cs.AI cs.LG 89%

The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models

Danielle Ensign, Henry Sleight, Kyle Fish

专题命中 预训练与数据 :LLM(title);large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09709 2025-04-28 cs.LG cs.CL 89%

GOFA: A Generative One-For-All Model for Joint Graph Language Modeling

Lecheng Kong, Jiarui Feng, Hao Liu, Chengsong Huang, Jiaxin Huang, Yixin Chen, Muhan Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01832 2025-01-06 cs.CL cs.LG 89%

Time Series Language Model for Descriptive Caption Generation

Mohamed Trabelsi, Aidan Boyd, Jin Cao, Huseyin Uzunalioglu

机构 * Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04646 2024-10-29 cs.CL cs.LG 89%

Efficacy of Large Language Models in Systematic Reviews

Aaditya Shah, Shridhar Mehendale, Siddha Kanthi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Both Shah and Mehendale contributed equally to this work; order of authorship is random. This paper will be published in the proceedings of The 2nd International Conference on Foundation and Large Language Models (FLLM2024) in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12425 2024-05-24 cs.CV cs.CL cs.LG 89%

The Neglected Tails in Vision-Language Models

Shubham Parashar, Zhiqiu Lin, Tian Liu, Xiangjue Dong, Yanan Li, Deva Ramanan, James Caverlee, Shu Kong

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05352 2024-01-23 cs.SE cs.AI cs.CL 89%

A Taxonomy of Foundation Model based Systems through the Lens of Software Architecture

Qinghua Lu, Liming Zhu, Xiwei Xu, Yue Liu, Zhenchang Xing, Jon Whittle

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11541 2023-12-20 cs.AI cs.CL 89%

CLIPSyntel: CLIP and LLM Synergy for Multimodal Question Summarization in Healthcare

Akash Ghosh, Arkadeep Acharya, Raghav Jain, Sriparna Saha, Aman Chadha, Setu Sinha

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03713 2026-08-12 cs.CV 版本更新 89%

Investigating Adversarial Robustness of Multi-modal Large Language Models

探究多模态大语言模型的对抗鲁棒性

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(哈利法大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 通过系统研究多模态大语言模型的对抗鲁棒性,提出诊断性CLIP对齐协议预测鲁棒视觉编码器的迁移效果,并证明端到端多模态对抗训练能显著提升模型在强对抗攻击下的性能。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 89%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30407 2026-06-09 cs.CL cs.AI cs.IR cs.LG 版本更新 89%

Exploring Autonomous Agentic Data Engineering for Model Specialization

探索用于模型专业化的自主智能体数据工程

Yujie Luo, Xiangyuan Ru, Jingsheng Zheng, Jingjing Wang, Yuqi Zhu, Jintian Zhang, Runnan Fang, Kewei Xu, Ye Liu, Zheng Wei, Jiang Bian, Zang Li, Shumin Deng

机构 * Zhejiang University(浙江大学) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏