arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2605.14062 2026-05-15 cs.AI cs.CL 89%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12452 2026-05-13 cs.CL cs.AI cs.CY 89%

The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

算法漫画:在危机事件中审计LLM生成的政治言论

Gunjan, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD), Division of Science, Computer Science Department(纽约大学(NYUAD),科学学院,计算机科学系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比真实与生成的政治言论,发现生成内容在情感强度、结构规律性和词汇框架上不如真实言论真实,提出了'漫画差距'作为评估生成内容社会真实性的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08875 2026-05-12 cs.LG cs.AI 89%

When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation

表格泄露:攻击基于大语言模型的表格数据生成中的字符串记忆化

Joshua Ward, Bochao Gu, Chi-Hua Wang, Guang Cheng

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的表格数据生成中字符串记忆化带来的隐私风险,提出LevAtt攻击方法并设计防御策略,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05227 2026-05-08 cs.LG cs.AI 89%

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

重新思考大语言模型训练中的数据整理:在线重加权优于离线方法

Wanru Zhao, Yihong Chen, Yuzhi Tang, Wentao Ma, Shengchao Hu, Shell Xu Hu, Alex Iacob, Abhinav Mehrotra, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) OATML, University of Oxford(牛津大学OATML实验室) University of Toronto(多伦多大学) Shanghai Jiao Tong University(上海交通大学) Samsung AI Center(三星人工智能中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出ADAPT框架,通过动态在线重加权提升模型泛化能力,实验显示其在指令微调和大规模预训练中优于传统离线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23475 2026-04-28 cs.LG cs.CL 89%

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

超节点和光环:LLM前馈层中的损失关键枢纽

Audrey Cherilyn, Houman Safaai

机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 89%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16423 2026-04-21 cs.LG cs.AI 89%

Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity

梯度偏移:理解防御性训练方法如何保护语言模型完整性

Satchel Grant, Victor Gillioz, Jake Ward, Thomas McGrath

机构 * Stanford University(斯坦福大学) MATS

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04781 2025-09-08 cs.CY cs.AI cs.LG 89%

The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models

Danielle Ensign, Henry Sleight, Kyle Fish

专题命中 预训练与数据 :LLM(title);large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09709 2025-04-28 cs.LG cs.CL 89%

GOFA: A Generative One-For-All Model for Joint Graph Language Modeling

Lecheng Kong, Jiarui Feng, Hao Liu, Chengsong Huang, Jiaxin Huang, Yixin Chen, Muhan Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01832 2025-01-06 cs.CL cs.LG 89%

Time Series Language Model for Descriptive Caption Generation

Mohamed Trabelsi, Aidan Boyd, Jin Cao, Huseyin Uzunalioglu

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04646 2024-10-29 cs.CL cs.LG 89%

Efficacy of Large Language Models in Systematic Reviews

Aaditya Shah, Shridhar Mehendale, Siddha Kanthi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Both Shah and Mehendale contributed equally to this work; order of authorship is random. This paper will be published in the proceedings of The 2nd International Conference on Foundation and Large Language Models (FLLM2024) in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12425 2024-05-24 cs.CV cs.CL cs.LG 89%

The Neglected Tails in Vision-Language Models

Shubham Parashar, Zhiqiu Lin, Tian Liu, Xiangjue Dong, Yanan Li, Deva Ramanan, James Caverlee, Shu Kong

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05352 2024-01-23 cs.SE cs.AI cs.CL 89%

A Taxonomy of Foundation Model based Systems through the Lens of Software Architecture

Qinghua Lu, Liming Zhu, Xiwei Xu, Yue Liu, Zhenchang Xing, Jon Whittle

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11541 2023-12-20 cs.AI cs.CL 89%

CLIPSyntel: CLIP and LLM Synergy for Multimodal Question Summarization in Healthcare

Akash Ghosh, Arkadeep Acharya, Raghav Jain, Sriparna Saha, Aman Chadha, Setu Sinha

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03713 2026-08-12 cs.CV 版本更新 89%

Investigating Adversarial Robustness of Multi-modal Large Language Models

探究多模态大语言模型的对抗鲁棒性

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(哈利法大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 通过系统研究多模态大语言模型的对抗鲁棒性,提出诊断性CLIP对齐协议预测鲁棒视觉编码器的迁移效果,并证明端到端多模态对抗训练能显著提升模型在强对抗攻击下的性能。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 89%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30407 2026-06-09 cs.CL cs.AI cs.IR cs.LG 版本更新 89%

Exploring Autonomous Agentic Data Engineering for Model Specialization

探索用于模型专业化的自主智能体数据工程

Yujie Luo, Xiangyuan Ru, Jingsheng Zheng, Jingjing Wang, Yuqi Zhu, Jintian Zhang, Runnan Fang, Kewei Xu, Ye Liu, Zheng Wei, Jiang Bian, Zang Li, Shumin Deng

机构 * Zhejiang University(浙江大学) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25442 2026-05-26 cs.CV 89%

Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models

利用多模态大语言模型增强单图像面部去变形

Nitish Shukla, Arun Ross

机构 * IEEE

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 提出一种基于多模态大语言模型引导的耦合扩散重建框架,通过提取中间层语义嵌入作为条件,实现无参考的面部去变形,恢复构成图像并保持身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08362 2026-05-22 cs.CL cs.AI cs.LG 89%

Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

迈向真实世界的人类行为模拟:在长时间跨度、跨场景、异质行为轨迹上对大语言模型进行基准测试

Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OmniBehavior基准测试,通过真实世界数据整合长周期、跨场景和异质行为模式,揭示现有模型在模拟复杂人类行为时的局限性,包括对正向平均人的趋同、人格同质化和乌托邦偏见,为未来高保真模拟研究指明方向。

Comments Project page: https://OmniBehavior.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12120 2026-05-21 cs.LG cs.AI cs.CL 89%

LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws

LLMs on the Line: 数据决定损失-损失缩放定律

Prasanna Mayilvahanan, Thaddäus Wiedemer, Sayak Mallick, Matthias Bethge, Wieland Brendel

机构 * Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究探讨了影响LLM损失-损失缩放定律的主要因素,发现预训练数据决定了缩放趋势,而模型大小、优化超参数、分词器和架构差异对缩放影响有限,因此应精心选择预训练数据以获得最佳下游性能。

Comments ICML 2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 89%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract)

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16422 2026-04-21 cs.CL cs.AI cs.LG 89%

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG

Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过持续预训练和GraphRAG两种方法将结构化生物医学知识注入语言模型,提升其在生物医学领域的表现,实验显示BERTUMLS在知识密集型问答任务中表现优异,GraphRAG在PubMedQA和BioASQ上提升显著。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07592 2026-04-10 cs.RO 89%

Spatio-Temporal Grounding of Large Language Models from Perception Streams

从感知流中对大语言模型进行时空 grounding

Jacob Anderson, Bardh Hoxha, Georgios Fainekos, Hideki Okamoto, Danil Prokhorov

机构 * Toyota Motor North America Research & Development(丰田北美研发中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06276 2026-04-09 cs.SE 89%

Story Point Estimation Using Large Language Models

利用大语言模型进行故事点估计

Pranam Prakash Shetty, Adarsh Balakrishnan, Mengqiao Xu, Xiaoyin Xi, Zhe Yu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究探讨了大语言模型在无训练数据或少量训练数据下对故事点的预测能力,并比较了比较判断与直接标注对模型性能的影响。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 89%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03864 2026-03-17 cs.DL 89%

Have Large Language Models Enhanced the Way Civil & Environmental Engineers Write? A Quantitative Analysis of Scholarly Communication over 25 Years

大语言模型是否增强了土木与环境工程师的写作方式?对25年学术交流的定量分析

Morgan D. Sanger, Brett W. Maurer

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过词汇频率分析方法,研究大语言模型对土木与环境工程领域学术写作的影响,发现自2022年起,LLM的使用显著改变了写作风格,使文章更复杂、自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04346 2026-03-05 cs.CV 89%

Underrepresented in Foundation Model Pretraining Data? A One-Shot Probe

在基础模型预训练数据中被低估?一个单次探测器

Chris Vorster, Mayug Maniparambil, Noel E. O'Connor, Noel Murphy, Derek Molloy

机构 * ML-Labs(ML实验室) Dublin City University(都柏林城市大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种低成本方法,通过单张标记图像预测VLFM在目标领域的零样本准确率,用于评估和优化数据标注决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17562 2026-02-27 cs.CV 89%

Visual Instruction Pretraining for Domain-Specific Foundation Models

面向领域特定基础模型的视觉指令预训练

Yuxuan Li, Yicheng Zhang, Wenhao Tang, Yimian Dai, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, Computer Science, NKU, Tianjin, China(PCA实验室、VCIP、计算机科学、NKU、天津,中国) NKIARI, Futian, Shenzhen, China(NKIARI、福田、深圳,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)

AI总结 本文提出ViTP,通过视觉指令预训练提升领域特定基础模型的感知与推理能力,在多个遥感和医学影像任务中取得新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18010 2026-02-23 cs.SD 89%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15461 2026-02-18 cs.CV 89%

Emergent Morphing Attack Detection in Open Multi-modal Large Language Models

开放多模态大语言模型中的涌现形变攻击检测

Marija Ivanovska, Vitomir Štruc

机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。

Comments This manuscript is currently under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏