arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2411.18755 2024-12-02 cs.LG cs.CL cs.CR 85%

Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models

Weiqiu You, Youngja Park

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18443 2024-10-07 cs.CL cs.AI cs.IR q-bio.QM 85%

BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers

Ran Xu, Wenqi Shi, Yue Yu, Yuchen Zhuang, Yanqiao Zhu, May D. Wang, Joyce C. Ho, Chao Zhang, Carl Yang

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024. The model and data are uploaded to \url{https://github.com/ritaranx/BMRetriever}

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16553 2024-08-28 cs.CL cs.AI 85%

SelectLLM: Can LLMs Select Important Instructions to Annotate?

Ritik Sachin Parkar, Jaehyung Kim, Jong Inn Park, Dongyeop Kang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments First Authors: Ritik Sachin Parkar and Jaehyung Kim | Second Author: Jong Inn Park | PI: Dongyeop Kang

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06484 2024-08-14 cs.CL cs.AI 85%

Cross-Lingual Conversational Speech Summarization with Large Language Models

Max Nelson, Shannon Wotherspoon, Francis Keith, William Hartmann, Matthew Snover

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07969 2024-03-15 cs.LG cs.AI 85%

KnowCoder: Coding Structured Knowledge into LLMs for Universal Information Extraction

Zixuan Li, Yutao Zeng, Yuxin Zuo, Weicheng Ren, Wenxuan Liu, Miao Su, Yucan Guo, Yantao Liu, Xiang Li, Zhilei Hu, Long Bai, Wei Li, Yidan Liu, Pan Yang, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06139 2024-03-12 cs.CL cs.AI 85%

Fine-grainedly Synthesize Streaming Data Based On Large Language Models With Graph Structure Understanding For Data Sparsity

Xin Zhang, Linhai Zhang, Deyu Zhou, Guoqiang Xu

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12060 2024-01-29 cs.CL cs.AI 85%

FlexKBQA: A Flexible LLM-Powered Framework for Few-Shot Knowledge Base Question Answering

Zhenyu Li, Sunqi Fan, Yu Gu, Xiuxing Li, Zhichao Duan, Bowen Dong, Ning Liu, Jianyong Wang

专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Accepted as AAAI-24 Oral paper; Knowledge Base Question Answering; Large Language Model; Data Generation; Few-Shot & Zero-Shot

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01055 2024-01-15 cs.CL cs.AI 85%

LLaMA Beyond English: An Empirical Study on Language Capability Transfer

Jun Zhao, Zhihao Zhang, Luhui Gao, Qi Zhang, Tao Gui, Xuanjing Huang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16832 2023-11-29 cs.CL cs.AI 85%

CharacterGLM: Customizing Chinese Conversational AI Characters with Large Language Models

Jinfeng Zhou, Zhuang Chen, Dazhen Wan, Bosi Wen, Yi Song, Jifan Yu, Yongkang Huang, Libiao Peng, Jiaming Yang, Xiyao Xiao, Sahand Sabour, Xiaohan Zhang, Wenjing Hou, Yijia Zhang, Yuxiao Dong, Jie Tang, Minlie Huang

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.02540 2020-07-07 cs.CL cs.AI 85%

LMVE at SemEval-2020 Task 4: Commonsense Validation and Explanation using Pretraining Language Model

Shilei Liu, Yu Guo, Bochao Li, Feiliang Ren

专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.CL、cs.AI

Comments Accepted in SemEval2020. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22796 2026-08-25 eess.AS cs.SD 新提交 85%

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型

Bingshen Mu, Xian Shi, Xiong Wang, Zhifang Guo, Ting He, Xize Cheng, Yu Xi, Jin Xu, Lei Xie

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08154 2026-08-20 cs.CV 85%

Investigating Vision-Language Model for Point Cloud-based Vehicle Classification

Yiqiao Li, Jie Wei, Camille Kamga

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract)

Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop

Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15875 2026-08-18 cs.RO 新提交 85%

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。

Comments https://gigaai.cc/blog/gigabrain07

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13482 2026-08-14 cs.LG cs.AI cs.CL 新提交 85%

Synthetic Persona Pretraining: Alignment from Token Zero

合成角色预训练:从零开始的对齐

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

机构 * EPFL(洛桑联邦理工学院) University of Toronto(多伦多大学) Northeastern University(东北大学) SJTU(上海交通大学) Saarland University(萨尔大学) Hereon(亥姆霍兹极地与海洋研究中心) TUHH(汉堡工业大学) Ontocord AI(Ontocord人工智能公司) TUC(德累斯顿工业大学) DFKI(德国人工智能研究中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00715 2026-08-11 cs.CL cs.AI cs.LG 版本更新 85%

To Memorize or to Retrieve: Scaling the Interaction Between Pretraining and Retrieval

记忆还是检索:考虑RAG的缩放规律

Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng

机构 * Stanford University(斯坦福大学) Independent Researcher(独立研究员) Patronus AI The Ohio State University(俄亥俄州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。

Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03930 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 85%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10277 2026-07-14 cs.SE 新提交 85%

From Business Requirements to Test Assertions: Evaluating LLM-Generated Oracles on Real Bugs

从业务需求到测试断言:评估大语言模型生成的预言机在实际错误上的表现

Tiancheng Ma, Nasir U. Eisty

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型能否从自然语言业务需求生成测试预言机,提出基于Defects4J的流程,对10个实际错误进行实验,评估预言机在与需求衍生预言机及被测系统一致性上表现,发现大语言模型有泛化但存在差异,为后续研究提供可行性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 85%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27655 2026-06-29 cs.CV 新提交 85%

Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection

时间涌现提示用于多帧红外小目标检测中的Segment Anything

Yinghui Xing, Donghao Chu, Shizhou Zhang, Di Xu

专题命中 预训练与数据 :prompting(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出TEP-SAM框架,通过联合建模全局运动模式和局部运动偏差,利用时间涌现线索提示SAM,实现低信噪比红外序列中小目标的精准定位与分割。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24173 2026-05-26 cs.CL cs.AI cs.CR cs.LG 85%

Extracting Training Data from Diffusion Language Models via Infilling

通过填充从扩散语言模型中提取训练数据

Yihan Wang, N. Asokan

机构 * University of Waterloo(滑铁卢大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出填充提取协议,利用扩散语言模型的双向去噪能力,通过任意二进制掩码参数化,揭示掩码几何形状控制提取能力,边缘条件掩码比前缀条件掩码多提取三倍逐字序列,且双向访问打开了自回归模型无法利用的通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22981 2026-05-25 cs.CL cs.AI cs.LG 85%

Memorization Dynamics of Fill-in-the-Middle Pretraining

Fill-in-the-Middle 预训练的记忆动态

Tobias von Arx, Tanguy Dieudonné

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过对比 FIM 与标准 LTR 预训练,研究 FIM 对逐字记忆的影响,发现 FIM 更易恢复短片段或部分匹配,而 LTR 对长精确延续置信度更高,且 FIM 训练下的逐字提取随重复次数近似线性增长。

Comments MemFM @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16455 2026-05-19 cs.CR 85%

MalwarePT: A Binary-Level Foundation Model for Malware Analysis

MalwarePT:一种用于恶意软件分析的二进制级基础模型

Saastha Vasan, Yuzhou Nie, Kaie Chen, Yigitcan Kaya, Hojjat Aghakhani, Roman Vasilenko, Wenbo Guo, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出MalwarePT,一种基于ModernBERT编码器的二进制级基础模型,通过预训练实现跨任务的迁移学习,提升恶意软件分析中API预测和功能分类的性能。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 85%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24416 2026-04-28 cs.CL cs.AI cs.LG 85%

Scaling Properties of Continuous Diffusion Spoken Language Models

连续扩散口语语言模型的可扩展性特性

Jason Ramapuram, Eeshan Gunesh Dhekane, Amitis Shidani, Dan Busbridge, Bogdan Mazoure, Zijin Gu, Russ Webb, Tatiana Likhomanenko, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究连续扩散口语语言模型在性能上的可扩展性,提出基于音素Jensen-Shannon散度的评估指标,发现其在参数规模增加时生成质量提升,但长文本连贯性仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12370 2026-04-20 cs.CV 85%

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成

Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal

机构 * Brown University(布朗大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。

Comments Project page: https://kunkun0w0.github.io/project/LLaMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01738 2026-04-16 cs.CV 85%

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

简单即正义:视觉基础模型中通用可推广AIGI检测的出现

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li

机构 * Shenzhen University(深圳大学) Nanchang University(南昌大学) University of North Texas(北得克萨斯大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09920 2026-04-14 cs.CV 85%

Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection

你的VFM说话植物吗?面向物体检测的视觉基础模型的植物语法

Lars Lundqvist, Earl Ranario, Hamid Kamangir, Heesup Yun, Christine Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出系统提示优化框架,评估四个开放词汇检测器在合成和真实农田图像中对豆科植物花和豆荚的检测性能,发现提示结构对不同模型响应各异,通过模型特定的组合提示显著提升检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06618 2026-04-10 cs.CR 85%

PoC-Adapt: Semantic-Aware Automated Vulnerability Reproduction with LLM Multi-Agents and Reinforcement Learning-Driven Adaptive Policy

PoC-Adapt: 基于语义的自动漏洞重现与LLM多智能体及强化学习驱动的自适应策略

Phan The Duy, Khoa Ngo-Khanh, Nguyen Huu Quyen, Van-Hau Pham

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PoC-Adapt框架,通过语义运行时验证和自适应策略学习,提升漏洞重现的可靠性并降低生成成本,实验表明其在CWE-Bench-Java和PrimeVul基准上验证可靠性和效率提升显著。

Comments 16 pages, abstracted and meta updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06894 2026-04-09 stat.AP 85%

How Does LLM Help Regional CPI Forecast: An LLM-powered Deep Panel Modeling Framework

大型语言模型如何帮助区域CPI预测:一种基于大型语言模型的深度面板建模框架

Tianchen Gao, Ao Sun, Yurou Wang, Jingyuan Liu, Cheng Hsiao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合大型语言模型分析和社会媒体叙述的深度面板建模框架,通过构建大规模叙述语料库和微调BERT模型生成高频LLM诱导替代品,提升区域CPI预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏