arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 28 篇

2512.12384 2025-12-16 cs.LG cs.CL 91%

The Data Efficiency Frontier of Financial Foundation Models: Scaling Laws from Continued Pretraining

金融基础模型的数据效率前沿:从持续预训练中获得的扩展定律

Jesse Ponnock

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了金融基础模型在持续预训练中的数据效率,发现通过较小的词预算可实现有效的领域适应,且大模型规模仍具可行性。

Comments 8 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12868 2025-12-16 cs.CL cs.AI cs.LG 88%

Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM

计数线索:一个轻量级概率基线可以匹配LLM

Furong Jia, Yuan Pu, Finn Guo, Monica Agrawal

机构 * Duke University(杜克大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种轻量级概率排名器FBPR,通过共现统计信息实现与LLM相当的性能,展示了概率基线在临床诊断中的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12770 2025-12-16 cs.CL 88%

Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining

Curió-Edu 7B: 探究数据选择对LLM持续预训练的影响

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing (IC) University of Campinas (UNICAMP)(计算研究所(IC)坎皮纳斯大学(UNICAMP)) School of Electrical and Computer Engineering (FEEC) University of Campinas (UNICAMP)(电气与计算机工程学院(FEEC)坎皮纳斯大学(UNICAMP))

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

AI总结 Curió-Edu 7B通过数据选择在有限计算资源下超越完整语料库模型,证明数据质量对语言适应的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13298 2025-12-16 cs.CL cs.AI 86%

MiniLingua: A Small Open-Source LLM for European Languages

MiniLingua:一种用于欧洲语言的小型开源大语言模型

Anna Aksenova, Boris Zverkov, Nicola Dainese, Alexander Nikitin, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MiniLingua是一种基于十亿参数的多语言开源大语言模型,针对13种欧洲语言训练,能够在指令遵循任务中超越同类模型,同时保持高效的计算性能。

Comments 9+6 pages, 6 figures and 3 tables in the main text. Code at https://github.com/MiniLingua-ai/training_artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15248 2025-12-16 cs.CL cs.AI 84%

Synthetic bootstrapped pretraining

合成增强预训练

Zitong Yang, Aonan Zhang, Hong Liu, Tatsunori Hashimoto, Emmanuel Candès, Chong Wang, Ruoming Pang

机构 * Apple(苹果公司) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SBP通过合成大量新语料库提升语言模型性能,实现60%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 82%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13279 2025-12-16 cs.CL 79%

AIR: Post-training Data Selection for Reasoning via Attention Head Influence

AIR:通过注意力头影响进行推理的后训练数据选择

Jinrui Liu, Jeff Wu, Xuanguang Pan, Gavin Cheung, Shuai Ma, Chongyang Tao

机构 * Beihang University(北洋大学) Independent Researcher(独立研究者)

专题命中 预训练与数据 :post-training(title,abstract);分类 cs.CL

AI总结 AIR通过注意力头影响机制,提升大语言模型推理能力的后训练数据选择效率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12710 2025-12-16 quant-ph cs.LG 79%

Practical Hybrid Quantum Language Models with Observable Readout on Real Hardware

实用的混合量子语言模型在真实硬件上实现可观测量读取

Stefan Balauca, Ada-Astrid Balauca, Adrian Iftene

机构 * FreeYaMind Campus(FreeYaMind校区)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出混合量子语言模型QRNNs和QCNNs,在真实量子硬件上实现端到端训练,通过多样本SPSA策略克服噪声影响,验证了NISQ设备上生成语言模型的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23548 2025-12-16 cs.CL 77%

Translation in the Wild

野外翻译

Yuri Balashov

机构 * Department of Philosophy Institute for Artificial Intelligence University of Georgia(哲学系人工智能研究所佐治亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文探讨了LLMs在翻译任务上的能力来源,提出其可能源于两种不同的预训练数据类型,并讨论了验证这一假设的前景及其对翻译概念的影响。

Comments 4 figures

Journal ref Information 2025, 16, 1077

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23229 2025-12-16 cs.LG 77%

Citegeist: Automated Generation of Related Work Analysis on the arXiv Corpus

Citegeist: 在arXiv语料库上自动生成相关工作分析的应用程序

Claas Beger, Carl-Leander Henneking

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Citegeist通过动态RAG技术在arXiv语料库上自动生成相关工作分析,结合嵌入相似性匹配、总结和多阶段过滤,提供引用支持的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12938 2025-12-16 cs.IR 75%

SPAR: Session-based Pipeline for Adaptive Retrieval on Legacy File Systems

SPAR:基于会话的适应性检索管道

Duy A. Nguyen, Hai H. Do, Minh Doan, Minh N. Do

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SPAR通过轻量级两阶段流程整合LLMs与RAG架构,提升遗留文件系统中检索效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 75%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 75%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12167 2025-12-16 cs.CL cs.AI 73%

Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings

通过删除预训练语言模型的位置嵌入来扩展上下文

Yoav Gelberg, Koshi Eguchi, Takuya Akiba, Edoardo Cetin

机构 * Sakana AI University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过删除预训练语言模型的位置嵌入,实现无需长上下文微调的零样本上下文扩展,提升语言模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13472 2025-12-16 cs.CL 70%

Scaling Laws for Code: Every Programming Language Matters

代码的缩放定律:每种编程语言都至关重要

Jian Yang, Shawn Guo, Lin Jing, Wei Zhang, Aishan Liu, Chuan Hao, Zhoujun Li, Wayne Xin Zhao, Xianglong Liu, Weifeng Lv, Bryan Dai

机构 * Beihang University(北京航空航天大学) Ubiquant

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文首次系统研究了多语言代码预训练的缩放定律,通过大规模实验揭示不同编程语言在模型大小和数据量上的差异影响,并提出比例依赖的多语言缩放定律以优化训练资源分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12201 2025-12-16 cs.HC cs.AI 70%

Epistemoverse: Toward an AI-Driven Knowledge Metaverse for Intellectual Heritage Preservation

Epistemoverse: 向一个由人工智能驱动的知识元宇宙,用于保护智力遗产

Predrag K. Nikolić, Robert Prentner

机构 * School of Design Arts\ University of Technology Kuching Malaysia Institute of Humanities ShanghaiTech University Shanghai China Arts\ University of Technology Institute of Humanities ShanghaiTech University

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Epistemoverse概念,通过AI驱动的互动,构建知识元宇宙以保护和扩展智力遗产。

Comments 7 pages, 7 figures, presented at SIGGRAPH VRCAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12175 2025-12-16 cs.AI 70%

Rethinking Label Consistency of In-Context Learning: An Implicit Transductive Label Propagation Perspective

重新思考上下文学习中的标签一致性:一种隐含的归纳标签传播视角

Haoyang Chen, Richong Zhang, Junfan Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从归纳标签传播视角重新思考上下文学习中的标签一致性问题,提出TopK-SD方法提升演示的一致性,优于传统TopK采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14765 2025-12-16 q-fin.GN q-fin.ST 67%

The Memorization Problem: Can We Trust LLMs' Economic Forecasts?

记忆问题:我们能否信任LLMs的经济预测?

Alejandro Lopez-Lira, Yuehua Tang, Mingyin Zhu

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文研究了LLMs在经济预测中的记忆问题,发现其能够记忆训练数据中的经济金融信息,且无法通过简单指令或屏蔽防止,表明LLMs的预测能力可能受限于记忆而非真正的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12356 2025-12-16 cs.HC 67%

Tacit Understanding Game (TUG): Predicting Interpersonal Compatibility

隐性理解游戏(TUG):预测人际兼容性

Yueshen Li, Krishnaveni Unnikrishnan, Aadya Agrawal

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 TUG通过玩家单字选择预测人际兼容性,利用隐私保护信号实现关系匹配,为社交平台提供新设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18702 2025-12-16 cs.CL cs.AI cs.LG cs.MA 67%

Unsupervised Acquisition of Discrete Grammatical Categories

无监督获取离散语法范畴

David Ph. Shakouri, Crit Cremers, Niels O. Schiller

机构 * Leiden University Centre for Linguistics (LUCL)(莱顿大学语言研究中心) Leiden University(莱顿大学) Leiden Institute for Brain and Cognition (LIBC)(莱顿脑与认知研究所) City University of Hong Kong (CityU)(香港城市大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过多代理系统无监督学习母语的语法范畴,利用统计分析生成离散语法规则,并验证了非平凡语法知识的获取。

Comments 34 pages, 3 figures, 7 tables. Related work: Shakouri et al., arXiv:2512.02195

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03682 2025-12-16 cs.CV cs.AI cs.LG 62%

How PARTs assemble into wholes: Learning the relative composition of images

如何将PART组合成整体:学习图像的相对组成

Melika Ayoughi, Samira Abnar, Chen Huang, Chris Sandino, Sayeri Lala, Eeshan Gunesh Dhekane, Dan Busbridge, Shuangfei Zhai, Vimal Thilak, Josh Susskind, Pascal Mettes, Paul Groth, Hanlin Goh

机构 * University of Amsterdam(阿姆斯特丹大学) Apple(苹果公司)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PART通过连续相对变换学习图像的相对组成,优于基于网格的方法,在空间理解任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12583 2025-12-16 cs.CR cs.AI 61%

Detecting Prompt Injection Attacks Against Application Using Classifiers

使用分类器检测应用于应用程序中的提示注入攻击

Safwan Shaheer, G. M. Refatul Islam, Mohammad Rafid Hamid, Md. Abrar Faiaz Khan, Md. Omar Faruk, Yaseen Nur

机构 * Department of Computer Science (CS)(计算机科学系) Department of Computer Science and Engineering (CSE)(计算机科学与工程系) School of Data and Sciences (SDS)(数据与科学学院)

专题命中 预训练与数据 :LLM(abstract,comments);分类 cs.AI

AI总结 本研究通过训练多种分类器,旨在检测网络应用中的提示注入攻击,提升系统安全性和稳定性。

Comments 9 pages, X figures; undergraduate research project on detecting prompt injection attacks against LLM integrated web applications using classical machine learning and neural classifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12537 2025-12-16 cs.CL 57%

NagaNLP: Bootstrapping NLP for Low-Resource Nagamese Creole with Human-in-the-Loop Synthetic Data

NagaNLP:通过人类在循环中的合成数据对低资源纳加拉语克里奥尔语进行NLP的自举

Agniva Maiti, Manya Pandey, Murari Mandal

机构 * RespAI Lab(RespAI实验室) KIIT(KIIT大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 NagaNLP通过人类在循环中的合成数据生成,为低资源纳加拉语克里奥尔语提供了一个开源工具包,实现了词性标注和命名实体识别的高精度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12508 2025-12-16 cs.CV cs.LG 57%

Generative Spatiotemporal Data Augmentation

生成性时空数据增强

Jinfan Zhou, Lixin Luo, Sungmin Eum, Heesung Kwon, Jeong Joon Park

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(安娜堡大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出利用视频扩散模型生成时空数据以增强模型性能,尤其在数据稀缺情况下提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11912 2025-12-16 cs.AI 57%

Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis

概率模型对低质量数据的鲁棒性:多视角分析

Liu Peng, Yaochu Jin

机构 * Trustworthy and General AI Lab(可信与通用人工智能实验室) Department of Artificial Intelligence(人工智能系)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本文通过多视角分析,揭示了概率模型在低质量数据下的鲁棒性差异,发现自回归模型更具韧性,而扩散模型表现较差,主要受条件信息丰富性和训练数据信息含量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08483 2025-12-16 cs.DB 50%

NeurIDA: Dynamic Modeling for Effective In-Database Analytics

NeurIDA:面向有效数据库分析的动态建模

Lingze Zeng, Naili Xing, Shaofeng Cai, Peng Lu, Gang Chen, Jian Pei, Beng Chin Ooi

专题命中 预训练与数据 :LLM(abstract)

AI总结 NeurIDA通过动态数据库建模实现端到端的数据库分析,提升分析效果和效率。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12070 2025-12-16 cs.CR 50%

Towards Channel-Robust and Receiver-Independent Radio Frequency Fingerprint Identification

面向通道鲁棒和接收端无关的射频指纹识别

Jie Ma, Junqing Zhang, Guanxiong Shen, Linning Peng, Alan Marshall

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出了一种三阶段射频指纹识别方法,通过对比学习预训练和孪生网络优化,有效缓解信道和接收端影响,实现高准确率的物联网设备认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23316 2025-12-16 cs.CV 50%

C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection

C3-OWD: 一种用于开放世界检测的课程跨模态对比学习框架

Siheng Wang, Zhengdao Li, Yanshu Li, Canran Xiao, Haibo Zhan, Zhengtao Yao, Xuzhi Zhang, Jiale Kang, Linshan Li, Weiming Liu, Zhikang Dong, Jifeng Shen, Junhao Dong, Qiang Sun, Piotr Koniusz

专题命中 预训练与数据 :pretraining(abstract)

AI总结 C3-OWD提出一种课程跨模态对比学习框架,通过预训练和视觉-语言对齐提升目标检测的鲁棒性和泛化能力。

Comments one of the authors doesn't agree any more

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 20 篇

2508.13426 2025-12-16 cs.CL cs.AI 90%

ALIGN: Word Association Learning for Cultural Alignment in Large Language Models

ALIGN: 用于大语言模型中文化对齐的词关联学习

Chunhua Liu, Kabir Manandhar Shrestha, Sukai Huang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学) Melbourne Data Analytics Platform, The University of Melbourne(墨尔本数据分析平台,墨尔本大学) Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 ALIGN通过微调大语言模型以学习母语使用者的词关联规范,显著提升文化对齐效果,无需昂贵重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16743 2025-12-16 cs.CL 89%

Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions

通过对比安全与有害分布实现大语言模型的安全对齐

Xiaoyun Zhang, Zhengyue Zhao, Wenxuan Shi, Kaidi Xu, Di Huang, Xing Hu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出ACD方法,通过生成安全与对抗性提示,实现大语言模型的安全对齐,提升安全性的同时保持生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏