arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2512.06266 2025-12-09 cs.CL 90%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22153 2025-12-09 cs.CL cs.AI 90%

Simplex-Optimized Hybrid Ensemble for Large Language Model Text Detection Under Generative Distribution Drif

基于简单形优化的混合集成用于在生成分布漂移下的大语言模型文本检测

Sepyan Purnama Kristanto, Lutfi Hakim, Dianni Yusuf

机构 * Department of Informatics, Politeknik Negeri Banyuwangi(信息学院,波斯瓦基国家技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于简单形优化的混合集成方法,用于在生成分布漂移下提高大语言模型文本检测的准确性和鲁棒性。

Comments 8 pages, 2 Figure, Politeknik Negeri Banyuwangi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06922 2025-12-09 cs.CL cs.CY 88%

Large Language Models and Forensic Linguistics: Navigating Opportunities and Threats in the Age of Generative AI

大语言模型与语言学鉴定:在生成式AI时代的机会与威胁

George Mikros

机构 * College of Humanities and Social Sciences(人文与社会科学学院) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对语言学鉴定的双重影响,指出其在分析工具与身份混淆方面的矛盾,并提出混合工作流程和可解释检测方法以提升科学可信度和法律可采性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06351 2025-12-09 cs.LG cs.CL 86%

LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing

用于智能制造碳感知作业调度的LLM升级图强化学习

Zhiying Yang, Fang Liu, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low, Boon Ping Gan

机构 * Singapore Institute of Technology(新加坡理工学院) Singapore University of Social Sciences(新加坡社会科学研究大学) D-SIMLAB Technologies(D-SIMLAB技术公司)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 Luca通过结合LLM和图神经网络,实现碳感知作业调度的高效优化,实验显示其在完成时间和排放方面均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15830 2025-12-09 cs.CL quant-ph 85%

Rethinking LLM Training through Information Geometry and Quantum Metrics

重新思考通过信息几何和量子度量进行大语言模型训练

Riccardo Di Sipio

机构 * Dayforce

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过信息几何和量子度量重新思考大语言模型训练,探讨曲率方法对理解LLM训练的贡献,并推测量子增强系统中的优化潜力。

Comments 9 pages, 1 figure(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19912 2025-12-09 cs.CV cs.LG cs.RO 83%

Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining

增强的时空一致性用于图像到LiDAR数据预训练

Xiang Xu, Lingdong Kong, Hui Shuai, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu, Qingshan Liu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机学院) Shanghai AI Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 SuperFlow++通过整合时空线索提升图像到LiDAR数据预训练效果,实现更鲁棒的特征表示和更高效的自动驾驶感知。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07452 2025-12-09 cs.IR 82%

From Show Programmes to Data: Designing a Workflow to Make Performing Arts Ephemera Accessible Through Language Models

从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问

Clarisse Bardiot, Pierre-Carl Langlais, Bernard Jacquemin, Jacob Hart, Antonios Lagarias, Nicolas Foucault, Aurélie Lemaître-Legargeant, Jeanne Fras

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。

Comments 19 pages, 8 figures, 5 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06642 2025-12-09 cs.CV astro-ph.CO astro-ph.IM cs.AI cs.LG 81%

Masked Autoencoder Pretraining on Strong-Lensing Images for Joint Dark-Matter Model Classification and Super-Resolution

在强引力透镜图像上预训练掩码自动编码器用于联合暗物质模型分类和超分辨率

Achmad Ardani Prasha, Clavino Ourizqi Rachmadi, Muhamad Fauzan Ibnu Syahlan, Naufal Rahfi Anugerah, Nanda Garin Raditya, Putri Amelia, Sabrina Laila Mutiara, Hilman Syachr Ramadhan

机构 * Faculty of Computer Science, Universitas Mercu Buana(默克普布亚大学计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过在强引力透镜图像上预训练MAE,实现了暗物质模型分类和图像超分辨率的双重任务,展示了MAE在天文图像处理中的有效性。

Comments 21 pages, 7 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07612 2025-12-09 cs.CL cs.AI cs.LG 80%

PCMind-2.1-Kaiyuan-2B Technical Report

PCMind-2.1-Kaiyuan-2B 技术报告

Kairong Luo, Zhenbo Sun, Xinyu Shi, Shengqi Chen, Bowen Yu, Yunyi Chen, Chenyi Dang, Hengtao Tao, Hui Wang, Fangming Liu, Kaifeng Lyu, Wenguang Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PCMind-2.1-Kaiyuan-2B通过开源20亿参数模型提升资源受限下的训练效率与效果,采用分位数数据基准、战略选择性重复和多领域课程训练等方法,实现与先进开源模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07309 2025-12-09 cs.IT cs.AI math.IT 79%

Radiance-Field Reinforced Pretraining: Scaling Localization Models with Unlabeled Wireless Signals

基于辐射场的强化预训练:利用未标记无线信号扩展定位模型

Guosheng Wang, Shen Wang, Lei Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(计算系,香港理工大学,香港,中国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出RFRP框架,通过结合大规模未标记无线信号数据提升定位模型的跨场景泛化能力,实验表明其显著降低定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07969 2025-12-09 cs.CL 79%

Understanding Syntactic Generalization in Structure-inducing Language Models

理解结构诱导语言模型中的句法泛化

David Arps, Hassan Sajjad, Laura Kallmeyer

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了结构诱导语言模型中的句法泛化问题,通过训练三种不同架构评估其句法表示和性能,发现GPST在长距离依赖性上表现最佳。

Comments Code available at https://github.com/davidarps/silm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06104 2025-12-09 cs.LG 79%

ARC-AGI Without Pretraining

ARC-AGI无需预训练

Isaac Liao, Albert Gu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 CompressARC通过最小化描述长度(MDL)在无需预训练的情况下解决ARC-AGI谜题,展示了深度学习在极低数据条件下产生智能的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06449 2025-12-09 cs.LG cs.AI 79%

FLEX: Continuous Agent Evolution via Forward Learning from Experience

FLEX: 通过经验向前学习实现连续智能体进化

Zhicheng Cai, Xinyuan Guo, Yu Pei, Jiangtao Feng, Jinsong Su, Jiangjie Chen, Ya-Qin Zhang, Wei-Ying Ma, Mingxuan Wang, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) ByteDance Seed(字节跳动种子) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Informatics, Xiamen University(厦门大学信息学院) SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR实验室和字节跳动种子)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FLEX通过经验向前学习实现LLM智能体的持续进化,提升数学推理、化学逆合成和蛋白质预测性能,并揭示经验增长的扩展规律和跨智能体的经验继承现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06196 2025-12-09 cs.AI cs.CL 76%

ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment

ARCANE:一种多智能体框架,用于可解释和可配置的对齐

Charlie Masters, Marta Grześkiewicz, Stefano V. Albrecht

专题命中 预训练与数据 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。

Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07064 2025-12-09 cs.LG cs.AI q-bio.QM 62%

Self-Supervised Learning on Molecular Graphs: A Systematic Investigation of Masking Design

分子图上的自监督学习:掩码设计的系统性研究

Jiannan Yang, Veronika Thost, Tengfei Ma

机构 * Stony Brook University(石溪大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文系统研究了分子图自监督学习中掩码设计的影响,发现预测目标与编码器架构的协同作用比复杂的掩码分布更为关键,且语义丰富的目标能显著提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07277 2025-12-09 cs.CL eess.AS 57%

Efficient ASR for Low-Resource Languages: Leveraging Cross-Lingual Unlabeled Data

低资源语言高效语音识别:利用跨语言无标签数据

Srihari Bandarupalli, Bhavana Akkiraju, Charan Devarakonda, Vamsiraghusimha Narsinga, Anil Kumar Vuppala

机构 * Speech Processing Lab, International Institute of Information Technology Hyderabad, India(信息与技术国际研究院语音处理实验室,海得拉巴)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 通过跨语言无标签数据预训练,提升低资源语言语音识别性能,模型参数更少但效果更优。

Comments Accepted in AACL IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06981 2025-12-09 cs.CV cs.LG 57%

Selective Masking based Self-Supervised Learning for Image Semantic Segmentation

基于选择性掩码的自监督学习用于图像语义分割

Yuemin Wang, Ian Stavness

机构 * Department of Computer Science University of Sasktachewan(计算机科学系萨斯喀彻温大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出选择性掩码自监督学习方法,通过选择性掩码提升语义分割性能,尤其在低预算预训练和低模型容量场景下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00224 2025-12-09 physics.chem-ph cond-mat.mtrl-sci cs.LG 57%

Learning from the electronic structure of molecules across the periodic table

在元素周期表范围内学习分子的电子结构

Manasa Kaniselvan, Benjamin Kurt Miller, Meng Gao, Juno Nam, Daniel S. Levine

机构 * FAIR at Meta(Meta 的 FAIR 部门) ETH Zurich(苏黎世联邦理工学院) MIT(麻省理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 HELM模型通过利用哈密顿矩阵数据提升分子电子结构学习,为低数据条件下能量预测提供改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏