arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2512.22217 2025-12-30 cs.CV cs.AI 79%

VLM-PAR: A Vision Language Model for Pedestrian Attribute Recognition

VLM-PAR:一种用于行人属性识别的视觉语言模型

Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Fadi Dornaika, Cosimo Distante, Abdenour Hadid

机构 * Department of Innovation Engineering(创新工程系) University of Salento, Italy(意大利萨伦托大学) Institute of Applied Sciences and Intelligent Systems - CNR(应用科学与智能系统研究所 - CNR) University of the Basque Country UPV/EHU(巴斯克国家大学UPV/EHU) IKERBASQUE, Basque Foundation for Science(伊基塔斯克巴塞克基金会) Sorbonne University Abu Dhabi(索邦大学阿布扎比分校)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.AI

AI总结 VLM-PAR通过整合大规模视觉语言预训练与跨模态细化,提升行人属性识别在类别不平衡和泛化挑战中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16581 2025-12-19 cs.LG cs.IR 79%

Abacus: Self-Supervised Event Counting-Aligned Distributional Pretraining for Sequential User Modeling

Abacus: 为序列用户建模的自监督事件计数对齐分布预训练

Sullivan Castro, Artem Betlei, Thomas Di Martino, Nadir El Manouzi

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 Abacus通过自监督预训练方法提升序列用户建模,结合事件计数统计与序列学习目标,提高下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15830 2025-12-19 cs.SD cs.CL q-bio.NC 79%

From Minutes to Days: Scaling Intracranial Speech Decoding with Supervised Pretraining

从分钟到天:通过监督预训练扩展颅内语音解码

Linnea Evanson, Mingfang Zhang, Hubert Banville, Saarang Panchavati, Pierre Bourdillon, Jean-Rémi King

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

AI总结 通过监督预训练扩展颅内语音解码,利用长期数据提升解码性能并解决跨天变化问题。

Comments Linnea Evanson* and Mingfang (Lucy) Zhang* are joint first authors. Pierre Bourdillon** and Jean-Rémi King** are joint last authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13279 2025-12-16 cs.CL 79%

AIR: Post-training Data Selection for Reasoning via Attention Head Influence

AIR:通过注意力头影响进行推理的后训练数据选择

Jinrui Liu, Jeff Wu, Xuanguang Pan, Gavin Cheung, Shuai Ma, Chongyang Tao

机构 * Beihang University(北洋大学) Independent Researcher(独立研究者)

专题命中 预训练与数据 :post-training(title,abstract);分类 cs.CL

AI总结 AIR通过注意力头影响机制,提升大语言模型推理能力的后训练数据选择效率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12710 2025-12-16 quant-ph cs.LG 79%

Practical Hybrid Quantum Language Models with Observable Readout on Real Hardware

实用的混合量子语言模型在真实硬件上实现可观测量读取

Stefan Balauca, Ada-Astrid Balauca, Adrian Iftene

机构 * FreeYaMind Campus(FreeYaMind校区)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出混合量子语言模型QRNNs和QCNNs,在真实量子硬件上实现端到端训练,通过多样本SPSA策略克服噪声影响,验证了NISQ设备上生成语言模型的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07309 2025-12-09 cs.IT cs.AI math.IT 79%

Radiance-Field Reinforced Pretraining: Scaling Localization Models with Unlabeled Wireless Signals

基于辐射场的强化预训练:利用未标记无线信号扩展定位模型

Guosheng Wang, Shen Wang, Lei Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(计算系,香港理工大学,香港,中国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出RFRP框架,通过结合大规模未标记无线信号数据提升定位模型的跨场景泛化能力,实验表明其显著降低定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07969 2025-12-09 cs.CL 79%

Understanding Syntactic Generalization in Structure-inducing Language Models

理解结构诱导语言模型中的句法泛化

David Arps, Hassan Sajjad, Laura Kallmeyer

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了结构诱导语言模型中的句法泛化问题,通过训练三种不同架构评估其句法表示和性能,发现GPST在长距离依赖性上表现最佳。

Comments Code available at https://github.com/davidarps/silm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06104 2025-12-09 cs.LG 79%

ARC-AGI Without Pretraining

ARC-AGI无需预训练

Isaac Liao, Albert Gu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 CompressARC通过最小化描述长度(MDL)在无需预训练的情况下解决ARC-AGI谜题,展示了深度学习在极低数据条件下产生智能的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05216 2025-12-08 cs.LG 79%

Coefficient of Variation Masking: A Volatility-Aware Strategy for EHR Foundation Models

方差系数掩码:一种考虑波动性的电子健康记录基础模型策略

Rajna Fani, Rafi Al Attrach, David Restrepo, Yugang Jia, Leo Anthony Celi, Peter Schüffler

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) Technical University of Munich (TUM)(慕尼黑技术大学) MICS CentraleSupélec – Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec研究所) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) Institute of Pathology Technical University of Munich(慕尼黑技术大学病理研究所) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出CV-Masking策略,通过考虑特征波动性改进EHR基础模型的预训练,提升重建性能和下游任务表现。

Comments 16 pages, 9 figures, 1 table, 1 algorithm. Accepted at Machine Learning for Health (ML4H) 2025, Proceedings of the Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01203 2025-12-08 cs.LG 79%

Hypergraph Foundation Model

超图基础模型

Yue Gao, Yifan Feng, Shiquan Liu, Xiangmin Han, Shaoyi Du, Zongze Wu, Han Hu

机构 * School of Software, BNRist, THUIBCS, BLBCI, Tsinghua University(软件学院,BNRist,THUIBCS,BLBCI,清华大学) Institute of Artificial Intelligence and Robotics, College of Artificial Intelligence, Xi’an Jiaotong University(人工智能与机器人研究院,人工智能学院,西安交通大学) College of Mechatronics and Control Engineering, Shenzhen University(机械与控制工程学院,深圳大学) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Hyper-FM是一种多领域知识提取的超图基础模型,通过层次化高阶邻居引导的顶点知识嵌入和结构知识提取,提升超图建模能力,并提出超图基础模型的扩展定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07755 2025-12-08 cs.CV cs.AI cs.GR cs.RO 79%

SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models

SAT:多模态语言模型的动态空间能力训练

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko

机构 * Boston University(波士顿大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Microsoft Research(微软研究院) New York University(纽约大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。

Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 79%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08805 2025-11-27 cs.CV cs.LG 79%

Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining

像测试一样过滤:基于数据的数据驱动数据过滤用于CLIP预训练

Mikey Shechter, Yair Carmon

机构 * Tel Aviv University, Israel(特拉维夫大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 FLYT通过数据驱动的方法提升CLIP预训练效果,实现DataComp基准上的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04619 2025-11-27 cs.LG stat.ML 79%

CTSyn: A Foundation Model for Cross Tabular Data Generation

CTSyn:跨表格数据生成的基准模型

Xiaofeng Lin, Chenheng Xu, Matthew Yang, Guang Cheng

机构 * Department of Statistics and Data Science, University of California Los Angeles(统计与数据科学系,加州大学洛杉矶分校) Department of Computer Science, University of California Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CTSyn提出了一种基于扩散的生成性基准模型,用于跨表格数据生成,通过统一潜在空间和条件潜在扩散模型提升表格合成的实用性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20643 2025-11-26 cs.CV cs.LG 79%

Concept-Aware Batch Sampling Improves Language-Image Pretraining

概念感知的批量采样提升语言-图像预训练

Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Trento(特伦托大学) LAION Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.LG

AI总结 本研究提出CABS方法,通过概念感知的批量采样提升语言-图像预训练效果,提供灵活的任务适应性数据整理方案。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19272 2025-11-25 cs.LG 79%

Tiny-TSM: Efficiently Training a Lightweight SOTA Time Series Foundation Model

Tiny-TSM:高效训练轻量级SOTA时间序列基础模型

Felix Birkel

机构 * Prior Labs(Prior实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Tiny-TSM通过高效训练方法,在资源受限环境下实现了轻量级时间序列基础模型的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18924 2025-11-25 cs.SE cs.AI 79%

LLM-Driven Kernel Evolution: Automating Driver Updates in Linux

基于大语言模型的内核进化:自动化Linux驱动更新

Arina Kharlamova, Jiawen Liu, Tianyi Zhang, Xinrui Yang, Humaid Alqasimi, Youcheng Sun, Chun Jason Xue

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI

AI总结 基于大语言模型的AUTODRIVER系统通过整合提示工程、多智能体协作等技术,实现了Linux驱动程序的自动化维护,提升了驱动与内核协同进化的安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18824 2025-11-25 cs.CV cs.CL 79%

Assessing the alignment between infants' visual and linguistic experience using multimodal language models

利用多模态语言模型评估婴儿的视觉和语言经验一致性

Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long

机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) Department of Psychology, Tsinghua University(心理学系,清华大学)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL

AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03589 2025-11-17 cs.LG 79%

VITA: Variational Pretraining of Transformers for Climate-Robust Crop Yield Forecasting

Adib Hasan, Mardavij Roozbehani, Munther Dahleh

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09665 2025-11-14 cs.LG 79%

Generalization Can Emerge in Tabular Foundation Models From a Single Table

Junwei Ma, Nour Shaheen, Alex Labach, Amine Mhedhbi, Frank Hutter, Anthony L. Caterini, Valentin Thomas

机构 * University of Toronto(多伦多大学) Polytechnique Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Layer 6 AI(Layer 6 AI公司) Prior Labs(Prior实验室) ELLIS Institute(ELLIS研究所) Tübingen University of Freiburg(弗赖堡大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09213 2025-11-13 cs.CL 79%

Pretraining Finnish ModernBERTs

Akseli Reunamo, Laura-Maria Peltonen, Hans Moen, Sampo Pyysalo

机构 * University of Turku, Department of Computing(图尔库大学计算机系) University of Eastern Finland and Kuopio University Hospital(东方芬兰大学和库奥皮奥大学医院) University of Turku and Turku University Hospital(图尔库大学和图尔库大学医院) Aalto University, Department of Computer Science(艾尔沃普大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04432 2025-11-13 cs.CL 79%

Can Language Models Handle a Non-Gregorian Calendar? The Case of the Japanese wareki

Mutsumi Sasaki, Go Kamoda, Ryosuke Takahashi, Kosuke Sato, Kentaro Inui, Keisuke Sakaguchi, Benjamin Heinzerling

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments Accepted to IJCNLP-AACL 2025 (Main). Code available at https://github.com/cl-tohoku/Non-Gregorian-Calendar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04478 2025-11-07 cs.HC cs.AI 79%

Generate, Evaluate, Iterate: Synthetic Data for Human-in-the-Loop Refinement of LLM Judges

Hyo Jin Do, Zahra Ashktorab, Jasmina Gajcin, Erik Miehling, Martín Santillán Cooper, Qian Pan, Elizabeth M. Daly, Werner Geyer

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03806 2025-11-07 cs.LG 79%

FusionDP: Foundation Model-Assisted Differentially Private Learning for Partially Sensitive Features

Linghui Zeng, Ruixuan Liu, Atiquer Rahman Sarkar, Xiaoqian Jiang, Joyce C. Ho, Li Xiong

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03276 2025-11-06 cs.LG 79%

Diffusion Language Models are Super Data Learners

Jinjie Ni, Qian Liu, Longxu Dou, Chao Du, Zili Wang, Hang Yan, Tianyu Pang, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室) StepFun Shanghai Qiji Zhifeng Co Ltd(上海启峰科技有限公司)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03019 2025-11-06 cs.CV cs.AI 79%

SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment

Wenbo Lu

机构 * Department of Data Science(数据科学系) New York University Shanghai(纽约大学上海分校)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

Comments Capstone Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25116 2025-10-30 cs.CL 79%

Pretraining Strategies using Monolingual and Parallel Data for Low-Resource Machine Translation

Idriss Nguepi Nguefack, Mara Finkelstein, Toadoum Sari Sakayo

机构 * AIMS Senegal(塞内加尔AIMS)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

Comments 8 pages, 1. figure

Journal ref ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23252 2025-10-30 cs.CL 79%

Are ASR foundation models generalized enough to capture features of regional dialects for low-resource languages?

Tawsif Tashwar Dipto, Azmol Hossain, Rubayet Sabbir Faruque, Md. Rezuwan Hassan, Kanij Fatema, Tanmoy Shome, Ruwad Naswan, Md. Foriduzzaman Zihad, Mohaymen Ul Anam, Nazia Tasnim, Hasan Mahmud, Md Kamrul Hasan, Md. Mehedi Hasan Shawon, Farig Sadeque, Tahsin Reasat

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL

Comments The manuscript has to be withdrawn to address an authorship and intellectual property clarification

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21204 2025-10-27 cs.LG 79%

Mitra: Mixed Synthetic Priors for Enhancing Tabular Foundation Models

Xiyuan Zhang, Danielle C. Maddix, Junming Yin, Nick Erickson, Abdul Fatir Ansari, Boran Han, Shuai Zhang, Leman Akoglu, Christos Faloutsos, Michael W. Mahoney, Cuixiong Hu, Huzefa Rangwala, George Karypis, Bernie Wang

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

Comments NeurIPS 2025. We released both classifier (autogluon/mitra-classifier) and regressor (autogluon/mitra-regressor) model weights on HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05064 2025-10-24 cs.LG 79%

Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning

Subhojyoti Mukherjee, Josiah P. Hanna, Qiaomin Xie, Robert Nowak

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments Accepted in Reinforcement Learning Conference 2025

Journal ref Reinforcement Learning Journal,vol. 6, 2025, pp. 1681-1723

详情

展开后加载摘要…

URL PDF HTML 收藏