arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.18010 2026-02-23 cs.SD 89%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20674 2026-02-23 cs.CL cs.AI 87%

PonderLM: Pretraining Language Models to Ponder in Continuous Space

PonderLM:在连续空间中预训练语言模型以进行思考

Boyi Zeng, Shixiang Song, Siyuan Huang, Yixuan Wang, He Li, Ziwei He, Xinbing Wang, Zhiyu Li, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 86%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10160 2026-02-23 cs.CL cs.AI cs.LG 85%

Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment

对齐预训练:人工智能 discourse 导致自我实现的(不)对齐

Cameron Tice, Puria Radmard, Samuel Ratnam, Andy Kim, David Africa, Kyle O'Brien

机构 * Geodesic Research(Geodesic研究机构) UK AI Security Institute(英国人工智能安全研究所) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17881 2026-02-23 cs.CL cs.AI cs.LG 83%

Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations

理解语言模型中转向向量的不可靠性:几何预测器与线性近似的局限性

Joschka Braun

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;foundation model(comments)

AI总结 该研究探讨了语言模型中转向向量的可靠性问题,发现训练数据和行为表示对转向效果有显著影响,提出几何预测器和非线性近似方法以提升稳定性。

Comments Master's Thesis, University of Tübingen. 89 pages, 34 figures. Portions of this work were published at the ICLR 2025 Workshop on Foundation Models in the Wild (see arXiv:2505.22637)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18137 2026-02-23 cs.CL cs.AI cs.LG 80%

Agentic Adversarial QA for Improving Domain-Specific LLMs

代理对抗问答:提升领域特定大语言模型

Vincent Grari, Ciprian Tomoiaga, Sylvain Lamprier, Tatsunori Hashimoto, Marcin Detyniecki

机构 * Stanford University(斯坦福大学) Polish Academy of Science, IBS PAN, Warsaw, Poland(波兰科学院、IBS PAN、华沙、波兰)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种对抗性问题生成框架,通过生成语义具有挑战性的问题来提升领域特定大语言模型的适应能力。

Comments 9 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 79%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18066 2026-02-23 cs.CV 78%

Faster Training, Fewer Labels: Self-Supervised Pretraining for Fine-Grained BEV Segmentation

更快的训练,更少的标签:用于细粒度BEV分割的自监督预训练

Daniel Busch, Christian Bohn, Thomas Kurbiel, Klaus Friedrichs, Richard Meyes, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学) APTIV(APTIV公司)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种自监督预训练方法,通过减少标注数据和训练时间,提升细粒度BEV分割性能。

Comments This Paper has been accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02228 2026-02-23 cs.LG 77%

xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity

xLSTM缩放定律:具有线性时间复杂度的竞争力表现

Maximilian Beck, Kajetan Schweighofer, Sebastian Böck, Sebastian Lehner, Sepp Hochreiter

机构 * ELLIS Unit Linz, Institute for Machine Learning, JKU Linz, Austria(林茨ELLIS单位、机器学习研究所、JKU林茨,奥地利) NXAI GmbH, Linz, Austria(林茨NXAI公司,奥地利)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 xLSTM在保持竞争力的同时,展现出线性时间复杂度和更优的缩放性能,优于Transformer架构。

Comments Accepted at ICLR 2026. Code and data available at https://github.com/NX-AI/xlstm_scaling_laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17080 2026-02-23 cs.LG math.OC 77%

Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum

Adam改进Muon:基于正交动量的自适应矩估计

Minxin Zhang, Yuxuan Liu, Hayden Schaeffer

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NAMO和NAMO-D优化器,通过正交化动量与基于范数的Adam型噪声适应相结合,提升大语言模型训练性能。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16986 2026-02-23 cs.IR cs.SI 67%

Bending the Scaling Law Curve in Large-Scale Recommendation Systems

在大规模推荐系统中弯曲缩放定律曲线

Qin Ding, Kevin Course, Linjian Ma, Jianhui Sun, Ruochen Liu, Zhao Zhu, Chunxing Yin, Wei Li, Dai Li, Yu Shi, Xuan Cao, Ze Yang, Han Li, Xing Liu, Bi Xue, Hongwei Li, Rui Jian, Daisy Shi He, Jing Qian, Matt Ma, Qunshu Zhang, Rui Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 ULTRA-HSTU通过创新的序列设计和稀疏注意机制,在大规模推荐系统中实现了显著的训练和推理效率提升,同时保持高质量的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17868 2026-02-23 cs.LG cs.AI 62%

MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies

MantisV2: 通过合成数据和测试时策略缩小零样本时间序列分类的差距

Vasilii Feofanov, Songkang Wen, Jianfeng Zhang, Lujia Pan, Ievgen Redko

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 MantisV2通过合成数据和测试时策略提升时间序列分类的零样本性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18252 2026-02-23 cs.CV cs.AI 57%

On the Adversarial Robustness of Discrete Image Tokenizers

对离散图像标记器的对抗鲁棒性的研究

Rishika Bhagwatkar, Irina Rish, Nicolas Flammarion, Francesco Croce

机构 * Mila - Quebec AI Institute(魁北克AI研究所) EPFL(苏黎世联邦理工学院) ELLIS Institute Finland - Aalto University(芬兰ELLIS研究所-阿莱大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 本文研究了离散图像标记器的对抗鲁棒性,提出了一种无监督对抗训练方法以提升其鲁棒性,适用于多种多模态任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18224 2026-02-23 cs.RO cs.LG 57%

SimVLA: A Simple VLA Baseline for Robotic Manipulation

SimVLA:一种简单的VLA基线用于机器人操作

Yuankai Luo, Woping Chen, Tong Liang, Baiqiao Wang, Zhenguo Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 SimVLA通过简化设计实现了最先进的机器人操作性能,展示了最小参数模型在模拟和真实环境中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05647 2026-02-23 cs.LG cs.CV 57%

Learning to Weight Parameters for Training Data Attribution

学习权重参数以训练数据归因

Shuangqi Li, Hieu Le, Jingyi Xu, Mathieu Salzmann

机构 * EPFL(苏黎世联邦理工学院) Stony Brook University(史蒂文斯理工学院) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出一种无需标注标签即可直接从数据学习参数重要性权重的方法,提升训练数据归因的准确性与细粒度分析能力。

Comments 31 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏