arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2603.04950 2026-04-23 cs.CV cs.AI 83%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15353 2026-04-21 cs.CL 83%

Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various Settings

在不同设置中为语言模型建立KL散度量表

Ryo Kishino, Yusuke Takase, Momose Oyama, Hiroaki Yamagiwa, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(日本科学技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过扩展log-likelihood空间,建立统一的KL散度量表,分析预训练轨迹显示log-likelihood空间变化比权重空间更小,导致学习轨迹亚扩散并早稳定语言模型行为。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23807 2026-04-21 cs.AI cs.CV 83%

Beyond the Failures: Rethinking Foundation Models in Pathology

超越失败:重新思考病理学中的基础模型

Hamid R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 病理学中基础模型表现不佳,需设计专门处理生物图像的模型,而非通用自然图像方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11983 2026-04-21 cs.LG math.OC 83%

Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training

大规模矩阵优化中的低秩正交化:应用于基础模型训练

Chuan He, Zhanwang Deng, Zhaosong Lu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出低秩正交化方法,通过利用神经网络训练中的梯度低秩特性,改进矩阵正交化以提升基础模型训练性能,理论分析了低秩MSGD和低秩Muon的迭代复杂度。

Comments 20 pages, add numerical comparison with Galore and SOAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10471 2026-04-15 cond-mat.mtrl-sci cs.AI 83%

Siamese Foundation Models for Crystal Structure Prediction

孪生基础模型用于晶体结构预测

Liming Wu, Wenbing Huang, Rui Jiao, Jianxing Huang, Liwei Liu, Yipeng Zhou, Hao Sun, Yang Liu, Fuchun Sun, Yuxiang Ren, Jirong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Advanced Computing and Storage Lab, Huawei Technologies(华为技术有限公司先进计算与存储实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Diffusion-based Crystal Omni框架,结合孪生生成模型和能量预测模型,提升晶体结构预测性能,并在实际超导材料中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11066 2026-04-14 cs.CL 83%

ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset

ks-pret-5m: 一个500万词、1200万token的克什米尔语言预训练数据集

Haq Nawaz Malik, Nahfid Nissar

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个包含500万词和1200万token的克什米尔语言最大公开预训练数据集,通过清理流程和分词方法,提升了数据质量,支持语言模型预训练和计算语言学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI 83%

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06903 2026-04-09 cs.CL 83%

Is Biomedical Specialization Still Worth It? Insights from Domain-Adaptive Language Modelling with a New French Health Corpus

生物医学专业化仍然值得吗?基于新法语健康语料库的领域自适应语言建模洞察

Aidan Mannion, Cécile Macaire, Armand Violle, Stéphane Ohayon, Xavier Tannier, Didier Schwab, Lorraine Goeuriot, François Portet

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,格勒诺布尔信息学实验室) Sorbonne Université, LIMICS(索邦大学,医学信息学与知识工程实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了在法语生物医学领域通过持续预训练对小型至中型LLM进行专业化的方法,发现DAPT在资源受限情况下有效,但需通过模型合并缓解泛化权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04271 2026-04-07 cs.NI cs.LG 83%

A Family of Open Time-Series Foundation Models for the Radio Access Network

面向无线接入网络的开放时间序列基础模型家族

Ioannis Panitsas, Leandros Tassiulas

机构 * Department of Electrical and Computer Engineering, Yale University(耶鲁大学电气与计算机工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TimeRAN框架,通过轻量时间序列基础模型和少量任务特定头部,实现跨任务的可迁移表示,提升RAN分析性能并减少系统复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 83%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28743 2026-04-07 cs.LG 83%

Rethinking Language Model Scaling under Transferable Hypersphere Optimization

重新思考在可转移超球优化下的语言模型扩展

Liliang Ren, Yang Liu, Yelong Shen, Weizhu Chen

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出HyperP框架,通过Frobenius球约束和Muon优化器,在模型宽度、深度、训练token和MoE粒度间转移最优学习率,实现更稳定的扩展,同时引入SqrtGate机制提升MoE粒度扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01277 2026-03-31 cs.SD cs.LG eess.AS q-bio.QM 83%

Foundation Models for Bioacoustics -- a Comparative Review

生物声学中的基础模型——比较综述

Raphael Schwinger, Paria Vali Zadeh, Lukas Rauch, Mats Kurz, Tom Hauschild, Sam Lapp, Sven Tomforde

机构 * Kiel University(基尔大学) University of Kassel(卡塞尔大学) University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文综述了大规模预训练生物声学基础模型,分析其在多种分类任务中的迁移能力,并通过实验验证不同模型的性能,为选择合适模型提供指导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24826 2026-03-27 cs.CL 83%

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

合成重写作为质量乘数:来自葡萄牙持续预训练的证据

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Maritaca AI

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过控制实验探讨合成重写在葡萄牙持续预训练中对数据质量的影响,发现高质量数据通过重写可提升模型性能,而低质量数据效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 83%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02566 2026-03-26 cs.CV cs.AI 83%

From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature

从面板到像素:从生物医学科学文献中进行缩放视觉-语言预训练

Kun Yuan, Min Woo Sun, Zhen Chen, Alejandro Lozano, Xiangteng He, Shi Li, Nassir Navab, Xiaoxiao Sun, Nicolas Padoy, Serena Yeung-Levy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、斯特拉斯堡,法国) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) DSAI, The Hong Kong Polytechnic University(香港理工大学DSAI实验室) University of British Columbia(不列颠哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) IHU Strasbourg, Strasbourg(斯特拉斯堡IHU医院,斯特拉斯堡) Vector Institute for AI(人工智能向量研究所) Yale University(耶鲁大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Panel2Patch方法,通过挖掘生物医学文献中的层次结构,生成多粒度监督,提升视觉-语言预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21847 2026-03-24 cs.CL 83%

Riding Brainwaves in LLM Space: Understanding Activation Patterns Using Individual Neural Signatures

在LLM空间中骑行脑波:利用个体神经特征理解激活模式

Ajan Subramanian, Sumukh Bettadapura, Rohan Sathish

机构 * Kubo Technologies

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究通过训练个性化线性探针,发现冻结的LLM表示能编码个体特定的EEG信号,且在高伽马功率上表现显著优于群体探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 83%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20732 2026-03-24 cs.CL 83%

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

MzansiText 和 MzansiLM:一种面向南非语言的开放语料库和解码器-only 语言模型

Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍MzansiText和MzansiLM,针对南非11种官方语言中的9种低资源语言,通过任务特定微调在自然语言理解与生成任务中取得显著成果,但小规模下少量推理仍具挑战性。

Comments 15 pages, 11 tables, appendix included. Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC 83%

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12343 2026-03-16 cs.CL 83%

LLM-Augmented Therapy Normalization and Aspect-Based Sentiment Analysis for Treatment-Resistant Depression on Reddit

基于大型语言模型的疗法规范化与基于方面的情感分析用于抗药性抑郁症的Reddit研究

Yuxin Zhu, Sahithi Lakamana, Masoud Rouhizadeh, Selen Bozkurt, Rachel Hershenberg, Abeed Sarker

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Reddit数据研究抗药性抑郁症患者的药物使用和情感倾向,利用大型语言模型进行情感分析,揭示药物感知差异及治疗经验特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08216 2026-03-10 eess.AS cs.CL cs.SD 83%

DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining

DualTurn: 从双通道生成式语音预训练中学习轮流对话

Shangeth Rajaa

机构 * Anyreach AI

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.CL

AI总结 DualTurn通过双通道生成式语音预训练,实现了更自然的轮流对话处理,优于现有方法在代理动作预测和词级轮流预测上的表现。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14106 2026-03-06 cs.AI 83%

HydroGEM: A Self Supervised Zero Shot Hybrid TCN Transformer Foundation Model for Continental Scale Streamflow Quality Control

HydroGEM:一种用于大陆尺度径流质量控制的自监督零样本混合TCN-Transformer基础模型

Ijaz Ul Haq, Byung Suk Lee, Julia N. Perdrial, David Baude

机构 * Department of Computer Science, University of Vermont(维珍尼亚大学计算机科学系) Water Resources Institute, University of Vermont(维珍尼亚大学水文资源研究所) Department of Geography and Geosciences, University of Vermont(维珍尼亚大学地理与地质学系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 HydroGEM通过自监督预训练和混合TCN-Transformer架构,实现了对大陆尺度径流质量控制的高效检测与重建,性能优于基线模型,展示了跨国家的泛化能力。

Comments Supplementary materials, datasets, and implementation code will be made publicly available upon acceptance for publication in a peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02840 2026-03-04 cs.LG stat.ML 83%

Adapting Time Series Foundation Models through Data Mixtures

通过数据混合适应时间序列基础模型

Thomas L. Lee, Edoardo M. Ponti, Amos Storkey

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 MixFT通过数据混合重新划分数据,以更好地适应不同子领域,提升时间序列基础模型的零样本预测性能。

Comments Preprint, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02711 2026-03-04 cs.AI 83%

A Natural Language Agentic Approach to Study Affective Polarization

一种自然语言代理方法研究情感极化

Stephanie Anneris Malvicini, Ewelina Gajewska, Arda Derbent, Katarzyna Budzynska, Jarosław A. Chudziak, Maria Vanina Martinez

机构 * Warsaw University of Technology (WUT)(华沙技术大学)

专题命中 预训练与数据 :language agent(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于自然语言代理的多代理模型,用于研究社交媒体中的情感极化现象,通过虚拟社区模拟和实验分析,提供新的研究视角和方法。

Comments Accepted at ICAART 2026 (18th International Conference on Agents and Artificial Intelligence). The final published version is available in the conference proceedings (SCITEPRESS)

Journal ref In Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Vol. 1, pp. 339-346. SCITEPRESS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23652 2026-03-04 cs.CV cs.AI 83%

3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection

面向MRI多器官异常检测的3D模态感知预训练

Haowen Zhu, Ning Yin, Xiaogen Zhou

机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22879 2026-02-27 cs.AI 83%

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐

Xingcheng Fu, Shengpeng Wang, Yisen Gao, Xianxian Li, Chunpei Li, Qingyun Sun, Dongran Yu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。

Comments 9 pages, 6 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21193 2026-02-25 cs.CL 83%

On Data Engineering for Scaling LLM Terminal Capabilities

关于扩大LLM终端能力的数据工程

Renjie Pi, Grace Lam, Mohammad Shoeybi, Pooya Jannaty, Bryan Catanzaro, Wei Ping

机构 * NVIDIA

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Terminal-Task-Gen和Terminal-Corpus,通过训练Nemotron-Terminal模型显著提升终端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00994 2026-02-25 cs.CL 83%

Should We Still Pretrain Encoders with Masked Language Modeling?

我们还应该用掩码语言模型预训练编码器吗?

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom TransPerfect Cohere MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本大学(里斯本 ELLIS 单位))

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究了在文本表示任务中,使用CLM还是MLM预训练编码器的优劣,发现双阶段训练策略在计算预算固定时表现最佳,并展示了从预训练CLM模型初始化的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16873 2026-02-20 cs.MA cs.AI 83%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 83%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏