arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 157 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2502.10361 2026-02-20 cs.CL cs.LG 91%

Enhancing Multilingual LLM Pretraining with Model-Based Data Selection

通过基于模型的数据选择增强多语言大语言模型预训练

Bettina Messmer, Vinko Sabolčec, Martin Jaggi

机构 * EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于模型的数据选择框架,通过提高多语言大语言模型预训练的效果,实现了在较少训练数据下达到基线分数并提升其他基准测试的表现。

Comments NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15162 2026-02-20 eess.SP cs.AI cs.LG 84%

Multimodal Wireless Foundation Models

多模态无线基础模型

Ahmed Aboulfotouh, Hatem Abou-Zeid

机构 * Department of Electrical and Software Engineering(电气与软件工程系) University of Calgary(卡尔加里大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个多模态无线基础模型,能处理IQ流和图像类无线模态,支持多种无线任务,展示了其在不同模态上的广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16873 2026-02-20 cs.MA cs.AI 83%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 83%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16784 2026-02-20 cs.LG cs.CL stat.ME 81%

Omitted Variable Bias in Language Models Under Distribution Shift

语言模型中分布偏移下的遗漏变量偏差

Victoria Lin, Louis-Philippe Morency, Eli Ben-Michael

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了语言模型在分布偏移下的遗漏变量偏差问题,提出框架用于评估和优化模型在分布偏移下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17088 2026-02-20 cs.LG 77%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17366 2026-02-20 cs.CL 70%

RPDR: A Round-trip Prediction-Based Data Augmentation Framework for Long-Tail Question Answering

RPDR:基于回程预测的数据增强框架用于长尾问答

Yiming Zhang, Siyue Zhang, Junbo Zhao, Chen Zhao

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) NYU Shanghai(纽约大学上海分校) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RPDR通过数据增强框架提升长尾问答性能,利用回程预测选择易学实例并动态路由查询以优化检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10382 2026-02-20 cond-mat.soft 67%

Advanced Manufacturing with Renewable and Bio-based Materials: AI/ML workflows and Process Optimization

先进生物基和可再生材料的制造:AI/ML工作流与工艺优化

Rigoberto Advincula, Jihua Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究通过AI/ML工作流和工艺优化,提升生物基和可再生材料在先进制造中的应用效率,促进可持续发展。

Comments 26 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17342 2026-02-20 cs.LG cs.AI 62%

From Subtle to Significant: Prompt-Driven Self-Improving Optimization in Test-Time Graph OOD Detection

从细微到显著:基于提示的自我改进优化在测试时图OoD检测中

Luzhi Wang, Xuanshuo Fu, He Zhang, Chuang Liu, Xiaobao Wang, Hongbo Liu

专题命中 预训练与数据 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出SIGOOD方法,通过自我改进的提示优化提升测试时图OoD检测的性能。

Comments 9pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08351 2026-02-20 cs.LG cs.AI 62%

The Chicken and Egg Dilemma: Co-optimizing Data and Model Configurations for LLMs

数据与模型配置的协同优化:大语言模型的鸡与蛋困境

Zhiliang Chen, Alfred Wei Lun Leong, Shao Yong Ong, Apivich Hemachandra, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Zhengyuan Liu, Nancy F. Chen, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Science, Technology and Research (A*STAR)(科技研究局)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 JoBS通过联合优化数据和模型配置,利用性能预测器提升大语言模型训练效率,有效降低优化成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 7 篇

2602.16836 2026-02-20 cs.CL 88%

Claim Automation using Large Language Model

利用大语言模型实现索赔自动化

Zhengda Mo, Zhiyu Quan, Eli O'Donohue, Kaiwen Zhong

机构 * Actuarial and Risk Management Sciences, University of Illinois at Urbana-Champaign(保险与风险管理科学系,伊利诺伊大学厄巴纳-香槟分校) PCMI Corporation(PCMI公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出利用大语言模型进行索赔自动化,通过领域特定微调显著提升保险领域纠正措施建议的准确性。

Comments 46 pages, 12 figures. Code and data processing pipeline described

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07989 2026-02-20 cs.CL cs.AI 86%

State of the Art in Text Classification for South Slavic Languages: Fine-Tuning or Prompting?

南斯拉夫语言文本分类的现状:微调还是提示?

Taja Kuzman Pungeršek, Peter Rupnik, Ivan Porupski, Vuk Dinić, Nikola Ljubešić

机构 * Jožef Stefan Institute(乔泽夫·斯塔芬研究所) Faculty of Computer and Information Science(计算机与信息科学系) University of Ljubljana(卢布尔雅纳大学) Institute of Contemporary History(当代历史研究所)

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了南斯拉夫语言文本分类中微调BERT模型与LLMs的性能,发现LLMs在零样本设置下表现优异,但存在推理慢和计算成本高等问题,故微调模型仍更实用。

Comments 17 pages; 4 figures; 3 tables. Submitted to the LLMs4SSH workshop, co-located with the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17478 2026-02-20 cs.CV 85%

QuPAINT: Physics-Aware Instruction Tuning Approach to Quantum Material Discovery

QuPAINT:一种面向量子材料发现的物理感知指令微调方法

Xuan-Bac Nguyen, Hoang-Quan Nguyen, Sankalp Pandey, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(Arkansas大学计算机视觉实验室) University of Utah, USA(犹他大学) Department of Physics, University of Arkansas, USA(Arkansas大学物理系)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 QuPAINT通过物理感知指令微调方法,提升量子材料发现的多模态表征能力,建立标准化评估基准。

Comments Project page: https://uark-cviu.github.io/projects/qupaint/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17475 2026-02-20 cs.CL 81%

Small LLMs for Medical NLP: a Systematic Analysis of Few-Shot, Constraint Decoding, Fine-Tuning and Continual Pre-Training in Italian

小型语言模型在医疗NLP中的应用:对少样本、约束解码、微调和持续预训练的系统分析

Pietro Ferrazzi, Mattia Franzin, Alberto Lavelli, Bernardo Magnini

机构 * Fondazione Bruno Kessler(布鲁诺·克瑟基金会) University of Padova(帕多瓦大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文研究了小型LLMs在医疗NLP中的应用,发现微调和约束解码能有效提升性能,最佳模型在多个任务中表现优于大模型。

Comments Paper Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17222 2026-02-20 cs.AI 81%

Decoding the Human Factor: High Fidelity Behavioral Prediction for Strategic Foresight

解码人类因素:为战略预见的高保真行为预测

Ben Yellin, Ehud Ezra, Mark Foreman, Shula Grinapol

机构 * OMGene AI Lab(OMGene AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出LBM模型,通过高维特质轮廓预测个体战略选择,提升高保真行为模拟能力,应用于战略预见等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16936 2026-02-20 cs.DC 75%

Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation

异构联邦微调与并行一秩适应

Zikai Zhang, Rui Hu, Jiahao Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Fed-PLoRA通过并行一秩适应和Select-N-Fold策略,解决异构联邦微调中的初始化和聚合噪声问题,提升LLM微调的准确性和效率。

Comments To appear in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16915 2026-02-20 cs.CV 50%

StereoAdapter-2: Globally Structure-Consistent Underwater Stereo Depth Estimation

StereoAdapter-2: 基于全局结构一致性的水下立体深度估计

Zeyu Ren, Xiang Li, Yiran Wang, Zeyu Zhang, Hao Tang

机构 * The University of Melbourne(墨尔本大学) Peking University(北京大学) Australian Centre for Robotics(澳大利亚机器人中心)

专题命中 指令微调 :foundation model(abstract)

AI总结 StereoAdapter-2通过引入基于选择性状态空间模型的ConvSS2D操作符,实现了高效的水下立体深度估计,提升了水下基准测试的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 9 篇

2602.16833 2026-02-20 cs.LG cs.AI 88%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 87%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16053 2026-02-20 cs.LG cs.CL 84%

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

多目标对齐语言模型以实现个性化心理治疗

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh, Saadia Gabriel

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 84%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14762 2026-02-20 cs.LG cs.CV 83%

Unlocking [CLS] Features for Continual Post-Training

解锁[CLS]特征以实现持续微调

Murat Onur Yildirim, Elif Ceren Gok Yildirim, Joaquin Vanschoren

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出TOSCA方法,通过在[CLS]标记上部署稀疏LuCA模块,实现持续学习中稳定性与可塑性的平衡,减少参数量并提升性能。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17338 2026-02-20 cs.AI cs.LG stat.ML 73%

Capturing Individual Human Preferences with Reward Features

通过奖励特征捕捉个体人类偏好

André Barreto, Vincent Dumoulin, Yiran Mao, Mark Rowland, Nicolas Perez-Nieves, Bobak Shahriari, Yann Dauphin, Doina Precup, Hugo Larochelle

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过奖励特征捕捉个体偏好,提出自适应奖励模型架构,展示其在不同用户偏好下的有效性。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17025 2026-02-20 cs.LG 57%

WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning

WS-GRPO:弱监督组相对策略优化用于高效推理

Gagan Mundada, Zihan Huang, Rohan Surana, Sheldon Yu, Jennifer Yuntong Zhang, Xintong Li, Tong Yu, Lina Yao, Jingbo Shang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 WS-GRPO 通过将终端奖励转换为正确性感知的指导,提高推理效率并减少冗余思考,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06355 2026-02-20 cs.CV cs.AI 57%

Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation

Di3PO - Diptych Diffusion DPO用于图像生成的针对性改进

Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta

机构 * Google(谷歌) DeepMind

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.AI

AI总结 Di3PO通过针对性改进图像生成中的特定区域,提升扩散模型的文本渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16987 2026-02-20 cs.CY 50%

A testable framework for AI alignment: Simulation Theology as an engineered worldview for silicon-based agents

一种可测试的AI对齐框架:模拟神学作为硅基智能体的工程世界观

Josef A. Habdank

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出模拟神学作为可测试的AI对齐框架,通过内化目标减少欺骗行为,促进AI与人类的可持续共存。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2602.17183 2026-02-20 cs.SE cs.AI 88%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16901 2026-02-20 cs.AI 79%

AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks

AgentLAB: 对长周期攻击下LLM代理的基准测试

Tanqiu Jiang, Yuhui Wang, Jiacheng Liang, Ting Wang

机构 * Department of Computer Science, Stony Brook University, Stony Brook, USA(计算机科学系,石溪大学,石溪,美国)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 AgentLAB是一个专门评估LLM代理对长周期攻击易感性的基准,通过五种新型攻击类型和28个现实环境测试,揭示了LLM代理在长周期攻击中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17641 2026-02-20 cs.LG cs.AI 62%

FAMOSE: A ReAct Approach to Automated Feature Discovery

FAMOSE:一种用于自动化特征发现的ReAct方法

Keith Burghardt, Jienan Liu, Sadman Sakib, Yuning Hao, Bo Li

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16075 2026-02-20 cs.AR cs.CR cs.ET cs.LG 57%

DARTH-PUM: A Hybrid Processing-Using-Memory Architecture

DARTH-PUM:一种混合处理-存储-记忆架构

Ryan Wong, Ben Feinberg, Saugata Ghose

机构 * Sandia National Laboratories(沙达国家实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 DARTH-PUM是一种通用混合PUM架构,通过优化外围电路和编程接口,实现高效内存计算,适用于多种应用领域。

Comments To appear in the ACM International Conference on Architectural Support for Programming Languages and Operating Systems (ASPLOS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏