arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-11 至 2026-02-11 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2508.06617 2026-02-11 cs.LG cs.AI cs.PF 91%

Generalizing Scaling Laws for Dense and Sparse Large Language Models

为密集和稀疏大语言模型推广缩放定律

Md Arafat Hossain, Xingfu Wu, Valerie Taylor, Ali Jannesari

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文提出了一种通用缩放定律,适用于密集和稀疏大语言模型,通过比较实验验证了其在大规模模型中的有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02044 2026-02-11 q-bio.NC cs.LG 87%

A Brain Graph Foundation Model: Pre-Training and Prompt-Tuning across Broad Atlases and Disorders

脑图基础模型:在广泛的大脑图谱和疾病中进行预训练和提示微调

Xinxu Wei, Kanhao Zhao, Yong Jiao, Lifang He, Yu Zhang

机构 * Lehigh University(莱文大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 BrainGFM通过图对比学习和图掩码自动编码器预训练,实现跨多种大脑图谱和疾病的高效泛化与迁移。

Comments 30pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09590 2026-02-11 cs.CL cs.AI 84%

Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models

面向上下文的反事实数据增强用于语言模型中的性别偏见缓解

Shweta Parihar, Liu Guangliang, Natalie Parde, Lu Cheng

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Context-CDA方法,通过增强上下文和过滤低质量反事实,有效缓解语言模型中的性别偏见,同时保持语言建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16612 2026-02-11 cs.CV cs.LG 83%

Federated EndoViT: Pretraining Vision Transformers via Federated Learning on Endoscopic Image Collections

联邦端oscopeViT:通过联邦学习在内窥镜图像集上预训练视觉Transformer

Max Kirchner, Alexander C. Jenke, Sebastian Bodenstedt, Fiona R. Kolbinger, Oliver L. Saldanha, Jakob N. Kather, Martin Wagner, Stefanie Speidel

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤中心) Translational Surgical Oncology(转化外科肿瘤学) Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院) DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(德累斯顿大学技术大学医学系和德累斯顿癌症研究中心) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗斯多夫亥姆霍兹中心) Centre for Tactile Internet with Human-in-the-Loop (CeTI), TU Dresden(具有人类在环的触觉互联网中心,德累斯顿技术大学) Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TU Dresden(visceral、胸外科和血管外科,医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院) Weldon School of Biomedical Engineering, Purdue University(生物医学工程韦尔登学校,普渡大学) Medical Oncology, NCT, University Hospital Heidelberg, Germany(医学肿瘤学,国家肿瘤中心,海德堡大学医院,德国) Medicine I, Faculty of Medicine and University Hospital Carl Gustav Carus, TU Dresden(医学I,医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出FL-EndoViT框架,通过联邦学习在内窥镜图像集上预训练视觉Transformer,解决数据隐私问题,提升手术基础模型的稳健性和泛化能力。

Comments Preprint submitted to MIDL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02603 2026-02-11 eess.IV cs.CV 82%

EchoJEPA: A Latent Predictive Foundation Model for Echocardiography

EchoJEPA:一种用于超声心动图的潜在预测基础模型

Alif Munim, Adibvafa Fallahpour, Teodora Szasz, Ahmadreza Attarpour, River Jiang, Brana Sooriyakanthan, Maala Sooriyakanthan, Heather Whitney, Jeremy Slivnick, Barry Rubin, Wendy Tsang, Bo Wang

机构 * University Health Network(大学健康网络) University of Toronto(多伦多大学) University of Chicago(芝加哥大学) University of California, San Francisco(加州大学旧金山分校) Vector Institute(向量研究所) Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 EchoJEPA通过潜在预测方法在超声心动图中实现鲁棒且可推广的医学AI,显著提升心室功能和压力估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10074 2026-02-11 cs.CR cs.CL 81%

CAPID: Context-Aware PII Detection for Question-Answering Systems

CAPID: 基于上下文的PII检测用于问答系统

Mariia Ponomarenko, Sepideh Abedini, Masoumeh Shafieinejad, D. B. Emerson, Shubhankar Mohapatra, Xi He

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 CAPID通过微调本地小型语言模型实现隐私保护的PII检测,有效提升问答系统中PII识别的准确性与实用性。

Comments Accepted to the Student Research Workshop at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02387 2026-02-11 cs.LG cs.AI 81%

BiSSL: Enhancing the Alignment Between Self-Supervised Pretraining and Downstream Fine-Tuning via Bilevel Optimization

BiSSL: 通过双层优化增强自监督预训练与下游微调之间的对齐

Gustav Wagner Zakarias, Lars Kai Hansen, Zheng-Hua Tan

机构 * Aalborg University(奥胡斯大学) Technical University of Denmark(技术大学) Pioneer Centre for AI(先锋人工智能中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 BiSSL通过双层优化增强自监督预训练与下游微调之间的对齐,提升模型在下游任务中的性能。

Journal ref Transactions on Machine Learning Research (TMLR), (02/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07087 2026-02-11 cs.LG 79%

When Should We Introduce Safety Interventions During Pretraining?

在预训练过程中何时引入安全干预

Dylan Sam, Sachin Goyal, Pratyush Maini, Alexander Robey, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文研究了在预训练过程中何时引入安全干预以提高模型鲁棒性,发现20%-60%的预训练阶段引入干预效果最佳,且早期干预能更清晰地区分安全与有害内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15792 2026-02-11 cs.LG physics.chem-ph 79%

Deep Learning Foundation Models from Classical Molecular Descriptors

从经典分子描述符构建深度学习基础模型

Jackson W. Burns, Akshat Shirish Zalte, Charlles R. A. Abreu, Jochen Sieg, Christian Feldmann, Miriam Mathea, William H. Green

机构 * BASF SE(巴斯夫股份有限公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CheMeleon通过低噪声分子描述符学习,实现超越经典方法的分子性质预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04482 2026-02-11 cs.HC 78%

ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data

ProAgentBench:基于真实数据评估LLM代理的前瞻性帮助

Yuanbo Tang, Huaze Tang, Tingyu Cao, Lam Nguyen, Anping Zhang, Xinwen Cao, Chunkang Liu, Wenbo Ding, Yang Li

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 ProAgentBench通过真实用户数据构建基准,评估LLM代理在连续工作流程中的前瞻性帮助能力,揭示真实数据对预测准确性的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09570 2026-02-11 cs.CL cs.AI cs.IR 73%

LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

LEMUR:一种用于多语言法律嵌入模型检索鲁棒微调的语料库

Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LEMUR通过构建多语言法律语料库并微调嵌入模型,提升了多语言法律检索的鲁棒性和准确性,尤其在低资源语言中表现显著。

Comments Accepted at EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08682 2026-02-11 cs.CV 67%

ALIVE: Animate Your World with Lifelike Audio-Video Generation

ALIVE: 用逼真音频视频生成动画你的世界

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu, Xiaofeng Mei, Bo Han, Xiang Yin, Bingyue Peng, Zehuan Yuan

机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。

Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09856 2026-02-11 cs.CV cs.AI cs.CL cs.HC 62%

Code2World: A GUI World Model via Renderable Code Generation

Code2World: 通过可渲染代码生成实现一个GUI世界模型

Yuhao Zheng, Li'an Zhong, Yi Wang, Rui Dai, Kaikui Liu, Xiangxiang Chu, Linyuan Lv, Philip Torr, Kevin Qinghong Lin

机构 * University of Science(科学大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) University of Oxford(牛津大学) Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 Code2World通过可渲染代码生成实现高保真UI预测,提升Android导航性能

Comments github: https://github.com/AMAP-ML/Code2World project page: https://amap-ml.github.io/Code2World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10105 2026-02-11 cs.RO 50%

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

DexImit:从单目人类视频中学习双臂灵巧操作

Juncheng Mu, Sizhe Yang, Yiming Bao, Hojin Bae, Tianming Wei, Linning Xu, Boyi Li, Huazhe Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 DexImit通过四阶段生成流程,将单目人类视频转化为物理合理的机器人数据,以解决双臂灵巧操作的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09722 2026-02-11 cs.RO 50%

Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization

重新思考视觉-语言-动作模型的扩展:对齐、混合与正则化

Ye Wang, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Haoqi Yuan, Chaoyi Xu, Haiweng Xu, Yicheng Feng, Mingyang Yu, Zhiyu Kang, Zongqing Lu, Qin Jin

机构 * Renmin University of China(中国人民大学) BeingBeyond Peking University(北京大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究重新审视视觉-语言-动作模型的扩展问题,探讨了对齐、混合与正则化在机器人控制中的关键作用,挑战了传统假设并提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏