arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2602.23410 2026-05-18 cs.LG cs.AI eess.SP q-bio.NC 84%

Brain-OF: An Omnifunctional Foundation Model for fMRI, EEG and MEG

Brain-OF:一种适用于fMRI、EEG和MEG的多功能基础模型

Hanning Guo, Hanwen Bi, Farah Abdellatif, Andrei Galbenus, Jon. N. Shah, Abigail Morrison, Jürgen Dammers

机构 * INM-4, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-4 实验室,德国) Department of Computer Science(计算机科学系) Software Engineering, RWTH Aachen University, Germany(软件工程,亚琛工业大学,德国) INM-7, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-7 实验室,德国) Institute of Systems Neuroscience, Heinrich Heine University, Germany(系统神经科学研究所,海因里希·海涅大学,德国) Department of Neurology, RWTH Aachen University, Germany(神经病学系,亚琛工业大学,德国) JARA-BRAIN-Translational Medicine, Germany(JARA-BRAIN 转化医学,德国) INM–11, JARA, Forschungszentrum Jülich, Germany(JARA-INM-11 实验室,Jülich 研究中心,德国) IAS-6, Forschungszentrum Jülich, Germany(IAS-6 实验室,Jülich 研究中心,德国) Department of Psychiatry, Psychotherapy and Psychosomatics, RWTH Aachen University, Germany(精神病学、心理治疗和精神病理学系,亚琛工业大学,德国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Brain-OF通过联合预训练fMRI、EEG和MEG数据,解决多模态数据语义异质性和分辨率差异问题,提升跨模态数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15179 2026-05-15 cs.LG cs.AI physics.comp-ph 84%

Eradicating Negative Transfer in Multi-Physics Foundation Models via Sparse Mixture-of-Experts Routing

通过稀疏混合专家路由消除多物理基础模型中的负迁移

Ellwil Sharma, Arastu Sharma

机构 * Shodh AI

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Shodh-MoE模型,通过稀疏激活的潜在变换器架构解决多物理传输中的负迁移问题,实现精确质量守恒和领域自适应路由。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10760 2026-05-12 cs.CL cs.LG stat.ML 84%

Why is prompting hard? Understanding prompts on binary sequence predictors

为何提示难以掌握?理解二进制序列预测器上的提示

Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了二进制序列预测器上提示的挑战,通过实验揭示了预训练分布对最优提示识别的影响,并分析了前沿模型中提示的统计和经验模式。

Journal ref Artificial Intelligence and Statistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07554 2026-05-11 cs.LG cs.AI q-bio.BM stat.ML 84%

ProteinJEPA: Latent prediction complements protein language models

ProteinJEPA:潜在预测补充蛋白质语言模型

Dan Ofer, Dafna Shahaf, Michal Linial

机构 * Department of Biological Chemistry(生物化学系) School of Computer Science and Engineering(计算机科学与工程学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在匹配的运行时间预算下,潜在空间预测能否补充蛋白质语言模型的token级目标。通过35-150M参数的预训练和随机初始化蛋白质序列编码器,发现最佳的Protein-JEPA设计是仅在掩码位置预测潜在目标并保留MLM交叉熵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15564 2026-05-01 cs.SE cs.AI cs.LG 84%

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen: 一个大规模的真实世界Python类语料库用于大语言模型研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 OpenClassGen提供324,843个Python类的语料库,用于评估大语言模型的代码生成能力,通过类骨架和静态代码度量指标,支持多种应用场景。

Comments This paper has been accepted for publication at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026) AI models/data track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02132 2026-04-23 cs.CL cs.LG 84%

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models

模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征

Michael Li, Nishant Subramani

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10370 2026-04-21 cs.CV cs.AI cs.LG 84%

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

SHRUG-FM:面向地球观测的可靠性感知基础模型

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe Massant, Shruti Nath, Patrick Ebel, Vasileios Sitokonstantinou

机构 * Universitat de València(瓦伦西亚大学) Wageningen University & Research(瓦赫宁根大学与研究所) Delft University of Technology(代尔夫特理工大学) European Space Agency(欧洲航天局) Heidelberg University(海德堡大学) Ghent University(根特大学) University of Oxford(牛津大学) Google Research(谷歌研究)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。

Comments Accepted for proceedings at CVPR EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18611 2026-04-21 cs.LG cs.AI 84%

Flow marching for a generative PDE foundation model

基于生成PDE基础模型的流推进

Zituo Chen, Sili Deng

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。

Comments This work has been substantially expanded and superseded by arXiv:2602.11229

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16570 2026-04-21 cs.LG cs.AI 84%

In Search of Lost DNA Sequence Pretraining

寻找丢失的DNA序列预训练

Zhijiang Tang, Jiaxin Qi, Yan Cui, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了DNA预训练中三个关键问题:下游数据集不恰当、邻域遮蔽策略缺陷及词汇讨论不足,并提出评估标准、任务设计指导和词汇分析,通过实验验证问题重要性,最终提出标准化测试平台以推动基因组基础模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10544 2026-04-14 cs.LG cs.AI 84%

WaveMoE: A Wavelet-Enhanced Mixture-of-Experts Foundation Model for Time Series Forecasting

WaveMoE: 一种用于时间序列预测的小波增强混合专家基础模型

Shunyu Wu, Jiawei Huang, Weibin Feng, Boxin Li, Xiao Zhang, Erli Meng, Dan Li, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米集团) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 WaveMoE通过整合小波域表示提升时间序列预测能力,采用双路径架构和共享专家路由机制,实验表明其在16个基准数据集上具有提升预测性能的潜力。

Comments Presented at ICLR 2026 TSALM Workshop (1st Workshop on Time Series in the Age of Large Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04723 2026-04-07 cs.CL cs.AI 84%

Individual and Combined Effects of English as a Second Language and Typos on LLM Performance

英语作为第二语言与拼写错误的个体与综合影响

Serena Liu, Yutong Yang, Prisha Sheth, Weixuan Dong, Mingjiao Diao, Xinru Zhu, Nikhil Banga, Oscar Melendez, Arnav Sharma, Minda Zhao, Marina Lin, Mengyu Wang

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了英语作为第二语言和拼写错误对大语言模型性能的影响,发现两者结合时性能下降更显著,且在封闭式任务中表现更一致,而开放式任务结果更混杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02719 2026-04-06 cs.CV cs.AI cs.LG 84%

MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications

MOMO:用于火星轨道应用的火星轨道基础模型

Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 MOMO是首个多传感器基础模型,通过模型融合整合来自HiRISE、CTX和THEMIS三种关键火星传感器的数据,提升多分辨率数据的稳定性和泛化能力。

Comments Accepted at CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16739 2026-03-31 cs.LG cs.AI cs.HC 84%

SpecMoE: Spectral Mixture-of-Experts Foundation Model for Cross-Species EEG Decoding

SpecMoE:用于跨物种EEG解码的频谱混合专家基础模型

Davy Darankoum, Chloé Habermacher, Julien Volle, Sergei Grudinin

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔-阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔国立理工学院、让·库尔曼实验室) SynapCell SAS(SynapCell公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SpecMoE模型,通过改进的频谱掩码策略和混合专家框架,提升EEG信号解码性能,实现跨物种和跨受试者的高准确率。

Comments 34 pages (12 pages in the main text and 22 pages in Supplementary Information)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24804 2026-03-27 cs.CV cs.AI cs.LG 84%

GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining

GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练

Deen Dayal Mohan, Hossein Souri, Vitali Petsiuk, Juhong Min, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 84%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20969 2026-03-24 cs.LG cs.CL 84%

Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge

理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理

Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis

机构 * University of Southern California(南加州大学) University of British Columbia(不列颠哥伦比亚大学) Flatiron Institute(Flatiron研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20466 2026-03-24 cs.CL cs.AI 84%

Diffutron: A Masked Diffusion Language Model for Turkish Language

Diffutron:一种针对土耳其语言的掩码扩散语言模型

Şuayp Talha Kocabay, Talha Rüzgar Akkuş

机构 * Hugging Face

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Diffutron,一种专为土耳其语言设计的掩码扩散语言模型,通过高效训练流程和分阶段指令微调,实现了紧凑模型在土耳其语言生成任务中的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 84%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19149 2026-03-20 cs.CL cs.LG 84%

Optimal Splitting of Language Models from Mixtures to Specialized Domains

从混合数据中语言模型的最优分割以专用于特定领域

Skyler Seto, Pierre Ablin, Anastasiia Filippova, Jiayuan Ye, Louis Bethune, Angelos Katharopoulos, David Grangier

机构 * Apple(苹果公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种方法,通过独立预训练多个模型并利用缩放定律确定预训练和继续预训练之间的最佳计算分配,从而提升不同模型大小和计算预算下的常识知识和推理基准性能。

Comments 26 pages, 11 tables, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15644 2026-03-18 cs.LG cs.CL 84%

Tokenization Tradeoffs in Structured EHR Foundation Models

结构电子健康记录基础模型中的分词权衡

Lin Lawrence Guo, Santiago Eduardo Arciniegas, Joseph Jihyung Lee, Adam Paul Yan, George Tomlinson, Jason Fries, Lillian Sung

机构 * Child Health Evaluative Sciences(儿童健康评估科学) The Hospital for Sick Children(圣迈克尔医院) University Health Network(大学健康网络) Department of Medicine(医学部) Division of Computational Medicine, Department of Medicine(计算医学科,医学部) Stanford University(斯坦福大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了结构化电子健康记录基础模型中分词设计对性能和效率的影响,通过实验发现联合事件编码和时间位置编码在多个临床预测任务中表现更优,且计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13301 2026-03-17 cs.IR cs.AI cs.LG 84%

Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval

并非所有查询都需要重写:当仅提示的LLM细化在密集检索中帮助和损害时

Varun Kotte

机构 * Adobe(Adobe公司)

专题命中 预训练与数据 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了仅提示的LLM查询重写对密集检索的影响,发现其效果高度依赖领域,通过实验发现重写在不同数据集上产生不同效果,并指出领域适应性后训练比单纯重写更安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 84%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11535 2026-03-13 cs.AI cs.CL 84%

Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing

专家阈值路由用于自回归语言模型的动态计算分配与负载均衡

Hanchi Sun, Yixin Liu, Yonghui Wu, Lichao Sun

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出专家阈值路由方法,通过动态计算分配和负载平衡机制提升自回归语言模型性能,实验显示其在预训练任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11648 2026-03-11 cs.LG cs.AI 84%

Lightweight Time Series Data Valuation on Time Series Foundation Models via In-Context Finetuning

基于上下文微调的轻量时间序列数据估值方法

Shunyu Wu, Tianyue Li, Yixuan Leng, Jingyi Suo, Jian Lou, Dan Li, See-Kiong Ng

机构 * Sun Yat-sen University State Key Laboratory of Internet Architecture(中山大学互联网架构国家重点实验室) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTSV方法,通过上下文微调实现轻量时间序列数据估值,有效解决传统方法的计算瓶颈和时间依赖性问题。

Comments Accepted as a full paper at DASFAA 2026 (The 31st International Conference on Database Systems for Advanced Applications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06088 2026-03-09 cs.CL cs.AI 84%

Experiences Build Characters: The Linguistic Origins and Functional Impact of LLM Personality

经验塑造性格:大语言模型人格的语言起源与功能影响

Xi Wang, Mengdie Zhuang, Jiqun Liu

机构 * University of Sheffield(谢菲尔德大学) University of Oklahoma(俄克拉荷马大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过持续预训练和大五人格框架,揭示了大语言模型人格的形成机制,发现模型能力在特定性格类型中表现最佳,并揭示了训练数据语言特征对推理性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04904 2026-03-06 cs.AI cs.CL 84%

Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems

对齐反噬:在16种语言的LLM多智能体系统中语言依赖性的安全干预逆转

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪精神病研究所以及性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在不同语言的LLM多智能体系统中,对齐干预可能导致安全措施的逆转,揭示了语言空间对对齐效果的决定性影响。

Comments 89 pages, 4 figures, 4 supplementary figures, 12 supplementary tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02026 2026-03-03 cs.CV cs.CL cs.LG 84%

Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT

学习如何注视:面向3D CT的疾病感知视觉-语言预训练

Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02052 2026-03-03 q-bio.BM cs.AI cs.LG q-bio.QM 84%

General Protein Pretraining or Domain-Specific Designs? Benchmarking Protein Modeling on Realistic Applications

通用蛋白质预训练还是领域特定设计?在真实应用场景中对蛋白质建模的基准测试

Shuo Yan, Yuliang Yan, Bin Ma, Chenao Li, Haochun Tang, Jiahua Lu, Minhua Lin, Yuyuan Feng, Enyan Dai

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Pennsylvania State University(宾夕法尼亚州立大学) Xiamen University(厦门大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Protap通过比较不同架构和预训练策略,在真实应用场景中评估蛋白质建模的性能,发现领域特定知识和结构信息对提升模型效果至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22557 2026-02-27 cs.AI cs.LG 84%

CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety

CourtGuard:一种用于大语言模型安全的模型无关框架,用于零样本策略适应

Umid Suleymanov, Rufiz Bayramov, Suad Gafarli, Seljan Musayeva, Taghi Mammadov, Aynur Akhundlu, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT(信息技术学院) Engineering, ADA University(工程学院,ADA大学) School of Law, ADA University(法学院,ADA大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CourtGuard通过证据辩论框架实现大语言模型的安全零样本适应,超越传统方法在多个安全基准测试中的表现,并具备跨领域泛化和自动数据审计能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15162 2026-02-20 eess.SP cs.AI cs.LG 84%

Multimodal Wireless Foundation Models

多模态无线基础模型

Ahmed Aboulfotouh, Hatem Abou-Zeid

机构 * Department of Electrical and Software Engineering(电气与软件工程系) University of Calgary(卡尔加里大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个多模态无线基础模型,能处理IQ流和图像类无线模态,支持多种无线任务,展示了其在不同模态上的广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏