arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12637 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12637 篇

2603.00857 2026-05-26 cs.LG cs.AI 81%

MultiPUFFIN: A Multimodal Domain-Constrained Foundation Model for Molecular Property Prediction of Small Molecules

MultiPUFFIN:用于小分子性质预测的多模态领域约束基础模型

Idelfonso B. R. Nogueira, Carine M. Rebello, Mumin Enis Leblebici, Erick Giovani Sperandio Nascimento

机构 * Department of Chemical Engineering, Norwegian University of Science and Technology (NTNU)(挪威科学与技术大学化学工程系) Faculty of Industrial Engineering, KU Leuven(鲁文大学工业工程学院) University of Surrey(萨里大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出多模态基础模型MultiPUFFIN,融合SMILES、2D图、3D构象及实验条件,通过条件感知精炼和热力学约束头,在小样本下优于ChemBERTa-2,预测小分子热物理性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24965 2026-05-26 cs.CV cs.AI cs.LG 81%

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

视觉基础模型在面部深度伪造检测中的跨域泛化极限

Ibrahim Delibasoglu

机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24771 2026-05-26 cs.CV cs.AI cs.LG 81%

From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

从理论到决策规则:校准视觉-语言模型弱监督的噪声标签交叉点——基于三个医学影像基准

Bruce Changlong Xu, Jose James, Alexander Ryu

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 领域大模型 :language model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过三个医学影像基准校准理论预测的噪声标签交叉点,提出基于少量金标标签的决策规则。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22001 2026-05-22 cs.CR cs.AI cs.CL 81%

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

守卫中的盲区:如何域伪装注入攻击在多智能体大语言模型系统中逃避检测

Aaditya Pai

机构 * Data Science Institute(数据科学研究所) Columbia University(哥伦比亚大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在多智能体大语言模型系统中,域伪装注入攻击如何通过模仿目标文档的领域词汇和权威结构来逃避检测,揭示了检测器在静态和伪装负载之间的检测率差异(Camouflage Detection Gap, CDG),并展示了多智能体辩论架构对静态注入攻击的放大效应以及检测器增强的有限有效性。

Comments 8 pages, 3 figures, 2 tables. Submitted to EMNLP 2026 ARR cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25723 2026-05-19 cs.CL cs.AI 81%

Natural-Language Agent Harnesses

自然语言代理Harness

Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 领域大模型 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出自然语言代理Harness(NLAH)作为一种可执行的自然语言对象,用于描述任务运行的Harness策略,并引入Intelligent Harness Runtime(IHR)作为共享运行时,能够将这些文档解释为代理调用、交接、状态更新、验证门和成果合同。实验表明,NLAH在编码、终端使用和计算机使用基准测试中表现与代码和提示实现相当,同时暴露了更短的静态Harness策略。

Comments revise paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23978 2026-05-19 cs.LG cs.CL cs.CY cs.SI 81%

LLM Agents Are the Antidote to Walled Gardens

大语言模型代理是封闭生态系统的解药

Samuele Marro, Philip Torr

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过大语言模型代理实现通用互操作性,打破封闭平台垄断,促进数据端到端迁移,同时探讨其带来的安全与法律挑战。

Comments Published at the ICML 2026 Position Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16222 2026-05-18 cs.CL cs.LG 81%

Artificial Aphasias in Lesioned Language Models

病变语言模型中的人工失语症

Nathan Roll, Jill Kries, Laura Gwilliams, Cory Shain

机构 * Wu Tsai Neurosciences Institute(吴Tsai神经科学研究所)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 通过模拟失语症对语言模型进行参数损伤,研究其功能组织特性,发现模型与人类失语症在症状分布上有显著差异,揭示学习和处理细节对语言处理的影响。

Comments 49 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16011 2026-05-18 cs.CL cs.AI 81%

Can Vision Language Models Be Adaptive in Mathematics Education? A Learner Model-based Rubric Study

视觉语言模型在数学教育中能否具备适应性?一种基于学习者模型的评分研究

Jie Gao, Yongan Yu, Junzhu Su, Yiran Lin, Adam K. Dube, Jackie Chi Kit Cheung

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克AI研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨视觉语言模型在数学教育中的适应性,提出基于学习者模型的评分框架,评估模型在认知、动机和复杂度方面的适应性,并发现现有模型在有限学习者信息下难以产生一致的指导响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14698 2026-05-15 cs.LG cs.AI 81%

NeuroAtlas: Benchmarking Foundation Models for Clinical EEG and Brain-Computer Interfaces

NeuroAtlas:用于临床EEG和脑机接口的基础模型基准测试

Konstantinos Kontras, Trui Osselaer, Stylianos G. Mouslech, Angeliki-Ilektra Karaiskou, Guido Gagliardi, Thomas Strypsteen, Mohammad Hossein Badiei, Anku Rani, Maarten Vanmarcke, Miguel Bhagubai, Chanakya Ekbote, Jaedong Hwang, Christos Chatzichristos, Paul Pu Liang, Maarten De Vos

机构 * KU Leuven(鲁文大学) MIT(麻省理工学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 NeuroAtlas是首个大规模EEG基准测试,包含42个数据集和260万小时的数据,涵盖癫痫、睡眠医学和脑年龄估计等领域,评估了EEG基础模型与通用时间序列模型的性能,揭示了现有模型在统一EEG模型上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00020 2026-05-04 cs.LG cs.AI cs.IT eess.SP math.IT 81%

AirFM-DDA: Air-Interface Foundation Model in the Delay-Doppler-Angle Domain for AI-Native 6G

AirFM-DDA:用于AI原生6G的延迟-多普勒-角度域空气接口基础模型

Kejia Bian, Meixia Tao, Jianhua Mo, Zhiyong Chen, Leyan Chen

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院,上海,200240,中国) Shanghai Innovation Institute, Shanghai 200231, China(上海创新研究院,上海200231,中国)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AirFM-DDA,一种在延迟-多普勒-角度域运作的空气接口基础模型,用于物理层任务,通过重新参数化CSI并引入帧结构感知位置编码,提升零样本泛化能力与计算效率。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04638 2026-04-21 cs.CL cs.AI 81%

SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation

SpeechMedAssist: 有效且高效地适应语音语言模型用于医疗咨询

Sirry Chen, Jieyi Wang, Wei Chen, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institude(上海创新研究院) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SpeechMedAssist,一种能进行语音多轮交互的语音语言模型,通过分阶段训练减少对医疗语音数据的需求,提升医疗咨询场景下的效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10065 2026-04-14 cs.CL cs.AI cs.SD eess.AS 81%

ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models

ASPIRin: 动作空间投影用于全双工语音语言模型中的交互优化强化学习

Chi-Yuan Hsiao, Ke-Han Lu, Yu-Kuan Fu, Guan-Ting Lin, Hsiao-Tsung Hung, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) ASUS Open Cloud Infrastructure Software Center(华硕开放云端基础设施软件中心) NVIDIA AI Technology Center(英伟达人工智能技术中心)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ASPIRin通过动作空间投影和GRPO方法优化全双工语音语言模型的交互性能,提升语义连贯性并减少重复生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05086 2026-04-10 cs.CL cs.AI 81%

A systematic framework for generating novel experimental hypotheses from language models

从语言模型生成新颖实验假设的系统框架

Kanishka Misra, Najoung Kim

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个系统框架,利用语言模型模拟未在文献中存在的实验结果,针对儿童语言发展中的代词动词习得和跨结构泛化问题,生成新颖未测试的假设,并设计可实验室测试的实验。

Comments Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06356 2026-04-09 cs.CL cs.AI 81%

In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads

语音语言模型中的上下文学习:分析语音特征、语言结构和归纳头的作用

Charlotte Pouw, Hosein Mohebbi, Afra Alishahi, Willem Zuidema

机构 * ILLC, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所) CSAI, Tilburg University(蒂尔堡大学认知科学与人工智能系)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了语音模型中上下文学习中语音特征、语言结构和归纳头的影响,发现语速显著影响学习效果,而音高和强度影响较小,归纳头在语音上下文学习中起因果作用。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22581 2026-04-08 cs.CV cs.AI cs.LG 81%

Cross-Domain Few-Shot Learning for Hyperspectral Image Classification Based on Mixup Foundation Model

跨领域少样本学习用于超光谱图像分类的Mixup基础模型

Naeem Paeedeh, Mahardhika Pratama, Ary Shiddiqi, Zehong Cao, Mukesh Prasad, Wisnu Jatmiko

机构 * School of Computer Science and IT, Adelaide University(阿德莱德大学计算机科学与信息技术学院) Department of Informatics, Institut Teknologi Sepuluh Nopember(泗水理工学院信息学系) University of Technology, Sydney, Australia(悉尼科技大学) Faculty of Computer Science, University of Indonesia(印度尼西亚大学计算机科学学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MIFOMO模型,通过共聚投影和混合域适应解决跨领域少样本学习中的数据稀缺和领域差异问题,实验表明其性能优于现有方法14%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25040 2026-04-03 cs.LG cs.CL cs.CV 81%

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

Intern-S1-Pro:万亿参数科学多模态基础模型

Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou, Xinyu Zhou, Dongzhan Zhou, Zhiwang Zhou, Yuhao Zhou, Bowen Zhou, Zhanping Zhong, Zhijie Zhong, Haiteng Zhao, Penghao Zhao, Xiaomeng Zhao, Zhiyuan Zhao, Yechen Zhang, Jin Zhang, Wenwei Zhang, Hongjie Zhang, Zhuo Zhang, Wenlong Zhang, Bo Zhang, Chao Zhang, Chen Zhang, Yuhang Zang, Fei Yuan, Jiakang Yuan, Jiashuo Yu, Jinhui Yin, Haochen Ye, Qian Yao, Bowen Yang, Danni Yang, Kaichen Yang, Ziang Yan, Jun Xu, Yicheng Xu, Wanghan Xu, Xuenan Xu, Chao Xu, Ruiliang Xu, Shuhao Xing, Long Xing, Xinchen Xie, Ling-I Wu, Zijian Wu, Zhenyu Wu, Lijun Wu, Yue Wu, Jianyu Wu, Wen Wu, Fan Wu, Xilin Wei, Qi Wei, Bingli Wang, Rui Wang, Ziyi Wang, Zun Wang, Yi Wang, Haomin Wang, Yizhou Wang, Lintao Wang, Yiheng Wang, Longjiang Wang, Bin Wang, Jian Tong, Zhongbo Tian, Huanze Tang, Chen Tang, Shixiang Tang, Yu Sun, Qiushi Sun, Xuerui Su, Qisheng Su, Chenlin Su, Demin Song, Jin Shi, Fukai Shang, Yuchen Ren, Pengli Ren, Xiaoye Qu, Yuan Qu, Jiantao Qiu, Yu Qiao, Biqing Qi, Runyu Peng, Tianshuo Peng, Jiahui Peng, Qizhi Pei, Zhuoshi Pan, Linke Ouyang, Wenchang Ning, Yichuan Ma, Zerun Ma, Ningsheng Ma, Runyuan Ma, Chengqi Lyu, Haijun Lv, Han Lv, Lindong Lu, Kuikun Liu, Jiangning Liu, Yuhong Liu, Kai Liu, Hongwei Liu, Zhoumianze Liu, Mengjie Liu, Ziyu Liu, Wenran Liu, Yang Liu, Liwei Liu, Kaiwen Liu, Junyao Lin, Junming Lin, Tianyang Lin, Dahua Lin, Jianze Liang, Linyang Li, Peiji Li, Zonglin Li, Zehao Li, Pengze Li, Guoyan Li, Lingkai Kong, Linglin Jing, Zhenjiang Jin, Feifei Jiang, Qian Jiang, Junhao Huang, Zixian Huang, Haian Huang, Zhouqi Hua, Ermo Hua, Han Hu, Linfeng Hou, Yinan He, Conghui He, Tianyao He, Xu Guo, Qipeng Guo, Aijia Guo, Yuzhe Gu, Lixin Gu, Jingyang Gong, Qiming Ge, Jiaye Ge, Songyang Gao, Jianfei Gao, Xinyu Fang, Caihua fan, Yue Fan, Yanhui Duan, Zichen Ding, Shengyuan Ding, Ning Ding, Xuanlang Dai, Erfei Cui, Ganqu Cui, Pei Chu, Tao Chu, Guangran Cheng, Yu Cheng, Kai Chen, Yongkang Chen, Chiyu Chen, Guanzhou Chen, Qiaosheng Chen, Sitao Chen, Xin Chen, Haojiong Chen, Yicheng Chen, Weihan Cao, Yuhang Cao, Qinglong Cao, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 Intern-S1-Pro是首个万亿参数科学多模态基础模型,具备跨通用与科学领域的能力提升,融合强推理、图像-文本理解及先进代理能力,专精于100余项科学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23783 2026-03-27 cs.LG cs.AI math.OC math.PR stat.ML 81%

Probabilistic Geometric Alignment via Bayesian Latent Transport for Domain-Adaptive Foundation Models

通过贝叶斯潜在传输的概率几何对齐用于领域自适应基础模型

Aueaphum Aueawatthanaphisut, Kuepon Auewattanapisut

机构 * School of Information, Computer Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathumthani, Thailand 0009-0006-4313-7359 epartment of Architecture, Faculty of Architecture Khon Kaen University Khon Kaen, Thailand

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种概率潜在传输框架,通过在表示空间中将领域适应建模为随机几何对齐问题,解决领域自适应中的潜在分布不匹配、优化动态不稳定和不确定性传播校准问题。

Comments 11 pages, 8 Figures, 25 Equations, 5 Tables and 3 Theorems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22767 2026-03-25 cs.AI cs.CL 81%

Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases

大语言模型代理能否生成真实世界证据?评估医学数据库中的观察性研究

Dubai Li, Yuxiang He, Yan Hu, Yu Tian, Jingsong Li

机构 * Zhejiang University(浙江大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型代理在生成真实世界证据方面的能力,通过RWE-bench基准测试,发现代理在生成完整证据包方面存在显著局限,需进一步改进验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21335 2026-03-25 cs.CL cs.LG 81%

TimeTox: An LLM-Based Pipeline for Automated Extraction of Time Toxicity from Clinical Trial Protocols

TimeTox:基于LLM的自动化提取临床试验协议中时间毒性管道

Saketh Vinjamuri, Marielle Fis Loperena, Marie C. Spezia, Ramez Kouzy

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 TimeTox通过Gemini模型三阶段提取临床试验协议中的时间毒性,验证了两阶段流程在真实数据中的高稳定性和准确性,展示了LLM在医疗领域应用的潜力。

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07946 2026-03-25 cs.LG cs.AI cs.ET 81%

Bringing Multi-Modal Multi-Task Federated Foundation Models to Education Domain: Prospects and Challenges

将多模态多任务联邦基础模型引入教育领域:前景与挑战

Kasra Borazjani, Naji Khosravan, Rajeev Sahay, Bita Akram, Seyyedali Hosseinalipour

机构 * University at Buffalo –SUNY, Department of Electrical Engineering(布法罗大学–纽约州立大学,电气工程系) Adobe Research(Adobe研究) University of California – San Diego, Department of Electrical and Computer Engineering(加州大学圣地亚哥分校,电气与计算机工程系) NC State University, Department of Computer Science(北卡罗来纳州立大学,计算机科学系)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模态多任务联邦基础模型(FedFMs)用于教育领域,旨在解决隐私保护、个性化和公平性问题,同时探讨未来研究方向和开放挑战。

Comments 12 pages, 2 figures

Journal ref Frontiers in Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00240 2026-03-19 cs.CR cs.AI cs.LG 81%

SecureBERT 2.0: Advanced Language Model for Cybersecurity Intelligence

SecureBERT 2.0:面向网络安全情报的高级语言模型

Ehsan Aghaei, Sarthak Jain, Prashanth Arun, Arjun Sambamoorthy

机构 * Cisco AI San Jose(思科AI圣何塞)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SecureBERT 2.0通过改进的长上下文建模和分层编码,提升网络安全领域威胁情报的语义搜索、分析和漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04594 2026-03-10 cs.LG cs.AI 81%

GraphProp: Training the Graph Foundation Models using Graph Properties

GraphProp: 基于图属性训练图基础模型

Ziheng Sun, Qi Feng, Lehao Lin, Chris Ding, Jicong Fan

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 GraphProp通过强调结构泛化,提升图基础模型在跨领域任务中的表现,尤其在无节点属性图的处理上效果显著。

Comments The paper will be extensively rewritten to resolve fundamental limitations, particularly concerning the influence of graph properties on performance across various graph tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27173 2026-03-06 cs.CE cs.AI cs.LG math.DS 81%

FMint-SDE: A Multimodal Foundation Model for Accelerating Numerical Simulation of SDEs via Error Correction

FMint-SDE:一种多模态基础模型,通过误差校正加速微分方程的数值模拟

Jiaxin Yuan, Haizhao Yang, Maria Cameron

机构 * University of Maryland(马里兰大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 FMint-SDE通过多模态学习实现误差校正,提升微分方程数值模拟的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20677 2026-03-03 cs.LG cs.AI 81%

UrbanFM: Scaling Urban Spatio-Temporal Foundation Models

UrbanFM: 扩展城市时空基础模型

Wei Chen, Yuqian Wu, Junle Chen, Xiaofang Zhou, Yuxuan Liang

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 UrbanFM通过扩展城市时空数据和模型架构,实现大规模城市时空基础模型的初步突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00054 2026-03-03 cs.LG cs.AI 81%

Expert Divergence Learning for MoE-based Language Models

专家分歧学习用于基于混合专家的语言模型

Jiaang Li, Haibin Chen, Langming Liu, Yujin Yuan, Yadao Wang, Yizhen Zhang, Chengting Yu, Xin Tong, Weidong Zhang, Shilei Liu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 专家分歧学习通过促进专家功能专业化,提升MoE模型的语言建模能力及下游任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19704 2026-02-27 q-bio.BM cs.AI cs.LG 81%

Multi-view biomedical foundation models for molecule-target and property prediction

多视图生物医学基础模型用于分子-靶点和性质预测

Parthasarathy Suryanarayanan, Yunguang Qiu, Shreyans Sethi, Diwakar Mahajan, Hongyang Li, Yuxin Yang, Elif Eyigoz, Aldo Guzman Saenz, Daniel E. Platt, Timothy H. Rumbell, Kenney Ng, Sanjoy Dey, Myson Burch, Bum Chul Kwon, Pablo Meyer, Feixiong Cheng, Jianying Hu, Joseph A. Morrone

机构 * IBM TJ Watson Research Center(IBM TJ Watson研究中心) Lerner Research Institute(Lerner研究机构) Cleveland Clinic Genome Center(克利夫兰诊所基因组中心) IBM Research - Almaden(IBM Research-阿玛登) IBM Research(IBM研究) Cleveland Clinic Lerner College of Medicine, Case Western Reserve University(克利夫兰诊所Lerner医学院,凯斯西储大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多视图生物医学基础模型MMELON,通过整合图、图像和文本视图,提升分子-靶点及性质预测的性能与准确性。

Comments 40 pages including supplement. 10 figures, 8 tables

Journal ref Advanced Science (2026) e17840

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21216 2026-02-26 cs.CL cs.AI 81%

EQ-5D Classification Using Biomedical Entity-Enriched Pre-trained Language Models and Multiple Instance Learning

利用生物医学实体增强的预训练语言模型和多实例学习进行EQ-5D分类

Zhyar Rzgar K Rostam, Gábor Kertész

机构 * Doctoral School of Applied Informatics and Applied Mathematics, Obuda University(应用信息与应用数学博士学校,奥布达大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用生物医学实体增强的预训练语言模型和多实例学习方法,提升EQ-5D在摘要中的检测精度,实现更高效的系统文献综述自动化筛选。

Comments 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08274 2026-02-25 cs.CL cs.AI 81%

Language Modeling and Understanding Through Paraphrase Generation and Detection

通过改写生成与检测实现语言模型与理解

Jan Philip Wahle

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分解改写类型提升语言模型对语义等价的理解能力,在剽窃检测和重复问题识别中取得显著成效。

Comments PhD Thesis (Dissertation), University of Göttingen Germany, 2025. 186 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01865 2026-02-23 cs.CL cs.AI 81%

Cross-Lingual Interleaving for Speech Language Models

跨语言交织用于语音语言模型

Adel Moumen, Guangzhi Sun, Philip C. Woodland

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言交织方法,通过混合多语言语音标记提升SLMs的跨语言理解和生成能力,并发布相关数据集和基准以促进多语言语音模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 81%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏