arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2506.22506 2026-01-28 cs.CR cs.AI 57%

SABRE-FL: Selective and Accurate Backdoor Rejection for Federated Prompt Learning

SABRE-FL:面向联邦提示学习的选样和准确后门拒绝

Momin Ahmad Khan, Yasra Chandio, Fatima Muhammad Anwar

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 SABRE-FL通过嵌入空间异常检测器有效识别并过滤联邦提示学习中的恶意客户端,显著降低后门攻击效果,提升系统鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 57%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21791 2026-01-28 stat.ML cs.LG 57%

Global Minimizers of $\ell^p$-Regularized Objectives Yield the Sparsest ReLU Neural Networks

ℓ^p正则化目标的全局极小解产生最稀疏的ReLU神经网络

Julia Nakhleh, Robert D. Nowak

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本文提出了一种连续可微的训练目标,通过ℓ^p准范数最小化,保证找到最稀疏的ReLU神经网络解,为稀疏性诱导提供了理论基础。

Comments Update to final published version (NeurIPS 2025). Fixed one incorrect citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08231 2026-01-28 cs.CL 57%

Out of Style: RAG's Fragility to Linguistic Variation

脱离风格:RAG对语言变异的脆弱性

Tianyu Cao, Neel Bhandari, Akhila Yerukola, Akari Asai, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 本研究分析了RAG系统在不同语言变异维度下的性能,发现其在非正式和语法错误查询中表现显著下降,凸显了对语言变化的脆弱性。

Comments Accepted to EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19822 2026-01-28 eess.SY cs.SY 50%

A Latent Space Framework for Modeling Transient Engine Emissions Using Joint Embedding Predictive Architectures

一种用于通过联合嵌入预测架构建模瞬态发动机排放的潜在空间框架

Ganesh Sundaram, Tobias Gehra, Jonas Ulmen, Mirjan Heubaum, Daniel Görges, Michael Günthner

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出了一种基于联合嵌入预测架构的潜在空间框架,用于高效建模瞬态发动机排放,提升预测精度和计算效率。

Comments 10 pages, Submitted to the 2026 SAE WCX

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19535 2026-01-28 cs.IR 50%

LURE-RAG: Lightweight Utility-driven Reranking for Efficient RAG

LURE-RAG:轻量级基于效用的重排序用于高效的RAG

Manish Chandra, Debasis Ganguly, Iadh Ounis

专题命中 效率与部署 :LLM(abstract)

AI总结 LURE-RAG通过基于LLM效用的列表排序损失优化检索文档顺序,实现高效RAG框架,在性能和效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 21 篇

2601.19325 2026-01-28 cs.CV cs.AI 89%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18998 2026-01-28 cs.CL 89%

Malicious Repurposing of Open Science Artefacts by Using Large Language Models

利用大语言模型恶意重用开放科学制品

Zahra Hashemi, Zhiqiang Zhong, Jun Pang, Wei Zhao

机构 * University of Luxemburg(卢森堡大学) University of Aberdeen(阿伯丁大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了利用大语言模型恶意重用开放科学制品生成有害研究的可能性,通过端到端流程揭示LLMs在恶意评估中的局限性,强调人类评估在双用途风险评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19559 2026-01-28 cs.IR stat.AP 89%

Comparing how Large Language Models perform against keyword-based searches for social science research data discovery

比较大型语言模型在社会科学研究数据发现中相对于基于关键词搜索的表现

Mark Green, Maura Halstead, Caroline Jay, Richard Kingston, Alex Singleton, David Topping

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文比较了基于大型语言模型的语义搜索在社会科学数据发现中的表现,发现其在处理复杂查询和拼写错误时表现优异,且在语义相似度上优于传统关键词搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19533 2026-01-28 cs.SD cs.AI 88%

SLM-SS: Speech Language Model for Generative Speech Separation

SLM-SS:用于生成式语音分离的语音语言模型

Tianhua Li, Chenda Li, Wei Wang, Xin Zhou, Xihui Chen, Jianqing Gao, Yanmin Qian

机构 * Auditory Cognition and Computational Acoustics Lab(听觉认知与计算声学实验室) MoE Key Lab of Artificial Intelligence, AI Institute(人工智能MoE重点实验室,AI研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) VUI Labs(VUI实验室) AI research Institute, iFLYTEK Company Limited(AI研究院,iFLYTEK公司)

专题命中 领域大模型 :language model(title,abstract);SLM(title,abstract);分类 cs.AI

AI总结 SLM-SS通过应用语音语言模型提升生成式语音分离的语音可懂度和连贯性,实验显示其在语音可懂度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 88%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 领域大模型 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19332 2026-01-28 cs.HC 85%

CaseMaster: Designing and Evaluating a Probe for Oral Case Presentation Training with LLM Assistance

CaseMaster: 设计和评估一种利用LLM辅助的口头病例展示训练探针

Yang Ouyang, Yuansong Xu, Chang Jiang, Yifan Jin, Haoran Jiang, Quan Li

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CaseMaster利用LLM辅助设计交互式探针,帮助医学生提升口头病例展示技能,通过形成性研究和专家反馈验证其在提高展示质量和减少工作量方面的潜力。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 85%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19588 2026-01-28 cs.LG cs.AI 84%

From Atoms to Chains: Divergence-Guided Reasoning Curriculum for Unlabeled LLM Domain Adaptation

从原子到链:基于分歧引导的推理课程用于无标签LLM领域适应

Yongqi Wang, Xiaofeng Ji, Jie Wang, Qingbin Li, Xiao Xiong, Zheming Yang, Jian Xu, Minghui Qiu, Xinxiao Wu

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ByteDance China(字节跳动中国)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGRC方法,通过分歧引导构建从原子知识到推理链的学习课程,提升无标签LLM在医疗和法律领域适应性能。

Comments Code: https://github.com/bytedance/DGRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17048 2026-01-28 eess.AS cs.CL cs.SD 83%

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

为何语音语言模型无法生成语义连贯的输出?一种模态演化的视角

Hankun Wang, Haoran Wang, Yiwei Guo, Zhihan Li, Chenpeng Du, Kai Yu

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文从模态演化的角度分析语音语言模型生成语义不连贯的原因,发现语音信息的复杂性和长度对模型性能有显著影响,提出改进端到端SLMs的路径。

Comments 5 pages, 3 figures, 4 tables. Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18942 2026-01-28 cs.CY cs.CL cs.DL 83%

Language Models Should be Used to Surface the Unwritten Code of Science and Society

语言模型应用于揭示科学与社会的

Honglin Bao, Siyang Wu, Jiwoong Choi, Yingrong Mao, James A. Evans

机构 * University of Chicago(芝加哥大学)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出利用语言模型揭示科学与社会中的隐含规则,通过生成自洽假设揭示同行评审中的隐藏因素,并探讨其在社会价值观公开讨论中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19191 2026-01-28 cs.CL cs.LG 81%

Transparency-First Medical Language Models: Datasheets, Model Cards, and End-to-End Data Provenance for Clinical NLP

面向透明性的医疗语言模型:数据表、模型卡片和端到端数据溯源用于临床NLP

Olaf Yunus Laitinen Imanov, Taner Yilmaz, Ayse Tuba Tugrul, Melike Nesrin Zaman, Ozkan Gunalp, Duygu Erisken, Sila Burde Dulger, Rana Irem Turhan, Izzet Ozdemir, Derya Umut Kulali, Ozan Akbulut, Harun Demircioglu, Hasan Basri Kara, Berfin Tavan

机构 * TeMLM Foundation(TeMLM基金会)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 TeMLM通过数据表、模型卡片和端到端数据溯源,为临床NLP提供透明性优先的发布工具包,支持可重复审计和真实数据验证。

Comments 12 pages, 9 figures, 15 tables. Technetium-I case study and ProtactiniumBERT-100M reference benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17177 2026-01-28 cs.CV cs.LG 79%

A Genealogy of Foundation Models in Remote Sensing

遥感领域基础模型的谱系

Kevin Lane, Morteza Karimzadeh

机构 * University of Colorado, Boulder(科罗拉多大学博尔德分校)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本文探讨了遥感领域基础模型的发展历程,分析了单传感器与多传感器方法的优劣,并提出了未来改进方向。

Comments 28 pages, submitted to ACM SigSpatial, accepted as of January 12th, 2026. This is the second revision from the original 20-page manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19286 2026-01-28 cs.CL 77%

ReToP: Learning to Rewrite Electronic Health Records for Clinical Prediction

ReToP:学习重写电子健康记录以进行临床预测

Jesus Lovon-Melgarejo, Jose G. Moreno, Christine Damase-Michel, Lynda Tamine

机构 * University of Toulouse, IRIT(图卢兹大学,IRIT) Toulouse University Hospital(图卢兹大学医院) University of Toulouse, Inserm UMR 1295(图卢兹大学,Inserm UMR 1295)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReToP通过端到端训练EHR重写器和临床预测器,利用分类监督贡献分数提升临床预测性能,实现EHR数据的优化重写与预测任务的结合。

Comments Accepted by WSDM 2026

Journal ref WSDM 2026, Feb 2026, Boise Idaho, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10113 2026-01-28 cs.CL 77%

What Does Neuro Mean to Cardio? Investigating the Role of Clinical Specialty Data in Medical LLMs

神经对心脏意味着什么?调查临床专科数据在医学大语言模型中的作用

Xinlan Yan, Di Wu, Yibin Lei, Christof Monz, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam UMC(医学信息学系,阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过S-MedQA数据集研究临床专科数据在医学大语言模型中的作用,发现领域转移比注入专科知识更能提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15301 2026-01-28 cs.CL cs.AI 76%

Can We Trust LLM Detectors?

我们能相信LLM检测器吗?

Jivnesh Sandhan, Harshit Jaiswal, Fei Cheng, Yugo Murawaki

机构 * Kyoto University(京都大学) IIT Kanpur(印度理工学院坎浦尔)

专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出监督对比学习框架,揭示现有LLM检测器在分布偏移和风格扰动下的脆弱性,指出构建领域无关检测器的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12529 2026-01-28 cs.HC cs.AI cs.CL 73%

Accepted with Minor Revisions: Value of AI-Assisted Scientific Writing

接受修改后:人工智能辅助科学写作的价值

Sanchaita Hazra, Doeun Lee, Bodhisattwa Prasad Majumder, Sachin Kumar

机构 * The University of Utah(犹他大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI辅助科学写作的有效性,发现AI生成摘要在披露来源信息后可达到与人工摘要相当的可接受性,且作者编辑行为受对AI作者身份的感知驱动。

Comments Published in ACM IUI 2026 (Paphos, Cyprus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 73%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12253 2026-01-28 cs.CV cs.LG 70%

Federated Joint Learning for Domain and Class Generalization

联邦联合学习用于领域和类别泛化

Haoran Xu, Jiaze Li, Jianzhong Ju, Zhenbo Luo

专题命中 领域大模型 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 FedDCG通过联邦联合学习同时解决领域和类别泛化问题,通过领域分组策略和解耦机制提升模型在未见领域和类别上的泛化能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10492 2026-01-28 cs.IR cs.LG 70%

Don't Waste It: Guiding Generative Recommenders with Structured Human Priors via Multi-Head Decoding

不要浪费它:通过多头解码引导生成推荐系统以利用结构化的人类先验

Yunkai Zhang, Qiang Zhang, Feng Lin, Ruizhong Qiu, Hanchao Yu, Jiayi Liu, Yinglong Xia, Benyu Zhang, Zeyu Zheng, Diji Yang

机构 * Meta AI

专题命中 领域大模型 :LLM(abstract);foundation model(abstract);分类 cs.LG

AI总结 通过多头解码引导生成推荐系统,利用结构化人类先验提升推荐准确性与多样性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18997 2026-01-28 cs.CV cs.LG 57%

Anatomically-aware conformal prediction for medical image segmentation with random walks

解剖学感知的符合预测用于带有随机游走的医学图像分割

Mélanie Gaillochet, Christian Desrosiers, Hervé Lombaert

机构 * École de Technologie Supérieure Mila - Quebec AI Institute Polytechnique Montréal

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 本文提出RW-CP方法,通过随机游走扩散不确定性,提升医学图像分割的解剖学一致性与预测稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18966 2026-01-28 cs.HC 50%

People Can Accurately Predict Behavior of Complex Algorithms That Are Available, Compact, and Aligned

人们可以准确预测可获得、紧凑且对齐的复杂算法的行为

Lindsay Popowski, Helena Vasconcelos, Ignacio Javier Fernandez, Chijioke Chinaza Mgbahurike, Ralf Herbrich, Jeffrey Hancock, Michael S. Bernstein

专题命中 领域大模型 :LLM(abstract)

AI总结 本文提出用户能准确预测复杂算法行为的三个条件:认知可用性、概念紧凑性和高对齐度,并通过实验验证了这些条件对预测准确性和心理模型的影响。

Comments 41 pages, 9 figures; this work to appear in PACMHCI V10, N2, April 2026 and be presented at the 29th ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 4 篇

2507.13550 2026-01-28 cs.AI cs.CL cs.SC 88%

GOFAI meets Generative AI: Development of Expert Systems by means of Large Language Models

GOFAI与生成式AI的交汇:通过大语言模型开发专家系统

Eduardo C. Garrido-Merchán, Cristina Puente

机构 * Quantitative Methods Department, Comillas Pontifical University Institute of Research in Technology (IIT)(定量方法部门,科利马斯天主教大学技术研究所) Computer Science Department, ICAI School of Engineering, Comillas Pontifical University(计算机科学系,ICAI工程学院,科利马斯天主教大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过大语言模型开发专家系统的方法,结合LLMs的检索能力和符号系统的精确性,以实现可解释、可扩展和可靠的知识表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19723 2026-01-28 cs.CL cs.AI 84%

Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes

语言模型组件级损伤揭示临床对齐的失语症表型

Yifan Wang, Jichen Zheng, Jingyuan Sun, Yunhao Zhang, Chunyu Ye, Jixing Li, Chengqing Zong, Shaonan Wang

机构 * Department of Computer Science, The University of Manchester, UK(曼彻斯特大学计算机科学系) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,中国科学院自动化研究所,北京) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京) Department of Linguistics and Translation, City University of Hong Kong, Hong Kong(香港城市大学语言学与翻译系) Department of Language Science and Technology, Hong Kong Polytechnic University, Hong Kong(香港理工大学语言科学与技术系)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过模块化LLM的组件级损伤模拟失语症,揭示临床相关的语言功能退化机制

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18901 2026-01-28 cs.CL 79%

Self-Aware Knowledge Probing: Evaluating Language Models' Relational Knowledge through Confidence Calibration

具有自意识的知识探测:通过置信度校准评估语言模型的关系知识

Christopher Kissling, Elena Merdjanovska, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种新的校准探测框架,用于评估语言模型在关系知识上的置信度,揭示了大多数模型在置信度校准上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏