arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-06 至 2026-02-06 共收录 201 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 37 篇

2602.05827 2026-02-06 cs.CV cs.RO 75%

Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation

稀疏视频生成推动现实世界超越视界视觉语言导航

Hai Zhang, Siqi Liang, Li Chen, Yuxian Li, Yukuan Xu, Yichao Zhong, Fu Zhang, Hongyang Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05269 2026-02-06 cs.LG cs.AI cs.CL 75%

Hybrid Gated Flow (HGF): Stabilizing 1.58-bit LLMs via Selective Low-Rank Correction

混合门控流(HGF):通过选择性低秩校正稳定1.58位LLM

David Alejandro Trejo Pizzo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 混合门控流(HGF)通过选择性低秩校正技术,在1.58位LLM中实现内存效率与模型质量的平衡,恢复了与FP16基线的55%质量差距。

Comments 21 pages, 4 figures, 6 tables. Code and models will be released at opencores.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18713 2026-02-06 cs.LG cs.AI stat.ML 73%

Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options

基于偏好强化学习的多选项扩展:多个选项的好处

Joongkyu Lee, Seouh-won Yi, Min-hwan Oh

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M-AUPO算法,通过多选项选择提升偏好强化学习的样本效率,并证明其理论性能界。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04926 2026-02-06 cs.DB cs.CL cs.LG 73%

Pruning Minimal Reasoning Graphs for Efficient Retrieval-Augmented Generation

对检索增强生成进行最小推理图剪枝以提高效率

Ning Wang, Kuanyan Zhu, Daniel Yuehwoon Yee, Yitang Gao, Shiying Huang, Zirun Xu, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 AutoPrunedRetriever通过最小推理图剪枝提升检索增强生成效率,实现更高效的知识密集型任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05943 2026-02-06 cs.LG 70%

Orthogonal Model Merging

正交模型融合

Sihan Yang, Kexuan Shi, Weiyang Liu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 正交模型融合通过在正交群流形上进行融合操作,有效保留模型权重的几何结构,减少灾难性遗忘并提升多任务性能。

Comments Technical report (18 pages, 9 figures, project page: https://spherelab.ai/OrthoMerge/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13821 2026-02-06 cs.LG 70%

The Double Life of Code World Models: Provably Unmasking Malicious Behavior Through Execution Traces

代码世界模型的双重生命:通过执行轨迹证明性地揭示恶意行为

Subramanyam Sahoo

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全倡议(BASIS)加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过语义轨道分析,CTVP验证代码生成模型的恶意行为,引入ARQ量化验证成本,理论证明对抗鲁棒性非游戏化。

Comments 13 Pages, A Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04903 2026-02-06 cs.LG 70%

Mind the Performance Gap: Capability-Behavior Trade-offs in Feature Steering

注意性能差距:特征引导中的能力-行为权衡

Eitan Sprejer, Oscar Agustín Stanchi, María Victoria Carro, Denise Alejandra Mester, Iván Arcuschin

机构 * BAISH, Universidad de Buenos Aires, Argentina(BAISH,布宜诺斯艾利斯大学,阿根廷) AISAR, AI Safety Argentina(AISAR,人工智能安全阿根廷) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata, Argentina(信息研究所LIDI,拉普拉塔国立大学,阿根廷) FAIR, IALAB UBA, Universidad de Buenos Aires, Argentina(FAIR,IALAB UBA,布宜诺斯艾利斯大学,阿根廷) Università degli Studi di Genova, Italy(热那亚大学,意大利)

专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.LG

AI总结 研究发现特征引导方法在控制行为时显著降低模型性能,揭示了能力与行为之间的权衡问题。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25502 2026-02-06 cs.LG cs.AI stat.ML 62%

TempoPFN: Synthetic Pre-training of Linear RNNs for Zero-shot Time Series Forecasting

TempoPFN:合成预训练线性RNN用于零样本时间序列预测

Vladyslav Moroshan, Julien Siems, Arber Zela, Timur Carstensen, Frank Hutter

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 TempoPFN通过合成预训练线性RNN,实现高效零样本时间序列预测,超越现有方法并提供可重复的研究基础。

Comments 38 pages, 22 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05164 2026-02-06 cs.LG cs.AI 62%

Position: Capability Control Should be a Separate Goal From Alignment

位置:能力控制应是与对齐分开的目标

Shoaib Ahmed Siddiqui, Eleni Triantafillou, David Krueger, Adrian Weller

机构 * University of Cambridge(剑桥大学) Google DeepMind(谷歌DeepMind) University of Montreal(蒙特利尔大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文主张将能力控制视为与对齐不同的目标,提出分层的控制机制以应对模型的潜在滥用和失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06031 2026-02-06 cs.LG 57%

AP-OOD: Attention Pooling for Out-of-Distribution Detection

AP-OOD:用于分布外检测的注意力池化

Claus Hofmann, Christian Huber, Bernhard Lehner, Daniel Klotz, Sepp Hochreiter, Werner Zellinger

机构 * Institute for Machine Learning, JKU LIT SAL IWS Lab(机器学习研究所) Silicon Austria Labs, JKU LIT SAL IWS Lab(Silicon Austria实验室) Interdisciplinary Transformation University Austria(跨学科转型大学) ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单元)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 AP-OOD通过利用token级信息,提出了一种新的分布外检测方法,有效提升了文本数据的检测性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05708 2026-02-06 cs.DB cs.CL 57%

Cost-Efficient RAG for Entity Matching with LLMs: A Blocking-based Exploration

基于阻塞机制的高效RAG实体匹配方法:一种成本高效的RAG架构

Chuangtao Ma, Zeyu Zhang, Arijit Khan, Sebastian Schelter, Paul Groth

机构 * Aalborg University(奥尔堡大学) University of Amsterdam(阿姆斯特丹大学) Bowling Green State University, USA(布林茅尔州立大学) Aalborg University, Denmark(奥尔堡大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 CE-RAG4EM通过阻塞机制降低计算开销,实现高效实体匹配,提升运行效率并优化性能与开销的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12911 2026-02-06 cs.CR cs.DC cs.LG 57%

A Selective Homomorphic Encryption Approach for Faster Privacy-Preserving Federated Learning

一种用于加速隐私保护联邦学习的选性同态加密方法

Abdulkadir Korkmaz, Praveen Rao

机构 * A. Korkmaz Dept. of Electrical Engineering \& Computer Science, The University of Missouri, Columbia, USA P. Rao Dept. of Electrical Engineering \& Computer Science, The University of Missouri, Columbia, USA

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 FAS通过结合选择性同态加密、差分隐私和位操作,实现高效安全的联邦学习,比传统FHE快90%并提升实用性。

Comments 18 pages, 18 figures

Journal ref Proceedings of the IEEE Consumer Communications & Networking Conference (CCNC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05508 2026-02-06 cs.CV 50%

VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency

VGGT-Motion:具有运动感知的校准自由单目SLAM用于长距离一致性

Zhuang Xiong, Chen Zhang, Qingshan Xu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing(科学与技术多光谱信息处理国家重点实验室) Huazhong University of Science and Technology(华中科技大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 VGGT-Motion通过运动感知子地图构造和锚点驱动的直接Sim(3)对齐策略,实现了高效且稳健的校准自由单目SLAM,提升了长距离轨迹的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01789 2026-02-06 cs.RO 50%

RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation

RFS: 通过残差流引导的强化学习用于灵巧操作

Entong Su, Tyler Westenbroek, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)

专题命中 效率与部署 :pretraining(abstract)

AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17039 2026-02-06 cs.IR 50%

Efficient Long-Document Reranking via Block-Level Embeddings and Top-k Interaction Refinement

通过块级嵌入和Top-k交互细化实现高效的长文档重排序

Minghan Li, Eric Gaussier, Guodong Zhou

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出基于块级嵌入和Top-k交互细化的高效长文档重排序方法,通过块级表示和轻量级模块提升重排序效果并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 15 篇

2602.05381 2026-02-06 cs.AI 92%

Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation

医学基于大语言模型聊天机器人在眼科患者查询中的临床验证与基于LLM的评估

Ting Fang Tan, Kabilan Elangovan, Andreas Pollreisz, Kevin Bryan Dy, Wei Yan Ng, Joy Le Yi Wong, Jin Liyuan, Chrystie Quek Wan Ning, Ashley Shuen Ying Hong, Arun James Thirunavukarasu, Shelley Yin-His Chang, Jie Yao, Dylan Hong, Wang Zhaoran, Amrita Gupta, Daniel SW Ting

专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了四个医疗LLM在回答眼科患者问题中的表现,发现Meerkat-7B表现最佳,而MedLLaMA3-v20存在大量误导内容,GPT-4-Turbo评分与临床评分一致,表明基于LLM的评估在大规模基准测试中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05059 2026-02-06 cs.AI 90%

Evaluating Large Language Models on Solved and Unsolved Problems in Graph Theory: Implications for Computing Education

在图论中解决和未解决的问题上评估大语言模型:对计算教育的启示

Adithya Kulkarni, Mohna Chakraborty, Jay Bagga

机构 * Department of Computer Science(计算机科学系) Ball State University(巴尔的摩州立大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) Jio Institute(乔研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究评估了大语言模型在图论已解决和未解决问题上的表现,发现其在已有知识探索上有效,但在需要创新数学洞察的任务中存在局限,对计算教育有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05374 2026-02-06 cs.CL cs.LG 90%

Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks

跨语言实证评估大型语言模型在阿拉伯语医疗任务中的表现

Chaimae Abouzahir, Congbo Ma, Nizar Habash, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过跨语言实证分析,揭示了阿拉伯语和英语在医疗问答任务中LLM性能的差异,指出语言驱动的性能差距随任务复杂性增加而加剧,强调了语言意识在医疗任务LLM设计中的重要性。

Comments Accepted to HeaLing-EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04914 2026-02-06 cond-mat.mtrl-sci 85%

From Literature to Lab: Closed-Loop Advancement of Perovskite Solar Cells via Domain Knowledge Guided LLM

从文献到实验室:通过领域知识引导的LLM实现钙钛矿太阳能电池的闭环进步

Penglei Sun, Shuyan Chen, Xiang Liu, Longhan Zhang, Huajie You, Chang Yan, Yongqi Zhang, Xiaowen Chu, Tong-yi Zhang

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过领域知识引导的LLM框架,实现钙钛矿太阳能电池的闭环进步,自主设计出高效配方并接近世界纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05289 2026-02-06 cs.CL cs.AI cs.MA 84%

Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science

迈向集体人工智能的科学:基于LLM的多智能体系统需要从盲目试错转向严谨的科学

Jingru Fan, Dewen Liu, Yufan Dang, Huatao Li, Yuheng Wang, Wei Liu, Feiyu Duan, Xuanwen Ding, Shu Yao, Lin Wu, Ruijie Shi, Wai-Shing Leung, Yuan Cheng, Zhongyu Wei, Cheng Yang, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学) King’s College London(伦敦大学国王学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过建立协作收益度量(Γ)和因素归因范式,推动多智能体系统从盲目试错向严谨科学转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05373 2026-02-06 cs.SD 82%

Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models

Speech-XL: 向大语言模型中的长形式语音理解迈进

Haoqin Sun, Chenyang Lyu, Shiwan Zhao, Xuanfan Ni, Xiangyu Kong, Longyue Wang, Weihua Luo, Yong Qin

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Alibaba International Digital Commerce(阿里巴巴国际数字商业) University of Exeter, Exeter, United Kingdom(埃克塞特大学,埃克塞特,英国)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract)

AI总结 Speech-XL通过引入语音摘要标记和课程学习策略,实现长形式语音压缩,提升大语言模型在长音频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05390 2026-02-06 cs.LG cs.AI 81%

Assessing Electricity Demand Forecasting with Exogenous Data in Time Series Foundation Models

基于时间序列基础模型的外生数据电力需求预测评估

Wei Soon Cheong, Lian Lian Jiang, Jamie Ng Suat Ling

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了不同基础模型在电力需求预测中的表现,发现基础模型在某些情况下不如简单基线,强调了模型架构和地理环境对预测效果的影响。

Comments 9 pages, 1 Figure and 3 Tables. Accepted to AI4TS Workshop @ AAAI'26 as an oral presentation (see https://ai4ts.github.io/aaai2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21086 2026-02-06 cs.AI cs.LG 81%

Are foundation models useful feature extractors for electroencephalography analysis?

基础模型在脑电图分析中是否有用的特征提取器?

Özgün Turgut, Felix S. Bott, Markus Ploner, Daniel Rueckert

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich(人工智能在医疗与健康中的研究所,慕尼黑技术大学) Department of Neurology, Technical University of Munich(神经病学系,慕尼黑技术大学) Center for Interdisciplinary Pain Medicine, Technical University of Munich(跨学科疼痛医学中心,慕尼黑技术大学) Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,德国慕尼黑) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基础模型在脑电图分析中的有效性,发现通用时间序列模型在特征提取上具有竞争力,能有效捕捉生物标志物特征,减少对大规模数据集的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05134 2026-02-06 cs.LG cs.DB 77%

SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines

SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线

Olga Ovcharenko, Matthias Boehm, Sebastian Schelter

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05506 2026-02-06 cs.HC 75%

Relying on LLMs: Student Practices and Instructor Norms are Changing in Computer Science Education

依赖大语言模型:计算机科学教育中学生实践与教师规范正在发生变化

Xinrui Lin, Heyan Huang, Shumin Shi, John Vines

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了计算机科学教育中学生与LLMs的互动,发现学生实践与教师规范存在不同程度的冲突,并提出了LLMs设计指南以促进学习。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03531 2026-02-06 cs.CL cs.AI cs.LG 75%

Real-Time Detection of Hallucinated Entities in Long-Form Generation

长文本生成中hallucinated实体的实时检测

Oscar Obeso, Andy Arditi, Javier Ferrando, Joshua Freeman, Cameron Holmes, Neel Nanda

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05628 2026-02-06 cs.HC cs.AI cs.CL 73%

AI chatbots versus human healthcare professionals: a systematic review and meta-analysis of empathy in patient care

人工智能聊天机器人与人类医疗专业人员:关于患者护理中同理心的系统综述和荟萃分析

Alastair Howcroft, Amber Bennett-Weston, Ahmad Khan, Joseff Griffiths, Simon Gay, Jeremy Howick

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统综述和荟萃分析,发现AI聊天机器人在文本场景中普遍被感知为比人类医疗专业人员更具同理心。

Comments Open Access Invited Review. Systematic review and meta analysis of 15 studies 2023-2024. Published 20 October 2025

Journal ref British Medical Bulletin, Volume 156, Issue 1, December 2025, ldaf017

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16175 2026-02-06 cs.LG cs.AI 73%

Learning to Discover at Test Time

在测试时间学习以发现

Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Astera Institute(Astera研究院) UC San Diego(加州大学圣地亚哥分校) Together AI

专题命中 领域大模型 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 通过在测试时间进行强化学习,TTT-Discover方法在多个科学领域实现了新的前沿状态,利用开放模型和公开代码实现高效解决方案。

Comments Code: https://github.com/test-time-training/discover

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05930 2026-02-06 cs.DL cs.AI 70%

Compound Deception in Elite Peer Review: A Failure Mode Taxonomy of 100 Fabricated Citations at NeurIPS 2025

精英同行评审中的复合欺骗:100个2025年NeurIPS伪造引用的失败模式分类

Samar Ansari

机构 * School of Computing and Engineering Sciences University of Chester(计算与工程科学学院 英国切斯特大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了NeurIPS 2025中100个伪造引用的失败模式,发现所有幻觉均表现出复合失败模式,揭示同行评审在验证引用时的不足,并提出强制自动引用验证的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05692 2026-02-06 cs.CL 70%

MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations

MedErrBench: 一种细粒度多语言基准,用于医疗错误检测与修正,带有临床专家注释

Congbo Ma, Yichun Zhang, Yousef Al-Jazzazi, Ahamed Foisal, Laasya Sharma, Yousra Sadqi, Khaled Saleh, Jihad Mallat, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) New York University(纽约大学) University of Birmingham(伯明翰大学) Cleveland Clinic Abu Dhabi(克利夫兰医学中心阿布扎赫尔分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MedErrBench是一个多语言医疗错误检测与修正基准,通过临床专家注释评估各类语言模型性能,揭示非英语环境中的性能差距,推动多语言临床NLP发展。

详情

展开后加载摘要…

URL PDF HTML 收藏