arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2136 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2136 篇

2605.07251 2026-05-11 cs.AI 50%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04320 2026-05-11 cs.SE 50%

Reproduction Test Generation for Java SWE Issues

Java SWE问题的再现测试生成

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文针对Java企业软件中的SWE问题,提出首个Java仓库级再现测试基准TDD-Bench-Java和高绩效的e-Otter++工具,填补了Python以外语言的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 50%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 50%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20948 2026-05-04 cs.AI 50%

Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs

用于知识图谱中演绎推理的可控逻辑假设生成

Yisen Gao, Jiaxin Bai, Tianshi Zheng, Qingyun Sun, Ziwei Zhang, Xingcheng Fu, Jianxin Li, Yangqiu Song

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Hong Kong University of Science and Technology(香港理工大学) Beihang University(北航) Key Lab of Education Blockchain and Intelligent Technology(教育区块链与智能技术重点实验室) Guangxi Normal University(广西师范大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出CtrlHGen框架,通过监督学习和强化学习解决知识图谱中假设生成的可控性问题,提升假设生成的准确性和实用性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10426 2026-05-01 cs.CR cs.DC 50%

Differential Privacy for Secure Machine Learning in Healthcare IoT-Cloud Systems

医疗物联网-云系统中差分隐私的安全机器学习

N Mangala, Murtaza Rangwala, S Aishwarya, B Eswara Reddy, Rajkumar Buyya, KR Venugopal, SS Iyengar, LM Patnaik

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出多层物联网-边缘-云架构,通过差分隐私框架保护患者隐私,提升应急医疗响应速度,同时通过区块链增强安全性和边缘计算降低延迟。

Journal ref Future Gener. Comput. Syst. 176 (2026) 108548

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27470 2026-05-01 cs.CL 50%

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

HealthBench Professional: 评估大型语言模型在真实临床对话中的表现

Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, Akshay Jagadeesh, Khaled Saab, Johannes Heidecke, Ashley Alexander, Nate Gross, Karan Singhal

机构 * OpenAI

专题命中 医学数据与评测 :healthcare AI(abstract)

AI总结 本文提出HealthBench Professional基准,用于评估大型语言模型在临床实践中真实任务的表现,包含三个核心用例,通过医师评分系统评估模型性能,提供医疗AI领域跟踪前沿模型进展的测量工具。

Comments Data link in paper; Blog: https://openai.com/index/making-chatgpt-better-for-clinicians/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27358 2026-05-01 cs.AI 50%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14791 2026-05-01 cs.SE cs.AI 50%

Enabling Predictive Maintenance in District Heating Substations: A Labelled Dataset and Fault Detection Evaluation Framework based on Service Data

在区域供暖变电站中实现预测性维护:基于服务数据的标记数据集和故障检测评估框架

Cyriana M. A. Roelofs, Edison Guevara Bastidas, Thomas Hugo, Stefan Faulstich, Anna Cadenbach

机构 * Fraunhofer IEE(弗劳恩霍夫研究所)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出基于服务数据的标记数据集和故障检测评估框架,通过公开数据集和开源代码,实现区域供暖变电站的故障早期检测与诊断方法评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21190 2026-04-30 cs.CL cs.AI 50%

Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation

Lunguage: 用于结构化和序列化胸部X光解读的基准测试

Jong Hak Moon, Geon Choi, Paloma Rabaey, Min Gwan Kim, Jung-Oh Lee, Hyuk Gi Hong, Eun Woo Doe, Hangyul Yoon, Jiyoun Kim, Harshita Sharma, Daniel C. Castro, Javier Alvarez-Valle, Edward Choi

机构 * KAIST(韩国科学技术院) Ghent University(根特大学) Seoul National University Hospital(首尔国立大学医院) Seoul Medical Center(首尔医院) Yeungnam University College of Medicine(延世大学医学院) Microsoft Research Health Futures(微软研究院健康未来)

专题命中 医学数据与评测 :radiology(abstract)

AI总结 本文提出LUNGUAGE基准数据集,用于结构化放射学报告生成,支持单报告评估和多研究的纵向患者评估。通过两阶段结构化框架和LUNGUAGESCORE指标,实现对放射学报告的细粒度评估。

Comments CHIL (Conference on Health, Inference, and Learning) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22802 2026-04-28 cs.DL cs.SI stat.AP 50%

NIH-MPINet: A Large-Scale Feature-Rich Network Dataset for Mapping the Frontiers of Team Science

NIH-MPINet:一个大规模特征丰富的网络数据集,用于映射团队科学的前沿

Cuiran Shi, Shuying Han, Shreya Kusumanchi, Mia Zhou, Didong Li

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究提出NIH-MPINet网络数据集,涵盖2006-2023年NIH资助项目合作网络,包含30127个PI节点和86743条边,揭示19个合作社区及20个研究主题,展现科研主题随时间变化趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22708 2026-04-27 cs.MA 50%

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试

Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 50%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20423 2026-04-23 cs.RO 50%

OVPD: A Virtual-Physical Fusion Testing Dataset of OnSite Auton-omous Driving Challenge

OVPD:OnSite自动驾驶挑战赛的虚拟-物理融合测试数据集

Yuhang Zhang, Jiarui Zhang, Bowen Jian, Xin Zhou, Zhichao Lv, Peng Hang, Rongjie Yu, Ye Tian, Jian Sun

机构 * College of Transportation, Tongji University, Shanghai 201804, China(同济大学交通运输学院,上海201804,中国)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 OVPD数据集通过融合虚拟背景交通与车辆-基础设施感知,构建可控互动闭环测试环境,提供多模态数据用于长期规划与决策验证,支持安全、效率等多维度评估。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10401 2026-04-22 cs.CL 50%

NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data

NameBERT: 通过LLM增强的开放学术数据扩展基于名称的国籍分类

Cong Ming, Ruixin Shi, Yifan Hu

机构 * Northeastern University, United States(美国东北大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出NameBERT,利用LLM增强开放学术数据构建大规模名称-国籍数据集,通过生成低资源国家名称提升分类性能,实现高效且准确的国籍分类。

Comments 12 pages, 3 figures, 8 tables; accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026)

Journal ref Proceedings of Machine Learning Research 318 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18302 2026-04-21 cs.AI 50%

Toward Zero-Egress Psychiatric AI: On-Device LLM Deployment for Privacy-Preserving Mental Health Decision Support

迈向零数据外溢的心理AI:设备端LLM部署用于隐私保护的心理健康决策支持

Eranga Bandara, Asanga Gunaratna, Ross Gore, Anita H. Clayton, Christopher K. Rhea, Sachini Rajapakse, Isurunima Kularathna, Sachin Shetty, Ravi Mukkamala, Xueping Liang, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(旧 Dominion 大学) AI Motion Labs(AI Motion 实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Blanchfield Army Community Hospital(Blanchfield陆军社区医院) McDonald Army Health Center(McDonald陆军医疗中心)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出一种零数据外溢的设备端AI平台,通过本地执行推理管道,实现隐私保护的心理健康决策支持,使用轻量级LLM进行诊断评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02933 2026-04-21 cs.CL cs.HC 50%

Pearmut: Human Evaluation of Translation Made Trivial

Pearmut:使翻译的人工评估变得简单

Vilém Zouhar, Tom Kocmi

机构 * ETH Zurich(苏黎世联邦理工学院) Cohere

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 Pearmut通过轻量级平台简化多语言NLP的人工评估流程,支持机器翻译任务,提供多种评估协议和动态分配策略,使人工评估成为模型开发的常规环节。

Comments typeset with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17642 2026-04-21 eess.AS 50%

HCFD: A Benchmark for Audio Deepfake Detection in Healthcare

HCFD:医疗音频深度伪造检测基准

Mohd Mujtaba Akhtar, Girish, Muskaan Singh

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文提出HCFD任务,针对病理语音条件下的编码器伪造检测,通过构建首个病理感知数据集和提出PHOENIX-Mamba框架,在多临床条件和编码器上实现最高性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17340 2026-04-21 cs.CL 50%

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

神经符号推荐冲突在多病共存临床指南中的解决

Shiyao Xie, Jian Du

机构 * Peking University(北京大学) National Institute of Health Data Science(国家健康数据科学研究院) Peking University Health Science Center(北京大学医学部) Institute of Medical Technology(医学技术研究院)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出神经符号框架解决多病共存临床指南中的推荐冲突问题,通过多智能体系统和SAT求解器验证逻辑规则,发现90.6%的冲突为局部冲突,F1分数达0.861。

Comments Accepted by Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (Bridge Program on Logic & AI: Logical and Symbolic Reasoning in Language Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15456 2026-04-20 cs.AI 50%

DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI

DeepER-Med: 通过代理AI推进医学中的深度证据导向研究

Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu

机构 * Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH)) Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室) Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH)) Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH)) Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH)) Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室) Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部) University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国) Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH)) University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 DeepER-Med通过代理AI框架提升医学研究的证据生成流程,包含研究规划、协作和证据综合模块,并通过专家评估和真实临床案例验证其有效性。

Comments 37 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 50%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11094 2026-04-14 cs.SE cs.AI 50%

E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning

E2E-REME:通过经验-模拟强化微服务自动修复

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Minghua He, Chiming Duan, Zhaoyang Liu, Bolin Ding, Ying Li

机构 * Peking University(北京大学) Key Laboratory of Data Intelligence and Security(数据智能与安全重点实验室) Alibaba Group(阿里巴巴集团) Key Laboratory of Data Space Technology and System(数据空间技术与系统重点实验室)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出E2E-MR任务,通过经验-模拟强化训练构建E2E-REME模型,实现从诊断报告自动生成可执行playbook,提升微服务系统修复的准确性和效率。

Comments accepted by FSE'26. arXiv admin note: text overlap with arXiv:2511.01166

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10853 2026-04-14 cs.AI 50%

A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness

一个用于空缺和重叠分析的基准:作为知识图谱任务准备性的测试

Maruf Ahmed Mridul, Rohit Kapa, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute, Troy, New York, United States(伦斯勒理工学院,纽约州特洛伊市,美国) Prudential Financial, Inc.(保德信金融集团)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出一个可执行且可审计的基准,用于评估知识图谱的质量,通过将自然语言合同文本与形式本体对齐,系统比较方法。该基准包括简化但多样的人寿保险合同、领域本体和知识库,以及58个结构化场景和SPARQL查询,展示显式建模提升空缺和重叠分析的一致性和诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09338 2026-04-13 cs.AI cs.CL 50%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08555 2026-04-13 cs.CL 50%

SynDocDis: A Metadata-Driven Framework for Generating Synthetic Physician Discussions Using Large Language Models

SynDocDis:一种基于元数据的生成合成医生讨论的框架

Beny Rubinstein, Sergio Matos

机构 * University of Aveiro(阿威罗大学) IEETA, DETI, LASI, University of Aveiro(阿威罗大学 IEETA、DETI、LASI)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 SynDocDis通过结合结构化提示技术和隐私保护的去标识病例元数据,生成临床准确的医生间对话,经九个肿瘤学和肝病学场景评估,显示优异的沟通效果和医学内容质量。

Journal ref In: Valente de Oliveira, J., Leite, J., Rodrigues, J., Dias, J., Cardoso, P. (eds) Progress in Artificial Intelligence. EPIA 2025. Lecture Notes in Computer Science(), vol 16121. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10477 2026-04-09 cs.CL 50%

PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses

PEEM:提示工程评估指标用于可解释地联合评估提示和响应

Minki Hong, Eunsoo Lee, Sohyun Park, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出PEEM,一种联合且可解释的提示和响应评估框架,通过9个轴线评估提示和响应质量,结合LLM评估器输出评分和解释,提升提示设计的可解释性和优化效果。

Comments This is a preprint version of a paper accepted to IEEE Access. The final published version is available at DOI: 10.1109/ACCESS.2026.3679809

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04036 2026-04-07 cs.IR cs.CL 50%

MisEdu-RAG: A Misconception-Aware Dual-Hypergraph RAG for Novice Math Teachers

MisEdu-RAG:一种面向初学者数学教师的误解意识双超图RAG

Zhihan Guo, Rundong Xue, Yuting Lu, Jionghao Lin

机构 * The University of Hong Kong(香港大学) Xi'an Jiaotong University(西安交通大学) Carnegie Mellon University(卡内基梅隆大学) Monash University(莫纳什大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对初学者数学教师难以诊断和纠正学生错误的问题,提出基于双超图的RAG框架,通过组织教学知识和学生错误案例,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29087 2026-04-07 cs.SD eess.AS 50%

IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)

IQRA 2026:现代标准阿拉伯语(MSA)自动发音评估挑战

Yassine El Kheir, Amit Meghanani, Mostafa Shahin, Omnia Ibrahim, Shammur Absar Chowdhury, Nada AlMarwani, Youssef Elshahawy, Ahmed Ali

机构 * DFKI(德国人工智能研究中心) Technical University of Berlin(柏林工业大学) University of Sheffield(谢菲尔德大学) University of New South Wales(新南威尔士大学) Alexandria University(亚历山大大学) QCRI(卡塔尔计算研究所) Taibah University(塔伊巴大学) HUMAIN

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文介绍了IQRA 2026挑战赛的成果,展示了在现代标准阿拉伯语发音检测与诊断(MDD)方面的研究进展,通过新增的Iqra_Extra_IS26数据集和多种模型方法,使F1分数提升了0.28。

Comments 5 pages paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14558 2026-04-07 cs.IR 50%

R2MED: A Benchmark for Reasoning-Driven Medical Retrieval

R2MED:一个面向推理驱动的医学检索基准

Xiangxu Zhang, Lei Li, Xiao Zhou, Zheng Liu

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 R2MED旨在解决医学检索中推理需求与现有方法的差距,通过876个查询涵盖三个任务,评估15种检索系统,发现最佳模型仅达31.4nDCG@10,凸显了推理驱动医学检索的挑战。

Comments 38 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02904 2026-04-06 cs.CL 50%

BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition

BioUNER:临床乌尔都语命名实体识别基准数据集

Wazir Ali, Adeeb Noor, Sanaullah Mahar, Alia, Muhammad Mazhar Younas

机构 * Department of Artificial Intelligence, Aror University(阿罗尔大学人工智能系)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出一个用于生物医学乌尔都语命名实体识别的基准数据集,通过爬取健康相关文章、医疗处方和医院健康博客等资料,经过预处理后由三名熟悉医学领域的标注者使用Doccano工具标注了153,000个词元,验证了数据集的金标准质量,并评估了多种机器学习和深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏