arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-24 至 2026-08-24 共收录 9 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 9 篇

2608.20418 2026-08-24 q-bio.QM cs.AI cs.LG 新提交 60%

Rigorous Evaluation of Large Language Models for Malaria Drug Discovery: Trade-offs in Performance, Scale, and Resource Utility

用于疟疾药物发现的大型语言模型的严格评估:性能、规模与资源效用之间的权衡

Marvellous O. Ajala (1), Zainab Ashimiyu-Abdusalam (1), Comfort Adesina (1) ((1) Magami Open Sciences Initiative)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG、q-bio

AI总结 本研究构建了Malaria-Instruct数据集,评估了多款开源LLM在疟疾虚拟筛选中的表现,发现微调后的开源LLM性能优于经典ML模型和专有模型,是高效的抗疟药物发现范式。

Comments 12 pages, 4 tables, 2 figures, Ijcai2026 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 57%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20608 2026-08-24 cs.CV 新提交 57%

A Dataset-Centric Benchmark of Deep Learning Methods for Grape Leaf Disease Classification and Detection

面向葡萄叶病害分类与检测的深度学习方法的以数据集为中心的基准测试

Petar Canoski, Vlatko Spasev, Ivica Dimitrovski, Ivan Kitanovski, Petre Lameski

机构 * Faculty of Computer Science and Engineering, University Ss Cyril and Methodius(圣西里尔与美多德大学计算机科学与工程学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 该研究构建了以数据集为中心的葡萄叶病害分类与检测的深度学习基准,分析公开数据集并评估模型在三类任务的表现,发现跨数据集性能骤降,强调真实评估与标注兼容性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21021 2026-08-24 cs.CL cs.AI cs.NI 新提交 50%

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估

Rishiraj Sengupta, Sotiris Chatzimiltis, Mohammad Shojafar, Xiatian Zhu

机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) Google(谷歌)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。

Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20853 2026-08-24 cs.AI 新提交 50%

MGAL: A Multilingual Granularity-Aware Long-Context Benchmark

MGAL:一个多语言粒度感知的长基准测试集

Chunhan Li, Chenglin Xu, Zongyang Zhang, Jiale Liu, Zhuoxi Rao, Xudong Jia, Junxiu He, Menglin Yang, Wenjuan Gong, Zhengzhe Liu, Chengwei Qin

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Northeastern University at Qinhuangdao(东北大学秦皇岛分校) Lingnan University, Hong Kong(香港岭南大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 MGAL是首个多语言粒度位置感知长基准,以联合国6种官方语言报告构建,含4种粒度及位置分层,实验发现LLM粗粒度任务表现差、闭源模型低资源语言占优,还识别出语义拥挤等新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20627 2026-08-24 cs.CL cs.AI 新提交 50%

When Failures Propagate: Causal Failure Attribution in Agentic Retrieval-Augmented Generation

当故障传播时:智能体检索增强生成中的因果故障归因

Lauren Pothuru

机构 * Anote(阿诺特)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出AgenticRAG-FP基准,针对智能体RAG的因果故障归因开展实验,发现基于覆盖率的诊断在第1轮表现较好,第2、3轮较差,明确将传播深度作为相关评估维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15242 2026-08-24 cs.AI cs.SE 版本更新 50%

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因

Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong Liu, Hengyue Jiang, Difeng Ma, Jiayi Zhang, Yongzhou Yao, Yanan Zhao, Fei Sun, Yintong Huo, Zhaoyang Liu, Jingjing Li, Gaogang Xie, Dan Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Chongqing University(重庆大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Singapore Management University(新加坡管理大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。

Comments 18 pages, 6 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-08-24 cs.CL 版本更新 50%

ZenGen: Social Mind for LLMs

Zing:大语言模型的社交智能

ZenGen Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-08-24 cs.DB 版本更新 50%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏