arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2132 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2132 篇

2606.07656 2026-06-09 physics.chem-ph cs.CE cs.LG 新提交 57%

SC3: The Multi-Solvent Solubility Challenge and Benchmark

SC3:多溶剂溶解度挑战与基准

Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Sergei Tatarin, Lev Krasnov, Sayan Ranu, Tarak Karmakar

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Kurnakov Institute of General and Inorganic Chemistry RAS, Russia(库尔诺夫一般和无机化学研究所俄罗斯科学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 针对多溶剂溶解度预测中现有基准的缺陷,提出SC3基准,包含可复现的数据处理流程、多层级共识集和评估指标,并揭示最佳模型与理论极限仍有5倍差距。

Comments 34 pages, 16 tables, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 57%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22669 2026-06-09 cs.LG 版本更新 57%

Beyond Fixed Rounds: Data-Free Early Stopping for Practical Federated Learning

超越固定轮次:面向实际联邦学习的无数据早停法

Youngjoon Lee, Hyukjoon Lee, Seungrok Jung, Andy Luo, Jinu Gong, Yang Cao, Joonhyuk Kang

专题命中 医学数据与评测 :pathology(abstract);分类 cs.LG

AI总结 提出一种无数据早停框架,通过监控任务向量增长率确定最优停止点,在皮肤病变/血细胞/结肠病理分类任务中达到与基于验证集的早停相当的性能,且仅需少量额外轮次。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02540 2026-06-05 cs.LG cs.AI 57%

Lazy But Effective: Collaborative Personalized Federated Learning with Heterogeneous Data

懒惰但有效:基于异构数据的协同个性化联邦学习

Ljubomir Rokvic, Panayiotis Danassis, Boi Faltings

机构 * Artificial Intelligence Laboratory EPFL(苏黎世联邦理工学院人工智能实验室) Telenor Research(Telenor研究)

专题命中 医学数据与评测 :medical image(abstract);分类 cs.LG

AI总结 本文提出了一种简单有效的个性化联邦学习框架pFedLIA,通过使用计算效率高的影响近似方法'Lazy Influence',在分布式 manner 中对客户端进行聚类,从而在模型聚合前协同训练模型以捕捉客户端特定的数据模式,实验证明其在非iid数据集上能有效恢复全局模型性能,并在多个基准任务中优于现有基线方法。

Comments Accepted at the International Joint Conference on Neural Networks (IJCNN), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02535 2026-06-02 cs.CV 57%

LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

LL-Bench: 在大规模生成模型时代重新思考低级视觉评估

Lu Liu, Huiyu Duan, Chenxin Zhu, Jintong Lu, Haoyun Jiang, Liu Yang, Qiang Hu, Guangtao Zhai, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出LL-Bench基准,包含大量真实退化图像和人工偏好标注,系统评估大规模生成模型在低级视觉任务中的性能,并引入LL-Score评估器以更好对齐人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18326 2026-06-02 cs.CV 57%

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

OmniHuman:面向以人为中心的视频生成的大规模数据集与基准

Lei Zhu, Xing Cai, Yingjie Chen, Yiheng Li, Binxin Yang, Hao Liu, Jie Chen, Chen Li, Jing LYu

机构 * Peking University(北京大学) WeChat Lab(微信实验室) Chinese Academy of Sciences(中国科学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17532 2026-06-02 cs.CL cs.LG 57%

OncoReason: Structuring Clinical Reasoning in LLMs for Robust and Interpretable Survival Prediction

OncoReason: 在大语言模型中构建临床推理以实现稳健且可解释的生存预测

Raghu Vamshi Hemadri, Geetha Krishna Guruju, Kristi Topollai, Anna Ewa Choromanska

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 提出统一多任务学习框架,通过监督微调、思维链提示和强化学习三种对齐策略,使自回归大语言模型在MSK-CHORD数据集上联合进行二元生存分类、连续生存时间回归和自然语言理由生成,实现可解释的生存预测。

Comments This manuscript is withdrawn to allow careful review and correction of bibliographic issues identified after submission, including references that could not be adequately verified. These matters should be resolved before further circulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31094 2026-06-01 cs.CV cs.AI 57%

Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation

重新定义实例匹配:全景分割评估中部件感知匹配的统一框架

Erik Großkopf, Soumya Snigdha Kundu, Hendrik Möller, Nicolas Münster, Mehdi Astaraki, Paula Tamara Buzduga, Kerstin Ritter, Benedikt Wiestler, Jan Kirschke, Jonathan Shapey, Tom Vercauteren, Florian Kofler

机构 * Hertie Institute for AI in Brain Health, University of Tübingen, Germany(人工智能与脑健康研究所,图宾根大学,德国) King’s College London, UK(伦敦国王学院,英国) Technical University of Munich, Germany(慕尼黑技术大学,德国) Stockholm University, Sweden(斯德哥尔摩大学,瑞典)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 提出将全景分割中的片段匹配重新表述为约束二分分配问题,定义四种匹配策略,并扩展至部件感知评估,发布基于Panoptica的统一开源包。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15197 2026-06-01 cs.AI cs.CL cs.CV cs.RO 57%

LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解

Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Zhongguancun Academy(北京中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhengzhou University(郑州大学) Beihang University(北航) East China Normal University(东华大学) DeepCybot Co., Ltd.(DeepCybot有限公司)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV

AI总结 针对VLA模型在训练中因数据偏差导致语言信息被忽略的问题,提出LangForce框架,通过贝叶斯分解和潜在动作查询构建双分支架构,最大化动作与指令的点互信息,无需新数据即可显著提升泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30219 2026-05-29 cs.AI cs.CL cs.LG 57%

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型何时应改变想法?大语言模型中的上下文信念管理

Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin Shang, Yu Gong, Shumin Deng

机构 * Zhejiang University(浙江大学) HomologyAI

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28844 2026-05-29 cs.NE cs.LG 57%

WASHH: An Anchor-Aware Whale-Guided Selection Hyper-Heuristic for Continuous Optimization and SVC Configuration

WASHH:一种用于连续优化和SVC配置的锚点感知鲸鱼引导选择超启发式算法

Yifu Zhao, Xiaofan Zou, Junhao Wei, Yanxiao Li, Baili Lu, Zhenhong Peng, Dexing Yao, Haochen Li, Qinbin He, Sio-Kei Im, Xu Yang, Yapeng Wang

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) School of Mechanical and Electrical Engineering and Automation, Shanghai University(上海大学机械与自动化工程学院) Pazhou Lab (Huangpu), Guangzhou(广州 Pazhou 实验室(黄埔)) College of Animal Science and Technology, Zhongkai University of Agriculture and Engineering(仲恺农业工程学院动物科学与技术学院) Macao Polytechnic University(澳门理工学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出WASHH超启发式算法,通过在线奖励控制器选择多种搜索行为,在连续优化和SVC超参数配置中取得最优平均排名和最低验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17110 2026-05-28 cs.CV 57%

From Clinical Intent to Clinical Model: Autonomous Coding-Agents for Clinician-driven AI Development

从临床意图到临床模型:面向临床医生驱动AI开发的自主编码代理

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Mathis Bode, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.CV

AI总结 提出一种自主编码代理系统,允许临床医生用自然语言描述任务,系统自动生成并迭代优化模型,在五项临床任务中达到竞争性能,并显著减少胸部X光片模型对胸腔引流管的依赖。

Comments Code is available at https://github.com/zhaozh10/clinical-automata/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24492 2026-05-26 cs.CV 57%

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

Med-R2: 面向医学视觉语言模型中基于证据推理的对抗性基准

Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.CV

AI总结 提出 Med-R2 Bench,一个分层对抗性基准,通过逐步QA任务和对抗扰动评估医学VLM在临床工作流中的视觉证据推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13930 2026-05-25 cs.LG cs.HC cs.NE 57%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22823 2026-05-22 cs.CV 57%

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

它往哪个方向移动?视频大语言模型中方向运动盲症的诊断与克服

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) Princeton University(普林斯顿大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文研究了视频大语言模型在理解方向运动时的盲点,提出MoDirect数据集和DeltaDirect方法,通过改进模型对方向运动的感知能力,显著提升了模型在合成和真实场景中的方向识别性能。

Comments Preprint. 59 pages, including appendix. Code: https://github.com/KHU-VLL/DeltaDirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21861 2026-05-22 cs.CV cs.AI 57%

Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models

在多模态医学视觉基础模型中学习涌现的模块化表示

Yuting He, Chenyu You, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学) Stony Brook University(石溪大学)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.CV

AI总结 本文提出Director-Experts (DEX)框架,通过调控模块化动态,在多模态医学视觉基础模型中学习稳定的模块化表示,并在新的医学视觉基准数据集上验证了其在26个下游任务中的优越性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21852 2026-05-22 cs.CV 57%

Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

癫痫半相学套件(S3):一个临床多模态数据集、基准和模型用于癫痫半相学理解

Lina Zhang, Tonmoy Monsoor, Peizheng Li, Jiarui Cui, Xinyi Peng, Chong Han, Prateik Sinha, Siyuan Dai, Jessica Nichole Pasqua, Colin M McCrimmon, Weiting Liu, Hailey Marie Miranda, Bing Hu, Xiangting Wu, Tengyou Xu, Chunhan Li, Jiaye Tian, Jiarui Tang, Detao Ma, Lingye Kong, Junnan Lyu, Jungang Li, Yan Zan, Junhua Huang, Rajarshi Mazumder, Vwani Roychowdhury

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Pittsburgh(匹兹堡大学) Fudan University(复旦大学) University of California, Riverside(加州大学河滨分校) Hong Kong University of Science(香港科学大学) Maharishi International University(玛希拉国际大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出S3数据集和基准,用于细粒度、结构化的癫痫半相学理解,通过评估多模态大语言模型在低级视觉感知、时间序列处理、叙述报告生成和癫痫诊断中的能力,揭示了现有模型在左右脑推理、时间定位、症状序列和临床忠实报告方面的系统性弱点,并展示了针对癫痫的微调和双阶段神经符号框架在癫痫与非癫痫癫痫分类中的高F1分数。

Comments Accepted to ICML 2026 as a Spotlight presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01712 2026-05-21 cs.AI cs.LG 57%

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 57%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20522 2026-05-19 cs.CV 57%

AI-assisted radiographic analysis in detecting alveolar bone-loss severity and patterns

辅助人工智能的放射学分析用于检测牙槽骨丧失的严重程度和模式

Chathura Wimalasiri, Piumal Rathnayake, Shamod Wijerathne, Sumudu Rasnayaka, Dhanushka Leuke Bandara, Roshan Ragel, Vajira Thambawita, Isuru Nawinne

机构 * Faculty of Engineering, University of Peradeniya(工程学院,珀德尼亚大学) Faculty of Dental Sciences, University of Peradeniya(牙科学院,珀德尼亚大学) Simula Metropolitan Center for Digital Engineering(模拟 Metropolitan 数字工程中心)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本研究提出了一种新型的基于人工智能的深度学习框架,利用牙内窥镜根尖放射图像自动检测和量化牙槽骨丧失及其模式,通过结合YOLOv8进行牙齿检测和Keypoint R-CNN模型识别解剖标志物,实现了对牙槽骨丧失严重程度的精确计算,并通过几何分析确定水平与角状骨丧失模式,实验结果在1000张专家标注的放射图像上达到了高准确率。

Comments This manuscript is 17 pages with 5 tables and 12 figures. The manuscript is under review at Nature Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00409 2026-05-19 eess.AS cs.AI cs.LG 57%

Perceptual implications of automatic anonymization in pathological speech

病态语音中自动匿名化的人感知影响

Soroosh Tayebi Arasteh, Saba Afza, Tri-Thien Nguyen, Lukas Buess, Maryam Parvin, Tomas Arias-Vergara, Paula Andrea Perez-Toro, Hiu Ching Hung, Mahshad Lotfinia, Thomas Gorges, Elmar Noeth, Maria Schuster, Seung Hee Yang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universit\"at Erlangen-N\"urnberg, Erlangen, Germany. Department of Urology, Stanford University, Stanford, CA, USA. Department of Radiology, Stanford University, Stanford, CA, USA. Lab for AI in Medicine, RWTH Aachen University, Aachen, Germany. Department of Diagnostic Interventional Radiology, University Hospital RWTH Aachen, Aachen, Germany. Institute of Radiology, University Hospital Erlangen, Erlangen, Germany. Department of Foreign Language Education, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany. Department of Otorhinolaryngology, Head Neck Surgery, Ludwig-Maximilians-Universität München, Munich, Germany. Speech \& Language Processing Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany.

专题命中 医学数据与评测 :pathology(abstract);分类 cs.LG

AI总结 本研究通过结构化协议评估自动匿名化病态语音的人感知影响,发现匿名化在不同疾病中存在显著差异,且感知质量下降,但临床严重程度评分保持稳定,同时发现感知结果与计算隐私指标脱钩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17236 2026-05-19 cs.CV cs.AI 57%

Systematic Evaluation of Vision Transformers for Automated Cervical Cancer Classification: Optimization, Statistical Validation, and Clinical Interpretability

对视觉变换器在自动化宫颈癌分类中的系统评估:优化、统计验证与临床可解释性

Nisreen Albzour, Sarah S. Lam

机构 * School of Systems Science and Industrial Engineering, Binghamton University(宾夕法尼亚大学系统科学与工业工程学院)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.CV

AI总结 本文研究了视觉变换器在自动化宫颈癌分类中的应用,通过优化和统计验证,展示了其在临床可解释性方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16122 2026-05-18 cs.CV cs.AI 57%

GenShield: Unified Detection and Artifact Correction for AI-Generated Images

GenShield:面向AI生成图像的统一检测与伪影校正

Zhipei Xu, Xuanyu Zhang, Youmin Xu, Qing Huang, Shen Chen, Taiping Yao, Shouhong Ding, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出GenShield框架,通过闭环诊断与修复流程实现可解释的AI生成图像检测与可控伪影校正,结合视觉链式推理课程学习策略,提升校正效果与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12074 2026-05-13 cs.CV 57%

BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

BARISTA:一种多任务第一人称视角基准,用于组合视觉理解

Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert

机构 * Ramblr.ai Research(Ramblr.ai 研究院) Technical University of Clausthal(Clausthal 技术大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 BARISTA通过185个真实世界咖啡制作视频,提供密集标注的数据集,涵盖全自动、手冲和胶囊式流程,用于评估场景理解中的多任务能力,揭示任务家族间强变化及无主导模型家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11304 2026-05-13 cs.CV 57%

CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

CheXTemporal:用于胸部X光影像中时间感知推理的数据集

Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) HOPPR University Hospital Zurich(苏黎世大学医院)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV

AI总结 该研究提出CheXTemporal数据集,用于胸部X光影像中时间感知推理,包含前后X光片及时间空间标注,评估了多种视觉语言模型在零样本设定下的接地和进展分类任务,发现模型在空间接地和时间推理方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11091 2026-05-13 cs.LG cs.AI 57%

ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder

ASD-Bench:面向自闭症谱系障碍的四轴综合AI模型基准

Shubhankit Singh, Hassan Shaikh, Kuldeep Raghuwanshi, Keshav Bulia

机构 * Research Commons AI IIT Bombay(印度理工学院博伊斯) IIT Delhi(印度理工学院德里)

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.LG

AI总结 ASD-Bench通过四轴评估框架,系统评估了不同年龄群体中多种AI模型在预测性能、校准、可解释性和对抗鲁棒性方面的表现,揭示了不同年龄段特征重要性的差异。

Comments 20 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24428 2026-05-12 eess.SP cs.AI 57%

BandRouteNet: An Adaptive Band Routing Neural Network for EEG Artifact Removal

BandRouteNet: 一种用于EEG去噪的自适应频段路由神经网络

Phat Lam

机构 * Ho Chi Minh City University of Technology(胡志明市技术大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 eess.SP

AI总结 本文提出BandRouteNet,通过频段特定处理与全频段上下文建模,有效去除EEG信号中的EOG和EMG干扰,提升去噪性能与参数效率。

Comments Preprint version, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09087 2026-05-12 cs.SD cs.LG 57%

Towards Trustworthy Audio Deepfake Detection: A Systematic Framework for Diagnosing and Mitigating Gender Bias

迈向可信的音频深度伪造检测:一种系统性框架用于诊断和缓解性别偏见

Aishwarya Fursule, Shruti Kshirsagar, Anderson R. Avila

机构 * School of Computing, Wichita State University(维克托利亚州立大学计算机学院) Institut national de la recherche scientifique (INRS-EMT)(国家科学研究机构(INRS-EMT)) INRS-UQO Mixed Research Unit on Cybersecurity(INRS-UQO网络安全混合研究单位)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文提出首个诊断优先框架,通过诊断偏见来源并针对性缓解,评估了AASIST和Wav2Vec2+ResNet18模型在ASVSpoof5上的表现,发现偏见源于声学表示差异、特征中性别泄露及评估结构不对称,提出新的公平性正则化方法,有效降低不公平性。

Comments Submitted to SMC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06902 2026-05-11 cs.LG 57%

Streaming Adversarial Robustness in Fuzzy ARTMAP: Mechanism-Aligned Evaluation, Progressive Training, and Interpretable Diagnostics

流式对抗鲁棒性在模糊ARTMAP中的研究:机制对齐的评估、渐进训练和可解释的诊断

Shane Cairns, Leonardo Enzo Brito da Silva, Sasha Petrenko, Donald C. Wunsch, Jian Liu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Kummer Institute Center for Artificial Intelligence and Autonomous Systems (KICAIAS)(人工智能与自主系统中心(KICAIAS)) Missouri University of Science and Technology(密苏里科技大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文研究模糊ARTMAP在流式学习中的对抗鲁棒性,提出WB-Softmax攻击代理,并展示渐进两阶段选择训练在无回放鲁棒性上的优势,同时通过显式类别几何实现可解释的诊断。

Comments 35 pages, 3 figures, 11 tables. Preprint submitted to Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05476 2026-05-08 cs.LG cs.AI cs.CL 57%

A Unified Benchmark for Evaluating Knowledge Graph Construction Methods and Graph Neural Networks

面向知识图谱构建方法和图神经网络的统一基准

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise

机构 * Nantes University, LS2N(南特大学,LS2N) National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 本文提出一个统一基准,用于评估知识图谱构建方法和图神经网络在噪声文本图上的性能,以及图构建方法在下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏