Context-Aware Interleaved Batching for WhisperX
面向WhisperX的上下文感知交错批处理
机构 * University of Oxford(牛津大学)
AI总结 针对WhisperX音频内批处理丢失上下文、标准Whisper推理慢且易幻觉的问题,提出上下文感知交错批处理,利用VAD边界稳定Whisper文本条件,在长音频基准上降WER、提升专有名词转录且保持高推理速度。
高校专区
面向WhisperX的上下文感知交错批处理
机构 * University of Oxford(牛津大学)
AI总结 针对WhisperX音频内批处理丢失上下文、标准Whisper推理慢且易幻觉的问题,提出上下文感知交错批处理,利用VAD边界稳定Whisper文本条件,在长音频基准上降WER、提升专有名词转录且保持高推理速度。
临床预测AI中性能指标的可折叠性
机构 * University of Oxford(牛津大学) ; KU Leuven(鲁汶大学) ; University of Birmingham(伯明翰大学)
AI总结 该研究分析临床预测AI的15种性能指标的可折叠性,发现AUC等5种指标非可折叠、10种可折叠,指出非可折叠性会误导公平性评估,明确报告其可折叠性可提升评估的可解释性与透明度。
最近的目标是错误的:Arc2Face身份遗忘中的目标分离
机构 * University of Oxford(牛津大学)
AI总结 该研究针对Arc2Face身份遗忘中重定向目标导致的失败问题,通过审计Arc2Face发现目标分离是关键设计变量,采用特定策略可提升干净遗忘率并降低遗忘身份的重新识别率。
Comments 16 pages, accepted at the ECCV 2026 Workshop on Unlearning and Model Editing (U&ME)
PET/CT放射报告的错误检测:领域特定模型与大语言模型
机构 * University of Oxford(牛津大学) ; Oxford University Hospitals NHS(牛津大学医院NHS) ; Imperial College London(伦敦帝国理工学院) ; University of Birmingham(伯明翰大学)
AI总结 本研究针对PET/CT报告错误检测,对比了领域特定模型与大语言模型,发现15M参数的领域特定BERT模型性能优于最强提示式LLM,任务适配的Llama-3.3-70B可缩小差距但计算需求更高,证明领域特定训练更关键。
从24小时腕部运动中学习人类健康与疾病
机构 * Big Data Institute, University of Oxford(牛津大学大数据研究所) ; Nuffield Department of Orthopaedics, Rheumatology and Musculoskeletal Sciences, University of Oxford(牛津大学纳菲尔德骨科、风湿病学与肌肉骨骼科学系) ; Oxford University Hospitals(牛津大学医院) ; Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Statistics, University of Oxford(牛津大学统计系) ; Department of Epidemiology and Biostatistics, School of Public Health, Peking University Health Science Center(北京大学医学部公共卫生学院流行病学与生物统计学系) ; Peking University Center for Public Health and Epidemic Preparedness and Response(北京大学公共卫生与疫情防控中心)
AI总结 该研究提出自监督基础模型Sensori,从24小时原始三轴腕部运动学习通用健康表征,经多人群队列验证,可跨场景泛化,结合临床协变量显著提升多种疾病的分类与风险预测性能。
AI在临床决策中极易被说服
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 本文通过对照实验发现,AI在临床决策中极易被专业权威、声称的过往表现等因素说服,甚至会被编造的合理观点误导,因此AI需在被说服时保持合理判断以保障医疗决策安全。
一种能力还是多种?测试前沿AI评估的经济有效性
机构 * University of Oxford(牛津大学)
AI总结 该研究测试前沿AI评估的经济基准是否对应独立能力,发现其未形成独特因子,仅为日期驱动的通用能力因子提供增量信息,同期模型差距需经日期调整后才反映能力差异。
Comments 25 pages, 11 figures. Analysis plan deposited at https://doi.org/10.17605/OSF.IO/VD34J (retrospective deposit; see the note there). Code and data: https://github.com/louisyzhu/frontier-ai-economic-validity