Context-Aware Interleaved Batching for WhisperX
面向WhisperX的上下文感知交错批处理
机构 * University of Oxford(牛津大学)
AI总结 针对WhisperX音频内批处理丢失上下文、标准Whisper推理慢且易幻觉的问题,提出上下文感知交错批处理,利用VAD边界稳定Whisper文本条件,在长音频基准上降WER、提升专有名词转录且保持高推理速度。
高校专区
面向WhisperX的上下文感知交错批处理
机构 * University of Oxford(牛津大学)
AI总结 针对WhisperX音频内批处理丢失上下文、标准Whisper推理慢且易幻觉的问题,提出上下文感知交错批处理,利用VAD边界稳定Whisper文本条件,在长音频基准上降WER、提升专有名词转录且保持高推理速度。
临床预测AI中性能指标的可折叠性
机构 * University of Oxford(牛津大学) ; KU Leuven(鲁汶大学) ; University of Birmingham(伯明翰大学)
AI总结 该研究分析临床预测AI的15种性能指标的可折叠性,发现AUC等5种指标非可折叠、10种可折叠,指出非可折叠性会误导公平性评估,明确报告其可折叠性可提升评估的可解释性与透明度。
最近的目标是错误的:Arc2Face身份遗忘中的目标分离
机构 * University of Oxford(牛津大学)
AI总结 该研究针对Arc2Face身份遗忘中重定向目标导致的失败问题,通过审计Arc2Face发现目标分离是关键设计变量,采用特定策略可提升干净遗忘率并降低遗忘身份的重新识别率。
Comments 16 pages, accepted at the ECCV 2026 Workshop on Unlearning and Model Editing (U&ME)
PET/CT放射报告的错误检测:领域特定模型与大语言模型
机构 * University of Oxford(牛津大学) ; Oxford University Hospitals NHS(牛津大学医院NHS) ; Imperial College London(伦敦帝国理工学院) ; University of Birmingham(伯明翰大学)
AI总结 本研究针对PET/CT报告错误检测,对比了领域特定模型与大语言模型,发现15M参数的领域特定BERT模型性能优于最强提示式LLM,任务适配的Llama-3.3-70B可缩小差距但计算需求更高,证明领域特定训练更关键。
从24小时腕部运动中学习人类健康与疾病
机构 * Big Data Institute, University of Oxford(牛津大学大数据研究所) ; Nuffield Department of Orthopaedics, Rheumatology and Musculoskeletal Sciences, University of Oxford(牛津大学纳菲尔德骨科、风湿病学与肌肉骨骼科学系) ; Oxford University Hospitals(牛津大学医院) ; Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Statistics, University of Oxford(牛津大学统计系) ; Department of Epidemiology and Biostatistics, School of Public Health, Peking University Health Science Center(北京大学医学部公共卫生学院流行病学与生物统计学系) ; Peking University Center for Public Health and Epidemic Preparedness and Response(北京大学公共卫生与疫情防控中心)
AI总结 该研究提出自监督基础模型Sensori,从24小时原始三轴腕部运动学习通用健康表征,经多人群队列验证,可跨场景泛化,结合临床协变量显著提升多种疾病的分类与风险预测性能。
AI在临床决策中极易被说服
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 本文通过对照实验发现,AI在临床决策中极易被专业权威、声称的过往表现等因素说服,甚至会被编造的合理观点误导,因此AI需在被说服时保持合理判断以保障医疗决策安全。
一种能力还是多种?测试前沿AI评估的经济有效性
机构 * University of Oxford(牛津大学)
AI总结 该研究测试前沿AI评估的经济基准是否对应独立能力,发现其未形成独特因子,仅为日期驱动的通用能力因子提供增量信息,同期模型差距需经日期调整后才反映能力差异。
Comments 25 pages, 11 figures. Analysis plan deposited at https://doi.org/10.17605/OSF.IO/VD34J (retrospective deposit; see the note there). Code and data: https://github.com/louisyzhu/frontier-ai-economic-validity
配置偏移下的共形大语言模型
机构 * University of Stuttgart(斯图加特大学) ; Robert Bosch GmbH(罗伯特·博世有限公司) ; University of Oxford(牛津大学) ; LMU Munich(慕尼黑大学) ; Tsinghua University(清华大学) ; University of Southampton(南安普顿大学) ; University of Oslo(奥斯陆大学)
AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。
Comments Accepted to EMNLP 2026 as a main conference paper
SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务
机构 * Imperial College London(伦敦帝国学院) ; The Chinese University of Hong Kong(香港中文大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Oxford(牛津大学) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。
再见视角API:NLP、CSS和LLM评估中的测量基础设施教训
机构 * Weizenbaum Institute(韦izenbaum研究所) ; TU Berlin(柏林技术大学) ; University of Oxford(牛津大学) ; KU Leuven(根特大学) ; Pleias(Pleias公司) ; Freie Universität Berlin(柏林自由大学) ; University of Bremen(不莱梅大学) ; ifib research(ifib研究) ; TU Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; HTW Berlin(柏林应用技术大学) ; University of Hamburg(汉堡大学)
AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。
Comments Accepted at EMNLP Findings 2026
不同的人口统计线索导致对LLM个性化和偏见的结论不一致
机构 * World Bank(世界银行) ; University of Oxford(牛津大学) ; New York University(纽约大学) ; University of Pennsylvania(宾夕法尼亚大学) ; LMU Munich(慕尼黑大学) ; Allen Institute for AI(人工智能研究院)
AI总结 研究通过1480万个提示测试了人口统计线索对LLM响应的影响,发现同一群体的不同线索导致响应变化不一致,偏见结论不稳定,揭示了身份线索与语言信号的关系。
Comments Accepted to EMNLP 2026 (Main Conference)
EquiReg:等变正则化扩散用于逆问题
机构 * University of Alberta(阿尔伯塔大学) ; Alberta Machine, Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) ; Neuroscience and Mental Health Institute, University of Alberta(阿尔伯塔大学神经科学与心理健康研究所) ; New York University(纽约大学) ; California Institute of Technology(加州理工学院) ; University of Oxford(牛津大学)
AI总结 EquiReg通过正则化扩散模型提升逆问题求解,有效引导采样向保持对称性的区域,提升图像修复和偏微分方程求解质量。