arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-09-01 至 2026-09-01 共收录 12
2608.31170 2026-09-01 cs.CL 新提交

Context-Aware Interleaved Batching for WhisperX

面向WhisperX的上下文感知交错批处理

Carlos Bain, Max Bain

机构 * University of Oxford(牛津大学)

AI总结 针对WhisperX音频内批处理丢失上下文、标准Whisper推理慢且易幻觉的问题,提出上下文感知交错批处理,利用VAD边界稳定Whisper文本条件,在长音频基准上降WER、提升专有名词转录且保持高推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30568 2026-09-01 cs.LG cs.AI 新提交

Collapsibility of Performance Metrics in Clinical Predictive AI

临床预测AI中性能指标的可折叠性

João Matos, Ben Van Calster, Richard D. Riley, Paula Dhiman, Gary S. Collins

机构 * University of Oxford(牛津大学) KU Leuven(鲁汶大学) University of Birmingham(伯明翰大学)

AI总结 该研究分析临床预测AI的15种性能指标的可折叠性,发现AUC等5种指标非可折叠、10种可折叠,指出非可折叠性会误导公平性评估,明确报告其可折叠性可提升评估的可解释性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30087 2026-09-01 cs.CV 新提交

The Nearest Target Is the Wrong One: Target Separation in Arc2Face Identity Unlearning

最近的目标是错误的:Arc2Face身份遗忘中的目标分离

Zeynel Tok

机构 * University of Oxford(牛津大学)

AI总结 该研究针对Arc2Face身份遗忘中重定向目标导致的失败问题,通过审计Arc2Face发现目标分离是关键设计变量,采用特定策略可提升干净遗忘率并降低遗忘身份的重新识别率。

Comments 16 pages, accepted at the ECCV 2026 Workshop on Unlearning and Model Editing (U&ME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30021 2026-09-01 cs.LG cs.AI 新提交

Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models

PET/CT放射报告的错误检测:领域特定模型与大语言模型

Hermione Warr, Harry Anthony, Lilli J Freischem, Yasin Ibrahim, Daniel R McGowan, Konstantinos Kamnitsas

机构 * University of Oxford(牛津大学) Oxford University Hospitals NHS(牛津大学医院NHS) Imperial College London(伦敦帝国理工学院) University of Birmingham(伯明翰大学)

AI总结 本研究针对PET/CT报告错误检测,对比了领域特定模型与大语言模型,发现15M参数的领域特定BERT模型性能优于最强提示式LLM,任务适配的Llama-3.3-70B可缩小差距但计算需求更高,证明领域特定训练更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29494 2026-09-01 cs.LG 新提交

Learning Human Health and Diseases from 24-hour Wrist Movement

从24小时腕部运动中学习人类健康与疾病

Yong Wang, Dylan McGagh, Katya Broomberg, Zizheng Zhang, Jonathan Carter, Junayed Naushad, Laura Brocklebank, Yang Sun, George Nicholson, Dianjianyi Sun, Canqing Yu, Jun Lv, Maxim Barnard, Hubert Lam, Andrew Steptoe, David W. Eyre, Liming Li, Zhengming Chen, Naomi Wray, Spiros Denaxas, Gary S. Collins, Huaidong Du, Aiden Doherty, Hang Yuan

机构 * Big Data Institute, University of Oxford(牛津大学大数据研究所) Nuffield Department of Orthopaedics, Rheumatology and Musculoskeletal Sciences, University of Oxford(牛津大学纳菲尔德骨科、风湿病学与肌肉骨骼科学系) Oxford University Hospitals(牛津大学医院) Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Statistics, University of Oxford(牛津大学统计系) Department of Epidemiology and Biostatistics, School of Public Health, Peking University Health Science Center(北京大学医学部公共卫生学院流行病学与生物统计学系) Peking University Center for Public Health and Epidemic Preparedness and Response(北京大学公共卫生与疫情防控中心)

AI总结 该研究提出自监督基础模型Sensori,从24小时原始三轴腕部运动学习通用健康表征,经多人群队列验证,可跨场景泛化,结合临床协变量显著提升多种疾病的分类与风险预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29453 2026-09-01 cs.CL cs.AI 新提交

AI Can Be Easily Persuaded in Clinical Decision Making

AI在临床决策中极易被说服

Jiayuan Zhu, Jiazhen Pan, Fenglin Liu, Minhao Hu, Junde Wu

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学)

AI总结 本文通过对照实验发现,AI在临床决策中极易被专业权威、声称的过往表现等因素说服,甚至会被编造的合理观点误导,因此AI需在被说服时保持合理判断以保障医疗决策安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29420 2026-09-01 cs.LG cs.CY cs.SE 新提交

One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation

一种能力还是多种?测试前沿AI评估的经济有效性

Louis Yiven Zhu

机构 * University of Oxford(牛津大学)

AI总结 该研究测试前沿AI评估的经济基准是否对应独立能力,发现其未形成独特因子,仅为日期驱动的通用能力因子提供增量信息,同期模型差距需经日期调整后才反映能力差异。

Comments 25 pages, 11 figures. Analysis plan deposited at https://doi.org/10.17605/OSF.IO/VD34J (retrospective deposit; see the note there). Code and data: https://github.com/louisyzhu/frontier-ai-economic-validity

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-09-01 cs.LG 版本更新

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Accepted to EMNLP 2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-09-01 cs.CL 版本更新

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25580 2026-09-01 cs.CL 版本更新

Bye Bye Perspective API: Lessons for Building and Governing Measurement Infrastructure

再见视角API:NLP、CSS和LLM评估中的测量基础设施教训

David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

机构 * Weizenbaum Institute(韦izenbaum研究所) TU Berlin(柏林技术大学) University of Oxford(牛津大学) KU Leuven(根特大学) Pleias(Pleias公司) Freie Universität Berlin(柏林自由大学) University of Bremen(不莱梅大学) ifib research(ifib研究) TU Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) HTW Berlin(柏林应用技术大学) University of Hamburg(汉堡大学)

AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。

Comments Accepted at EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18486 2026-09-01 cs.CL cs.CY 版本更新

Different Demographic Cues Yield Inconsistent Conclusions About LLM Personalization and Bias

不同的人口统计线索导致对LLM个性化和偏见的结论不一致

Manuel Tonneau, Neil K. R. Sehgal, Niyati Malhotra, Sharif Kazemi, Victor Orozco-Olvera, Ana María Muñoz Boudet, Lakshmi Subramanian, Samuel P. Fraiberger, Sharath Chandra Guntuku, Valentin Hofmann

机构 * World Bank(世界银行) University of Oxford(牛津大学) New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学) LMU Munich(慕尼黑大学) Allen Institute for AI(人工智能研究院)

AI总结 研究通过1480万个提示测试了人口统计线索对LLM响应的影响,发现同一群体的不同线索导致响应变化不一致,偏见结论不稳定,揭示了身份线索与语言信号的关系。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22973 2026-09-01 cs.LG cs.AI 版本更新

EquiReg: Equivariance Regularized Diffusion for Inverse Problems

EquiReg:等变正则化扩散用于逆问题

Bahareh Tolooshams, Aditi Chandrashekar, Rayhan Zirvi, Abbas Mammadov, Jiachen Yao, Chuwei Wang, Anima Anandkumar

机构 * University of Alberta(阿尔伯塔大学) Alberta Machine, Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) Neuroscience and Mental Health Institute, University of Alberta(阿尔伯塔大学神经科学与心理健康研究所) New York University(纽约大学) California Institute of Technology(加州理工学院) University of Oxford(牛津大学)

AI总结 EquiReg通过正则化扩散模型提升逆问题求解,有效引导采样向保持对称性的区域,提升图像修复和偏微分方程求解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏