arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

共收录 2173
2609.03662 2026-09-04 cs.LG 新提交

Extracting Forgotten Prompts from Targeted Unlearned Models

从定向遗忘模型中提取被遗忘的提示

Au Ashley Hoi-Ting, Meghdad Kurmanji, William F. Shen, Nicholas D. Lane, Ligang He

机构 * University of Warwick(华威大学) University of Cambridge(剑桥大学)

AI总结 该研究发现定向遗忘模型存在新漏洞,提出TAS攻击方法,可从模型中提取被遗忘的提示,在多组实验中实现高准确率且大幅减少查询量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03604 2026-09-04 cs.LG cs.AI 新提交

On the Interaction Between Model Compression and Test-Time Adaptation

模型压缩与测试时适应(TTA)之间的相互作用

Francesco Corti, Dong Wang, Young D. Kwon, Cecilia Mascolo, Olga Saukh

机构 * Graz University of Technology(格拉茨工业大学) Samsung AI Center-Cambridge(三星剑桥人工智能中心) University of Cambridge(剑桥大学) Complexity Science Hub(复杂系统科学中心)

AI总结 该研究分析了结构化模型压缩与测试时适应(TTA)的相互作用,发现压缩会导致TTA性能显著下降,其核心原因是表征多样性降低和结构约束,需设计保留适应性的压缩策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02897 2026-09-04 cs.CL 新提交

Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding

边际而非窗口:无训练的逐步有损推测解码

Oszkár Urbán, Young D. Kwon, Stylianos I. Venieris, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Samsung AI Center-Cambridge, UK(英国三星剑桥人工智能中心)

AI总结 该研究提出无训练的逐步推测解码方法AdaptiveSpec,通过调整token匹配规则与draft树形状,在SGLang引擎上实现比EAGLE-3最高56%的吞吐量提升,同时保持93%至完全无损的任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12271 2026-09-04 cs.LG physics.ao-ph 版本更新

Earth observation embeddings are effective sub-grid descriptors for probabilistic weather downscaling

地球观测嵌入是概率性天气降尺度的有效亚网格描述符

Pedro Sousa, Will Tebbutt, Sadiq Jaffer, Robin Young, Anil Madhavapeddy, Richard E. Turner

机构 * University of Cambridge(剑桥大学)

AI总结 该研究提出用TESSERA嵌入增强卷积条件神经过程,用于概率性天气降尺度,在五个气候区提升了2米温度和10米风速的降尺度技能,且对不同变量和新站点均有效。

Comments 46 pages, 13 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18338 2026-09-04 cs.LG astro-ph.EP astro-ph.IM 版本更新

ThousandWorlds: A benchmark for climate emulation of potentially habitable exoplanets

ThousandWorlds: 一个用于潜在宜居系外行星气候模拟的基准数据集

Edward T. Stevenson, Mei Ting Mak, Eric Wolf, Denis E. Sergeev, Tobi Hammond, N. J. Mayne, Miles Cranmer

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Bristol(布里斯托大学) Purdue University(普渡大学) University of Exeter(埃克塞特大学)

AI总结 为加速系外行星气候模拟,提出ThousandWorlds基准数据集,包含五个全球气候模型的约1800次模拟,用于评估机器学习模拟器在低数据、多模拟器参数到场回归任务中的性能。

Comments 10 pages main text, 30 pages references/appendix, plus NeurIPS checklist. Data at https://doi.org/10.57967/hf/8695. Code at https://github.com/edstevenson/ThousandWorlds

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06350 2026-09-04 cs.CL 版本更新

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

EDIT:基于证据诊断的干预训练以实现遵循规则的LLM评分

Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

机构 * King’s College London(伦敦国王学院) University of Cambridge(剑桥大学) AQA The Alan Turing Institute(艾伦·图灵研究所)

AI总结 提出EDIT框架,通过内部模型信号定位推理错误步骤并修正,结合信念引导的奖励塑造,提升LLM评分对评分标准的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26785 2026-09-04 cs.CL cs.AI 版本更新

EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

EmoDistill: 对抗性谈判中语言模型代理的离线情感技能蒸馏

Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

机构 * University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Exiger LLC The Alan Turing Institute(艾伦·图灵研究所)

AI总结 提出EmoDistill离线框架,通过隐式Q学习选择情感和低秩适应策略表达情感,蒸馏情感谈判技能到语言模型代理,在四个高风险谈判领域取得最高效用。

Comments Code: https://github.com/Yunbo-max/EmoDistill

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02566 2026-09-03 cs.LG 新提交

Online Reinforcement Learning in the Met Office Unified Model through Distributed Model-Agent Coupling

通过分布式模型-智能体耦合在英国气象局统一模式中开展在线强化学习

Pritthijit Nath, Sebastian Schemm, Peter Haynes, Emily Shuckburgh, Mark Webb

机构 * University of Cambridge(剑桥大学) Met Office Hadley Centre(英国气象局哈德利中心)

AI总结 本研究将英国气象局统一模式与分布式强化学习智能体耦合,在单案例中验证了该在线学习框架的可行性,可降低特定纬度带的气象预报误差,为业务系统应用奠定基础。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01936 2026-09-03 cs.CL cs.AI cs.LG 新提交

Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens

稀疏读出棱镜:在特征而非 token 层面解释 Logit-Lens 分数

Matteo He, William F. Shen, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学)

AI总结 该研究提出稀疏读出棱镜(SRP),用于独立于拟合语料库分析语言模型读出结构,其稀疏近似重构 logit 差值的能力优于基线,且主导读出特征不受拟合语料库影响,为透镜分析提供了可靠对照。

Comments 55 pages, 33 figures, 42 tables. Under review. Code: https://github.com/hematteo/sparse-readout-prism Dictionaries: https://huggingface.co/hematteo/sparse-readout-prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01823 2026-09-03 cs.CV 新提交

Kirin: Animal Motion Generation from In-the-Wild Video

Kirin:从野外视频生成动物动作

Brian Nlong Zhao, Zhuoyang Pan, James M. Rehg, Jiajun Wu, Shangzhe Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学) University of Cambridge(剑桥大学)

AI总结 针对动物动作数据稀缺的问题,提出Kirin框架,构建首个四足动物视频-文本-动作对齐大规模数据集AiM3D,开发双条件动作生成模型,实现可渲染动画动物的自动生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01705 2026-09-03 cs.LG astro-ph.IM physics.plasm-ph 新提交

Generative Diffusion Surrogates with Analytical Variance Schedule

带有解析方差调度的生成式扩散替代模型

Patrick Reichherzer, Gianluca Gregori, David N. Hosking, Subir Sarkar

机构 * University of Oxford(牛津大学) Princeton University(普林斯顿大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) University of Cambridge(剑桥大学) Gonville & Caius College(贡维尔与凯斯学院)

AI总结 本文提出一种带有解析方差调度的生成式扩散替代模型,将正向噪声化速率设为方差的时间导数,无需中间输运数据,即可校准仿真并实现基于似然的推断,在湍流等离子体输运中表现良好。

Comments Accepted for publication in Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17117 2026-09-03 cs.LG cs.CL 版本更新

Persistent Sparse Autoencoders: Learning Feature-Specific Timescales in Language Model Representations

持久稀疏自动编码器:在语言模型中学习特征时间尺度

Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

AI总结 研究在语言模型中学习特征时间尺度的问题,提出持久稀疏自动编码器,通过为特征学习持久性系数扩展标准SAEs,实验表明其能保持竞争力的重建质量,为解释和监测语言模型带来新机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03557 2026-09-03 cs.AI cs.HC 版本更新

From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Worlds

从提示到服务:基于SLM的AI驱动虚拟世界代理编排网关

Louis Nisiotis, Aimilios Hadjiliasi

机构 * University of Cambridge(剑桥大学)

AI总结 本文提出一种基于小语言模型的代理编排网关,通过意图驱动的服务路由解耦虚拟世界客户端与异构AI后端,并在虚拟博物馆测试床中验证了其可行性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28632 2026-09-02 cs.AI cs.CL cs.LG 版本更新

AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment

AutoScientist-Quant:用于量化投资自动研究的自进化编码智能体

Zongqian Li, Yaoyiran Li, Yaohui Guo, Ming Zhang, Nigel Collier, Eugene Ie

机构 * Google(谷歌公司) University of Cambridge(剑桥大学)

AI总结 AutoScientist-Quant是将量化研究视为带预算约束搜索问题的自进化编码智能体,修复了评估流程的前瞻问题,在CSI universe等场景下实现最优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23379 2026-09-02 cs.LG cs.AI cs.NE q-bio.BM

Symbolic Neural Generation with Applications to Lead Discovery in Drug Design

符号神经生成及其在药物设计先导发现中的应用

Ashwin Srinivasan, Tirtharaj Dash, A Baskar, Michael Bain, Sanjay Kumar Dey, Mainak Banerjee

机构 * Dept. of Computer Science & Information Systems and APPCAIR BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系及APPCAIR比特纳学院,K K Birl拉果阿校区,印度) Dept. of Computer Science & Information Systems BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系比特纳学院,K K Birl拉果阿校区,印度) Department of Biochemistry, University of Cambridge, Cambridge, UK(生物化学系,剑桥大学,剑桥,英国) School of Computer Science and Engineering University of New South Wales, Sydney(计算机科学与工程学院新南威尔士大学,悉尼) Dr. B.R. Ambedkar Center for Biomedical Research University of Delhi, New Delhi, India(B.R.阿姆贝卡尔生物医学研究中心,德里大学,新德里,印度) Department of Chemistry BITS Pilani, K.K. Birla Goa Campus, India(化学系比特纳学院,K.K. Birl拉果阿校区,印度)

AI总结 提出符号神经生成器(SNG)框架,结合归纳逻辑编程与大语言模型,通过符号约束指导神经生成,在药物设计中生成满足形式规范的候选分子,性能与现有方法相当,并在探索性问题上产生与临床候选分子相当的结合亲和力。

Comments 37 pages, submitted to the Machine Learning journal; partial overlap of experimental results with https://doi.org/10.1101/2025.02.14.634875

Journal ref Mach Learn 115, 210 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12204 2026-09-02 cs.RO cs.SY eess.SY 版本更新

D4orm: Multi-Robot Trajectories with Dynamics-aware Diffusion Denoised Deformations

D4orm:基于动力学感知扩散去噪变形的多机器人轨迹生成方法

Yuhao Zhang, Keisuke Okumura, Heedo Woo, Ajay Shankar, Amanda Prorok

机构 * University of Cambridge(剑桥大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

AI总结 D4orm是一种基于扩散模型的多机器人轨迹优化方法,无需学习,仅靠动力学模型和适应度函数即可生成无碰撞可行轨迹,速度优于MPPI,已在多旋翼无人机上零样本部署。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07392 2026-09-02 cs.RO cs.CV 版本更新

NGD-SLAM: Towards Real-Time Dynamic SLAM without GPU

NGD-SLAM:无需GPU的实时动态SLAM系统

Yuhao Zhang, Mihai Bujanca, Mikel Luján

机构 * University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) Qualcomm Technologies XR Labs, Austria(Qualcomm Technologies XR 研究所,奥地利)

AI总结 本文提出仅在CPU运行的实时动态SLAM系统,通过掩码传播机制解耦跟踪与掩码生成,结合ORB特征与光流的混合跟踪策略,在笔记本CPU上实现60 FPS跟踪帧率,保持动态环境高定位精度,代码公开。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30603 2026-09-01 cs.CV cs.AI 新提交

DiffSAC: Diffusion-guided Sampling for Consensus-based Robust Estimation

DiffSAC:用于基于共识的鲁棒估计的扩散引导采样

Chang Nie, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) Department of Engineering, Cambridge University(剑桥大学工程系)

AI总结 针对传统样本共识鲁棒估计采样效率低的问题,提出DiffSAC框架,通过扩散模型学习有效最小集分布,仅需几十个假设就实现最先进性能,可作为即插即用模块改进现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29995 2026-09-01 cs.CL cs.AI 新提交

Generating Clinical Vignettes that Preserve Cognitive Formulations

生成保留认知构想的临床案例 vignettes

Amit Oren, Nimrod Hertz-Palmor, Dean Ariel, Guy Laban

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Cambridge(剑桥大学) Clalit Health Services(克拉利特医疗服务机构) Tel Aviv University(特拉维夫大学) School of Brain Sciences and Cognition, Ben-Gurion University of the Negev(内盖夫本-古里安大学脑科学与认知学院) Azrieli National Center for Autism and Neurodevelopment Research(阿兹里利国家自闭症与神经发育研究中心)

AI总结 本研究提出基于理论的 FORMA 框架,将认知模型编译为图来生成符合临床结构的创伤后应激障碍案例 vignettes,经评估其质量高且人口统计学差异小,可作为合成临床文本生成的可审计规范。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code and data: https://github.com/Amit-Oren/FORMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29431 2026-09-01 cs.CL 新提交

Evaluating the Semantic Specificity of Representation Steering in Language Models

评估语言模型中表征引导的语义特异性

Zhangdie Yuan, Andreas Vlachos

机构 * University of Cambridge(剑桥大学)

AI总结 本研究提出CRT诊断框架,发现LRS仅注入全局标签偏差而非修复推理回路,为区分真正推理修复与表面标签覆盖提供了严谨方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29206 2026-09-01 cs.AI 新提交

Benevolent Bias in Multi-Turn Human-Agent Dialogue

多轮人机对话中的善意偏见

Qianqi Liu, Jin Huang, Fethiye Irmak Dogan, Hatice Gunes

机构 * University of Cambridge(剑桥大学)

AI总结 本研究针对人机对话中隐藏在积极语气后的善意偏见,构建了标注语料库并测试两类检测器,发现现有安全检测器难识别善意偏见,LLM评判器易误判,需关注对待方式差异以实现公平监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28853 2026-09-01 cs.LG cs.AI 新提交

Equivariant Sheaf Neural Networks: Learning Geometric Transport on Graphs

等变层状神经网络:学习图上的几何传输

Alessio Borgi, Mario Severino, Fabrizio Silvestri, Pietro Liò

机构 * University of Cambridge(剑桥大学) Sapienza University of Rome(罗马第一大学) University of Padua(帕多瓦大学)

AI总结 该研究提出等变层状神经网络(ESNN),通过学习图上边的矩阵值几何传输,在保持等变性的同时提升了多个几何相关任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28631 2026-09-01 cs.AI cs.CE cs.CY 新提交

CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science

CrossAudit:面向智能体科学的原生Git跨供应商审计循环

Zhaohe Dong, Yuhao Chen

机构 * University of Cambridge(剑桥大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 CrossAudit是面向智能体科学的原生Git跨供应商审计协议,通过不同供应商智能体按人类规则审计工作,试验显示不同供应商对规则解读有差异,其自身审计记录为核心证据。

Comments 19 pages, 4 figures, 3 tables, 22 references. Reference implementation, audit ledger, and experiment artefacts: https://github.com/dongzhaohe321418-lab/crossaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19021 2026-09-01 cs.CV 版本更新

Orthogonal Polynomial Approximation for Matrix Log Normalization in Global Covariance Pooling

全局协方差池化中矩阵对数归一化的正交多项式逼近

Md Rifat Ur Rahman, Md Raihan Khan, Md Sakib Hossain Shovon, Pietro Liò, Mohammad Ali Moni

机构 * NeuronAITree(神经元AI树) Cambridge University(剑桥大学)

AI总结 该研究针对全局协方差池化中矩阵对数归一化的数值不稳定问题,提出用正交多项式逼近实现无分解的矩阵对数归一化,在多数据集上验证了其速度与精度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30814 2026-09-01 cs.CL 版本更新

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

当校准排名反转:面向LLM公平比较的精度控制评估框架

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学)

AI总结 针对全局校准指标因模型精度差异导致比较不公平的问题,提出ACE精度控制评估框架,通过实例对齐、分布对齐和候选对齐三种视角实现公平比较,发现原始指标下的优势在控制精度后大幅减弱,排名反转频繁。

Comments EMNLP main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-09-01 cs.CL cs.AI 版本更新

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26081 2026-09-01 cs.AI 版本更新

VeriTrace: Evolving Mental Models for Deep Research Agents

VeriTrace:深度研究智能体的心智模型演化

Haolang Zhao, Yunbo Long, Lukas Beckenbauer, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute(艾伦·图灵研究所)

AI总结 针对深度研究智能体面临的信息不确定性,提出VeriTrace认知图框架,通过显式反馈循环(解释更新、偏差反馈、模式修正)来演化心智模型,在DeepResearch Bench和DeepConsult上取得显著提升。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11290 2026-09-01 cs.CL 版本更新

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Accepted to EMNLP 2026 Main Track. Website is in https://ljvmiranda921.github.io/polyglot-teachers/

详情

展开后加载摘要…

URL PDF HTML 收藏