arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-12 至 2026-08-12 共收录 3
2608.10836 2026-08-12 cs.SD cs.AI 新提交

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

感知耳语的大语言模型:用于鲁棒耳语语音识别的自监督不确定性学习

Gaopeng Xu, Zhenyu Wang, Zheng Xue, Yinfeng Xia, Haitao Yao

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部)

AI总结 本文提出Whisper-Aware LLM框架,通过自监督学习量化声学信号缺陷并结合置信融合解码机制,在AISHELL6-Whisper数据集上将耳语语音识别的CER相对降低17%,幻觉率降至4.5%,达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-08-12 cs.CL 新提交

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10678 2026-08-12 cs.CL cs.AI 新提交

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

通过采样BPE词元统计审计中文网页规模语料库

Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

机构 * Tsinghua University(清华大学) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

AI总结 针对中文网页污染审计的三项挑战,提出Sampled-BPE轻量级审计流程,在大幅降低运行时间和内存消耗的同时保持精度,审计多类语料库并发布分层中文网页词元数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏