arXivDaily arXiv每日学术速递 周一至周五更新

作者

Yejin Choi

Natural Language Processing

2026-02-04 至 2026-02-04 共收录 4
2602.03183 2026-02-04 cs.CL cs.AI

Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch

Privasis:从零开始合成最大的“公共”私有数据集

Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan, Rui Xin, Shuyue Stella Li, Jaehun Jung, David Acuna, Qi Pang, Hanshen Xiao, G. Edward Suh, Sewoong Oh, Yulia Tsvetkov, Pang Wei Koh, Yejin Choi

机构 * NVIDIA CMU(卡内基梅隆大学) USC(南加州大学)

AI总结 Privasis是首个从零开始构建的百万级合成数据集,用于提升隐私敏感领域研究的规模和效率,其模型在隐私净化任务中表现优异。

Comments For code and data, see https://privasis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23223 2026-02-04 cs.CL

Are you going to finish that? A Practical Study of the Partial Token Problem

你打算完成那个吗?对部分标记问题的实用研究

Hao Xu, Alisa Liu, Jonathan Hayase, Yejin Choi, Noah A. Smith

机构 * Paul G. Allen School of Computer Science(保罗·G·艾伦计算机科学与工程学院) Engineering, University of Washington(华盛顿大学工程学院) Nvidia(Nvidia公司) Allen Institute for AI(艾伦人工智能研究所)

AI总结 本文研究了部分标记问题对语言模型预测的影响,发现词边界与令牌边界不一致导致严重预测偏差,并提出缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22975 2026-02-04 cs.AI

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

金 Goose:从不可验证的互联网文本中合成无限 RLVR 任务的简单技巧

Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of California San Diego(圣地亚哥大学)

AI总结 Golden Goose 通过从不可验证的互联网文本中合成无限 RLVR 任务,提升大型语言模型在复杂推理和网络安全领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19004 2026-02-04 cs.CL

Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations

破损的标记?你的语言模型可以秘密处理非标准标记化

Brian Siyuan Zheng, Alisa Liu, Orevaoghene Ahia, Jonathan Hayase, Yejin Choi, Noah A. Smith

AI总结 研究发现语言模型在面对非标准标记化时表现出意外的鲁棒性,通过指令训练可提升特定任务性能,揭示模型对标记化的依赖程度较低。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏