arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Yejin Choi

Natural Language Processing

2026-03-03 至 2026-03-03 共收录 3
2510.01265 2026-03-03 cs.LG cs.AI cs.CL

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13648 2026-03-03 cs.CL cs.AI

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距

Yuling Gu, Oyvind Tafjord, Hyunwoo Kim, Jared Moore, Ronan Le Bras, Peter Clark, Yejin Choi

机构 * Allen Institute for AI(艾伦人工智能研究所) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27492 2026-03-03 cs.CV

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

ThinkMorph:多模态交错链式推理中的涌现特性

Jiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li, Michael Qizhe Shieh, Yejin Choi, Ranjay Krishna, Yu Cheng

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) absolute AI The Chinese University of Hong Kong(香港中文大学)

AI总结 ThinkMorph通过统一模型提升多模态推理性能,展现视觉操控与模式切换等新兴能力。

Comments project page: https://thinkmorph.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏