Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
并行思考,一答为终:用于开放性推理的Logit平均
机构 * National University of Singapore(新加坡国立大学) ; Sea AI Lab(Sea AI实验室)
AI总结 ThinkMerge通过并行推理轨迹的logit平均提升开放式推理性能,适用于代码生成和网络深度研究等任务。
高校专区
并行思考,一答为终:用于开放性推理的Logit平均
机构 * National University of Singapore(新加坡国立大学) ; Sea AI Lab(Sea AI实验室)
AI总结 ThinkMerge通过并行推理轨迹的logit平均提升开放式推理性能,适用于代码生成和网络深度研究等任务。
驯服受控摄像机视频生成的可验证几何奖励
机构 * AIsphere ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出了一种在线强化学习框架,通过可验证的几何奖励提升摄像机控制的视频生成精度与一致性。
Comments 11 pages, 4 figures, 7 tables
CogDrive: 基于认知的多模态预测-规划融合用于安全自主性
机构 * Singapore-MIT Alliance for Research and Technology (SMART), Singapore(新加坡-麻省理工联合研究技术联盟) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) ; School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院) ; Department of Mechanical Engineering, National University of Singapore, Singapore(新加坡国立大学机械工程系) ; Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University, China(同济大学交通工程重点实验室)
AI总结 CogDrive通过结合认知多模态预测与安全导向规划,实现了在复杂交通中的安全自主性,提升了轨迹预测和适应性行为。
Comments 25 pages, 6 figures
medDreamer:基于复杂电子病历的潜在想象的模型驱动强化学习用于临床决策支持
机构 * National University of Singapore(新加坡国立大学)
AI总结 medDreamer通过结合潜在想象和自适应特征集成模块,实现基于复杂电子病历的模型驱动强化学习,以提升个性化治疗推荐的性能。
SkyLadder: 通过上下文窗口调度实现更优更高效的预训练
机构 * National University of Singapore(新加坡国立大学) ; Sea AI Lab(Sea AI实验室) ; City University of Hong Kong(香港城市大学)
AI总结 SkyLadder通过上下文窗口调度策略,在保持基准性能的同时,提升了长上下文任务的表现,并加快了训练速度。
Comments Accepted to NeurIPS 2025. 10 pages
HealthContradict: 评估语言模型在生物医学知识中的矛盾
机构 * Faculty of Medicine, University of Geneva(日内瓦大学医学院) ; Department of Biomedical Informatics, Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院生物医学信息学系) ; Department of Biostatistics & Bioinformatics, Duke University Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所生物统计学与生物信息学系)
AI总结 HealthContradict数据集评估语言模型在处理生物医学知识矛盾时的推理能力,揭示模型在正确上下文利用与错误上下文抵抗方面的表现。