Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
结果准确性不够:对奖励模型推理过程的对齐
机构 * Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。
高校专区
结果准确性不够:对奖励模型推理过程的对齐
机构 * Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。
教育中的LLM代理:进展与应用
机构 * Squirrel Ai Learning ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
AI总结 本文综述了LLM代理在教育中的应用进展,探讨了其技术实现、挑战及在不同教育领域的应用。
Comments Accepted by EMNLP 2025 Findings
Point2Insert: 通过稀疏点引导的视频物体插入
机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) ; Sun Yat-sen University(孙中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Fudan University(复旦大学)
AI总结 Point2Insert通过稀疏点引导实现视频中物体的灵活插入,优于现有方法并具备更高的效率。
分段后审计:用于语言指代音频视频分段的无参考掩码质量评估
机构 * MBZUAI ; National University of Singapore(国立新加坡大学) ; Fudan University(复旦大学)
AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。
并非所有负样本都平等:LLM通过合理推理学习更好
机构 * East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; Independent Researcher(独立研究者)
AI总结 本文提出PNS方法,通过合成高质量负样本提升LLM推理能力,实验显示其在多个基准测试中优于其他方法。
颜色至关重要:基于去马赛克的色彩相关性训练用于通用的AI生成图像检测
机构 * Department of Computer Science, City University of Hong Kong, Hong Kong(香港城市大学计算机科学系) ; Department of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学系) ; School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics, Nanchang, China(江西财经大学计算机与人工智能学院)
AI总结 本文提出DCCT框架,通过去马赛克引导的色彩相关性训练,提升AI生成图像检测的泛化和鲁棒性。