Best Practice Critic Optimization
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
大厂专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
去噪未来:用于时序知识图谱外推的上下文感知谱扩散
机构 * Southwest Minzu University(西南民族大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 针对现有扩散式时序知识图谱外推方法的目标判别信号削弱问题,提出FreqDiff频率感知扩散框架,通过双流去噪器与频域正则化项提升性能,在四个公开基准上达最优表现。
Comments EMNLP 2026 Main
CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集
机构 * Tencent(腾讯)
AI总结 本文提出用于组合式指令引导视频编辑的大规模高质量数据集CoinVE-200K,构建基准CoinVE-Bench及22B参数模型CoinVE-Edit,在基准测试中表现优异。
Comments Project page: this https URL (https://coinve200k.github.io) and Dataset is available at this https URL (https://huggingface.co/datasets/FireCRT/CoinVE-200K) and see source codes at this https URL (https://github.com/coinve200k/CoinVE-200K)
TangramPuzzle: 通过组合空间推理评估多模态大语言模型
机构 * Tsinghua University(清华大学) ; Sun-Yat Sen University(孙逸人大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学香槟分校)
AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。
Comments EMNLP 2026 Findings
机构 * Tencent Quantum Laboratory(腾讯量子实验室) ; HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利冯·诺依曼数学研究所) ; HUN-REN Institute for Computer Science and Control(匈牙利计算机科学与控制研究所) ; Centre for Quantum Technologies(量子技术中心) ; National University of Singapore(新加坡国立大学) ; CNRS, IRIF, Université Paris Cité(法国国家科学研究中心、IRIF、巴黎Cité大学)
Comments 48 pages, 1 figure. v2: slightly improved results, some proofs and sections rewritten, references added and fixed; v3: a few sections completely rewritten, better stabiliser testing bounds, several typos and inconsistencies fixed