How to Train a Critic Stably and Efficiently
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
大厂专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
上下文分配定律:生成式搜索中的因果测量与闭环编排
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学国家软件工程研究中心) ; Peking University(北京大学) ; Tencent(腾讯)
AI总结 该研究针对RAG的证据利用测量与上下文预算分配瓶颈,提出因果留一法探针与闭环次模调度器,实现组合召回率提升16.7-20.5个百分点,确立顺序反馈驱动编排为生成式搜索的范式。
用于视觉表征学习的双曲层次聚类
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯混元) ; Zhejiang Sci-Tech University(浙江理工大学)
AI总结 该研究提出基于双曲层次聚类的透明令牌混合器ClusterMixer,构建新骨干HCFormer,其在多视觉任务上性能优于同类方法,推动可解释骨干网络发展。
洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击
机构 * Dalian University of Technology(大连理工大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Tongji University(同济大学)
AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。
FIRM-Video:可靠文本到视频奖励建模的评分前检查机制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Tongji University(同济大学)
AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。
GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Lightspeed Studios, Tencent(腾讯光速工作室)
AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。
WorldMind:用于状态感知NPC行为的解耦游戏世界模型
机构 * Tencent(腾讯)
AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。
Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)