How to Train a Critic Stably and Efficiently
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
大厂专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
上下文分配定律:生成式搜索中的因果测量与闭环编排
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学国家软件工程研究中心) ; Peking University(北京大学) ; Tencent(腾讯)
AI总结 该研究针对RAG的证据利用测量与上下文预算分配瓶颈,提出因果留一法探针与闭环次模调度器,实现组合召回率提升16.7-20.5个百分点,确立顺序反馈驱动编排为生成式搜索的范式。
用于视觉表征学习的双曲层次聚类
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯混元) ; Zhejiang Sci-Tech University(浙江理工大学)
AI总结 该研究提出基于双曲层次聚类的透明令牌混合器ClusterMixer,构建新骨干HCFormer,其在多视觉任务上性能优于同类方法,推动可解释骨干网络发展。
洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击
机构 * Dalian University of Technology(大连理工大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Tongji University(同济大学)
AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。
FIRM-Video:可靠文本到视频奖励建模的评分前检查机制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Tongji University(同济大学)
AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。
GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Lightspeed Studios, Tencent(腾讯光速工作室)
AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。
WorldMind:用于状态感知NPC行为的解耦游戏世界模型
机构 * Tencent(腾讯)
AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。
Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。
Comments Accepted by EMNLP 2026 Main Conference, 32 pages, 12 figures, 6 tables
ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制
机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)
AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。
Comments SIGGRAPH Asia 2026
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis