Environment Evolution for Terminal Agents
终端智能体的环境演化
机构 * Hunyuan Team, Tencent(腾讯混元团队)
AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。
大厂专区
终端智能体的环境演化
机构 * Hunyuan Team, Tencent(腾讯混元团队)
AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。
针对重尾分布的极值分位数处理效应的位置不变估计量
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tencent(腾讯)
AI总结 针对重尾分布极值QTE估计量的位置偏移不不变问题,通过适配位置不变EVI估计量并替换外推方案,提出位置不变的极值QTE估计量,经模拟验证其性质良好。
WorldReward:面向相机条件世界模型的奖励建模
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 该研究提出WorldReward,一种基于VLM的成对偏好奖励模型,解决相机条件世界模型现有奖励函数的缺陷,在WorldReward-Bench上超GPT-5.5,还提升了HY-WorldPlay 1.5的动作与视觉质量。
Comments Website: https://codegoat24.github.io/WorldReward
OCR-EDR:面向闭环OCR改进的渲染感知诊断与修复
机构 * WeChat Vision, Tencent(腾讯微信视觉)
AI总结 提出OCR-EDR框架,构建OCRErrBench数据集与DocEDR模型,实现OCR错误的细粒度诊断与迭代修复,提升OCR在公式等场景的性能。
FlowBalance:基于验证器的在线策略推理经验自改进方法
机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿(机构)) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 FlowBalance是基于验证器的在线策略推理经验自改进方法,通过校准轨迹级自指导分数实现结果校准的自指导,在数学推理任务中其性能、训练速度及稳定性均优于FlowRL,且策略多样性更高。
Comments 28 pages, 7 figures, 10 tables. Code and blog available
VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法
机构 * Tencent(腾讯)
AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。
ParaBridge: 弥合语音语言模型中的副语言感知与对话行为
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tencent Hunyuan(腾讯混元) ; Shenzhen Loop Area Institute(深圳河套学院) ; Amphion Technology Co., Ltd.(Amphion科技有限公司) ; Tsinghua University(清华大学)
AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。
机构 * Shenzhen Loop Area Institute (SLAI)(深圳环湖区研究所) ; Tencent(腾讯)
Comments Published as a conference paper at ICLR 2026
MegaStyle++:通过分层风格定义扩展图像风格空间
机构 * Tongji University(同济大学) ; Tencent(腾讯) ; Nanyang Technological University(南洋理工大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 针对图像风格缺乏统一定义的问题,提出分层风格定义,构建含多类数据的大规模风格数据集MegaStyle++-8M,扩展了风格空间并提供研究图像风格的可扩展基础。
Comments The dataset and code will be updated at https://github.com/Tencent/MegaStyle, 10pages, 5 figures
洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击
机构 * Dalian University of Technology(大连理工大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Tongji University(同济大学)
AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。
Comments We identified errors in the experimental setup and analysis that affect several key results and conclusions. As substantial re-analysis is required and the conclusions may change, we respectfully request withdrawal of the current version
LivingArena:大语言模型知道其他大语言模型所不知道的吗?作为可扩展评估的对等探测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
AI总结 研究大语言模型能否利用其他模型的未知进行评估,提出自动化抗污染评估框架LivingArena,模型轮流提问,经评审验证,能产生稳定排行榜,可衡量事实严谨性等,与人类偏好相关性弱,提供低成本持续评估方法。
AdaMem: 学习为个性化长时程LLM代理记住什么
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。
让其可塑形:用于3D角色的前馈潜在姿态模型
机构 * EEIS Department University of Science(电子信息科学系中国科学技术大学) ; Tencent PCG Shenzhen China(腾讯PCG深圳中国) ; Tencent PCG New York USA(腾讯PCG纽约美国) ; Tencent PCG Beijing China(腾讯PCG北京中国) ; University of Science(中国科学技术大学) ; Tencent PCG(腾讯PCG)
AI总结 本文提出Make-It-Poseable模型,通过将角色姿态问题转化为无皮肤的潜在空间转换,解决传统方法在皮肤权重、网格拓扑和姿态适应性上的不足,提升3D角色姿态重建质量。
Comments Accepted to SIGGRAPH Asia 2026. Project page: https://jasongzy.github.io/Make-It-Poseable/
从人类偏好中学习查询特定评分标准用于DeepResearch报告生成
机构 * Tencent(腾讯) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 提出一种通过强化学习训练查询特定评分标准生成器的流水线,以解决DeepResearch长报告生成中缺乏可验证奖励信号的问题,并在人类偏好测试和下游任务中取得显著性能提升。
H3-World:将语言理解转化为世界控制
机构 * Tencent(腾讯) ; National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 H3-World是复用大型视频生成器语义表示的高效框架,仅需少量样本与参数,即可将语言接口转化为精确的交互式世界控制,且能泛化到未见场景。
CoBRA:通过反事实边际学习工具使用边界
机构 * WeChat, Tencent Inc(腾讯公司微信业务部) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学)
AI总结 针对大型语言模型工具调用决策问题,提出CoBRA框架,通过构建双专家、估计奖励边际优化边界,在Qwen3-4B上提升工具使用效率与边界敏感型答案准确率。
Comments Acceptedy by EMNLP2026
冻结核心需要任务信号:用于低资源大语言模型适配的Fisher白化交叉协方差
机构 * Zhejiang University(浙江大学) ; Hunyuan, Tencent(腾讯混元)
AI总结 该研究提出FCCA方法,通过固定权重矩阵基并优化小尺寸核心,在低资源预算下实现大语言模型高效适配,在多任务多模型上表现优异,参数规模远低于LoRA、DoRA等方法。
从显著性到判别性:面向VLM重排序器的秩保持视觉令牌剪枝
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent Yuanbao(腾讯元宝) ; ARC Lab, Tencent(腾讯ARC实验室)
AI总结 针对VLM重排序器的令牌剪枝偏差问题,提出无需训练的RaDiCal框架,在多检索基准和VLM架构上实现高效剪枝,降低计算量并提升速度,同时保持排序性能。
Comments EMNLP 2026 (Main Conference)
DramaChain Bench:面向短剧生成的端到端基准测试集
机构 * Hunyuan, Tencent(腾讯混元) ; Beijing Film Academy(北京电影学院) ; Peking University(北京大学) ; Shenzhen University(深圳大学)
AI总结 本研究提出首个评估短剧全制作链条各阶段的基准测试集DramaChain Bench,构建配套系统实现模型公平比较与自动评分,证实上游缺陷会级联影响最终剧集质量,为短剧生成研究提供端到端评估支撑。
Comments 50 pages, 19 figures, 19 tables. Technical report. Haoyuan Shi and Mingtao Chen contributed equally. Project lead: Zhichao Hu. Corresponding author: Richeng Xuan
ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式崩溃
机构 * Southern University of Science and Technology(南方科技大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 ReNFT 是一种从扩散生成器内部修复奖励后训练模式崩溃的方法,在保留 NFT 高奖励的同时显著提升了 DreamSim-Div,为外部干预提供互补方案。
Comments 17 pages, 13 figures, 4 tables
超越人类监督扩展大型推理模型:通往超级智能的路径
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zhongguancun Academy(中关村学院) ; Xi’an Jiaotong University(西安交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; Hong Kong Baptist University(香港浸会大学) ; Hunyuan Tencent(腾讯混元) ; National University of Singapore(新加坡国立大学) ; Xiamen University(厦门大学)
AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。
Comments 72pages
InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑
机构 * The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Tencent AI Lab(腾讯AI实验室) ; Singapore Management University(新加坡管理学院)
AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。
Comments Main conference of EMNLP 2026
用于增量命名实体识别的类型平衡上下文学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Kyoto University(京都大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tencent, AI Lab(腾讯人工智能实验室)
AI总结 针对增量命名实体识别中基于伪标签方法的偏差上下文问题,提出含句子对学习方案和上下文一致性损失的TBCL方法,经多数据集多设置实验验证有效。
Comments Accepted by IEEE Transactions on Artificial Intelligence
基于异构语音协议的证据受限心理健康推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) ; GDIIST(广东省智能制造研究所) ; Tencent(腾讯)
AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper
大型智能体:面向持久智能体的感知中心架构
机构 * Fudan University(复旦大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Tencent(腾讯)
AI总结 该研究提出面向持久智能体的感知中心架构(Pera),用于刻画、组织和指导持久AI智能体的发展,类比软件工程的小型到大型编程,推动语言智能体向长期自适应智能系统演进。
Comments 41 pages, 5 figures
从最终产物到轨迹:面向证据支撑的长文本生成的回溯过程监督
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 针对开放式长文本生成任务轨迹数据稀缺的问题,提出RetroGen框架,利用预训练数据中丰富的高质量最终产物重构轨迹,训练模型以提升证据支撑等任务表现。
超越极化:点式重排序中思维链的生成约束
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Tencent(腾讯)
AI总结 本研究针对点式重排序中思维链模型性能弱于直接评分模型的问题,通过实证研究及多种干预措施,发现排序差距源于离散文本传递连续相关性语义的瓶颈,而非易解决的训练偏差。
Comments Accepted at EMNLP 2026 Findings
高维旋转位置嵌入
机构 * The Chinese University of Hong Kong(香港中文大学) ; Tencent Hunyuan(腾讯混元) ; Tsinghua University(清华大学) ; University of Macau(澳门大学)
AI总结 针对RoPE跨通道混合与鲁棒性不足的问题,提出HD-RoPE,通过扩展至高维旋转并引入Paley-I正交基,在无额外参数的情况下提升性能,获基准测试显著改善。
Comments Accepted to EMNLP 2026
JPO:用于刑事判决预测中结构化法律推理的司法策略优化
机构 * Tencent(腾讯) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; University of California(加利福尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Zhejiang University(浙江大学) ; University of Hong Kong(香港大学)
AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。
Comments EMNLP 2026 Main
SnapBench:面向移动交互的抓拍提问多模态检索基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent Yuanbao(腾讯元宝) ; Tsinghua University(清华大学) ; ARC Lab, Tencent(腾讯ARC实验室) ; The University of Hong Kong(香港大学)
AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。
Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026