Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
跨领域整合RLVR能力:融合范式的深入探究
机构 * Tencent(腾讯) ; Fudan University(复旦大学)
AI总结 该研究探究Merge、Mix RL、MOPD三种RLVR融合范式的性能差异与适用场景,发现其平均性能差最多1.4点,单基准差达8.6点,给出了不同场景下的选择指南。
大厂专区
跨领域整合RLVR能力:融合范式的深入探究
机构 * Tencent(腾讯) ; Fudan University(复旦大学)
AI总结 该研究探究Merge、Mix RL、MOPD三种RLVR融合范式的性能差异与适用场景,发现其平均性能差最多1.4点,单基准差达8.6点,给出了不同场景下的选择指南。
直接还是中介?大型音频语言模型中任务依赖的音频信息路由
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) ; WXG, Tencent(腾讯微信事业群)
AI总结 该研究针对大型音频语言模型,发现其在拼接两段音频的任务中,自动语音识别稳定而音频问答性能大幅下降,揭示了两类任务依赖不同的音频信息路由路径,指出信息利用是其泛化的潜在限制。
Comments 8 pages, 2 figures
从原子到智能体:迈向大语言模型智能体数学能力的可解释评估
机构 * Sun Yat-sen University(中山大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Pengcheng Laboratory(鹏城实验室)
AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。
Comments EMNLP 2026
思考镜头:基于智能体推理的一致多镜头视频编辑
机构 * Nankai University(南开大学) ; Tencent(腾讯)
AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。
Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)
FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) ; Duke University(杜克大学) ; Sun Yat-sen University(中山大学) ; TengenX(天工科技) ; Tencent Robotics X(腾讯Robotics X实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。
Comments Accepted to CVPR 2026
不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; WeChat AI, Tencent Inc.(腾讯微信人工智能部门)
AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。
Comments Accepted by EMNLP 2026 Findings
ElementCheck:基于句子元素的复杂度感知长文本事实性评估
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Fudan University(复旦大学) ; Tencent(腾讯) ; University of Cambridge(剑桥大学) ; University of Aberdeen(阿伯丁大学)
AI总结 ElementCheck是一种基于句子元素的复杂度感知框架,通过提取实体对构建元素图,在FastFact-Sent等基准上提升了五个主干模型的长文本事实性验证性能,且优化了准确率与成本的权衡。
Comments 25 pages, 4 figures