Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
跨领域整合RLVR能力:融合范式的深入探究
机构 * Tencent(腾讯) ; Fudan University(复旦大学)
AI总结 该研究探究Merge、Mix RL、MOPD三种RLVR融合范式的性能差异与适用场景,发现其平均性能差最多1.4点,单基准差达8.6点,给出了不同场景下的选择指南。
大厂专区
跨领域整合RLVR能力:融合范式的深入探究
机构 * Tencent(腾讯) ; Fudan University(复旦大学)
AI总结 该研究探究Merge、Mix RL、MOPD三种RLVR融合范式的性能差异与适用场景,发现其平均性能差最多1.4点,单基准差达8.6点,给出了不同场景下的选择指南。
直接还是中介?大型音频语言模型中任务依赖的音频信息路由
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) ; WXG, Tencent(腾讯微信事业群)
AI总结 该研究针对大型音频语言模型,发现其在拼接两段音频的任务中,自动语音识别稳定而音频问答性能大幅下降,揭示了两类任务依赖不同的音频信息路由路径,指出信息利用是其泛化的潜在限制。
Comments 8 pages, 2 figures
从原子到智能体:迈向大语言模型智能体数学能力的可解释评估
机构 * Sun Yat-sen University(中山大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Pengcheng Laboratory(鹏城实验室)
AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。
Comments EMNLP 2026
思考镜头:基于智能体推理的一致多镜头视频编辑
机构 * Nankai University(南开大学) ; Tencent(腾讯)
AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。
Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)
FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) ; Duke University(杜克大学) ; Sun Yat-sen University(中山大学) ; TengenX(天工科技) ; Tencent Robotics X(腾讯Robotics X实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。
Comments Accepted to CVPR 2026
不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; WeChat AI, Tencent Inc.(腾讯微信人工智能部门)
AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。
Comments Accepted by EMNLP 2026 Findings
ElementCheck:基于句子元素的复杂度感知长文本事实性评估
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Fudan University(复旦大学) ; Tencent(腾讯) ; University of Cambridge(剑桥大学) ; University of Aberdeen(阿伯丁大学)
AI总结 ElementCheck是一种基于句子元素的复杂度感知框架,通过提取实体对构建元素图,在FastFact-Sent等基准上提升了五个主干模型的长文本事实性验证性能,且优化了准确率与成本的权衡。
Comments 25 pages, 4 figures
4DStreamCtrl:基于在线4D控制的交互式视频生成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。
Comments 23 pages
基础模型的无监督后训练:一项综述
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Xiaohongshu Inc.(小红书公司) ; WeChat, Tencent(腾讯微信) ; CUHK(香港中文大学) ; AI Robotics(人工智能机器人)
AI总结 该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。
Comments Accepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables
复杂城市场景中基于证据的可信多模态推理与评估基准
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; Tencent CDG(腾讯云与智慧产业事业群) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所)
AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。
Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission
摘要生成尚未消亡
机构 * Saarland University(萨尔大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) ; University of Cambridge(剑桥大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Tencent YouTu Lab(腾讯优图实验室)
AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。
Comments EMNLP 2026 Main & Long Conference Paper