BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
大厂专区
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
CAFE:自改进搜索智能体需要协同演化的反馈
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
AI总结 该研究提出 CAFE 框架,通过共享参数模型耦合搜索智能体与评判者的协同演化反馈,在七个及六个域外搜索基准上均优于现有 RL 智能体,减少答案幻觉且性能持续提升。
IAPO:面向多轮服务智能体信用分配的感知影响策略优化
机构 * Fudan University(复旦大学) ; WeChat, Tencent Inc.(腾讯公司微信业务)
AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。
Comments 12 pages, 3 figures, 5 tables. Preprint
VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法
机构 * Tencent(腾讯)
AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。
WeMM-Embedding:微信多模态嵌入技术报告
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)
AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
去噪未来:用于时序知识图谱外推的上下文感知谱扩散
机构 * Southwest Minzu University(西南民族大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 针对现有扩散式时序知识图谱外推方法的目标判别信号削弱问题,提出FreqDiff频率感知扩散框架,通过双流去噪器与频域正则化项提升性能,在四个公开基准上达最优表现。
Comments EMNLP 2026 Main
CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集
机构 * Tencent(腾讯)
AI总结 本文提出用于组合式指令引导视频编辑的大规模高质量数据集CoinVE-200K,构建基准CoinVE-Bench及22B参数模型CoinVE-Edit,在基准测试中表现优异。
Comments Project page: this https URL (https://coinve200k.github.io) and Dataset is available at this https URL (https://huggingface.co/datasets/FireCRT/CoinVE-200K) and see source codes at this https URL (https://github.com/coinve200k/CoinVE-200K)
TangramPuzzle: 通过组合空间推理评估多模态大语言模型
机构 * Tsinghua University(清华大学) ; Sun-Yat Sen University(孙逸人大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学香槟分校)
AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。
Comments EMNLP 2026 Findings
机构 * Tencent Quantum Laboratory(腾讯量子实验室) ; HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利冯·诺依曼数学研究所) ; HUN-REN Institute for Computer Science and Control(匈牙利计算机科学与控制研究所) ; Centre for Quantum Technologies(量子技术中心) ; National University of Singapore(新加坡国立大学) ; CNRS, IRIF, Université Paris Cité(法国国家科学研究中心、IRIF、巴黎Cité大学)
Comments 48 pages, 1 figure. v2: slightly improved results, some proofs and sections rewritten, references added and fixed; v3: a few sections completely rewritten, better stabiliser testing bounds, several typos and inconsistencies fixed