BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
大厂专区
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
CAFE:自改进搜索智能体需要协同演化的反馈
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
AI总结 该研究提出 CAFE 框架,通过共享参数模型耦合搜索智能体与评判者的协同演化反馈,在七个及六个域外搜索基准上均优于现有 RL 智能体,减少答案幻觉且性能持续提升。
IAPO:面向多轮服务智能体信用分配的感知影响策略优化
机构 * Fudan University(复旦大学) ; WeChat, Tencent Inc.(腾讯公司微信业务)
AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。
Comments 12 pages, 3 figures, 5 tables. Preprint
VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法
机构 * Tencent(腾讯)
AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。
WeMM-Embedding:微信多模态嵌入技术报告
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)
AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。