arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-04-14 至 2026-04-14 共收录 9
2604.11627 2026-04-14 cs.CV

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM

Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Xiao Zhou, Jie Zhou, Weidi Xie, Yanfeng Wang

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) WeChat AI, Tencent(腾讯微信人工智能)

AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11365 2026-04-14 cs.AI cs.CL

Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories

从对比中学习:从多样的搜索轨迹中合成推理路径

Peiyang Liu, Zhirui Chen, Xi Wang, Di Liang, Youru Li, Zhi Cai, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室) Tencent Technology(腾讯科技) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

AI总结 本文提出CRPS框架,通过对比高质与低质搜索轨迹合成推理路径,减少数据集规模并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10456 2026-04-14 cs.CV

A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation

一个用于指令驱动电影视频编译的基准和多智能体系统

Peixuan Zhang, Chang Zhou, Ziyuan Zhang, Hualuo Liu, Chunjie Zhang, Jingqi Liu, Xiaohui Zhou, Xi Chen, Shuchen Weng, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频事业部AI技术中心) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 本文提出CineBench基准和CineAgents系统,解决电影视频编译中的上下文崩溃和时间碎片化问题,通过脚本逆向工程和迭代叙事规划生成更连贯的编译结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10925 2026-04-14 cs.LG cs.CL

Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation

找到你的最优教师:通过路由器引导的多教师蒸馏实现个性化数据合成

Hengyuan Zhang, Shiping Yang, Xiao Liang, Chenming Shang, Yuxuan Jiang, Chaofan Tao, Jing Xiong, Hayden Kwok-Hay So, Ruobing Xie, Angel X. Chang, Ngai Wong

机构 * The University of Hong Kong(香港大学) Simon Fraser University(西蒙菲莎大学) University of California, Los Angeles(加州大学洛杉矶分校) Dartmouth College(达特茅斯学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Tencent(腾讯)

AI总结 本文提出PerSyn策略,通过'路由然后生成'范式为每个学生模型定制数据,提升学习效率。实验表明其在指令微调和数学推理中表现优异。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17784 2026-04-14 cs.LG cs.AI cs.CL

Proximal Supervised Fine-Tuning

近端监督微调

Wenhong Zhu, Ruobing Xie, Rui Wang, Xingwu Sun, Di Wang, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Model Department, Tencent(腾讯大语言模型部) University of Macau(澳门大学)

AI总结 本文提出近端监督微调(PSFT),通过引入信任区域方法约束策略漂移,提升模型在新领域中的泛化能力,实验显示其在跨领域泛化和长期稳定性方面优于传统监督微调。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10188 2026-04-14 cs.CV

Radiology Report Generation for Low-Quality X-Ray Images

低质量X光图像的放射科报告生成

Hongze Zhu, Chen Hu, Jiaxuan Jiang, Hong Liu, Yawen Huang, Ming Hu, Tianyu Wang, Zhijian Wu, Yefeng Zheng

机构 * Westlake University(西湖大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

AI总结 本文提出针对低质量图像的稳健报告生成框架,通过双循环训练策略提升模型在不同图像质量下的诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09711 2026-04-14 cs.CV cs.CL

Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality

在多模态大语言模型中实现模态专精以在缺失模态下实现鲁棒的虚假新闻检测

Kai Qian, Weijie Shi, Jiaqi Wang, Mengze Li, Hao Chen, Yue Cui, Hanghui Guo, Ziyi Liu, Jia Zhu, Jiajie Xu

机构 * Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学) Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) The Hong Kong University of Science and Technology(香港科技大学) FiT, Tencent(腾讯FiT) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Education, Zhejiang Normal University(浙江师范大学教育学院)

AI总结 本文提出在多模态大语言模型中通过头级专精机制提升鲁棒性,以应对缺失模态下的虚假新闻检测,通过保留模态专精能力与利用稀疏单模注释提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏