arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-07-07 至 2026-07-07 共收录 15
2605.03677 2026-07-07 cs.LG 版本更新

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05150 2026-07-07 cs.CV 新提交

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

用于视频字幕强化学习的声明级评分标准奖励(CuRe)

Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Chinese Academy of Sciences(中国科学院大学) LLM Department, Tencent(腾讯大语言模型部)

AI总结 针对密集视频字幕强化学习的奖励设计瓶颈,提出声明级评分标准奖励框架,将奖励建模重构为细粒度声明级验证,规避传统奖励方案的固有缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03928 2026-07-07 cs.SD cs.AI eess.AS 新提交

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

TokAN:使用自监督语音令牌进行口音归一化

Qibing Bai, Shuai Wang, Yuhan Du, Bohan Li, Yannan Wang, Haizhou Li

机构 * School of Data Science (SDS), The Chinese University of Hong Kong, Shenzhen (CUHKSZ)(香港中文大学(深圳)数据科学学院) Tencent Ethereal Audio Lab, Tencent(腾讯虚幻音频实验室) School of Intelligence Science and Technology, Nanjing University, Suzhou(南京大学苏州校区智能科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) School of Artificial Intelligence (SAI), CUHKSZ(香港中文大学(深圳)人工智能学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 研究提出TokAN框架,基于自监督离散语音令牌,用自回归编解码器转换口音,引入强化学习后训练,还用流匹配合成器和持续时间预测器,实验表明其在降低字错误率和提升可懂度上优于基线。

Comments Submitted to IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03093 2026-07-07 cs.CL cs.AI 新提交

Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking

不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话

Ante Wang, Jiaqi Fu, Xuanyi Chen, Ruotian Ma, Zhaopeng Tu, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tencent(腾讯)

AI总结 研究针对大语言模型被动思考导致对话延迟问题,提出主动思考框架,介绍无训练基线,通过模拟实时对话流基准测试,证明该方法提升交互效率且不损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02980 2026-07-07 cs.CL cs.AI 新提交

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

正确实现分层稀疏注意力:迈向无限上下文建模

Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu, Yan Wang, Sirui Han, Yushi Bai, Kewei Tu, Haitao Mi, Leo Liang

机构 * Tencent HY Team(腾讯混元团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 研究如何解决现代大语言模型扩展到长上下文时的计算成本和注意力长度外推问题。提出分层地标稀疏注意力机制,通过语言模型损失端到端学习块选择,实现高效长上下文建模。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02607 2026-07-07 cs.CV cs.CL 新提交

Latent Visual Cache for Video Reasoning

用于视频推理的潜在视觉缓存

Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02588 2026-07-07 cs.CV cs.AI cs.CL 新提交

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

荷马:通过分层记忆和智能推理理解长视频

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

机构 * Soochow University(苏州大学) Tencent Hunyuan Multimodal Department(腾讯混元多模态部)

AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01348 2026-07-07 cs.CV 版本更新

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

ChartArena: 跨语言、场景和格式的图表解析基准测试

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Shenzhen Loop Area Institute(深圳河套学院) Nankai University(南开大学)

AI总结 提出ChartArena,一个覆盖8种图表族、3种视觉场景的双语基准,通过人机协作标注和格式无关评估协议,系统评估26个多模态大模型的图表解析能力,揭示前沿模型差距与挑战。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09484 2026-07-07 cs.CV 版本更新

Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing

净化然后引导:重新思考多模态人脸反欺骗的领域泛化

Yingjie Ma, Xun Lin, Zitong Yu, Haonan Wang, Ruixin Zhang, Shouhong Ding, Xin Liu, Xiaochen Yuan, Weicheng Xie, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) Tencent Youtu Lab(腾讯优图实验室) School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏