arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-06-10 至 2026-06-10 共收录 8
2606.10738 2026-06-10 eess.AS cs.AI 新提交

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11075 2026-06-10 cs.LG 新提交

Exploring the Design Space of Reward Backpropagation for Flow Matching

探索流匹配的奖励反向传播设计空间

Ruoyu Wang, Boye Niu, Xiangxin Zhou, Yushi Huang, Tongliang Liu, Chi Zhang

机构 * Westlake University(西湖大学) Tencent Hunyuan(腾讯混元) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对文本到图像流匹配模型,提出统一代理轨迹框架FlowBP,通过设计反向轨迹(稀疏重建、桥耦合、拉格朗日积分)解决直接奖励反向传播中的内存和梯度爆炸问题,在多个模型和指标上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-06-10 cs.CL cs.SD eess.AS 新提交

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10346 2026-06-10 cs.AI 新提交

Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

推理还是记忆?LLM强化学习中的方向感知多样性探索

Jiangnan Xia, Yucheng Shi, Yu Yang, Kishan Panaganti, Zhenwen Liang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Lab(腾讯AI实验室) The Education University of Hong Kong(香港教育大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出DiRL框架,通过方向感知奖励区分推理与记忆驱动的探索,在GRPO中集成方向加权梯度特征,显著提升数学与通用推理性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07088 2026-06-10 cs.LG math.OC 版本更新

Residual-Controlled Multiplier Learning for Stochastic Constrained Decision-Making

残差控制乘子学习用于随机约束决策

Kang Liu, Jianchen Hu, Ziyu Qu, Edward Hengzhou Yan, Lun Yang, Meng Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent(腾讯) China University of Geosciences(中国地质大学)

AI总结 提出残差控制乘子学习(RCML),通过将乘子更新重构为投影压力反馈,并引入模块化随机稳定组件,解决随机约束决策中原始-对偶方法因小批量噪声导致乘子更新不稳定的问题,实现有限增益收敛和局部KKT残差解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23183 2026-06-10 cs.IR cs.AI 版本更新

Reasoning over Semantic IDs Enhances Generative Recommendation

基于语义ID的推理增强生成式推荐

Yingzhi He, Yan Sun, Junfei Tan, Yuxin Chen, Xiaoyu Kong, Chunxu Shen, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Tencent Inc.(腾讯公司)

AI总结 提出SIDReasoner两阶段框架,通过增强语义ID与语言的对齐和结果驱动的强化优化,实现无需大量推理标注的有效推理,提升生成式推荐的准确性、可解释性和跨领域泛化能力。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏