arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-06-11 至 2026-06-11 共收录 7
2606.12199 2026-06-11 eess.AS cs.CL cs.SD 新提交

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究

Zhen Ye, Xu Tan, Yiming Li, Guangyan Zhang, Chimin Chan, Haohe Liu, Zhengxi Liu, Hongzhan Lin, Zheqi Dai, Xinshen Zhang, Peiwen Sun, Qiuqiang Kong, Wei Xue

机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) Tencent, China(腾讯) University of Surrey, United Kingdom(Surrey大学) Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) Independent Researcher(独立研究者)

AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。

Comments Accepted by Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12397 2026-06-11 cs.LG cs.AI cs.CL 新提交

Redesign Mixture-of-Experts Routers with Manifold Power Iteration

重新设计混合专家模型的路由器:基于流形幂迭代

Songhao Wu, Ang Lv, Ruobing Xie, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Large Language Model Department, Tencent(腾讯大型语言模型部门)

AI总结 提出将路由器行与专家矩阵主奇异方向对齐,并基于流形幂迭代(MPI)重新设计路由器,通过“幂迭代-收缩”范式实现对齐,理论证明收敛性,实验验证1B至11B参数规模下模型效果提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12273 2026-06-11 cs.CL 新提交

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models

超越完全随机掩码:扩散语言模型的注意力引导去噪与优化

Jia Deng, Junyi Li, Wayne Xin Zhao, Jinpeng Wang, Hongyu Lu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Meituan(美团) WeChat, Tencent(腾讯微信) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)

AI总结 提出AGDO框架,利用注意力结构指导去噪顺序并强化关键令牌,在数学和编码基准上提升扩散语言模型的推理性能。

Comments 13 pages. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12099 2026-06-11 cs.CV 新提交

ISAP-3D: Identity-Slot Aligned Part-Aware 3D Generation

ISAP-3D: 身份槽对齐的部件感知3D生成

Junlin Hao, Haoshuai Fu, Xibin Song, Wei Li, Ruigang Yang, Xinggong Zhang, Jinchuan Zhang

机构 * Peking University(北京大学) Tencent(腾讯) Huawei(华为) University of Science and Technology of China(中国科学技术大学)

AI总结 针对部件感知3D生成中因身份-布局纠缠导致的结构歧义问题,提出身份槽对齐框架ISAP-3D,通过语义身份令牌锚定每个部件并进行一对一布局预测,实现稳定可控的部件级3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11953 2026-06-11 cs.CL 新提交

Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos

解码多模态线索:揭示仇恨视频背后的隐含意义

Junyu Lu, Deyi Ji, Liqun Liu, Xiaokun Zhang, Youlin Wu, Roy Ka-Wei Lee, Peng Shu, Huan Yu, Jie Jiang, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Tencent(腾讯) City University of Hong Kong(香港城市大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 提出IARE框架,通过信息增强和推理优化实现可解释的仇恨视频检测,在Ex-HateMM和Ex-ImpliHateVid数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11828 2026-06-11 cs.SD cs.AI cs.CR cs.MM 新提交

Feature-Aligned Speech Watermarking for Robustness to Reconstruction Distortions

特征对齐的语音水印技术以抵抗重建失真

Haiyun Li, Shuhai Peng, Zhisheng Zhang, Jingran Xie, Xiaofeng Xie, Hanyang Peng, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen Key Laboratory of Intelligent Media and Content Understanding(深圳市智能媒体与内容理解重点实验室) Tencent AI Lab(腾讯人工智能实验室)

AI总结 提出特征对齐水印方法,通过将水印与原始语音特征分布对齐,在保持不可感知性的同时提高水印能量,增强对语音重建模型的鲁棒性。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10968 2026-06-11 cs.LG cs.AI 版本更新

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

超越大语言模型强化学习中的统一令牌级信任区域

Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元)

AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。

Comments Project Page: https://hunyuan-cppo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏