arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-13 至 2026-05-13 共收录 10
2605.12310 2026-05-13 cs.SD

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

Poly-SVC:具有和声建模的多声部意识歌唱语音转换

Chen Geng, Meng Chen, Ruohua Zhou, Ruolan Liu, Weifeng Zhao

机构 * School of Intelligence Science and Technology(智能科学与技术学院) Beijing University of Civil Engineering and Architecture(北京建筑大学) Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐Lyra实验室) Beijing Key Laboratory of Super Intelligent Technology for Urban Architecture(北京超智能城市建筑技术重点实验室)

AI总结 本文提出Poly-SVC,一种零样本、跨语言的歌唱语音转换系统,通过常数Q变换提取音高并融合内容与音色特征,实现自然的多声部输出。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12245 2026-05-13 cs.LG

SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

SOAR:在NVFP4量化中的尺度优化以实现准确重建

Chengzhu Bao, Xianglong Yan, Zhiteng Li, Guangshuo Qin, Guanghua Yu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

AI总结 本文提出SOAR框架,通过闭式联合尺度优化和解耦尺度搜索提升NVFP4量化精度,实验证明其在相同内存占用下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12112 2026-05-13 cs.CV

When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

当策略熵约束失效时:通过感知熵在基于流的RLHF中保持多样性

Xiaofeng Tan, Jun Liu, Bin-Bin Gao, Yuanting Fan, Xi Jiang, Chengjie Wang, Hongsong Wang, Feng Zheng

机构 * Southeast University(东南大学) Tencent Youtu Lab(腾讯云图实验室) Southern University of Science and Technology(南方科技大学)

AI总结 本文研究了基于流的RLHF中策略熵与多样性之间的关系,提出感知熵作为新的约束方法,通过在感知空间中保持多样性提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12013 2026-05-13 cs.CV cs.AI

L2P: Unlocking Latent Potential for Pixel Generation

L2P:解锁像素生成的潜在能力

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Jiawei Chen, Zhuoqi Zeng, Wei Zhang, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) Hainan-biuh(海南-比乌) Weess Gmbh(韦斯公司)

AI总结 本文提出L2P框架,通过利用预训练LDM的知识,高效构建像素空间模型,无需大量数据和计算资源,实现快速收敛和高分辨率生成。

Comments project page: https://nju-pcalab.github.io/projects/L2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11960 2026-05-13 cs.CV

Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

Chronicles-OCR: 中国文字演变轨迹的跨时代感知基准

Gengluo Li, Shangpin Peng, Xingyu Wan, Chengquan Zhang, Hao Feng, Xin Xu, Pian Wu, Bang Li, Zengmao Ding, Yongge Liu, Yipei Ye, Yang Yang, Zhan Shu, Guojun Yan, Zhe Li, Can Ma, Weiping Wang, Yu Zhou, Han Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) Tencent(腾讯) Anyang Normal University(安阳师范学院) The Palace Museum(故宫博物院) Nankai University(南开大学)

AI总结 Chronicles-OCR通过跨时代视觉感知任务评估VLLMs在汉字演变中的鲁棒性,包含2800张平衡图像和四个量化任务,推动历史文本感知研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11869 2026-05-13 cs.CV cs.LG

FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity

FIS-DiT:通过无训练帧交错稀疏性打破视频推断的少步障碍

Jian Tang, Jiawei Fan, Qingbin Liu, Zheng Wei

机构 * Platform and Content Group, Tencent(腾讯平台与内容组)

AI总结 本文提出FIS-DiT,通过将优化重点从时间轨迹转向潜在帧维度,解决少步推断中特征复用和预测建模受限的问题,实现2.11-2.41倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06139 2026-05-13 cs.CL

GRP: Goal-Reversed Prompting for Zero-Shot Evaluation with LLMs

GRP:基于大语言模型的零样本评估中的目标反转提示

Mingyang Song, Mao Zheng, Xuan Luo

机构 * Tencent(腾讯)

AI总结 本文提出GRP方法,通过要求模型选择更差的答案来反转传统评估目标,从而提升判断准确性,实验表明其在多个基准测试中表现优异。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11711 2026-05-13 cs.LG cs.AI

Debiased Model-based Representations for Sample-efficient Continuous Control

去偏的基于模型的表示用于样本高效的连续控制

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言) McGill University(麦吉尔大学) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出DR.Q算法,通过最大化当前状态-动作对表示与下一状态之间的互信息,并采用衰减优先经验回放,以减少表示和actor-critic学习中的偏差,从而在连续控制任务中取得优于现有方法的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02007 2026-05-13 cs.CL cs.AI

Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation

超越RAG的代理记忆:通过解耦与聚合进行检索

Zhanghao Hu, Qinglin Zhu, Runcong Zhao, Di Liang, Hanqi Yan, Yulan He, Lin Gui

机构 * King’s College London(伦敦国王学院) Tencent, Yuanbao Team(腾讯元宝团队)

AI总结 本文提出xMemory,通过解耦与聚合原则优化代理记忆检索,提升答案质量和推理效率。

Comments Project Address: https://zhanghao-xmemory.github.io/Academic-project-page-template/; Code Address: https://github.com/HU-xiaobai/xMemory

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏