arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-04-16 至 2026-04-16 共收录 8
2604.14142 2026-04-16 cs.LG cs.AI cs.CL

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14010 2026-04-16 cs.LG cs.CL

Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning

参数重要性并非静态:为监督微调设计的演进参数隔离

Zekai Lin, Chao Xue, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng

机构 * Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) Peking University(北京大学) UESTC University of New South Wales(新南威尔士大学)

AI总结 本文提出EPI框架,通过动态调整参数隔离策略,减少训练中的任务干扰和遗忘,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13822 2026-04-16 cs.LG

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization

UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化

Zhengxi Lu, Fei Tang, Guangyi Liu, Kaitao Song, Xu Tan, Jin Ma, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13737 2026-04-16 cs.IR cs.AI

TokenFormer: Unify the Multi-Field and Sequential Recommendation Worlds

TokenFormer:统一多字段和序列推荐领域

Yifeng Zhou, Yuehong Hu, Zhixiang Feng, Junwei Pan, Kaihui Wu, Hanyong Li, Shangyu Zhang, Shudong Huang, Zhangbin Zhu, Chengguo Yin, Haijie Gu, Jie Jiang

机构 * Tencent Inc.(腾讯公司)

AI总结 TokenFormer通过引入BFTS注意力机制和NLIR,解决多字段与序列推荐的融合问题,提升模型鲁棒性和表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26519 2026-04-16 cs.LG

Think Outside the Policy: In-Context Steered Policy Optimization

突破政策限制:基于上下文的政策优化

Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department(大模型部门) Tencent(腾讯)

AI总结 本文提出ICPO框架,利用大推理模型的上下文学习能力,通过混合策略GRPO和隐式专家强制扩展探索范围,提升RLVR在数学推理任务中的性能和稳定性。

Comments ACL 2026 Findings. 19 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07591 2026-04-16 cs.CL cs.AI

MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models

MulDimIF:一种多维约束框架用于评估和改进大语言模型的指令遵循能力

Junjie Ye, Caishuang Huang, Zhuohan Chen, Wenjie Fu, Chenyuan Yang, Leyi Yang, Yilong Wu, Peng Wang, Meng Zhou, Xiaolong Yang, Tao Gui, Qi Zhang, Zhongchao Shi, Jianping Fan, Xuanjing Huang

机构 * Fudan University(复旦大学) Lenovo Research(联想研究院) Tencent(腾讯) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

AI总结 本文提出MulDimIF框架,通过多维约束模式、类别和难度等级,设计可控指令生成流程,生成9106个可验证样本,评估18个LLM模型,发现不同约束设置下性能差异显著,并通过训练提升指令遵循能力而不影响通用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏