arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-04-21 至 2026-04-21 共收录 16
2604.18493 2026-04-21 cs.LG

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

过于正确而无法学习:在饱和推理数据上进行强化学习

Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

AI总结 本文提出CUTS策略,通过约束均匀Top-K采样增强探索,结合Mixed-CUTS框架提升推理多样性,实验显示在AIME25基准上Pass@1准确率提升15.1%。

Comments ACL 2026 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18187 2026-04-21 cs.SD cs.CL

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

Audio-DeepThinker:渐进式推理感知强化学习用于音频语言模型中高质量推理链涌现

Xiang He, Chenxing Li, Jinting Wang, Yan Rong, Tianxin Xie, Wenfu Wang, Li Liu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science(香港科技大学)

AI总结 本文提出Audio-DeepThinker框架,通过混合奖励和渐进式课程学习提升音频推理质量,实现高质量推理链涌现,取得多项评测冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18131 2026-04-21 cs.AI

Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

通过世界知识探索训练具有自发、无奖励自我进化的LLM代理

Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出一种无需外部监督的LLM代理自我进化方法,通过世界知识探索提升任务成功率,实验表明在WebVoyager和WebWalker上性能提升20%,并使紧凑型Qwen3模型超越Gemini-2.5-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17883 2026-04-21 cs.SE cs.HC cs.LG

Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer

规模化的人工智能编码协作需要一个可治理的共识层

Tianfu Wang, Zhezheng Hao, Yin Wu, Wei Wu, Qiang Lin, Hande Dong, Nicholas Jing Yuan, Hui Xiong

机构 * Tencent(腾讯)

AI总结 本文提出Agentic Consensus共识层,通过类型属性图替代代码作为主要工程产物,解决AI辅助开发中代码与聊天历史维度塌陷导致的系统不透明问题,强调通过共识熵衡量协作流程的对齐度和干预距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17870 2026-04-21 cs.CL

GraSP: Graph-Structured Skill Compositions for LLM Agents

GraSP:用于LLM代理的图结构技能组合

Tianle Xia, Lingxiang Hu, Yiding Sun, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang

机构 * Tencent(腾讯)

AI总结 本文提出GraSP,一种可执行技能图架构,通过引入编译层提升LLM代理技能编排效率,通过五种类型操作符将扁平技能集转化为带前提-效应边的有向无环图,提升任务完成效率和奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17827 2026-04-21 cs.CL

Learning to Seek Help: Dynamic Collaboration Between Small and Large Language Models

学习寻求帮助:小语言模型与大语言模型之间的动态协作

Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Jiarui Zhang, Shaojie Tang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) WeChat Tencent, Beijing, China(微信腾讯) State University of New York at Buffalo, New York, United States(纽约州立大学布法罗分校)

AI总结 本文提出动态协作框架,使小模型主动请求大模型进行多步推理,大模型提供适应性反馈,通过系统研究协作策略受模型能力与效率隐私约束的影响,实验表明动态策略优于静态流程和独立推理,并能稳健迁移至未见的大模型。

Comments 8 content pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08364 2026-04-21 cs.CV

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05449 2026-04-21 cs.CV cs.AI

DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

DisCa:通过与知识蒸馏兼容的可学习特征缓存加速视频扩散变换器

Chang Zou, Changlin Li, Yang Li, Patrol Li, Jianbing Wu, Xiao He, Songtao Liu, Zhao Zhong, Kailin Huang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Xidian University(西安电子科技大学)

AI总结 本文提出一种与知识蒸馏兼容的可学习特征缓存机制,用于加速视频扩散变换器,通过轻量级可学习神经预测器提升高维特征演化过程的准确性,并采用保守的受限均值流方法实现更稳定无损的知识蒸馏,从而将加速边界推至11.8倍同时保持生成质量。

Comments 18 pages, 8 figures; cvpr2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03938 2026-04-21 cs.LG cs.AI cs.CL

FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning

FOREVER: 基于遗忘曲线的记忆回放用于语言模型连续学习

Yujie Feng, Hao Wang, Jian Li, Xu Chu, Zhaolu Kang, Yiran Liu, Yasha Wang, Philip S. Yu, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) ShineMo Ltd., China(中国 ShineMo 公司) Solar System of OVB, Tencent, China(腾讯 OVB 太阳系中国) Peking University(北京大学) University College London(伦敦大学学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 FOREVER通过引入遗忘曲线概念,提出了一种基于模型自身时间的连续学习框架,有效缓解了语言模型在持续学习中的灾难性遗忘问题。

Comments ACL 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09275 2026-04-21 cs.CL cs.AI

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation

卓越还是真实表现?通过动态评估重新思考医疗诊断基准

Xiangxu Zhang, Lei Li, Yanyun Zhou, Xiao Zhou, Yingying Zhang, Xian Wu

机构 * GSAI, Renmin University of China(清华大学人工智能研究院,中国人民大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部)

AI总结 本文提出DyReMe动态基准,通过生成临床相关干扰因素的咨询式案例,评估医疗诊断模型的鲁棒性,揭示现有模型在临床干扰下的不足。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02034 2026-04-21 cs.CV

SemMorph3D: Unsupervised Semantic-Aware 3D Morphing via Mesh-Guided Gaussians

SemMorph3D:通过网格引导高斯进行无监督的语义感知3D变形

Mengtian Li, Yunshu Bai, Yimin Chu, Xinru Guo, Haolin Liu, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University School of Artificial Intelligence , Wuhan University Tencent Shanghai Engineering Research Center of Motion Picture Special Effects(上海大学人工智能学院、武汉大学、腾讯、上海影视特效工程研究中心)

AI总结 SemMorph3D通过网格引导高斯方法实现从多视角图像直接生成语义感知的3D形状和纹理变形,解决传统方法在结构完整性和输入拓扑上的不足,提升变形的稳定性和颜色一致性。

Comments Project page: https://baiyunshu.github.io/GAUSSIANMORPHING.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17419 2026-04-21 cs.MA cs.LG

ARMove: Learning to Predict Human Mobility through Agentic Reasoning

ARMove: 通过代理推理学习预测人类移动

Chuyue Wang, Jie Feng, Yuxi Wu, Shenglin Yi, Hang Zhang

机构 * Tencent(腾讯) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Meituan(美团)

AI总结 ARMove通过代理推理方法,解决人类移动预测中的可解释性、迭代学习和迁移性问题,实验表明其在六个指标上优于现有方法,且在不同地区和用户群体中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11137 2026-04-21 cs.AI cs.LG

From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning

从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理

Chen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23885 2026-04-21 cs.CV

Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training

通过现实场景合成和文档感知训练实现真实世界文档解析

Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20075 2026-04-21 cs.AI

Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback

Curriculum-RLAIF: 通过人工智能反馈的强化学习进行课程对齐

Jiaye Lin, Mengdi Li, Xufeng Zhao, Wenhao Lu, Peilin Zhao, Stefan Wermter, Di Wang

机构 * Tsinghua University(清华大学) Provable Responsible AI and Data Analytics Lab(可证明责任AI与数据 analytics 实验室) King Abdullah University of Science and Technology(卡布斯王国科学与技术大学) University of Hamburg(汉堡大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Curriculum-RLAIF框架,通过构建不同难度的偏好对,提升奖励模型的泛化能力,从而显著提高策略模型对齐性能,且无需额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏