arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-07-24 至 2026-07-24 共收录 6
2607.21570 2026-07-24 cs.CL cs.HC 新提交

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

MedGame:由大语言模型赋能的用于医学教育的故事化游戏化

Qian Wu, Xinrong Zhou, Zizhan Ma, Kai Chen, Zheyao Gao, Xun Lin, Hongqiu Wu, Longfei Gou, Yixiao Liu, Ann Sin Nga Lau, Qi Dou

机构 * CUHK(香港中文大学) Southern Medical University(南方医科大学) Peking University(北京大学) Tencent(腾讯)

AI总结 研究旨在利用大语言模型助力医学教育,提出MedGame框架,通过双引擎设计将临床病例转化为故事化游戏,构建MedGame Bench进行评估,实验显示特定任务微调提升开源模型表现,学生研究表明其更具吸引力和实用性。

Comments Work in Progress; an explorational design and study on AI+Education+Game

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19747 2026-07-24 cs.CL 版本更新

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

超越以相关性为中心的检索:面向评分标准的文档集选择与排序

Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu, Baochen Fu, Bin Li, Vichwang, Yu Lu, Haibo Shi

机构 * University of Science and Technology of China(中国科学技术大学) Yuanbao Team, Tencent(腾讯元宝团队) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学)

AI总结 研究针对大语言模型和人工智能代理对搜索结果质量需求,提出评估-诊断-优化框架。设计SetwiseEvalKit评估基准,评估多种重排器。在此基础上提出Rubric4Setwise方法,无需训练,能以更少文档和搜索轮次实现最佳下游生成性能,验证了闭环有效性。

Comments Project Page: https://rubric4setwise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11052 2026-07-24 cs.SD 版本更新

LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation

LaDA-Band:语言扩散模型用于人声到伴奏生成

Qi Wang, Zhexu Shen, Meng Chen, Guoxin Yu, Chaoxu Pang, Weifeng Zhao, Wenjiang Zhou

机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全国家重点实验室) Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐集团Lyra实验室) Pengcheng Laboratory(鹏城实验室)

AI总结 LaDA-Band通过引入离散掩码扩散模型,解决了人声到伴奏生成中保持音质真实、维持全局连贯性和产生动态编曲的三重挑战,提升了长距离结构一致性和时间同步性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏