arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-11 至 2026-05-11 共收录 11
2605.07872 2026-05-11 cs.CV cs.AI

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

视频理解奖励建模:一个稳健的基准和高效的奖励模型

Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

机构 * South China University of Technology(华南理工大学) Peking University(北京大学) The University of Hong Kong(香港大学) Tencent(腾讯)

AI总结 本文提出Video Understanding Reward Bench基准和VideoDRM/VideoGRM模型,通过大规模高质量数据提升视频理解奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07545 2026-05-11 cs.CV cs.AI

Implicit Preference Alignment for Human Image Animation

隐式偏好对齐用于人类图像动画

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Tencent Hunyuan(腾讯文脉)

AI总结 本文提出隐式偏好对齐框架,通过最大化自动生成高质量样本的似然并惩罚与预训练先验的偏差,提升手部生成质量并降低偏好数据构建门槛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26509 2026-05-11 cs.RO cs.CV

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07396 2026-05-11 cs.LG cs.AI

Rubric-based On-policy Distillation

基于评分标准的在线蒸馏

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng Jiang, Dan Zhang, Haiyun Guo, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯)

AI总结 本文提出ROPD框架,利用教师生成的响应而非教师日志进行在线蒸馏,实现更灵活的黑盒兼容方案,实验显示在多数场景下性能优于基于日志的蒸馏方法,样本效率提升达10倍。

Comments Preprint. Code is available at https://github.com/Peregrine123/ROPD_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07276 2026-05-11 cs.AI

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

信号重塑用于弱反馈代理代码修复中的GRPO

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Tencent(腾讯)

AI总结 本文研究了在弱反馈环境下,通过信号重塑提升GRPO在代理代码修复中的性能,通过三种信号重塑方法改进轨迹排名、轨迹内信用分配和组内可比性,实验表明信号重塑显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏