arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-04 至 2026-05-04 共收录 3
2412.02125 2026-05-04 cs.AI cs.LG

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

偏好目标微调:冻结策略的后训练作为潜在控制

Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00043 2026-05-04 cs.DB cs.AI cs.MA

SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms

SiriusHelper:一种基于LLM代理的大数据平台操作助手

Yu Shen, Shiyang Liu, Qihang He, Yihang Cheng, Haining Xie, Zhiming He, Huahua Fan, Xianzhi Tan, Teng Ma, Shaoquan Zhang, Danqing Huang, Fan Jiang, Yang Li, Chongqing Zhao, Peng Chen, Jie Jiang, Bin Cui

机构 * TEG, Tencent Inc.(腾讯科技(TEG)) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24276 2026-05-04 cs.AI

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

G-reasoner:用于统一图结构知识推理的基础模型

Linhao Luo, Zicheng Zhao, Junnan Liu, Zhangchi Qiu, Junnan Dong, Serge Panev, Chen Gong, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung, Alan Wee-Chung Liew, Shirui Pan

机构 * Monash University(莫纳什大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学) Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) NVIDIA(英伟达)

AI总结 G-reasoner通过整合图与语言基础模型,实现对多样化图结构知识的高效推理,采用标准化四层抽象QuadGraph统一异构知识源,并通过混合精度训练和分布式消息传递提升效率与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏