arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-05-04 至 2026-05-04 共收录 4
2504.10368 2026-05-04 cs.CL cs.AI

Exploring the System 1 Thinking Capability of Large Reasoning Models

探索大型推理模型的系统1思维能力

Wenyuan Zhang, Shuaiyi Nie, Xinghua Zhang, Zefeng Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 本文研究大型推理模型的系统1思维能力,提出S1-Bench基准测试,发现现有模型在简单问题上存在准确率低和效率差的问题,揭示了模型对问题难度的隐含编码。

Comments Accepted by IJCAI 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00610 2026-05-04 cs.LG

Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

在整合前解耦:测试时合成SFT和RLVR任务向量

Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang

机构 * Department of Systems Engineering and Engineering Management, Chinese University of Hong Kong, Hong Kong, China(系统工程与工程管理系,香港中文大学,香港,中国) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国) DAMO Academy, Alibaba Group, Hangzhou, China(达摩院,阿里巴巴集团,杭州,中国) Hupan Lab, Hangzhou, China(虎派实验室,杭州,中国)

AI总结 本文提出DoTS框架,通过测试时任务向量运算解耦SFT和RLVR,减少干扰并提升性能,实验表明其在多个数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00072 2026-05-04 cs.CR cs.AI

XekRung Technical Report

XekRung技术报告

Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, Zhaoyu Hu, Yiliang Zhang, Ziang Weng, Longtao Huang, Dongjie Zhang, Libin Dong, Yang Ge, Yuanda Wang, Kaiwen Lv Kacuila, Bingyu Zhu, Jing Wang, Jin Xu

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

AI总结 本文提出XekRung,一种面向网络安全的前沿大语言模型,通过定制数据合成管道和多阶段训练流程,实现网络安全领域的高性能表现。

Comments 22 pages, 2 figures, 5 tables. Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, and Zhaoyu Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07349 2026-05-04 cs.CL

Reward Modeling from Natural Language Human Feedback

从自然语言人类反馈中学习奖励模型

Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出RM-NLHF方法,通过自然语言反馈获取过程奖励信号,解决二元任务中解决方案空间有限的问题,实验表明其优于仅用结果监督的生成奖励模型。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏