arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-03 至 2026-08-03 共收录 9
2607.26873 2026-08-03 cs.CL 版本更新

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

SERPO:面向开放式测试时强化学习的自进化规则策略优化

Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 SERPO通过协同进化响应证据、查询规则和策略参数的闭环机制,在开放式测试时强化学习任务中显著提升了HealthBench等基准的性能,支持分布外迁移与跨基准进化。

Comments 20 pages, including the appendix. Code is available at https://github.com/chiefovoavicii/SERPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13316 2026-08-03 cs.AI 版本更新

ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

ReSum: 通过强化学习协同LLM推理与摘要生成

Xucong Wang, Ziyu Ma, Yong Wang, Shidong Yang, Hailang Huang, Renda Li, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

AI总结 提出ReSum框架,利用自摘要机制让LLM压缩和组织推理轨迹,通过对比评估自适应触发摘要,在提升性能4%的同时减少18.6%的推理长度。

Comments 24 pages, including 13 pages of main text and 11 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12384 2026-08-03 cs.LG cs.AI 版本更新

APPO: Agentic Procedural Policy Optimization

APPO: 智能体程序策略优化

Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Southern University of Science and Technology(南方科技大学)

AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。

Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02906 2026-08-03 cs.LG 版本更新

OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning

面向软件运维构建大型语言模型的端到端框架

Jingkai He, Pengfei Chen, Chenghui Wu, Shuang Liang, Ye Li, Gou Tan, Xidao Wen, Chuanfu Zhang, Fang Situ, Qi Zhou

机构 * School of Systems Science and Engineering, Sun Yat-sen University(系统科学与工程学院,中山大学) School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) Alibaba Cloud Computing(阿里云 computing)

AI总结 本文提出OpsLLM,一个专为软件运维设计的大型语言模型,支持基于知识的问题回答和根本原因分析。通过人机协同机制构建高质量数据集,并结合监督微调和强化学习优化模型性能,在多个任务中优于现有开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00015 2026-08-03 eess.SP cs.AI cs.CV cs.LG 版本更新

TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning

TimeRFT:通过强化微调提升TSFMs的时间序列预测通用性

Siyang Li, Yize Chen, Zijie Zhu, Yuxin Pan, Yan Guo, Ming Huang, Hui Xiong

机构 * University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云) City University of Hong Kong(香港城市大学)

AI总结 TimeRFT通过强化微调方法解决时间序列基础模型在特定任务适应中的泛化问题,提升预测精度和抗分布偏移能力。

Comments 15 pages, 8 figures, In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29888 2026-08-03 cs.HC cs.AI 版本更新

Generative AI in Action: Field Experimental Evidence from Alibaba's Customer Service Operations

生成AI在行动:来自阿里巴巴客户服务中心的实地实验证据

Xiao Ni, Yiwei Wang, Tianjun Feng, Lauren Xiaoyan Lu, Yitong Wang, Congyi Zhou

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Dartmouth College(达特茅斯学院) Alibaba Group Inc.(阿里巴巴集团)

AI总结 本研究通过大规模实地实验评估生成AI助手对电商售后客服人员绩效的影响,发现AI显著提升服务速度和服务质量,但对顶级员工产生负面影响,提示需定制化部署策略。

详情

展开后加载摘要…

URL PDF HTML 收藏