arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-26 至 2026-08-26 共收录 10
2608.24747 2026-08-26 cs.CL 新提交

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:为强化学习智能体演化可验证技能

Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24300 2026-08-26 cs.LG cs.AI 新提交

Contrastive Branch Policy Optimization

对比分支策略优化

Ying Wang, Changlin Qiu, Bang Lin, Linbo Jin, Wen Jiang, Zhe Sun, Jingli Yang

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对工具集成智能体训练的细粒度信用分配问题,提出CBPO解耦分支采样的预算分配与信用转化,在十个基准上优于现有方法,获两个领域及两种模型规模下最高宏平均准确率。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23982 2026-08-26 cs.AI cs.CL cs.LG 新提交

Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning

记忆并非总是必需:科学推理中条件记忆的特征分析

Zhen Bi, Xueshu Chen, Yan Wang, Zhizhi Peng, Haosen Hong, Zhen Wang, Zhixuan Chu, Bingyu Zhu, Jungang Lou

机构 * Huzhou Normal University(湖州师范大学) Alibaba Group(阿里巴巴集团) Bota Biosciences(博塔生物科技) Zhejiang University(浙江大学)

AI总结 本研究探究科学推理中条件记忆的参与机制,提出知识边界感知路由器,在生物化学推理基准上验证其可保留有益记忆贡献并抑制退化,确立选择性记忆分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23864 2026-08-26 cs.CV 新提交

AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer

AffineTok:面向扩散模型友好型视觉分词器的语义仿射一致性

Junqiu Yu, Pandeng Li, Yikai Wang, Jiaxing Zhao, Yujie Wei, Kaixun Jiang, Quanhao Li, Hongtao Yu, Zhihang Liu, Zhaohe Liao, Junjie Zhou, Yun Zheng, Yu Liu, Yanwei Fu

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出AffineTok,通过语义仿射一致性(SAC)引导视觉分词器训练,引入M_SAC作为代理指标,在ImageNet 256上实现了gFID的显著降低,达到无引导1.21、有引导1.10的SOTA性能。

Comments Project page: this https URL (https://michaelyu781.github.io/AffineTok-site/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-26 cs.CL 版本更新

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-26 cs.AI 版本更新

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-08-26 cs.CL 版本更新

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Wen Wang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏