SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
SkillForge:为强化学习智能体演化可验证技能
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)
AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。
大厂专区
SkillForge:为强化学习智能体演化可验证技能
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)
AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。
HMGCLIP:面向电商表征学习的异构多粒度对比学习
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。
对比分支策略优化
机构 * Alibaba Group(阿里巴巴集团) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 针对工具集成智能体训练的细粒度信用分配问题,提出CBPO解耦分支采样的预算分配与信用转化,在十个基准上优于现有方法,获两个领域及两种模型规模下最高宏平均准确率。
Comments 10 pages, 5 figures, 3 tables
记忆并非总是必需:科学推理中条件记忆的特征分析
机构 * Huzhou Normal University(湖州师范大学) ; Alibaba Group(阿里巴巴集团) ; Bota Biosciences(博塔生物科技) ; Zhejiang University(浙江大学)
AI总结 本研究探究科学推理中条件记忆的参与机制,提出知识边界感知路由器,在生物化学推理基准上验证其可保留有益记忆贡献并抑制退化,确立选择性记忆分配的重要性。
AffineTok:面向扩散模型友好型视觉分词器的语义仿射一致性
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出AffineTok,通过语义仿射一致性(SAC)引导视觉分词器训练,引入M_SAC作为代理指标,在ImageNet 256上实现了gFID的显著降低,达到无引导1.21、有引导1.10的SOTA性能。
Comments Project page: this https URL (https://michaelyu781.github.io/AffineTok-site/)
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference
MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试
机构 * Alibaba(阿里巴巴)
AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。
从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计
机构 * Alibaba Group(阿里巴巴集团)
AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。
Comments 19 pages, 10 figures
Tora3:基于轨迹的音频视频生成与物理一致性
机构 * Alibaba Cloud Computing(阿里巴巴云 computing) ; Fudan University(复旦大学)
AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。
Comments accepted by ACM MM 2026
开放评分系统:通过成对自适应评分表扩展强化学习
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。