Qwen-Image-VAE-2.0 Technical Report
Qwen-Image-VAE-2.0 技术报告
机构 * Qwen Team(通义实验室)
AI总结 Qwen-Image-VAE-2.0 提出了一种高压缩变分自编码器,通过改进架构和训练方法,提升了重建保真度和扩散能力,同时引入了新的评估基准。
大厂专区
Qwen-Image-VAE-2.0 技术报告
机构 * Qwen Team(通义实验室)
AI总结 Qwen-Image-VAE-2.0 提出了一种高压缩变分自编码器,通过改进架构和训练方法,提升了重建保真度和扩散能力,同时引入了新的评估基准。
从基线到运输测地线:通过最优生成流的公理化归因
机构 * Shanghai Jiao Tong University(上海交通大学) ; Aalto University(艾尔沃斯大学) ; Alibaba(阿里巴巴) ; Technical University of Denmark(丹麦技术大学)
AI总结 本文研究归因路径的模糊性问题,提出通过数据生成运输过程选择路径的公理化归因方法,结合最优生成流理论,提出运输-测地线归因原则,并通过实验验证其稳定性与结构化解释能力。
Comments 10 figures, 31 pages
SupChain-Bench:针对现实世界供应链管理的大语言模型基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出SupChain-Bench基准测试,用于评估大语言模型在现实世界供应链管理中的表现,揭示模型执行可靠性差距,并提出SupChain-ReAct框架提升工具调用性能。
在摄像机坐标系中统一机器人动作
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司)
AI总结 本文提出CalibAll方法,通过摄像机外参标注统一不同机器人平台的动作表示,提升跨平台学习性能。
ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型
机构 * Zhejiang University(浙江大学) ; Amap, Alibaba Group(阿里集团阿地图) ; Nanjing University(南京大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Beijing University of Chemical Technology(北京化工大学) ; Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) ; Tsinghua University(清华大学) ; Queen Mary University of London(伦敦大学玛丽女王学院)
AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。
CROP:通过组合推理和优化偏好实现专家对齐的图像裁剪
机构 * Southeast University(东南大学) ; Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术重点实验室) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出CROP方法,通过组合推理和优化偏好,解决传统图像裁剪方法在复杂场景中难以做出组合权衡和缺乏适应性推理的问题,提升裁剪结果与专家审美的一致性。