arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-14 至 2026-05-14 共收录 6
2605.13565 2026-05-14 cs.CV

Qwen-Image-VAE-2.0 Technical Report

Qwen-Image-VAE-2.0 技术报告

Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Yiliang Gu, Yi Wang, Xiaoxiao Xu, Lin Qu

机构 * Qwen Team(通义实验室)

AI总结 Qwen-Image-VAE-2.0 提出了一种高压缩变分自编码器,通过改进架构和训练方法,提升了重建保真度和扩散能力,同时引入了新的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05093 2026-05-14 cs.LG cs.AI cs.CV

From Baselines to Transport Geodesics: Axiomatic Attribution via Optimal Generative Flows

从基线到运输测地线:通过最优生成流的公理化归因

Cenwei Zhang, Lin Zhu, Manxi Lin, Lei You

机构 * Shanghai Jiao Tong University(上海交通大学) Aalto University(艾尔沃斯大学) Alibaba(阿里巴巴) Technical University of Denmark(丹麦技术大学)

AI总结 本文研究归因路径的模糊性问题,提出通过数据生成运输过程选择路径的公理化归因方法,结合最优生成流理论,提出运输-测地线归因原则,并通过实验验证其稳定性与结构化解释能力。

Comments 10 figures, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07342 2026-05-14 cs.AI

SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management

SupChain-Bench:针对现实世界供应链管理的大语言模型基准测试

Shengyue Guan, Yihao Liu, Lang Cao

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出SupChain-Bench基准测试,用于评估大语言模型在现实世界供应链管理中的表现,揭示模型执行可靠性差距,并提出SupChain-ReAct框架提升工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17001 2026-05-14 cs.RO

Unify Robot Actions in Camera Frame

在摄像机坐标系中统一机器人动作

Sicheng Xie, Lingchen Meng, Zijie Diao, Haidong Cao, Zhiying Du, Shuyuan Tu, Jiaqi Leng, Qiuyue Wang, Mingsheng Li, Shuai Bai, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司)

AI总结 本文提出CalibAll方法,通过摄像机外参标注统一不同机器人平台的动作表示,提升跨平台学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12545 2026-05-14 cs.CV cs.AI

CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference

CROP:通过组合推理和优化偏好实现专家对齐的图像裁剪

Zhitong Dong, Chao Li, Jie Yu, Hao Chen

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术重点实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出CROP方法,通过组合推理和优化偏好,解决传统图像裁剪方法在复杂场景中难以做出组合权衡和缺乏适应性推理的问题,提升裁剪结果与专家审美的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏