arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-06-02 至 2026-06-02 共收录 12
2606.02138 2026-06-02 cs.LG cs.AI

VLBM: Variational Latent Basis Modeling for OOD Robust Multivariate Time Series Forecasting

VLBM:面向OOD鲁棒多变量时间序列预测的变分潜在基建模

Xudong Zhang, Jierui Lei, Jiacheng Li, Lingdong Shen, Jian Cui, Haina Tang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Amap, Alibaba Group(阿里巴巴集团阿地图) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Environmental Microbiome and Innovative Genomics Laboratory, Peking University(北京大学环境微生物与创新基因组实验室)

AI总结 提出VLBM框架,通过变分潜在基分离稳定动态与OOD偏差,实现混合ID/OOD分布下的鲁棒预测,在12个基准任务上平均MAE和MSE分别提升15.08%和7.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02000 2026-06-02 cs.CV cs.AI eess.IV

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学) INSAIT

AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。

Comments Project page: https://jingyunliang.github.io/MeshToken/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01677 2026-06-02 cs.SD

UniVocal: Unified Speech-Singing Code-Switching Synthesis

UniVocal: 统一语音-歌唱代码切换合成

Yufei Shi, Qian Chen, Wen Wang, Xiangang Li, Zhen-Hua Ling, Yang Ai

机构 * Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Independent Researcher(独立研究者)

AI总结 提出UniVocal统一框架,通过两阶段课程学习和链式思维生成,隐式从文本上下文推断发声模式,实现语音-歌唱代码切换合成,在SCSBench上达到最优性能。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00724 2026-06-02 cs.CL cs.AI

WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering

WaveFilter: 通过小波引导的KV缓存过滤增强扩散型大语言模型的长上下文能力

Jinnan Yang, Yan Wang, Zhen Bi, Kehao Wu, Xiaojie Li, Jungang Lou, Zechao Li, Jing Liu

机构 * Nanjing University of Science and Technology(南京理工大学) Alibaba Group(阿里巴巴集团) Huzhou Normal University(湖州师范学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对扩散型大语言模型在长上下文任务中计算开销大和推理延迟高的问题,提出一种无需训练的通用缓存框架WaveFilter,利用小波变换分解长序列以精确识别关键token,构建稀疏KV缓存,从而提升现有KV缓存方法在复杂长上下文任务中的性能。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30280 2026-06-02 cs.RO cs.AI cs.CL

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

机构 * Qwen Team(通义实验室)

AI总结 提出Qwen-VLA,一种基于DiT动作解码器的统一具身基础模型,通过大规模联合预训练和具身感知提示,将操作、导航和轨迹预测统一为动作-轨迹预测框架,实现跨任务、环境和机器人形态的泛化。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03893 2026-06-02 cs.AI

FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning

FeynmanBench:多模态大语言模型在图解物理推理上的基准测试

Zeyu Wang, Jingye Xu, Xiaogang Li, Peiyao Xiao, Qinhao Kong, Ben Wang, Chengliang Xu, Zichao Chen, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Skylenage

AI总结 提出FeynmanBench基准,包含2000多个费曼图任务,评估多模态大模型在拓扑结构、守恒约束和视觉-代数映射等全局结构推理上的能力,发现模型在局部识别上表现良好但在拓扑重建和代数推导上严重不足。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14771 2026-06-02 cs.AI

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场

Peigen Liu, Rui Ding, Yuren Mao, Ziyan Jiang, Yuxiang Ye, Yunjun Gao, Ying Zhang, Renjie Sun, Longbin Lai, Zhengping Qian

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Alibaba Cloud(阿里云)

AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03309 2026-06-02 cs.CV cs.AI

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型

Jianke Zhang, Xiaoyu Chen, Qiuyue Wang, Mingsheng Li, Yanjiang Guo, Yucheng Hu, Jiajun Zhang, Shuai Bai, Junyang Lin, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)

AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17502 2026-06-02 cs.RO

RynnVLA-002: A Unified Vision-Language-Action and World Model

RynnVLA-002: 统一的视觉-语言-动作与世界模型

Jun Cen, Siteng Huang, Yuqian Yuan, Kehan Li, Hangjie Yuan, Chaohui Yu, Bohan Hou, Yuming Jiang, Jiayan Guo, Xin Li, Hao Luo, Fan Wang, Deli Zhao, Hao Chen

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学)

AI总结 提出统一视觉-语言-动作(VLA)与世界模型的框架RynnVLA-002,通过联合学习环境动态和动作规划,在仿真和真实机器人任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16114 2026-06-02 cs.IR cs.AI

GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks

GFlowGR:使用生成流网络微调生成式推荐框架

Yejing Wang, Shengyu Zhou, Jinyu Lu, Qidong Liu, Xinhang Li, Wenlin Zhang, Feng Li, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团)

AI总结 针对生成式推荐中微调步骤忽略未观测正样本导致的曝光偏差问题,提出基于GFlowNets的微调框架GFlowGR,通过自适应轨迹采样器和综合奖励模型整合协同知识,利用GFlowNets的多样生成特性缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12081 2026-06-02 cs.IR cs.LG

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

从规模到结构化表达能力:重新思考用于CTR预测的Transformer

Bencheng Yan, Yuejie Lei, Zhiyuan Zeng, Zheye Deng, Di Wang, Kaiyi Lin, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。

Comments KDD 2026; The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16915 2026-06-02 cs.CV cs.AI

DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?

DetailMaster:你的文本到图像模型能处理长提示吗?

Qirui Jiao, Daoyuan Chen, Yilun Huang, Xika Lin, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Worcester Polytechnic Institute(沃斯特理工学院) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省火灾科学与智能应急技术重点实验室)

AI总结 提出DetailMaster基准,通过自动数据构建和评估流程,系统评估文本到图像模型在长提示下的性能,发现编码器和扩散模型在细节密集条件下的局限性,并证明高保真生成需要扩展提示限制与长提示训练的协同组合。

Comments 36 pages, 10 figures, 21 tables, accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏