arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-04 至 2026-08-04 共收录 11
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02580 2026-08-04 cs.RO 新提交

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02442 2026-08-04 cs.AI cs.CL 新提交

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02352 2026-08-04 cs.LG cs.CL 新提交

Qwen-CUA: Native Computer Use for (almost) Everything

Qwen-CUA:面向几乎所有场景的原生计算机使用智能体

Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que Shen, Bowen Wang, Junli Wang, Chencan Wu, Rui Xie, Tianbao Xie, Zhihui Xie, Haiyang Xu, An Yang, Tao Yu, Wenzhen Yuan, Xi Zhang, Zhenru Zhang, Mingkang Zhu, Zhaoqing Zhu, Yizhong Cao, Kai Dang, Binyuan Hui, Kaixin Li, Junyang Lin, Haiquan Wang, Zekun Wang, Yiheng Xu, Fan Yan, Mengqi Yuan, Danyang Zhang, Jiajun Zhang, Zhipeng Zhang, Fan Zhou, Fan Zhou

机构 * Qwen Team(通义千问团队) Xlang Lab(Xlang实验室)

AI总结 本文提出原生计算机使用智能体Qwen-CUA,采用397B-A17B Qwen混合专家主干,经大规模训练后在多基准测试中性能优于Qwen3.7,为通用能力智能体奠定基础。

Comments 24 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01964 2026-08-04 cs.CV 新提交

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01643 2026-08-04 cs.CV cs.AI cs.GR 新提交

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

StreamTalk:基于关键姿态锚定的流式伴随语音手势生成

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

机构 * The University of Tokyo(东京大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学)

AI总结 StreamTalk是带周期性生成-检索-精调循环的闭环流式伴随语音手势生成框架,通过关键姿态锚定减少长程漂移,在BEAT2数据集上达到最优FGD指标,实时运行帧率达76 FPS。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01306 2026-08-04 cs.CV 新提交

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

SPAE:用于预训练视觉隐层的频谱引导自编码器

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

AI总结 针对DiT生成隐层与编码器隐层的频谱不匹配问题,提出SPAE框架,通过紧凑瓶颈结构与通道级掩码策略实现隐层适配,在视觉理解、生成质量与重建保真度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00423 2026-08-04 cs.AI 新提交

Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces

压缩前诊断:面向大语言模型服务轨迹的预测独立瓶颈见证优化

Liming Liu, Chao Hu, Mingfei Lu, Cong Tan, Yiwei Ge, Chijin Zhou, Yongjun Xie, Runzhe Wang, Xiaohai Shi, Heyuan Shi

机构 * Central South University(中南大学) University of Technology Sydney(悉尼科技大学) Chongqing Normal University(重庆师范大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

AI总结 针对LLM服务轨迹重放成本高及现有方法的局限,提出BPW框架,通过三阶段流程构建紧凑可靠的重放套件,在三个数据集上优于16种策略,获两项指标提升

详情

展开后加载摘要…

URL PDF HTML 收藏