arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-01 至 2026-04-01 共收录 8
2603.29494 2026-04-01 cs.CV

VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

VecAttention: 向量级稀疏注意力用于加速长上下文推理

Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie

机构 * SCS, Peking University(北京大学计算机科学技术学院) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19835 2026-04-01 cs.LG

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

FIPO:通过未来KL影响的策略优化激发深度推理

Chiyu Ma, Shuo Yang, Kexin Huang, Jinda Lu, Haoming Meng, Shangshang Wang, Bolin Ding, Soroush Vosoughi, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

AI总结 FIPO通过引入折扣后的未来KL散度,改进策略更新,使模型突破传统基线的长度停滞,提升推理能力与准确率。

Comments Move related work to main paper, and add one more background information in Preliminary section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03638 2026-04-01 cs.LG cs.AI math.RT stat.ML

Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling

隐式模型的表达能力:丰富的均衡与测试时扩展

Jialin Liu, Lisang Ding, Stanley Osher, Wotao Yin

机构 * University of Central Florida(中佛罗里达大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Decision Intelligence Lab, DAMO Academy, Alibaba US(达摩院决策智能实验室,阿里巴巴美国)

AI总结 研究隐式模型通过非参数分析揭示其表达能力,证明其表达能力随测试时计算量增加而提升,验证了其在多个领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏