arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-14 至 2026-04-14 共收录 18
2604.11757 2026-04-14 cs.RO cs.AI cs.CV

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11637 2026-04-14 cs.CV

STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding

STS-Mixer:用于4D点云视频理解的时空频混合器

Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。

Comments Accepted by CVPR 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11522 2026-04-14 cs.CL

Triviality Corrected Endogenous Reward

修正的内生奖励

Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Lanzhou University(兰州大学)

AI总结 本文提出TCER,通过相对信息增益和概率修正机制解决开放性写作中内生奖励的平凡偏差问题,提升生成多样性与内容质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11094 2026-04-14 cs.SE cs.AI

E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning

E2E-REME:通过经验-模拟强化微服务自动修复

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Minghua He, Chiming Duan, Zhaoyang Liu, Bolin Ding, Ying Li

机构 * Peking University(北京大学) Key Laboratory of Data Intelligence and Security(数据智能与安全重点实验室) Alibaba Group(阿里巴巴集团) Key Laboratory of Data Space Technology and System(数据空间技术与系统重点实验室)

AI总结 本文提出E2E-MR任务,通过经验-模拟强化训练构建E2E-REME模型,实现从诊断报告自动生成可执行playbook,提升微服务系统修复的准确性和效率。

Comments accepted by FSE'26. arXiv admin note: text overlap with arXiv:2511.01166

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06939 2026-04-14 cs.CV

Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis

基于语义的强制:在自回归视频合成中连接时间无关语义与近端动态

Jintao Chen, Chengyu Bai, Junjun Hu, Xinda Xue, Mu Xu

机构 * Peking University(北京大学) Alibaba(阿里巴巴)

AI总结 本文提出Grounded Forcing框架,通过三种机制解决自回归视频合成中的语义遗忘、视觉漂移和可控性丢失问题,提升长程一致性和视觉稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11040 2026-04-14 cs.AI

Intelligent Approval of Access Control Flow in Office Automation Systems via Relational Modeling

通过关系建模实现办公自动化系统中的智能审批流程

Dugang Liu, Zulong Chen, Chuanfei Xu, Jiaxuan He, Yunlu Ma, Jia Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间先进技术研究院) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出基于关系建模的智能审批框架RMIA,通过二元和三元关系模块融合信息,提升办公自动化系统中审批流程的智能化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11037 2026-04-14 cs.LG cs.AI

RTMC: Step-Level Credit Assignment via Rollout Trees

RTMC:通过展开树进行步骤级信用分配

Tao Wang, Suhang Zheng, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 RTMC通过展开树方法实现步骤级信用分配,无需学习型批评者,提升SWE-bench Verified任务的pass@1性能3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02578 2026-04-14 cs.CL cs.AI cs.HC cs.LG

How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities

大型语言模型有多可控?跨行为细粒度的统一评估

Ziwen Xu, Kewei Xu, Haoming Xu, Haiwen Hong, Longtao Huang, Hui Xue, Ningyu Zhang, Yongliang Shen, Guozhou Zheng, Huajun Chen, Shumin Deng

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出SteerEval基准,从语言特征、情感和个性三个领域评估LLM可控性,揭示细粒度控制效果下降问题,提供安全可控的LLM行为框架。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05467 2026-04-14 cs.CV cs.CL cs.RO

MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation

MerNav:一种高度可泛化的记忆-执行-审查框架用于零样本物体目标导航

Dekang Qi, Shuang Zeng, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Mu Xu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出MerNav框架,通过记忆、执行和审查模块提升视觉语言导航任务中的成功率和泛化能力,在多个数据集上均取得显著提升。

Comments 9 pages, 2 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02343 2026-04-14 cs.CL cs.AI cs.CV cs.IR cs.LG

Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics

为何转向有效:语言模型参数动态的统一视角

Ziwen Xu, Chenyan Wu, Hengyu Sun, Haiwen Hong, Mengru Wang, Yunzhi Yao, Longtao Huang, Hui Xue, Shumin Deng, Zhixuan Chu, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出统一视角分析语言模型控制方法,通过偏好-效用分析揭示控制效果的权衡关系,并引入SPLIT方法提升偏好与效用。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18957 2026-04-14 cs.CV

Eevee: Towards Close-up High-resolution Video-based Virtual Try-on

Eevee:迈向基于视频的高分辨率虚拟试衣

Jianhao Zeng, Yancheng Bai, Ruidong Chen, Xuanpu Zhang, Lei Sun, Dongyang Jin, Ryan Xu, Nannan Zhang, Dan Song, Xiangxiang Chu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Tianjin University(天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出高分辨率视频虚拟试衣数据集,解决现有方法在真实纹理细节捕捉和近距离视频生成上的不足,引入VGID指标评估服装一致性,提升虚拟试衣的真实感和细节保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10167 2026-04-14 cs.CV cs.CL cs.IR

Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval

视觉后期分块:一种上下文分块用于高效视觉文档检索的实证研究

Yibo Yan, Mingdong Ou, Yi Cao, Jiahao Huo, Xin Zou, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出ColChunk框架,通过多模态后期分块构建高效上下文化多向量,减少存储需求并提升检索性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10150 2026-04-14 cs.AI cs.CL

Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration

从空缺中学习:通过内容无关概率校准去偏列表重排序

Hang Lv, Hongchao Gu, Ruiqing Yang, Liangyue Li, Zulong Chen, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出CapCal框架,通过内容无关的概率校准方法,解决列表重排序中的位置偏差问题,提升轻量模型性能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10044 2026-04-14 cs.AI

LoopGuard: Breaking Self-Reinforcing Attention Loops via Dynamic KV Cache Intervention

LoopGuard: 通过动态KV缓存干预打破自增强注意力循环

Dongjie Xu, Hao Wu, Weijie Shi, Yue Cui, Yuanjun Liu, Jiawei Li, Haolun Ma, An Liu, Jia Zhu, Jiajie Xu

机构 * Soochow University(苏州大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团) Zhejiang Normal University(浙江师范大学)

AI总结 本文通过系统实验发现长上下文生成中解码会陷入持续重复循环,提出LoopGuard通过动态KV缓存干预检测并打断循环,有效减少循环发生率并恢复输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09711 2026-04-14 cs.CV cs.CL

Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality

在多模态大语言模型中实现模态专精以在缺失模态下实现鲁棒的虚假新闻检测

Kai Qian, Weijie Shi, Jiaqi Wang, Mengze Li, Hao Chen, Yue Cui, Hanghui Guo, Ziyi Liu, Jia Zhu, Jiajie Xu

机构 * Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学) Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) The Hong Kong University of Science and Technology(香港科技大学) FiT, Tencent(腾讯FiT) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Education, Zhejiang Normal University(浙江师范大学教育学院)

AI总结 本文提出在多模态大语言模型中通过头级专精机制提升鲁棒性,以应对缺失模态下的虚假新闻检测,通过保留模态专精能力与利用稀疏单模注释提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15498 2026-04-14 cs.LG

MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification

MARS:通过边距感知验证释放推测解码的潜力

Jingwei Song, Xinyu Wang, Hanbin Wang, Xiaoxuan Lei, Bill Shi, Shixin Han, Eric Yang, Xiao-Wen Chang, Lynn Ai

机构 * The University of Hong Kong(香港大学) McGill University(麦吉尔大学) Peking University(北京大学) gradient Alibaba Cloud(阿里云) Mila SimpleWay

AI总结 MARS通过边距感知验证策略提升LLM推理效率,无需额外训练,适应目标模型的决策稳定性,减少验证过程中的回滚成本,实验证明在不同模型规模上显著提升推理速度同时保持生成质量。

Comments 12 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏