arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-11 至 2026-05-11 共收录 8
2605.07982 2026-05-11 cs.CL cs.CR

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard:面向LLM安全的模式条件分类

Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

机构 * Qwen Team(通义实验室)

AI总结 GLiGuard通过模式条件编码实现高效多维度内容安全评估,在参数更小的情况下达到与大模型守卫模型相当的准确率,同时提升吞吐量和降低延迟。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07915 2026-05-11 cs.CV

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07510 2026-05-11 cs.CV cs.CL cs.IR

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

InterLV-Search:交错多模态代理搜索基准测试

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Damo Academy, Alibaba Group(阿里达摩院)

AI总结 本文提出InterLV-Search基准测试,用于评估交错语言-视觉代理搜索,包含多层级任务,涵盖主动视觉证据搜索、受控离线交错多模态搜索和开放网页交错多模态搜索,揭示当前系统在视觉证据获取、搜索控制及多模态证据整合方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07503 2026-05-11 cs.CV

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07141 2026-05-11 cs.CV cs.AI

Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

Qwen3-VL-Seg: 解锁基于视觉-语言接地的开放世界指代分割

Yuan Yao, Qiushi Yang, Humen Zhong, Jiangning Wei, Yifang Men, Shuai Bai, Miaomiao Cui, Zhibo Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 Qwen3-VL-Seg通过视觉-语言接地框架实现开放世界指代分割,采用轻量级的框引导掩码解码器,结合多尺度空间特征注入和迭代掩码感知查询优化,实现参数高效且精确的像素级分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05949 2026-05-11 cs.AI cs.SE

MAS-Algorithm: A Workflow for Solving Algorithmic Programming Problems with a Multi-Agent System

MAS-Algorithm: 一个基于多智能体系统的算法问题求解工作流

Yuliang Xu, Xiang Xu, Yao Wan, Hu Wei, Tong Jia

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出MAS-Algorithm,通过多智能体工作流提升算法问题求解能力,实验显示在多个模型上均取得显著提升,包括接受率提升6.48%和LiveCodeBench-Pro上的4.72%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08077 2026-05-11 cs.CV

AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

AdaSpark: 为高效长视频理解设计的自适应稀疏性

Handong Li, Zikang Liu, Longteng Guo, Tongtian Yue, Yepeng Tang, Xinxin Zhu, Chuanyang Zheng, Ziming Wang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 AdaSpark通过自适应稀疏框架减少计算负载达57% FLOPs,保持性能并保留细粒度长程依赖,适用于小时级视频基准测试。

Comments 8 pages, CVPR2026 Accept (Highlight)

Journal ref Proceedings of the IEEE/CVF Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏