arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-15 至 2026-05-15 共收录 13
2605.15055 2026-05-15 cs.LG cs.CV

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

DiffusionOPD:扩散模型中在线策略蒸馏的统一视角

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

机构 * Fudan University(复旦大学) Wan Team, Alibaba Group(阿里集团万团队)

AI总结 本文提出DiffusionOPD,通过在线策略蒸馏统一多任务训练,解决多任务优化中的交叉干扰和不平衡问题,理论推导出连续状态马尔可夫过程的KL目标,实验显示其在训练效率和性能上优于多奖励RL和级联RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13338 2026-05-15 cs.CR cs.AI

Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击

Shuqiang Wang, Wei Cao, Jiaqi Weng, Jialing Tao, Licheng Pan, Hui Xue, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出一种基于分层遗传算法的黑盒攻击方法,通过系统扰动输入问题的逻辑结构,诱导大语言模型产生过度思考,从而引发资源耗尽攻击。

Comments Accepted at ICML 2026. Code available at: https://github.com/EndlessCao/Overthink-HGA

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14754 2026-05-15 cs.AI

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

XDomainBench:诊断高维科学知识组合中的推理崩溃

Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim

机构 * Alibaba Group, China(阿里巴巴集团,中国)

AI总结 XDomainBench通过系统压力测试科学推理,揭示LLM在跨学科知识组合中的推理崩溃问题,发现领域组合导致直接难度增加和轨迹模式引发的误差累积是根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14569 2026-05-15 cs.CV

Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

连接大脑与语义:一种用于语义增强的fMRI到视频重建的分层框架

Yujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang, Shiwei Zhang, Biao Gong, Shuai Tan, Hangjie Yuan, Hongming Shan

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

AI总结 本文提出CineNeuron框架,通过分层结构解决fMRI信号与视频内容间的语义鸿沟问题,结合底部向上语义丰富和顶部向下记忆整合,提升视频重建效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14434 2026-05-15 cs.IR cs.AI

Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL

电商搜索中高效的生成检索:结合语义聚类ID和专家引导的强化学习

Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

AI总结 本文提出CQ-SID和EG-GRPO方法,通过语义聚类ID和强化学习提升电商搜索的生成检索效果,实现点击率和转化率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10550 2026-05-15 cs.CL

Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy

多领域多模态文档分类基准与多级分类法

Denghao Ma, Qing Liu, Zulong Chen, Chuanfei Xu, Jia Xu, Zhibo Yang, Wei Shao, Zhao Li

机构 * Beijing Information Science and Technology University(北京信息科学与技术大学) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Guangzhou University(广州大学) Zhejiang Lab(浙江实验室)

AI总结 本文提出首个多级多领域多模态文档分类基准MMMBench,包含五级多级分类体系和12个商业领域的5990个真实多模态文档,通过系统实验识别出四个核心挑战并提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09603 2026-05-15 cs.DC cs.AI cs.LG

ECHO: Elastic Speculative Decoding with Sparse Gating for High-Concurrency Scenarios

ECHO:基于稀疏门控的弹性推测解码用于高并发场景

Xinyi Hu, Yuhao Shen, Baolin Zhang, Hengxin Zhang, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingcheng Wan

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务部)

AI总结 ECHO通过将推测执行转化为预算调度问题,结合稀疏置信门控优化并发场景下的解码效率,在不同模型规模下均优于现有方法,实现高达5.35倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21250 2026-05-15 cs.AI

Graph of States: Solving Abductive Tasks with Large Language Models

状态图:利用大语言模型解决假设推理任务

Yu Luo, Rongchen Gao, Lu Teng, Xidao Wen, Jiamin Jiang, Qingliang Zhang, Yongqian Sun, Shenglin Zhang, Jiasong Feng, Tong Liu, Wenjie Zhang, Dan Pei

机构 * Nankai University(南开大学) Wenzhou Medical University(温州医科大学) Alibaba Cloud(阿里云) Tsinghua University(清华大学)

AI总结 本文提出状态图框架,通过结构化信念状态和因果图实现逻辑依赖编码,解决假设推理中的证据伪造等问题,实验证明其在复杂任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23798 2026-05-15 cs.LG cs.AI cs.CR cs.DC

MPU: Towards Secure and Privacy-Preserving Knowledge Unlearning for Large Language Models

MPU:面向大语言模型安全和隐私保护的知识遗忘

Tiantong Wang, Xinyu Yan, Tiantong Wu, Yurong Hao, Pengjun Xie, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里云-南洋理工大学全球可持续发展科技实验室) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 MPU提出一种隐私保护的多扰动副本遗忘框架,通过预处理和后处理模块实现安全的知识遗忘,实验表明其性能与无噪声基线相当甚至更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏