arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-28 至 2026-04-28 共收录 13
2604.24351 2026-04-28 cs.LG cs.AI cs.CV cs.SE

Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

扩散模板:一种统一的插件框架,用于可控扩散

Zhongjie Duan, Hong Zhang, Yingda Chen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出Diffusion Templates框架,通过解耦基础模型推理与可控能力注入,统一了扩散模型的可控能力,支持多种任务和不同backbone的兼容性,提升了模块化和可扩展性。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10551 2026-04-28 cs.GT cs.AI cs.LG

LLM-Auction: Generative Auction towards LLM-Native Advertising

LLM-Auction: 面向LLM原生广告的生成拍卖

Chujie Zhao, Qun Hu, Shiping Song, Dagui Chen, Han Zhu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03563 2026-04-28 cs.CL cs.IR

Data-CUBE: Data Curriculum for Instruction-based Sentence Representation Learning

数据课程:基于指令的学习的句子表示学习

Yingqian Min, Kun Zhou, Dawei Gao, Wayne Xin Zhao, He Hu, Yaliang Li

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学歌华人工智能学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Data-CUBE数据课程方法,通过优化任务顺序和实例难度分配,减少多任务学习中的干扰,提升句子表示学习性能。

Comments 14 pages, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24086 2026-04-28 cs.RO cs.AI

AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation

AsyncShield: 一种异步云边协同的边缘适配器用于异步云边VLA导航

Kai Yang, Zedong Chu, Yingnan Guo, Zhengbo Wang, Shichao Xie, Yanfen Shen, Xiaolong Wu, Xing Li, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团地图部门) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出AsyncShield,通过确定性物理白盒空间映射替代传统黑盒时间序列预测,解决云边异步导航中时空对齐问题,提升导航鲁棒性和安全性。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24001 2026-04-28 cs.AI

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准

Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(沪幻实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29957 2026-04-28 cs.SE cs.LG

Think Anywhere in Code Generation

在代码生成中任意思考

Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu, Binhua Li, Wenpin Jiao, Zhi Jin, Yongbin Li, Yihong Dong

机构 * School of Computer Science, Peking University(1 计算机科学系,北京大学) Tongyi Lab, Alibaba Group(2 龙洋实验室,阿里巴巴集团)

AI总结 本文提出Think-Anywhere机制,使LLM在代码生成过程中可按需调用推理,通过冷启动训练和基于结果的强化学习奖励,实现适应性推理,提升代码生成性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22865 2026-04-28 cs.CV

MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction

MeshLAM:基于前馈的单次可动画纹理网格人像重建

Yisheng He, Steven Hoi

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 MeshLAM通过单次前馈过程从单张图像生成高保真、可动画的3D人脸网格人像,采用双形状和纹理映射架构及改进的纹理指导机制,提升重建质量与动画能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03109 2026-04-28 cs.SD cs.MM eess.AS

pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues

pTSE-T:基于非对齐文本提示的呈现目标说话人提取

Ziyang Jiang, Jiahe Lei, Xueyan Chen, Yifan Zhang, Zexu Pan, Wei Xue, Xinyuan Qian

机构 * University of Science and Technology Beijing (USTB), China(科学技术大学(USTB)) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡) Hong Kong University of Science and Technology (HKUST), China(香港科技大学(HKUST))

AI总结 本文提出pTSE-T方法,利用非对齐文本内容中的语义提示提取目标说话人语音,通过融合音频特征与内容语义生成时间-频率掩码,提升噪声抑制效果,实验结果显示在SI-SDRi、SDRi、PESQi和STOIi指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏