arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-09-01 至 2026-09-01 共收录 26
2608.31106 2026-09-01 cs.CV cs.SD 新提交

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30785 2026-09-01 cs.AI 新提交

SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩

Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30730 2026-09-01 cs.LG cs.CL 新提交

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30449 2026-09-01 cs.LG cs.IR 新提交

PRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert

PRIME:通过插件式残差输入条件混合专家缓解共享CTR顶层网络中的子组优化竞争

Heng Yao, Siyun Hou, Tianying Liu, Yulou Shu, Yong He, Chuan Yuan, Kaibin Qiu, Guowei Chen, Jiayu Zhao, Chao Yu, Ke Ding

机构 * Ant Group(蚂蚁集团) Henan Polytechnic University(河南理工大学) Alibaba Inc.(阿里巴巴集团)

AI总结 PRIME以Dense为锚点的残差输入条件混合专家,解决共享CTR顶层网络的子组优化竞争,在Avazu、Criteo等数据集上提升AUC、降低LogLoss且优于APG,参数更少、延迟更低。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30345 2026-09-01 cs.AI 新提交

Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

基于答案探测引导的大语言模型多样化解决方案探索搜索

Yi Fang, Que Shen, Chengpeng Li, Boyi Deng, Wei Shi, Wenjie Wang, Fuli Feng, Fengli Xu, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。

Comments Accepted to the EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30320 2026-09-01 cs.CL 新提交

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen3.8-Next架构设计:评估、效率与训练稳定性

Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu

机构 * Qwen Team(千问团队)

AI总结 该研究设计了Qwen3.8-Flash-Next稀疏混合专家模型,通过混合注意力、门控残差等结构及Muon优化器,在参数、计算量大幅降低的同时,实现了更高效、更稳定且性能接近前代模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30295 2026-09-01 cs.LG cs.AI 新提交

CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

CateKV:面向长上下文大语言模型推理加速的顺序一致性研究

Haoyun Jiang, Haolin Li, Jianwei Zhang, Fei Huang, Qiang Hu, Minmin Sun, Shuai Xiao, Yong Li, Junyang Lin, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。

Comments Published at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27569-27585, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29804 2026-09-01 cs.CV 新提交

Beyond Global Realism: Virtual Try-On Evaluation and Optimization with Dimension-wise Garment Fidelity Assessment

超越全局真实感:基于维度化服装保真度评估的虚拟试穿评估与优化

Kaidong Zhang, Yukang Ding, Xiaoyu Liu, Ying Chen

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对现有虚拟试穿评估指标难以捕捉服装多维保真度的问题,提出DAT框架,分解服装一致性为7个维度并训练专用评估模型,其性能优于多款专有模型,还可用于优化Qwen-Image-Edit的虚拟试穿生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29305 2026-09-01 cs.CL cs.AI cs.LG 新提交

Learning Simple Test-Time Environments for LLM Web Agents

为大型语言模型网页智能体学习简单的测试时环境

Junxuan Li, Zijun Liu, Ziyi Huang, Peng Li, Yuzhou Liu, Ming Yan, Yang Liu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。

Comments Code and data are released at https://github.com/THUNLP-MT/TTED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29280 2026-09-01 cs.CV cs.AI 新提交

RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

RAGDiffusion++:面向服装生成的从宏观检索到微观保真度对齐

Yuhan Li, Xianfeng Tan, Fangao Zeng, Wenxiang Shang, Pipei Huang, Hao Zhou, Zhiyu Jin, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对服装生成的高频轨迹坍塌问题,提出RAGDiffusion++模型,通过AR-GRPO策略结合STGarment-Plus数据集、FLUX架构与Garment-RM奖励模型,实现服装图像的宏观结构准确与微观纹理保真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29073 2026-09-01 cs.AI 新提交

Revolutionizing Turn-by-Turn Navigation with Cloud-Edge Deep Learning

基于云边端深度学习的逐向导航技术革新

Yiming Yang, Hao Fu, Fanxiang Zeng, Xikai Yang, Yue Liu, Ning Guo

机构 * AMap, Alibaba Group(高德地图,阿里巴巴集团)

AI总结 该研究针对传统逐向导航音频指令的不足,提出结合Transformer与混合专家(MoE)的云边协同深度学习框架,大幅降低车辆偏航率,是深度学习在驾驶音频导航的首次大规模应用,推动了智能交通技术发展。

Comments This paper has accepted by IEEE Transactions on Intelligent Transportation Systems

Journal ref Volume: 27, Issue: 7, July 2026, Page(s): 7882 - 7892

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28649 2026-09-01 cs.CL cs.AI cs.IR 新提交

Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?

大型语言模型能否识别转化归因中有意义的接触点?

Jinqi Wu, Sishuo Chen, Zhangming Chan, Yong Bai, Chao Yi, Han Zhu, Shuodian Yu, Lei Zhang, Sheng Chen, Chenghuan Hou, Jian Xu, Chaoyou Fu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。

Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28630 2026-09-01 cs.CL cs.AI cs.SD 新提交

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

通过广义风格感知全双工框架实现主动口语话轮

Tianrui Pan, Qinglin Zhang, Chong Deng, Luyao Cheng, Qian Chen, Wen Wang, Jie Tang, Gangshan Wu, Jie Liu

机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)

AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-09-01 cs.CV 版本更新

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-09-01 cs.CV 版本更新

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24109 2026-09-01 cs.GR cs.CV 版本更新

ExMesh++: From Multi-View Images to Relightable UV-PBR Mesh Assets via Topology-Adaptive Reconstruction and Decomposition

ExMesh++:通过拓扑自适应重建与分解从多视图图像生成可重光照UV-PBR网格资产

Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

AI总结 ExMesh++是一种分阶段框架,通过拓扑自适应重建与分解,从多视图图像生成可重光照UV-PBR网格资产,在几何精度、重光照性能上表现优异,导出资产可直接用于标准DCC工作流。

Comments Project page: https://fan-treasure.github.io/ExMeshpp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22704 2026-09-01 cs.CL cs.SD 版本更新

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

WnW:用于长文本语音大语言模型的消长型键值缓存

Yiming Yao, Chenyang Lyu, Xuanfan Ni, Longyue Wang, Weihua Luo, Yazheng Yang, Jinsong Su

机构 * Alibaba Group(阿里巴巴集团) School of Informatics Xiamen University(厦门大学信息学院)

AI总结 针对长音频语音大语言模型的KV缓存内存开销问题,提出WnW消长型KV缓存方法,通过分类KV头实现高准确率与低GPU内存占用,且开销小、可迁移。

Comments Accepted at EMNLP 2026 Main Conference. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-09-01 cs.CL 版本更新

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10678 2026-09-01 cs.CL cs.AI 版本更新

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

通过采样BPE词元统计审计中文网页规模语料库

Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

机构 * Tsinghua University(清华大学) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

AI总结 针对中文网页污染审计的三项挑战,提出Sampled-BPE轻量级审计流程,在大幅降低运行时间和内存消耗的同时保持精度,审计多类语料库并发布分层中文网页词元数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-09-01 cs.CL 版本更新

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17546 2026-09-01 cs.CV 版本更新

ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling

ProGVC:基于渐进式的生成视频压缩 via 自动回归上下文建模

Daowen Li, Ruixiao Dong, Kai Li, Ying Chen, Ding Ding, Li Li

机构 * Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

AI总结 ProGVC提出一种统一渐进传输、高效熵编码和细节合成的视频压缩框架,通过多尺度自回归上下文模型实现低比特率下的高质量视频压缩与可扩展性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09347 2026-09-01 cs.CL 版本更新

LLP: LLM-Based Product Pricing in E-commerce

LLP:基于大语言模型的电商产品定价方案

Hairu Wang, Sheng You, Qiheng Zhang, Xike Xie, Shuguang Han, Yuchen Wu, Fei Huang, Jufeng Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xianyu of Alibaba(阿里巴巴闲鱼)

AI总结 针对C2C平台二手卖家定价难题,研究人员提出首个基于LLM的二手产品定价框架LLP,经两阶段优化与置信过滤后,在闲鱼部署的性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏