arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-09-01 至 2026-09-01 共收录 17
2608.31106 2026-09-01 cs.CV cs.SD 新提交

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30785 2026-09-01 cs.AI 新提交

SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩

Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30730 2026-09-01 cs.LG cs.CL 新提交

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30449 2026-09-01 cs.LG cs.IR 新提交

PRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert

PRIME:通过插件式残差输入条件混合专家缓解共享CTR顶层网络中的子组优化竞争

Heng Yao, Siyun Hou, Tianying Liu, Yulou Shu, Yong He, Chuan Yuan, Kaibin Qiu, Guowei Chen, Jiayu Zhao, Chao Yu, Ke Ding

机构 * Ant Group(蚂蚁集团) Henan Polytechnic University(河南理工大学) Alibaba Inc.(阿里巴巴集团)

AI总结 PRIME以Dense为锚点的残差输入条件混合专家,解决共享CTR顶层网络的子组优化竞争,在Avazu、Criteo等数据集上提升AUC、降低LogLoss且优于APG,参数更少、延迟更低。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30345 2026-09-01 cs.AI 新提交

Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

基于答案探测引导的大语言模型多样化解决方案探索搜索

Yi Fang, Que Shen, Chengpeng Li, Boyi Deng, Wei Shi, Wenjie Wang, Fuli Feng, Fengli Xu, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。

Comments Accepted to the EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30320 2026-09-01 cs.CL 新提交

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen3.8-Next架构设计:评估、效率与训练稳定性

Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu

机构 * Qwen Team(千问团队)

AI总结 该研究设计了Qwen3.8-Flash-Next稀疏混合专家模型,通过混合注意力、门控残差等结构及Muon优化器,在参数、计算量大幅降低的同时,实现了更高效、更稳定且性能接近前代模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30295 2026-09-01 cs.LG cs.AI 新提交

CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

CateKV:面向长上下文大语言模型推理加速的顺序一致性研究

Haoyun Jiang, Haolin Li, Jianwei Zhang, Fei Huang, Qiang Hu, Minmin Sun, Shuai Xiao, Yong Li, Junyang Lin, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。

Comments Published at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27569-27585, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29804 2026-09-01 cs.CV 新提交

Beyond Global Realism: Virtual Try-On Evaluation and Optimization with Dimension-wise Garment Fidelity Assessment

超越全局真实感:基于维度化服装保真度评估的虚拟试穿评估与优化

Kaidong Zhang, Yukang Ding, Xiaoyu Liu, Ying Chen

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对现有虚拟试穿评估指标难以捕捉服装多维保真度的问题,提出DAT框架,分解服装一致性为7个维度并训练专用评估模型,其性能优于多款专有模型,还可用于优化Qwen-Image-Edit的虚拟试穿生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29305 2026-09-01 cs.CL cs.AI cs.LG 新提交

Learning Simple Test-Time Environments for LLM Web Agents

为大型语言模型网页智能体学习简单的测试时环境

Junxuan Li, Zijun Liu, Ziyi Huang, Peng Li, Yuzhou Liu, Ming Yan, Yang Liu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。

Comments Code and data are released at https://github.com/THUNLP-MT/TTED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29280 2026-09-01 cs.CV cs.AI 新提交

RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

RAGDiffusion++:面向服装生成的从宏观检索到微观保真度对齐

Yuhan Li, Xianfeng Tan, Fangao Zeng, Wenxiang Shang, Pipei Huang, Hao Zhou, Zhiyu Jin, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对服装生成的高频轨迹坍塌问题,提出RAGDiffusion++模型,通过AR-GRPO策略结合STGarment-Plus数据集、FLUX架构与Garment-RM奖励模型,实现服装图像的宏观结构准确与微观纹理保真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29073 2026-09-01 cs.AI 新提交

Revolutionizing Turn-by-Turn Navigation with Cloud-Edge Deep Learning

基于云边端深度学习的逐向导航技术革新

Yiming Yang, Hao Fu, Fanxiang Zeng, Xikai Yang, Yue Liu, Ning Guo

机构 * AMap, Alibaba Group(高德地图,阿里巴巴集团)

AI总结 该研究针对传统逐向导航音频指令的不足,提出结合Transformer与混合专家(MoE)的云边协同深度学习框架,大幅降低车辆偏航率,是深度学习在驾驶音频导航的首次大规模应用,推动了智能交通技术发展。

Comments This paper has accepted by IEEE Transactions on Intelligent Transportation Systems

Journal ref Volume: 27, Issue: 7, July 2026, Page(s): 7882 - 7892

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28649 2026-09-01 cs.CL cs.AI cs.IR 新提交

Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?

大型语言模型能否识别转化归因中有意义的接触点?

Jinqi Wu, Sishuo Chen, Zhangming Chan, Yong Bai, Chao Yi, Han Zhu, Shuodian Yu, Lei Zhang, Sheng Chen, Chenghuan Hou, Jian Xu, Chaoyou Fu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。

Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28630 2026-09-01 cs.CL cs.AI cs.SD 新提交

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

通过广义风格感知全双工框架实现主动口语话轮

Tianrui Pan, Qinglin Zhang, Chong Deng, Luyao Cheng, Qian Chen, Wen Wang, Jie Tang, Gangshan Wu, Jie Liu

机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)

AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏