DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
DreamX-Creator:实现2K分辨率原生音视频生成的民主化
机构 * Alibaba Group(阿里巴巴集团)
AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。
大厂专区
DreamX-Creator:实现2K分辨率原生音视频生成的民主化
机构 * Alibaba Group(阿里巴巴集团)
AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。
SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。
电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) ; Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)
AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。
PAC:面向大语言模型多任务强化学习的进度增强优势课程
机构 * Alibaba Group(阿里巴巴集团)
AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。
Comments Accepted at EMNLP 2026 (Main)
PRIME:通过插件式残差输入条件混合专家缓解共享CTR顶层网络中的子组优化竞争
机构 * Ant Group(蚂蚁集团) ; Henan Polytechnic University(河南理工大学) ; Alibaba Inc.(阿里巴巴集团)
AI总结 PRIME以Dense为锚点的残差输入条件混合专家,解决共享CTR顶层网络的子组优化竞争,在Avazu、Criteo等数据集上提升AUC、降低LogLoss且优于APG,参数更少、延迟更低。
Comments 14 pages, 4 figures
将基础模型搭建为物理世界智能体以推动长时程导航前沿
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Inc(阿里巴巴集团) ; Zhongguancun Academy(中关村学院) ; Adelaide University(阿德莱德大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。
Comments 22 pages, 6 figures
基于答案探测引导的大语言模型多样化解决方案探索搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。
Comments Accepted to the EMNLP 2026 Main
Qwen3.8-Next架构设计:评估、效率与训练稳定性
机构 * Qwen Team(千问团队)
AI总结 该研究设计了Qwen3.8-Flash-Next稀疏混合专家模型,通过混合注意力、门控残差等结构及Muon优化器,在参数、计算量大幅降低的同时,实现了更高效、更稳定且性能接近前代模型的效果。
CateKV:面向长上下文大语言模型推理加速的顺序一致性研究
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学)
AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。
Comments Published at ICML 2025
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27569-27585, 2025
DICS:探索数据内在一致性用于视觉指令选择
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Alibaba Token Hub, Alibaba Group(阿里巴巴集团)
AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能
Comments Accepted by EMNLP2026
超越全局真实感:基于维度化服装保真度评估的虚拟试穿评估与优化
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 针对现有虚拟试穿评估指标难以捕捉服装多维保真度的问题,提出DAT框架,分解服装一致性为7个维度并训练专用评估模型,其性能优于多款专有模型,还可用于优化Qwen-Image-Edit的虚拟试穿生成。
Comments 12 pages, 6 figures
基于诊断引导候选回收的视频扩散模型测试时缩放
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。
Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)
为大型语言模型网页智能体学习简单的测试时环境
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) ; School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。
Comments Code and data are released at https://github.com/THUNLP-MT/TTED
RAGDiffusion++:面向服装生成的从宏观检索到微观保真度对齐
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对服装生成的高频轨迹坍塌问题,提出RAGDiffusion++模型,通过AR-GRPO策略结合STGarment-Plus数据集、FLUX架构与Garment-RM奖励模型,实现服装图像的宏观结构准确与微观纹理保真。
基于云边端深度学习的逐向导航技术革新
机构 * AMap, Alibaba Group(高德地图,阿里巴巴集团)
AI总结 该研究针对传统逐向导航音频指令的不足,提出结合Transformer与混合专家(MoE)的云边协同深度学习框架,大幅降低车辆偏航率,是深度学习在驾驶音频导航的首次大规模应用,推动了智能交通技术发展。
Comments This paper has accepted by IEEE Transactions on Intelligent Transportation Systems
Journal ref Volume: 27, Issue: 7, July 2026, Page(s): 7882 - 7892
大型语言模型能否识别转化归因中有意义的接触点?
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。
Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026
通过广义风格感知全双工框架实现主动口语话轮
机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)
AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。
Comments Accepted by ACM MM 2026