DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
DreamX-Creator:实现2K分辨率原生音视频生成的民主化
机构 * Alibaba Group(阿里巴巴集团)
AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。
大厂专区
DreamX-Creator:实现2K分辨率原生音视频生成的民主化
机构 * Alibaba Group(阿里巴巴集团)
AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。
SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。
电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) ; Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)
AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。
PAC:面向大语言模型多任务强化学习的进度增强优势课程
机构 * Alibaba Group(阿里巴巴集团)
AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。
Comments Accepted at EMNLP 2026 (Main)
PRIME:通过插件式残差输入条件混合专家缓解共享CTR顶层网络中的子组优化竞争
机构 * Ant Group(蚂蚁集团) ; Henan Polytechnic University(河南理工大学) ; Alibaba Inc.(阿里巴巴集团)
AI总结 PRIME以Dense为锚点的残差输入条件混合专家,解决共享CTR顶层网络的子组优化竞争,在Avazu、Criteo等数据集上提升AUC、降低LogLoss且优于APG,参数更少、延迟更低。
Comments 14 pages, 4 figures
将基础模型搭建为物理世界智能体以推动长时程导航前沿
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Inc(阿里巴巴集团) ; Zhongguancun Academy(中关村学院) ; Adelaide University(阿德莱德大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。
Comments 22 pages, 6 figures
基于答案探测引导的大语言模型多样化解决方案探索搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。
Comments Accepted to the EMNLP 2026 Main
Qwen3.8-Next架构设计:评估、效率与训练稳定性
机构 * Qwen Team(千问团队)
AI总结 该研究设计了Qwen3.8-Flash-Next稀疏混合专家模型,通过混合注意力、门控残差等结构及Muon优化器,在参数、计算量大幅降低的同时,实现了更高效、更稳定且性能接近前代模型的效果。
CateKV:面向长上下文大语言模型推理加速的顺序一致性研究
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学)
AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。
Comments Published at ICML 2025
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27569-27585, 2025
DICS:探索数据内在一致性用于视觉指令选择
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Alibaba Token Hub, Alibaba Group(阿里巴巴集团)
AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能
Comments Accepted by EMNLP2026
超越全局真实感:基于维度化服装保真度评估的虚拟试穿评估与优化
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 针对现有虚拟试穿评估指标难以捕捉服装多维保真度的问题,提出DAT框架,分解服装一致性为7个维度并训练专用评估模型,其性能优于多款专有模型,还可用于优化Qwen-Image-Edit的虚拟试穿生成。
Comments 12 pages, 6 figures
基于诊断引导候选回收的视频扩散模型测试时缩放
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。
Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)
为大型语言模型网页智能体学习简单的测试时环境
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) ; School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。
Comments Code and data are released at https://github.com/THUNLP-MT/TTED
RAGDiffusion++:面向服装生成的从宏观检索到微观保真度对齐
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对服装生成的高频轨迹坍塌问题,提出RAGDiffusion++模型,通过AR-GRPO策略结合STGarment-Plus数据集、FLUX架构与Garment-RM奖励模型,实现服装图像的宏观结构准确与微观纹理保真。
基于云边端深度学习的逐向导航技术革新
机构 * AMap, Alibaba Group(高德地图,阿里巴巴集团)
AI总结 该研究针对传统逐向导航音频指令的不足,提出结合Transformer与混合专家(MoE)的云边协同深度学习框架,大幅降低车辆偏航率,是深度学习在驾驶音频导航的首次大规模应用,推动了智能交通技术发展。
Comments This paper has accepted by IEEE Transactions on Intelligent Transportation Systems
Journal ref Volume: 27, Issue: 7, July 2026, Page(s): 7882 - 7892
大型语言模型能否识别转化归因中有意义的接触点?
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。
Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026
通过广义风格感知全双工框架实现主动口语话轮
机构 * Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry)
AI总结 该研究构建含LPS-TC控制器、WildTurn数据集及两级评估方案的风格感知全双工框架,结合半双工/全双工模型后,可实现更自然类人的主动口语交互,时机与响应质量表现优异。
Comments Accepted by ACM MM 2026
RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Alibaba DAMO Academy(阿里巴巴达摩院)
AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。
Comments Accepted to EMNLP 2026 Main Conference
Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。
Comments 19 pages, 10 figures
ExMesh++:通过拓扑自适应重建与分解从多视图图像生成可重光照UV-PBR网格资产
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团)
AI总结 ExMesh++是一种分阶段框架,通过拓扑自适应重建与分解,从多视图图像生成可重光照UV-PBR网格资产,在几何精度、重光照性能上表现优异,导出资产可直接用于标准DCC工作流。
Comments Project page: https://fan-treasure.github.io/ExMeshpp_page/
WnW:用于长文本语音大语言模型的消长型键值缓存
机构 * Alibaba Group(阿里巴巴集团) ; School of Informatics Xiamen University(厦门大学信息学院)
AI总结 针对长音频语音大语言模型的KV缓存内存开销问题,提出WnW消长型KV缓存方法,通过分类KV头实现高准确率与低GPU内存占用,且开销小、可迁移。
Comments Accepted at EMNLP 2026 Main Conference. 9 pages, 5 figures
已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。
通过采样BPE词元统计审计中文网页规模语料库
机构 * Tsinghua University(清华大学) ; SiliconProspect AI(硅景人工智能) ; Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团)
AI总结 针对中文网页污染审计的三项挑战,提出Sampled-BPE轻量级审计流程,在大幅降低运行时间和内存消耗的同时保持精度,审计多类语料库并发布分层中文网页词元数据集。
LexRubric:面向开放式法律任务的基于评分指南的诊断基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; University of Waterloo(滑铁卢大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。
Comments Accepted to EMNLP 2026 Main Conference
ProGVC:基于渐进式的生成视频压缩 via 自动回归上下文建模
机构 * Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学)
AI总结 ProGVC提出一种统一渐进传输、高效熵编码和细节合成的视频压缩框架,通过多尺度自回归上下文模型实现低比特率下的高质量视频压缩与可扩展性。
Comments Accepted by ECCV 2026
LLP:基于大语言模型的电商产品定价方案
机构 * University of Science and Technology of China(中国科学技术大学) ; Xianyu of Alibaba(阿里巴巴闲鱼)
AI总结 针对C2C平台二手卖家定价难题,研究人员提出首个基于LLM的二手产品定价框架LLP,经两阶段优化与置信过滤后,在闲鱼部署的性能显著优于现有方法。