Multi-Block Diffusion Language Models
多块扩散语言模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xi’an Jiao Tong University(西安交通大学) ; Huawei(华为)
AI总结 提出多块教师强制(MultiTF)训练策略,将单块扩散语言模型扩展为多块扩散(MultiBD),通过块缓冲机制实现并行解码,提升令牌吞吐量和准确率。
大厂专区
多块扩散语言模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xi’an Jiao Tong University(西安交通大学) ; Huawei(华为)
AI总结 提出多块教师强制(MultiTF)训练策略,将单块扩散语言模型扩展为多块扩散(MultiBD),通过块缓冲机制实现并行解码,提升令牌吞吐量和准确率。
InstanceControl: 无需实例标注的可控复杂图像生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)
AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026
面向动态环境的通用机器人操作
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Technologies Co. Ltd(华为技术有限公司)
AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。
Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/
跨分辨率分布匹配的扩散蒸馏
机构 * Huawei(华为) ; Nanjing University of Science and Technology(南京理工大学) ; HiThink Research(海康研究院)
AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。
LLM赋能的智能MAC协议:一种动态Stackelberg博弈方法
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) ; Huawei Technologies Company Ltd.(华为技术有限公司) ; Zhejiang Lab(之江实验室) ; Zhejiang University(浙江大学) ; Macau University of Science and Technology(澳门科技大学)
AI总结 提出一种博弈论LLM赋能的多智能体深度强化学习框架,将上行传输建模为动态多追随者Stackelberg博弈,通过PPO协调LLM驱动代理合成自适应语义MAC协议,实现无需重训的泛化,吞吐量提升77.6%,公平性提升65.2%。
Comments This work has been submitted to IEEE for possible publication