FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models
FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练
机构 * Huawei(华为)
AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。
大厂专区
FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练
机构 * Huawei(华为)
AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。
DrivingVoxels:用于动态驾驶场景重建的组合稀疏体素光栅化
机构 * Noah’s Ark, Huawei Paris Research Center, France(华为巴黎研究中心诺亚方舟实验室) ; EURECOM, France(法国EURECOM)
AI总结 提出DrivingVoxels框架,通过组合多个独立八叉树的稀疏体素联合光栅化,结合LiDAR引导的结构初始化,高效重建动态驾驶场景,在PandaSet上达到与3DGS相当或更优的感知与结构指标,且训练时间更短。
各有所尺:发现用于物理视频评估的每VLM分类体系
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Huawei Darwin Research Center(华为达尔文研究中心) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。
HiL-ResRL: 通过人在回路残差强化学习的模型无关微调适配器
机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司云机器人实验室) ; South China University of Technology(华南理工大学)
AI总结 提出一种模型无关的即插即用微调流程,通过残差策略和人在回路指导,在1.5小时内使机器人操作成功率超过95%。
Comments 8 pages, 9 figures
TriMotion: 模态无关的摄像机控制用于视频生成
机构 * GIST(光州科学技术院) ; Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Yonsei University(延世大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。
Comments ECCV Accepted
EmoInstruct-TTS:双路径指令引导的情感语音合成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research(科大讯飞研究院) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
AI总结 提出EmoInstruct-TTS双路径框架,通过情感嵌入和指令条件情感流模型实现细粒度情感控制,提升语音情感可控性和自然度。
Comments 5 pages, 3 figures, 4 tables. Submitted to Interspeech 2026. Audio demos: https://huanyu-lab.github.io/EMOINSTRUCT-TTS
学习记住什么:通过约束优化实现长时域语言代理的观测安全记忆保留
机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
AI总结 针对长时域语言代理的有限上下文窗口,提出OSL-MR框架,将记忆保留建模为约束随机优化问题,通过在线可观测特征与离线监督的严格分离学习查询条件化的证据价值,实验表明在严格预算下优于现有方法。
HapTile: 用于接触丰富模仿学习的触觉感知视觉-触觉-语言-动作数据集
机构 * King’s College London, UK(伦敦国王学院) ; Huawei, Noah’s Ark Lab, UK(华为、诺亚实验室) ; University College London, UK(伦敦大学学院)
AI总结 提出HapTile数据集,通过集成指尖触觉反馈和操作员触觉感知,为接触丰富的机器人操作任务提供视觉-触觉-语言-动作联合数据,并验证其在策略学习中的有效性。
SparseWorld: 通过具有稀疏场景表示的世界模型增强端到端自动驾驶
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) ; Labs, Huawei(华为2012实验室) ; State Key Laboratory of Industrial Control Technology(国家工业控制技术重点实验室)
AI总结 提出SparseWorld,一种基于稀疏场景表示的轻量级世界模型,通过自回归预测未来地图元素和周围智能体,并利用预测结果优化下游运动预测和轨迹规划,在nuScenes数据集上实现0.05%的碰撞率,达到开放循环规划指标的最优性能。
MoCapAnything V2:面向任意骨骼的端到端动作捕捉
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; Central Research Institute(中央研究院)
AI总结 本文提出MoCapAnything V2,通过端到端框架联合优化Video-to-Pose和Pose-to-Rotation模块,解决任意骨骼动作捕捉中姿态到旋转映射的模糊性问题,提升鲁棒性和效率。
Comments Project page: https://animotionlab.github.io/MoCapAnythingV2/
本质子空间中的模型合并
机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用国家重点实验室(东南大学),中华人民共和国,中国) ; Huawei Technologies, Shanghai, China(华为技术有限公司,上海,中国)
AI总结 提出ESM框架,通过对参数更新引起的特征偏移进行主成分分析,提取本质子空间进行低秩分解,并采用多级极化缩放策略,有效缓解任务干扰,实现多任务模型合并的最优性能。
Comments Accepted by CVPR 2026
NOEM$^{3}$A:一种用于移动代理中多意图理解的神经符号本体增强方法
机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) ; Technical University of Munich(慕尼黑技术大学)
AI总结 提出NOEM$^{3}$A,一种轻量级神经符号层,通过意图本体增强紧凑语言模型,在低延迟和隐私约束下提升移动代理的自然语言理解准确率。
大型语言模型的数值稳定性分析
机构 * Faculty of Mathematics(数学系) ; University of Vienna(维也纳大学) ; Huawei Technologies(华为技术)
AI总结 本文通过混合精度分析推导Transformer推理的条件数和前向误差界,比较LayerNorm与RMSNorm在极端异常值下的稳定性,并量化注意力汇聚对扰动敏感性的影响,发现数值稳定性由权重幅度与残差流增长共同决定。
Comments Major revision