FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models
FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练
机构 * Huawei(华为)
AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。
大厂专区
FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练
机构 * Huawei(华为)
AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。
DrivingVoxels:用于动态驾驶场景重建的组合稀疏体素光栅化
机构 * Noah’s Ark, Huawei Paris Research Center, France(华为巴黎研究中心诺亚方舟实验室) ; EURECOM, France(法国EURECOM)
AI总结 提出DrivingVoxels框架,通过组合多个独立八叉树的稀疏体素联合光栅化,结合LiDAR引导的结构初始化,高效重建动态驾驶场景,在PandaSet上达到与3DGS相当或更优的感知与结构指标,且训练时间更短。
各有所尺:发现用于物理视频评估的每VLM分类体系
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Huawei Darwin Research Center(华为达尔文研究中心) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。
HiL-ResRL: 通过人在回路残差强化学习的模型无关微调适配器
机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司云机器人实验室) ; South China University of Technology(华南理工大学)
AI总结 提出一种模型无关的即插即用微调流程,通过残差策略和人在回路指导,在1.5小时内使机器人操作成功率超过95%。
Comments 8 pages, 9 figures
TriMotion: 模态无关的摄像机控制用于视频生成
机构 * GIST(光州科学技术院) ; Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Yonsei University(延世大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。
Comments ECCV Accepted
EmoInstruct-TTS:双路径指令引导的情感语音合成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research(科大讯飞研究院) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
AI总结 提出EmoInstruct-TTS双路径框架,通过情感嵌入和指令条件情感流模型实现细粒度情感控制,提升语音情感可控性和自然度。
Comments 5 pages, 3 figures, 4 tables. Submitted to Interspeech 2026. Audio demos: https://huanyu-lab.github.io/EMOINSTRUCT-TTS
学习记住什么:通过约束优化实现长时域语言代理的观测安全记忆保留
机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
AI总结 针对长时域语言代理的有限上下文窗口,提出OSL-MR框架,将记忆保留建模为约束随机优化问题,通过在线可观测特征与离线监督的严格分离学习查询条件化的证据价值,实验表明在严格预算下优于现有方法。