LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
LoomVideo: 统一多模态输入到视频生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。
大厂专区
LoomVideo: 统一多模态输入到视频生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。
SegMoTE: 用于医学图像分割的令牌级混合专家模型
机构 * Sichuan University(四川大学) ; Xinjiang University(新疆大学) ; Fuzhou University(福州大学) ; Alibaba DAMO Academy(阿里巴巴 DAMO 院)
AI总结 提出SegMoTE框架,通过令牌级混合专家机制和渐进式提示令牌化,在极低标注成本下实现医学图像分割的跨模态自适应与SOTA性能。
CoQuIR:面向代码质量感知信息检索的综合基准
机构 * Linköping University(林波伊大学) ; MBZUAI(麦肯锡人工智能研究院) ; TU Darmstadt(德累斯顿技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; EPFL(苏黎世联邦理工学院) ; University of Groningen(Groningen大学) ; Google Tokyo(东京Google) ; Alibaba Group(阿里巴巴集团) ; TU Munich(慕尼黑技术大学)
AI总结 提出首个大规模多语言代码质量感知检索基准CoQuIR,涵盖正确性、效率、安全性和可维护性四维度,通过细粒度标注和两个质量中心指标评估23个模型,发现顶尖模型常无法区分有缺陷代码,并探索了训练方法以提升质量感知能力。