arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-03-11 至 2026-03-11 共收录 2
2603.09206 2026-03-11 cs.CV cs.LG

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09072 2026-03-11 cs.HC cs.AI

A Text-Native Interface for Generative Video Authoring

生成视频创作的文本原生界面

Xingyu Bruce Liu, Mira Dontcheva, Dingzeyu Li

机构 * Adobe Research(Adobe研究院)

AI总结 Doki是一种基于文本的生成视频创作界面,通过文本交互实现视频创作,简化了视频制作流程,提高了创作的可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏