VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
VISA:用于多模态指令遵循的智能体式自进化数据合成
机构 * vivo AI Lab(vivo AI实验室)
AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。
大厂专区
VISA:用于多模态指令遵循的智能体式自进化数据合成
机构 * vivo AI Lab(vivo AI实验室)
AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。
可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习
机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) ; vivo AI Lab(vivo AI实验室) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Southeast University(东南大学) ; Peking University(北京大学) ; School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) ; Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)
AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。
Comments Accepted to the Main Conference of EMNLP '26