ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted at ICCV 2025