机构
*
Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校)
;
Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组)
;
Monash University, Melbourne, Australia(墨尔本大学)
专题命中
视觉定位与Grounding
:vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV