机构
*
East China Normal University(华东师范大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Northwest A&F University(西北农林科技大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Xiamen University(厦门大学)
专题命中
VLM训练与架构
:LLaVA(title,abstract);multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu
机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Meituan(美团)
专题命中
VLM训练与架构
:LLaVA(title,abstract);multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract)
CommentsAccepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables
Journal refProceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026
机构
*
Nanyang Technological University(南洋理工大学)
;
Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心)
;
Allen Institute for AI(艾伦人工智能研究所)
;
University of Washington(华盛顿大学)
机构
*
Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所)
;
University of Exeter(埃克塞特大学)
;
Queen Mary University of London(伦敦大学玛丽皇后学院)
机构
*
Chinese Academy of Sciences(中国科学院)
;
Microsoft Research(微软研究院)
;
Sun Yat-sen University(中山大学)
;
Zhejiang University(浙江大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Xi’an Jiaotong University(西安交通大学)
机构
*
University of Maryland College Park(马里兰大学帕克分校)
;
Nanjing University of Posts and Telecommunications(南京邮电大学)
;
Stanford University(斯坦福大学)
;
Motional AD Inc.(Motional AD公司)
机构
*
Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学)
;
Khalifa University(卡利法大学)
;
Michigan State University(密歇根州立大学)
;
Australian National University(澳大利亚国立大学)
20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone
20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案
DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt
机构
*
DatologyAI
专题命中
VLM训练与架构
:vision language model(title,title_cn);VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)
Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
构造性失真:通过注意力引导的图像扭曲改进MLLMs
Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain
机构
*
University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Skan AI
;
Texas A&M University(德克萨斯大学阿姆斯特朗分校)
;
University of California, Irvine(加州大学 Irvine 分校)