机构
*
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI))
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解
Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi
机构
*
DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门)
;
University of California, Santa Cruz, USA(加州大学圣克ruz分校)
;
Analogy AI
;
East China Normal University, China(华东师范大学)
;
Nanjing University, China(南京大学)
;
Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)
Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges
构建第一人称程序化AI助手:方法、基准和挑战
Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang
机构
*
Department of EEE(电子工程系)
;
The Hong Kong Polytechnic University(香港理工大学)
;
RayNeo
;
Tsinghua University(清华大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Nanyang Technological University(南洋理工大学)
SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning
SMMILE:一个多模态医学上下文学习的专家驱动基准
Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Lund University(隆德大学)
;
Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院)
;
UCSF(加州大学旧金山分校)
;
University of Zurich(苏黎世大学)
;
University Hospital Zurich(苏黎世大学医院)
;
HOPPR
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG
GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing
GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型
Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen
机构
*
School of Computing, Kyung Hee University(京畿大学计算机学院)
;
School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
;
College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院)
;
College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院)
;
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi
机构
*
Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学)
;
School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)
RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance
RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助
Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang
机构
*
School of Information
;
Software Engineering, University of Electronic Science
;
School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China
;
Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science
;
Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences
;
Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China
;
School of Medicine, University of Electronic Science
;
Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China
Towards Vision-Language Geo-Foundation Model: A Survey
迈向视觉-语言地理基础模型:一种综述
Yue Zhou, Zhihang Zhong, Xue Yang
机构
*
School of GeoAI(地理人工智能学院)
;
Hindon STAI Institute(Hindon STAI研究所)
;
Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室)
;
East China Normal University(华东师范大学)
;
School of AI(人工智能学院)
;
Shanghai Jiao Tong University(上海交通大学)
;
School of Automation and Intelligent Sensing(自动化与智能感知学院)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
SpatialReasoner: 大规模3D场景理解中的主动感知
Hongpei Zheng, Shijie Li, Yanran Li, Hujun Yin
机构
*
University of Manchester(曼彻斯特大学)
;
Institute for Infocomm Research (I2R), A*STAR, Singapore(信息与通信研究 institute(I2R),A*STAR,新加坡)
;
University of Bedfordshire(贝德福德郡大学)