FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
FORGE:用于长视频理解的相关几何中的帧正交性
Ghazal Kaviani, Ghassan AlRegib
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP))
;
School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中
视觉问答
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定
Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li
机构
*
Beijing Institute of Technology, Beijing, China(北京理工大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
Tsinghua University, Beijing, China(清华大学)
;
The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
CommentsAccepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li
机构
*
School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
;
Tencent Jarvis Lab(腾讯Jarvis实验室)
;
University of Cambridge(剑桥大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI