arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2605.27885 2026-05-28 cs.CV 77%

Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

教师与求解器智能体之间的反思性对话用于视频问答

Takuya Murakawa, Toru Tamaki

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出一种仅通过推理时上下文注入的适应方法,利用教师与求解器智能体之间的反思性对话(RD)来提升视频问答性能,在EgoCross基准上超越零样本和标准上下文学习,获得CVPR 2026 EgoVis Workshop跨域挑战赛开源赛道第三名。

Comments Yhis paper serves as the technical report for the 1st Cross-Domain EgoCross Challenge @ EgoVis Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18003 2026-05-22 cs.CV 77%

Universal Skeleton Understanding via Differentiable Rendering and MLLMs

通过可微渲染和大语言模型实现通用骨架理解

Ziyi Wang, Peiming Li, Xinshun Wang, Yang Tang, Kai-Kuang Ma, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国) Tencent(腾讯) Nanjing University of Aeronautics(南京航空航天大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SkeletonLLM,通过可微渲染将任意骨架序列转换为大语言模型的视觉模态,实现通用骨架理解,同时引入协同训练策略提升推理能力,展示了在开放词汇动作识别中的强泛化能力,并扩展到异构骨架格式的运动描述和问答任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25809 2026-05-11 cs.CV 77%

Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

基于指令和证据的对比双流解码用于 grounded 视觉语言推理

Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kharagpur(印度理工学院Kharagpur分校)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出 IECD$^2$ 方法,通过双流解码平衡语言信息和视觉真实性,提升视觉语言推理任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09298 2026-05-08 cs.CV 77%

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen

机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。

Journal ref 2025 CCF BigData

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 77%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV 77%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16099 2026-04-20 cs.CV 77%

DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

DenTab:一个用于真实世界牙科估算表识别和视觉问答的数据集

Laziz Hamdi, Amine Tamasna, Thierry Paquet

机构 * LITIS, Normandy, France(诺曼底大学LITIS实验室) Malakoff Humanis, Paris, France(巴黎Malakoff Humanis机构)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 DenTab数据集包含2000张牙科估算表图像,用于评估表识别和视觉问答性能,包含2208个问题,涵盖检索、聚合和逻辑一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01310 2026-04-03 cs.CV 77%

Sparse Spectral LoRA: Routed Experts for Medical VLMs

稀疏光谱LoRA:用于医学VLMs的路由专家

Omid Nejati Manzari, Hojat Asgariandehkordi, Taha Koleilat, Yiming Xiao, Hassan Rivaz

机构 * Concordia University(康考迪亚大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出MedQwen,一种参数高效的医学VLM,结合了光谱路由的专家混合(MoE)与理论支持的缩放规则,通过非重叠SVD段初始化专家,减少序列遗忘并提升医疗图像任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV 77%

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19188 2026-02-24 cs.CV 77%

PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration

PositionOCR: 通过混合专家整合增强多模态模型的位置意识

Chen Duan, Zhentao Guo, Pei Fu, Zining Wang, Kai Zhou, Pengfei Yan

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14462 2026-02-17 cs.CV cs.CL 77%

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

RAVENEA:多模态检索增强视觉文化理解的基准

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie

机构 * University of Copenhagen(哥本哈根大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。

Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 77%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01416 2026-01-06 cs.CV 77%

AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval

AirSpatialBot: 一种空间感知的空中智能体用于细粒度车辆属性识别与检索

Yue Zhou, Ran Ding, Xue Yang, Xue Jiang, Xingzhao Liu

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 AirSpatialBot通过空间感知的VLM和两阶段训练策略,实现细粒度车辆属性识别与检索,解决遥感图像中的空间理解难题。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 77%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 77%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15183 2025-11-20 cs.CL cs.LG 77%

HinTel-AlignBench: A Framework and Benchmark for Hindi-Telugu with English-Aligned Samples

Rishikant Chigrupaatii, Ponnada Sai Tulasi Kanishka, Lalit Chandra Routhu, Martin Patel Sama Supratheek Reddy, Divyam Gupta, Dasari Srikar, Krishna Teja Kuchimanchi, Rajiv Misra, Rohun Tripathi

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08668 2025-11-06 cs.CV 77%

Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Tianxiang Hu, Chenyi Zhou, Bin Pu, Yan Zhang, Zhibo Yang, Yang Feng, Joey Tianyi Zhou, Jin Hao, Zijian Chen, Ruijia Wu, Tao Tang, Junhui Lv, Hongxia Xu, Hongwei Wang, Jun Xiao, Bin Feng, Fudong Zhu, Kenli Li, Weidi Xie, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学计算机科学与技术学院) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine(浙江大学口腔医院) Alibaba Inc(阿里巴巴集团) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Angelalign Technology Inc.(Angelalign技术有限公司) CFAR & IHPC, Agency for Science, Technology and Research(CFAR与IHPC,新加坡科技研究局) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University(上海第九人民医院正畸科,上海交通大学口腔医学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22765 2025-11-04 cs.AI 77%

Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval

Binxiao Xu, Junyu Feng, Shaolin Lu, Yulin Luo, Shilin Yan, Hao Liang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Alibaba Group(阿里巴巴集团) Intel Labs China(英特尔中国实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12267 2025-10-15 cs.CV 77%

SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis

Chenghanyu Zhang, Zekun Li, Peipei Li, Xing Cui, Shuhan Xia, Weixiang Yan, Yiqiao Zhang, Qianyu Zhuang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Peking Union Medical College Hospital(北京佑安医学大学医院)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Proceedings of the 33rd ACM International Conference on Multimedia,ACMMM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04479 2025-10-14 cs.CV 77%

VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery

Nonghai Zhang, Zeyu Zhang, Jiazi Wang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) Beijing Jiaotong University(北京交通大学) La Trobe University(拉特罗布大学)

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04532 2025-10-07 cs.AI cs.CL cs.RO 77%

More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models

Xurui Song, Shuo Huai, JingJing Jiang, Jiayi Kong, Jun Luo

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

Comments The dataset will be released publicly once the paper is accepted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24231 2025-09-30 cs.CV 77%

EVLF-FM: Explainable Vision Language Foundation Model for Medicine

Yang Bai, Haoran Cheng, Yang Zhou, Jun Zhou, Arun Thirunavukarasu, Yuhe Ke, Jie Yao, Kanae Fukutsu, Chrystie Wan Ning Quek, Ashley Hong, Laura Gutierrez, Zhen Ling Teo, Darren Shu Jeng Ting, Brian T. Soetikno, Christopher S. Nielsen, Tobias Elze, Zengxiang Li, Linh Le Dinh, Hiok Hong Chan, Victor Koh, Marcus Tan, Kelvin Z. Li, Leonard Yip, Ching Yu Cheng, Yih Chung Tham, Gavin Siew Wei Tan, Leopold Schmetterer, Marcus Ang, Rahat Hussain, Jod Mehta, Tin Aung, Lionel Tim-Ee Cheng, Tran Nguyen Tuan Anh, Chee Leong Cheng, Tien Yin Wong, Nan Liu, Iain Beehuat Tan, Soon Thye Lim, Eyal Klang, Tony Kiat Hon Lim, Rick Siow Mong Goh, Yong Liu, Daniel Shu Wei Ting

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23789 2025-09-30 cs.LG cs.CR 77%

Visual CoT Makes VLMs Smarter but More Fragile

Chunxue Xu, Yiwei Wang, Yujun Cai, Bryan Hooi, Songze Li

机构 * Southeast University, China(东南大学) University of California, Merced, USA(加州大学梅德福分校) The University of Queensland, Australia(昆士兰大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16476 2025-09-23 cs.CV 77%

Eye Gaze Tells You Where to Compute: Gaze-Driven Efficient VLMs

Qinyu Chen, Jiawen Qi

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04323 2025-09-15 cs.CV 77%

MedM-VL: What Makes a Good Medical LVLM?

Yiming Shi, Shaoshuai Yang, Xun Zhu, Haoyu Wang, Xiangling Fu, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08757 2025-09-11 cs.RO cs.CV 77%

SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation

Michael J. Munje, Chen Tang, Shuijing Liu, Zichao Hu, Yifeng Zhu, Jiaxun Cui, Garrett Warnell, Joydeep Biswas, Peter Stone

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) Army Research Laboratory(陆军研究实验室) Sony AI(索尼人工智能)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Conference on Robot Learning (CoRL) 2025 Project site: https://larg.github.io/socialnav-sub

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08715 2025-09-11 cs.CV 77%

BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion

Sike Xiang, Shuang Chen, Amir Atapour-Abarghouei

机构 * Department of Computer Science, Durham University(计算机科学系,杜伦大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03805 2025-09-05 cs.CL cs.AI 77%

Measuring How (Not Just Whether) VLMs Build Common Ground

Saki Imai, Mert İnan, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19944 2025-09-03 cs.CV cs.CL 77%

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Taebaek Hwang, Minseo Kim, Gisang Lee, Seonuk Kim, Hyunjun Eun

机构 * Waddle Seoul National University(首尔国立大学) Krafton UNIST(全南大学) SK Telecom(SK电信)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16763 2025-08-26 cs.CV 77%

WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation

Rabiul Awal, Mahsa Massoud, Aarash Feizi, Zichao Li, Suyuchen Wang, Christopher Pal, Aishwarya Agrawal, David Vazquez, Siva Reddy, Juan A. Rodriguez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) École de Technologie Supérieure (ETS)(高等技术学院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments This paper has been accepted to the EMNLP 2025 main conference. Check the project page here: https://webmmu-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏