arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 75%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24652 2026-05-26 cs.AI cs.CV cs.MM cs.SD 75%

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

AVBench:面向音视频生成模型的人类对齐与自动化评估基准

Jialiang Yang, Bin Xia, Ruihang Chu, Dingdong Wang, Wanke Xia, Zhun Mou, Tianyang Zhong, Yiting Zhao, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出AVBench,通过细粒度人类中心指标和偏好学习训练的专业评估器,实现音视频生成的自动化、准确评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 75%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06157 2026-05-08 cs.CL cs.AI cs.CV 75%

HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

HNC:利用硬负样本提升具有细粒度视觉-语言理解能力的模型

Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang, Thang Vu, Carina Silberer

机构 * Institute for Natural Language Processing, University of Stuttgart(自然语言处理研究所,斯图加特大学)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HNC数据集,通过自动创建硬负样本提升图像-文本匹配模型的细粒度跨模态理解能力,并提供人工创建的测试集评估模型在复杂跨模态匹配任务中的表现。

Journal ref Association for Computational Linguistics (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 75%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 75%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17045 2026-01-29 cs.CV cs.AI cs.MM 75%

RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis

RacketVision: 一种多 racket 运动基准数据集用于统一的球和 racket 分析

Linfeng Dong, Yuchen Yang, Hao Wu, Wei Wang, Yuenan Hou, Zhihang Zhong, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 RacketVision 是一个用于多 racket 运动分析的基准数据集,通过细粒度注释和 CrossAttention 机制提升球轨迹预测性能。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 75%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20595 2025-12-24 cs.CL cs.AI cs.CV 75%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07817 2025-08-14 eess.IV cs.AI cs.CV cs.LG cs.MM 75%

MIND: A Noise-Adaptive Denoising Framework for Medical Images Integrating Multi-Scale Transformer

Tao Tang, Chengxu Yang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by the 7th International Conference on Intelligent Control, Measurement and Signal Processing (ICMSP 2025). 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20930 2025-05-22 cs.AI cs.CL cs.CV 75%

ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification

Ziqing Fan, Cheng Liang, Chaoyi Wu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13307 2025-05-20 cs.CL cs.AI cs.CV 75%

RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning

Qiguang Chen, Libo Qin, Jinhao Liu, Yue Liao, Jiaqi Wang, Jingxuan Zhou, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(社会计算与交互机器人研究中心,哈尔滨工业大学) Faculty of Computing, Harbin Institute of Technology(计算学院,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) Chinese University of Hong Kong(香港中文大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13854 2024-10-18 cs.CL cs.AI cs.CV cs.CY 75%

Can MLLMs Understand the Deep Implication Behind Chinese Images?

Chenhao Zhang, Xi Feng, Yuelin Bai, Xinrun Du, Jinchang Hou, Kaixin Deng, Guangzeng Han, Qinrui Li, Bingli Wang, Jiaheng Liu, Xingwei Qu, Yifei Zhang, Qixuan Zhao, Yiming Liang, Ziqiang Liu, Feiteng Fang, Min Yang, Wenhao Huang, Chenghua Lin, Ge Zhang, Shiwen Ni

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 32 pages,18 figures. Project Page: https://cii-bench.github.io/ Code: https://github.com/MING_X/CII-Bench Dataset: https://huggingface.co/datasets/m-a-p/CII-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01525 2024-07-18 cs.CV cs.AI cs.CL 75%

ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities

Chenming Zhu, Tai Wang, Wenwei Zhang, Kai Chen, Xihui Liu

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by ECCV 2024. A comprehensive and hierarchical 3D reasoning grounding benchmark in the era of foundation models. Project page: https://zcmax.github.io/projects/ScanReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05814 2024-07-09 cs.CV cs.AI cs.MM 75%

Cross-domain Few-shot In-context Learning for Enhancing Traffic Sign Recognition

Yaozong Gan, Guang Li, Ren Togo, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02842 2024-07-04 cs.CV cs.AI cs.CL 75%

MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis

Lei Chen, Feng Yan, Yujie Zhong, Shaoxiang Chen, Zequn Jie, Lin Ma

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09411 2024-07-03 cs.CV cs.AI cs.CL 75%

MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Fei Wang, Xingyu Fu, James Y. Huang, Zekun Li, Qin Liu, Xiaogeng Liu, Mingyu Derek Ma, Nan Xu, Wenxuan Zhou, Kai Zhang, Tianyi Lorena Yan, Wenjie Jacky Mo, Hsiang-Hui Liu, Pan Lu, Chunyuan Li, Chaowei Xiao, Kai-Wei Chang, Dan Roth, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments typos corrected, references added, Project Page: https://muirbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 75%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12915 2024-01-24 cs.AI cs.CL cs.CV 75%

Red Teaming Visual Language Models

Mukai Li, Lei Li, Yuwei Yin, Masood Ahmed, Zhenguang Liu, Qi Liu

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16561 2022-05-05 cs.CV cs.AI cs.CL 75%

Diagnosing Vision-and-Language Navigation: What Really Matters

Wanrong Zhu, Yuankai Qi, Pradyumna Narayana, Kazoo Sone, Sugato Basu, Xin Eric Wang, Qi Wu, Miguel Eckstein, William Yang Wang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.08473 2018-10-11 cs.CV cs.AI cs.MM 75%

Beyond Narrative Description: Generating Poetry from Images by Multi-Adversarial Training

Bei Liu, Jianlong Fu, Makoto P. Kato, Masatoshi Yoshikawa

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06243 2026-01-21 cs.CL cs.AI 74%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 多模态评测 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22465 2026-08-25 cs.CV 新提交 74%

M$^3$ISR: A Multi-Modal Multi-View Benchmark for 3D/4D Gaussian Splatting and Feedforward Compression

M$^3$ISR:面向3D/4D高斯溅射(Gaussian Splatting)与前馈压缩的多模态多视图基准测试

Xinhui Liu, Lei Liu, Zhenghao Chen, Lebin Zhou, Wei Wang, Wei Jiang

机构 * The University of Hong Kong(香港大学) University of Newcastle(纽卡斯尔大学) Santa Clara University(圣克拉拉大学) Futurewei Technologies, Inc.(华为主导未来技术公司)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 该研究提出面向3D/4D高斯溅射的可控合成基准M$^3$ISR,含25个场景等,设5个赛道,评估发现静态重建质量差异小但存储成本差异大,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 74%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05356 2026-08-13 cs.CV cs.RO 版本更新 74%

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

LoDA:一种面向目标级变化检测的检测级别感知方法及多模态感知基准

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng

机构 * Western Australia Machine Intelligence Group Pty Ltd(西澳大利亚机器智能集团有限公司) The University of Western Australia(西澳大利亚大学) Curtin University(科廷大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究针对自动驾驶等领域的目标级变化检测问题,提出LoDA检测级别感知方法,构建LoDA基准,在Subiaco和Urb3DCD-V2基准上均超越现有最佳基线,提升了变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08859 2026-08-11 cs.LG cs.AI 新提交 74%

Agentic Anomaly Detection with ORCA-Style Dynamic Inductive Bias Adaptation in Multimodal Wearable Time Series Data

基于ORCA风格动态归纳偏差自适应的多模态可穿戴时间序列智能体异常检测

Anushka Roy, Jyotirmoy Singh, Shreea Bose, Chittaranjan Hota

机构 * BITS Pilani(皮尔尼理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 该研究针对资源受限的非平稳生理时间序列异常检测问题,提出ORCA框架,通过监督控制器动态调整时间感受野,在WBAN和MIMIC-IV数据集上实现稳健性能,无需预调时间范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05539 2026-08-07 cs.CV 新提交 74%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 74%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03649 2026-08-05 cs.CV 新提交 74%

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware

更少的视觉令牌何时能加速多模态推理?跨决策位置与硬件的盈亏平衡点研究

Hao Dou, Ruiwen Tian

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究通过可复现协议分析视觉令牌数量与多模态推理延迟的盈亏平衡点,发现视觉前路由在A100上的延迟优势超过视觉后策略的下游令牌减少量,且视觉后预测器的效果经校正后仍显著。

Comments 16 pages, 3 figures, 13 tables. Experiments use Qwen2.5-VL-3B-Instruct on RTX 3090 and A100 PCIe GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 74%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏