arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2605.12325 2026-05-14 cs.CV 57%

VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference

VIP:基于视觉引导的提示进化用于高效的密集视觉-语言推理

Hao Zhu, Shuo Jin, Wenbin Liao, Jiayu Xiao, Yan Zhu, Siyue Yu, Feng Dai

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Liverpool(利物浦大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VIP方法,通过视觉引导的提示进化提升密集视觉-语言推理的效率与质量,实现更准确的细粒度物体感知。

Comments Accepted by ICML2026. Code is available at https://github.com/MiSsU-HH/VIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10855 2026-05-12 cs.CL 57%

Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding

从少量数据中学习更多:利用反事实以提高图表理解的数据效率

Jianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Aumovio Singapore Pte. Ltd.(Aumovio新加坡私人有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出ChartCF框架,通过反事实数据合成和多模态偏好优化,提升图表理解的反事实敏感性,实验表明其在少数据下表现优异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 57%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV 57%

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12878 2026-05-12 cs.CV cs.RO 57%

Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views

Uni-Hand:面向亲身体验视角的通用手部运动预测

Junyi Ma, Wentao Bao, Jingyi Xu, Guanzhong Sun, Yu Zheng, Erhang Zhang, Xieyuanli Chen, Hesheng Wang

机构 * IRMV Lab, Shanghai Jiao Tong University(上海交通大学IMV实验室) Meta Reality Labs(Meta现实实验室) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) China University of Mining and Technology(中国矿业大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学与技术学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Uni-Hand框架,通过多模态输入、多维多目标预测和多任务赋能,实现手部在2D和3D空间的精准预测,并引入目标指标预测手腕和指尖关节点,同时预测手-物体交互状态,提升下游任务性能。

Comments Accepted by T-PAMI 2026. Code and data: https://github.com/IRMVLab/UniHand

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00884 2026-05-12 cs.CV 57%

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

LiteVLA-H: 双速率视觉-语言-动作推断用于机载空中引导与语义感知

Justin williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber Physical Systems, Clark Atlanta University(克劳克阿特拉大学网络物理系统系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 LiteVLA-H通过双速率操作在边缘设备上实现高效视觉-语言-动作推断,兼顾快速动作输出与语义理解,提升空中引导与场景感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08254 2026-05-12 cs.LG cs.AI 57%

HyperTransport: Amortized Conditioning of T2I Generative Models

HyperTransport:T2I生成模型的 amortized 条件控制

Valentino Maiorca, Eleonora Gualdoni, Xavier Suau, Marco Cuturi, Luca Zappella, Pau Rodríguez

机构 * Apple(苹果公司)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 HyperTransport 通过超网络框架实现对T2I生成模型的amortized条件控制,结合连续可解释强度控制和跨模态条件,提升模型可控性与效率,验证结果在多个测试概念上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 57%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05340 2026-05-11 cs.CR cs.AI 57%

How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

VLMs在物理世界中离隐私意识还有多远?一项实证研究

Junran Wang, Xinjie Shen, Zehao Jin, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 图文多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文通过实证研究揭示VLMs在物理环境中隐私意识的不足,提出ImmersedPrivacy框架评估模型在复杂场景中的隐私感知能力,发现现有模型在感知和隐私冲突处理上存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06080 2026-05-08 cs.CV 57%

MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation

MSD-Score:多尺度分布评分用于无参考图像描述评估

Shichao Kan, Xuyang Zhang, Haojie Zhang, Zhe Zhu, Yigang Cen, Yixiong Liang, Lianlei Shan, Linna Zhang, Zhe Qu, Jiazhi Xia

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Computer Science and Technology and the State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学计算机科学与技术学院和先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出MSD-Score,一种无参考图像描述评估指标,通过多尺度分布评分方法量化语义差异,实现对局部 grounding 错误的透明诊断,优于现有无参考指标。

Comments Preprint. 17 pages, 10 figures. Code is available at: https://steinsgatesg.github.io/MSDScore/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 57%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01662 2026-05-05 cs.CV 57%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00824 2026-05-04 cs.MM 57%

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

CustomDancer:通过文本-舞蹈检索实现定制化舞蹈推荐

Yawen Qin, Ke Qiu, Qin Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出CustomDancer框架,通过CLIP文本编码器、音乐与运动编码器及音乐-运动融合模块,实现文本与舞蹈的多模态检索,提升舞蹈推荐的个性化与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00323 2026-05-04 cs.CV cs.LG 57%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 57%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26462 2026-04-30 cs.CV 57%

A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows

一种多阶段提取流水线用于长扫描金融文档:工业KYC工作流的实证研究

Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

机构 * OCBC

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出多阶段提取框架,整合图像预处理、多语言OCR、混合页面级检索和紧凑VLM基于结构化提取,提升复杂多页文档的提取精度,实验证明在工业KYC工作中性能优于直接PDF到VLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25884 2026-04-29 quant-ph cs.CV 57%

QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding

QCalEval:用于量子校准图理解的视觉-语言模型基准测试

Shuxiang Cao, Zijian Zhang, Abhishek Agarwal, Grace Bratrud, Niyaz R. Beysengulov, Daniel C. Cole, Alejandro Gómez Frieiro, Elena O. Glen, Hao Hsu, Gang Huang, Raymond Jow, Greshma Shaji, Tom Lubowe, Ligeng Zhu, Luis Mantilla Calderón, Nicola Pancotti, Joel Pendleton, Brandon Severin, Charles Etienne Staub, Sara Sussman, Antti Vepsäläinen, Neel Rajeshbhai Vora, Yilun Xu, Varinia Bernales, Daniel Bowring, Elica Kyoseva, Ivan Rungger, Giulia Semeghini, Sam Stanwyck, Timothy Costa, Alán Aspuru-Guzik, Krysta Svore

机构 * NVIDIA University of Toronto(多伦多大学) IQM Quantum Computers(IQM量子计算机) Lawrence Berkeley National Laboratory(伯克利国家实验室) Conductor Quantum(Conductor量子) National Physical Laboratory(国家物理实验室) Infleqtion Harvard University(哈佛大学) Fermi National Accelerator Laboratory(费米国家加速器实验室) Northwestern University(西北大学) EeroQ Corporation(EeroQ公司) Royal Holloway University of London(伦敦皇家霍洛威大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出QCalEval,首个用于评估视觉-语言模型理解量子校准图能力的基准测试,包含243个样本和87种场景类型,测试零样本和上下文学习下的六种问题类型,展示了不同模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI 57%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23214 2026-04-29 cs.CL 57%

DARC-CLIP: Dynamic Adaptive Refinement with Cross-Attention for Meme Understanding

DARC-CLIP:动态自适应细化与跨注意力机制用于表情包理解

Qiyuan Jin

机构 * The Hong Kong University of Science(香港科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DARC-CLIP框架,通过层次化细化栈实现自适应多模态融合,提升表情包中多模态线索的建模精度,尤其在仇恨检测任务中取得显著提升。

Comments Accepted to IEEE ICASSP 2026. 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29080 2026-04-29 cs.CV cs.LG 57%

Is the Modality Gap a Bug or a Feature? A Robustness Perspective

模态间隙是bug还是feature?从鲁棒性视角

Rhea Chowers, Oshri Naparstek, Udi Barzelay, Yair Weiss

机构 * Hebrew University(希伯来大学) IBM Research(IBM研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文从鲁棒性角度探讨模态间隙的存在原因,发现减少间隙可提升模型鲁棒性而不影响清洁准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13302 2026-04-29 cs.CL 57%

Images Amplify Misinformation Sharing in Vision-Language Models

图像在视觉-语言模型中放大虚假信息的传播

Alice Plebe, Timothy Douglas, Diana Riazi, R. Maria del Rio-Chanona

机构 * Department of Industrial Engineering, University of Trento(特伦托大学工业工程系) Computer Science Department, University College London(伦敦大学学院计算机科学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究探讨了图像如何影响视觉-语言模型分享新闻内容的倾向,发现图像能提高虚假新闻的分享率,且不同模型对图像的反应存在差异。

Comments Accepted for oral presentation at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24642 2026-04-28 cs.CV 57%

Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

探测CLIP对360度文本和视觉语义的理解

Hai Wang, Xiaochen Yang, Mingzhi Dong, Jing-Hao Xue

机构 * Department of Statistical Science, University College London, UK(伦敦大学统计科学系) School of Mathematics and Statistics, University of Glasgow, UK(格拉斯哥大学数学与统计学学院) Department of Computer Science, University of Bath, UK(巴斯大学计算机科学系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文探讨CLIP模型对360度全景图像-文本对语义对齐的评估能力,提出新的评价方法,发现CLIP在处理360度视觉语义时存在局限,并提出LoRA微调框架以提升其理解能力。

Comments Project Page: https://littlewhitesea.github.io/360Semantics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 57%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 57%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24146 2026-04-28 cs.CV 57%

EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT

EXACT:一种可解释的异常感知视觉基础模型,用于3D胸部CT分析

Xuguang Bai, Mingxuan Liu, Tongxi Song, Yifei Chen, Hongjia Yang, Kasidit Anmahapong, Zihan Li, Ying Zhou, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科) Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 EXACT通过学习空间解析表示,提升3D胸部CT的异常检测与可解释性,优于现有医学基础模型,适用于多疾病诊断和报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV 57%

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI 57%

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 57%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25383 2026-04-23 cs.CV 57%

CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation

CLIP-RD:基于相对蒸馏的高效CLIP知识蒸馏

Jeannie Chung, Hanna Jang, Ingyeong Yang, Uiwon Hwang, Jaehyeong Sim

机构 * Ewha Womans University(东亚妇女大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CLIP-RD框架,通过引入垂直关系蒸馏和交叉关系蒸馏方法,提升学生模型对教师模型多方向关系的保留能力,实现更高效的CLIP知识蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏