arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46237 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2608.22996 2026-08-25 cs.CV 新提交 70%

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法

Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。

Journal ref ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 70%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08840 2026-08-11 cs.CV 新提交 70%

SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

SLAP:基于部分最优传输的鱼类重识别选择性局部视觉-语言对齐

Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen

机构 * University of Verona(维罗纳大学) Institute of Marine Research(海洋研究所) University of Agder(阿格德大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对鱼类重识别中全局对齐易引入噪声的问题,提出基于POT的选择性局部视觉-语言对齐框架,在多数据集上实现优于CLIP类方法的性能,泛化性良好。

Comments This is the author version prior to incorporating the camera-ready comments. The final version will be included in the Proceedings of the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02137 2026-08-04 cs.CV 新提交 70%

Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models

同一硬币的两面:面向视觉-语言模型跨任务攻击的协同演化搜索

Xuanhui Lin, Junhao Dong, Mingrong Gong, Yucheng Chen, Xinghua Qu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心) School of Electrical Engineering and Automation, Fuzhou University(福州大学电气工程与自动化学院) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视觉-语言模型易受对抗扰动的问题,提出协同演化跨模态攻击框架,联合优化文本与视觉空间,在多任务上展现出强攻击性能与跨任务可迁移性。

Comments 15 pages, 7 figures, and 8 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新 70%

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29136 2026-08-03 cs.CV 新提交 70%

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models

自监督点云编码器在高效3D大语言模型中的效能研究

Yao Zheng, Tian Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 该研究探究低成本自监督点云编码器能否替代昂贵多模态编码器用于3D-LLM,经实验发现其与架构存在强交互,为高性价比3D-LLM设计提供指南。

Comments 14 pages, 3 figures. This work has been previously released as a preprint on ChinaXiv (No. ChinaXiv:202607.00167, DOI: 10.12074/202607.00167)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08881 2026-07-31 cs.CV 版本更新 70%

Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models

Precise Shield:通过神经层面指导解释和对齐VLLM安全

Enyi Shi, Fei Shen, Chuancheng Shi, Shuyi Miao, Linxia Zhu, Pengyang Shao, Jinhui Tang, Tat-Seng Chua

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Beihang University(北京航空航天大学) Nanjing Forestry University(南京林业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 70%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03316 2026-07-28 cs.CV 版本更新 70%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新 70%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17693 2026-07-21 cs.CV 新提交 70%

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

用于无训练测试时医学图像分割的内存支持协同适应

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。

Comments 18 pages, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03117 2026-07-21 cs.CV 版本更新 70%

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

揭示物理世界语义漏洞:用于红外视觉语言模型的通用对抗性补丁

Chengyin Hu, Yuxian Dong, Yikun Guo, Xiang Chen, Qike Zhang, Junqi Wu, Jiahuan Long, Jiujiang Guo, Yiwei Wei, Tingsong Jiang, Wen Yao

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出通用曲网格补丁框架UCGP,用于揭示红外视觉语言模型的语义鲁棒性漏洞,通过扰动视觉表征空间以削弱跨模态语义对齐,验证了其在多种架构和数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14721 2026-07-17 cs.CV cs.LG 新提交 70%

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

多模态作为监督:通过多模态进行自监督的测试环境特化

Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用跨模态学习机制,提出在特定测试环境下的受限设置并开发TST方法,通过在测试环境收集多模态数据自监督预训练模型,评估其在下游任务的表现,发现可减少对外部大规模数据集预训练的依赖。

Comments Project page: https://tst-vision.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12800 2026-07-15 cs.CV 新提交 70%

UniVR: Thinking in Visual Space for Unified Visual Reasoning

UniVR:用于统一视觉推理的视觉空间思考

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 UniVR旨在从纯视觉演示中同时学习复杂推理、物理动力学和长期规划,核心是VR-GRPO强化学习范式。构建VR-X基准进行训练和评估,在VR-X上有25%的提升,还提高了多模态理解基准性能,相关资源已开源。

Comments Code and models are released at: https://maverickren.github.io/UniVR.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01109 2026-07-09 cs.AI 版本更新 70%

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

贫困地图绘制的柏拉图式表示:统一的视觉语言代码还是智能体诱导的新颖性?

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud

机构 * AI and Global Development Lab(人工智能与全球发展实验室) Institute for Analytical Sociology(分析社会学研究所) Institute of Computer Science(计算机科学研究所) Department of Government(政府系)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 研究社会经济指标在卫星图像和网络文本中的信息印记,开发多模态框架经五条管道预测家庭财富,贡献包括融合视觉与文本提升预测、发现部分表示对齐证据、发布大规模多模态数据集。

Comments ICSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 70%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 70%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08907 2026-07-03 cs.CV 版本更新 70%

Towards Interactive Global Geolocation Assistant

迈向交互式全球地理定位助手

Zhiyang Dou, Zipeng Wang, Xumeng Han, Guorong Li, Zhipei Huang, Zhenjun Han

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉学科学院) School of Electronic, Electrical and Communication Engineering, UCAS(中国科学院大学电子、电气与通信工程学院) School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出基于大型视觉语言模型的交互式全球地理定位助手GaGA,通过挖掘图像地理线索并结合世界知识进行定位,支持用户交互,在GWS15k数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00428 2026-07-02 cs.CV 新提交 70%

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28719 2026-06-30 cs.AI 70%

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

ComMem:视觉语言模型测试时自适应的互补记忆系统

Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。

Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 70%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11421 2026-06-25 cs.CV cs.LG 版本更新 70%

BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning

BOFA: 基于CLIP的类增量学习中的桥接层正交低秩融合

Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出BOFA框架,通过将适应限制在CLIP的跨模态桥接层并使用正交低秩融合防止遗忘,无需额外参数或数据回放,实现高效类增量学习。

Comments Accepted by AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(27): 22967-22975, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24774 2026-06-24 cs.CV 新提交 70%

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

揭示视觉语言大模型中的训练数据暴露:基于参数梯度的方法

Zhihao Zhu, Hongyi Tang, Yi Yang, Ahmed Abbasi

机构 * Department of Information Systems, Business Statistics and Operations Management (ISOM), Hong Kong University of Science and Technology, Hong Kong, China(信息系统、商业统计与运营管理系(ISOM),香港科技大学,香港,中国) Department of IT, Analytics, and Operations, University of Notre Dame, Notre Dame, Indiana, USA(信息技术、分析与运营系,诺丁汉大学,诺丁汉,印第安纳州,美国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出梯度审计框架GradAudit,通过分析模型参数梯度特征检测训练数据,在医疗和通用数据集上显著优于现有方法,并揭示现有方法低估了未经授权数据使用程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22543 2026-06-23 cs.CV 新提交 70%

MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization

MAPS: 多锚点投影相似性用于联合视觉-语言地理定位

Yutong Hu, Siyuan Tan, Shaocheng Yan, Pengcheng Shi, Qingwu Hu, Jiayuan Li

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出多锚点投影相似性(MAPS)度量,将联合图像-文本查询的地理定位建模为多锚点几何对齐问题,通过目标特征在查询锚平面上的投影长度衡量相似性,并引入基于MAPS的对比损失,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19522 2026-06-19 cs.AI 新提交 70%

REVEAL++: Differentiable Phenotypic Grouping for Vision-Language Retinal Modeling of Alzheimer's Disease Risk

REVEAL++:用于阿尔茨海默病风险视觉-语言视网膜建模的可微分表型分组

Ethan Elio Meidinger, Seowung Leem, Zeyun Zhao, Ruogu Fang

机构 * University of Virginia(弗吉尼亚大学) J. Crayton Pruitt Family Department of Biomedical Engineering, Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院J. Crayton Pruitt家庭生物医学工程系)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出可微分连续表型相似性权重函数,替代离散分组,在对比学习中端到端学习跨模态对齐与表型结构,提升AD风险预测。

Comments Accepted for publication at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 70%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09715 2026-06-11 cs.AI 版本更新 70%

Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT

问题真的重要吗?视觉-语言SFT的无训练数据选择

Peng Sun, Yi Yang, Huawen Shen, Yi Ban, Tianfan Fu, Yanbo Wang, Yuqiang Li

机构 * Nanjing University(南京大学) Institute of Information Engineering(信息工程研究所) North University of China(中国北方大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出CVS方法,利用冻结的视觉-语言大模型评估问题对答案有效性的影响,无需训练即可筛选出需要跨模态推理的高质量样本,在多个数据集上以少量数据超越全量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09167 2026-06-09 cs.CV 新提交 70%

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating

视觉-语言引导的高光谱目标跟踪:语义融合与上下文模板更新

Rui Yao, Yuhong Zhang, Kunyang Sun, Hancheng Zhu, Jiaqi Zhao, Zhiwen Shao, Abdulmotaleb El Saddik

机构 * China University of Mining and Technology(中国矿业大学) University of Ottawa(渥太华大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出VLHTrack框架,通过语言引导波段选择模块缓解光谱冗余,利用多模态融合模块整合视觉与语言特征,并采用动态模板更新策略应对目标形变,在HOT2023/2024上超越现有方法。

Comments 14 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08970 2026-06-09 cs.AI 新提交 70%

An Effective Router for Vision-Language Model Selection

一种有效的视觉-语言模型选择路由器

Can Wang, Shengwei Wang, Bolin Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 针对视觉-语言模型(VLM)选择中数据缺乏、特征表示无效和模型空间僵化的问题,提出ARMS路由器,通过增强输入信号和扩展训练策略,在分布内和分布外测试集上表现优异,仅800M参数即可超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24470 2026-06-05 cs.CV 70%

TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

TempRet: 面向CVPR 2026 EPIC-KITCHENS-100多实例检索挑战的时间增强与两阶段重排序

Zixu Li, Yupeng Hu, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对第一人称视频检索中时间动态被忽视的问题,提出基于CLIP双编码器、视频端时间Transformer和两阶段重排序的TempRet方法,在EK-100 MIR基准上达到67.97%平均mAP和82.92%平均nDCG。

Comments Technical Report for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏