arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 93 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2608.23172 2026-09-01 cs.CL cs.CV 版本更新 81%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新 75%

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13426 2026-09-01 cs.LG cs.AI cs.CL 版本更新 62%

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

减少矩阵乘法:面向大语言模型推理的输入自适应矩阵乘积约简方法

Zixuan Lan, Yanhong Li, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对Transformer语言模型推理开销高的问题,提出无需训练的输入自适应RMM方法,通过选择矩阵乘积信息切片减少计算,在多任务多模型上验证其鲁棒性,可提升长序列推理效率,且适用于多模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-09-01 cs.CV cs.AI 版本更新 62%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, Jikai Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026. Code is available at https://github.com/MegviiAlgo-Team/CC-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18176 2026-09-01 cs.CV cs.AI 版本更新 62%

CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification

CLIPure:基于CLIP的潜在空间纯化用于对抗鲁棒零样本分类

Mingkun Zhang, Keping Bi, Wei Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出CLIPure,一种基于CLIP多模态潜在空间的对抗鲁棒零样本分类纯化方法,含两个变体,在多个数据集上大幅提升了对抗鲁棒性,其中CLIPure-Cos不依赖生成模型且防御效率更高。

Comments accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-09-01 cs.CV 版本更新 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-09-01 cs.CV 版本更新 57%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

Comments Submitted to IEEE Access for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-09-01 cs.CL 版本更新 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2601.14569 2026-09-01 cs.CL cs.LG 版本更新 85%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-09-01 cs.CV 版本更新 83%

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-09-01 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Accepted to Findings of EMNLP 2026, page 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-09-01 eess.AS 版本更新 57%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments INTERSPEECH 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00571 2026-09-01 cs.SD eess.AS 版本更新 57%

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview

从音频深度伪造检测到AI生成音乐检测——路径与综述

Yupei Li, Manuel Milling, Lucia Specia, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文系统综述AI生成音乐(AIGM)检测方法,建立四级分类体系,结合音频深度伪造检测开展分层可迁移性分析,从多维度分类代表性方法并提出未来研究方向。

Comments Accepted at Computational Intelligence Magazine (CIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2026-09-01 cs.MM 版本更新 57%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

基于身份驱动的参考辅助多媒体伪造检测

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 针对现有媒体伪造数据集的局限,提出含54位名人视频的IDForge数据集,设计参考辅助多模态伪造检测网络R-MFDN,实验验证其在多媒体伪造检测任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 10 篇

2509.06422 2026-09-01 cs.CV 版本更新 83%

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Phantom-Insight:基于多模态大语言模型的视频伪装目标自适应多线索融合检测方法

Hua Zhang, Changjiang Luo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对视频伪装目标检测的两大问题,提出Phantom-Insight方法,通过多线索融合与解耦学习优化SAM,在MoCA-Mask数据集上达最优性能,且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09625 2026-09-01 cs.HC 版本更新 78%

AwareLLM: A Proactive Multimodal Ecosystem for Personalized Human-AI Collaboration to Enhance Productivity

AwareLLM: 一种主动多模态生态系统,用于个性化人机协作以提升生产力

Amog Rao, Utkarsh Agarwal, Amol Harsh, Siddharth Siddharth

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 AwareLLM通过整合多模态数据与大语言模型,实现主动适应用户心理生理状态,提升任务表现并降低认知疲劳,推动人机协作新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 73%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00514 2026-09-01 cs.RO 版本更新 71%

Cross-Modal Visuo-Tactile Representation Learning with Action Chunking Transformers for Contact-Rich Manipulation

一种低成本的基于视觉的触觉夹具,用于接触丰富的操作

Yaohua Liu, Rong Fu, Amir H. Gandomi, Simon Fong, Hengjun Zhang

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) School of Computing, National University of Singapore(计算机学院,新加坡国立大学) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)

专题命中 视频多模态 :cross-modal(title)

AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-09-01 cs.CV cs.AI 版本更新 62%

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-09-01 cs.CV 版本更新 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20186 2026-09-01 cs.CV 版本更新 57%

Improving Image-to-Image Translation via a Rectified Flow Reformulation

通过修正流重新公式化改进图像到图像转换

Satoshi Iizuka, Shun Okamoto, Kazuhiro Fukui

机构 * University of Tsukuba(茨口大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出I2I-RFR方法,通过将标准图像到图像回归网络重新解释为连续时间传输模型,提升图像转换性能,保留传统监督训练流程,增强感知质量和细节保留。

Comments Accepted to ECCV 2026. Project page: https://iizuka.cs.tsukuba.ac.jp/projects/i2irfr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09608 2026-09-01 cs.RO 版本更新 50%

Super4DR: 4D Radar-centric Self-supervised Odometry and Gaussian-based Map Optimization

Super4DR: 基于4D雷达的自监督里程计与高斯基于地图优化

Zhiheng Li, Weihua Wang, Qiang Shen, Yichen Zhao, Zheng Fang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Super4DR通过基于4D雷达的自监督里程计和高斯地图优化,在恶劣天气中实现更准确的定位与地图重建。

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2510.26861 2026-09-01 cs.IR cs.CL 版本更新 83%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14747 2026-09-01 cs.CV cs.AI 版本更新 81%

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

MMLongEmbed: 长上下文场景下的多模态嵌入模型基准测试

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang

机构 * Soochow University(苏州大学) Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态嵌入模型在长上下文场景中缺乏系统评估的问题,提出首个综合基准MMLongEmbed,涵盖文本、文档和视频模态的检索任务,揭示模型依赖浅层特征匹配、难以捕捉深层语义依赖等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新 79%

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新 79%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-09-01 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏