arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2604.00013 2026-04-14 cs.CL cs.AI 81%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 81%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 81%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02492 2026-04-06 cs.CV cs.AI 81%

Token-Efficient Multimodal Reasoning via Image Prompt Packaging

通过图像提示包装实现高效的多模态推理

Joong Ho Choi, Jiayang Zhao, Avani Appalla, Himansh Mukesh, Dhwanil Vasani, Boyi Qian

机构 * BNY Pittsburgh US(美国匹兹堡)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出图像提示包装方法,通过将结构化文本嵌入图像以减少文本令牌开销,并在多个数据集和模型上验证其效果,展示了在多模态系统设计中视觉编码的重要性。

Comments 9 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02396 2026-04-06 cs.CV cs.AI 81%

Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework

面向环境的车用通信信道预测:一种多模态视觉特征融合框架

Xuejian Zhang, Ruisi He, Minseok Kim, Inocent Calist, Mi Yang, Ziyi Qi

机构 * Graduate School of Science and Technology, Niigata University(新潟大学研究生院科学与技术系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态视觉特征融合框架,利用GPS数据、车辆全景RGB图像及语义分割和深度估计提取语义、深度和位置特征,通过三分支架构和 squeeze-excitation 注意力门控模块实现自适应多模态融合,实现路径损耗、时延扩展、到达方位扩展、离开方位扩展和角功率谱的联合预测。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02338 2026-04-06 cs.LG cs.CL cs.CV 81%

LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning

LiME:轻量级专家混合用于高效的多模态多任务学习

Md Kowsher, Haris Mansoor, Nusrat Jahan Prottasha, Ozlem Garibay, Victor Zhu, Zhengping Ji, Chen Chen

机构 * UCF(中佛罗里达大学) Coventry University(考文垂大学) Axon(Axon公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LiME通过轻量级调制实现专家专业化,减少可训练参数并提升泛化能力,实验表明其在多模态多任务基准上性能优异且训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01667 2026-04-03 cs.AI cs.CV 81%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29450 2026-04-01 cs.CV cs.AI 81%

Few-shot Writer Adaptation via Multimodal In-Context Learning

基于多模态上下文学习的少样本作家适应

Tom Simon, Stephane Nicolas, Pierrick Tranouez, Clement Chatelain, Thierry Paquet

机构 * LITIS EA4108, University of Rouen Normandy(LITIS EA4108,鲁昂诺曼底大学) LITIS EA4108, INSA of Rouen Normandy(LITIS EA4108,鲁昂诺曼底国立应用科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于多模态上下文学习的少样本手写体识别框架,通过少量目标作家样本实现推理时的作家适应,无需参数更新,实验在IAM和RIMES数据集上取得优于现有模型的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 81%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23153 2026-03-31 cs.CV cs.AI 81%

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

高效无编码器的基于傅里叶的3D大多模态模型

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) JKU Linz, Austria(奥地利林茨约翰·开普勒大学) CSIRO, Australia(澳大利亚联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Fase3D,一种基于傅里叶变换的无编码器3D多模态模型,通过结构化超点和空间填充曲线实现高效全局上下文建模,显著提升计算效率和参数效率。

Journal ref CVPR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26726 2026-03-31 cs.CV cs.AI 81%

A Multimodal Deep Learning Framework for Edema Classification Using HCT and Clinical Data

一种结合头颅CT和临床数据的多模态深度学习框架用于水肿分类

Aram Ansary Ogholbake, Hannah Choi, Spencer Brandenburg, Alyssa Antuna, Zahraa Al-Sharshahi, Makayla Cox, Haseeb Ahmed, Jacqueline Frank, Nathan Millson, Luke Bauerle, Jessica Lee, David Dornbos, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Department of Computer Science, University of Kentucky(肯塔基大学计算机科学系) Department of Neurological Surgery, University of Kentucky(肯塔基大学神经外科学系) University of Kentucky College of Medicine(肯塔基大学医学院) Department of Neurology, University of Kentucky(肯塔基大学神经学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AttentionMixer框架,通过融合头颅CT和临床数据实现脑水肿检测,采用自监督Vision Transformer Autoencoder编码CT数据,并利用交叉注意力模块整合临床信息,最终通过MLP-Mixer提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25155 2026-03-27 cs.CV cs.AI 81%

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon:通过高效多模态大语言模型加速体积理解

Chengyu Fang, Heng Guo, Zheng Jiang, Chunming He, Xiu Li, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(湖畔实验室) Duke University(杜克大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20008 2026-03-25 cs.CV cs.AI 81%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20729 2026-03-24 cs.CV cs.AI physics.geo-ph 81%

Weakly supervised multimodal segmentation of acoustic borehole images with depth-aware cross-attention

弱监督多模态分割:基于深度感知的跨注意力机制用于声学钻孔图像

Jose Luis Lima de Jesus Silva

机构 * Federal University of Bahia, Institute of Geosciences, Department of Geophysics(巴伊亚联邦大学,地质科学学院,地球物理学系) Grupo de Estudos e Aplicação de Inteligência Artificial em Geofísica (GAIA)(地质物理中人工智能研究与应用小组)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种弱监督多模态分割框架,通过深度感知的跨注意力机制提升钻孔图像分割性能,结合二维图像纹理与一维井下数据,实现无监督的高精度分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00431 2026-03-24 cs.CV cs.AI 81%

Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

面向层次视觉识别的分类意识表示对齐

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机系王轩研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TARA方法,通过生物基础模型的层次对比学习将分类知识注入大模态模型,提升层次视觉识别中对已知和新类别的识别性能。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17343 2026-03-23 cs.CV cs.LG cs.MM 81%

Principled Multimodal Representation Learning

原理化的多模态表征学习

Xiaohao Liu, Xiaobo Xia, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出PMRL框架,通过优化表示矩阵的主导奇异值实现多模态的同时对齐,采用基于softmax的损失函数和实例对比正则化,提升表征稳定性与分离性,在多种任务中优于基线方法。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI 81%

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15168 2026-03-17 cs.CV cs.AI 81%

Multimodal Connectome Fusion via Cross-Attention for Autism Spectrum Disorder Classification Using Graph Learning

通过交叉注意力进行多模态连接组融合用于自闭症谱系障碍分类的图学习

Ansar Rahman, Hassan Shojaee-Mend, Sepideh Hatamikia

机构 * Department of Medicine, Danube Private University (DPU)(丹ube私人大学医学系) Department of Medical Physics and Biomedical Engineering, Medical University of Vienna(维也纳医学大学医学物理与生物医学工程系) Department of Medical Informatics, Faculty of Medicine, Gonabad University of Medical Sciences(戈纳巴德医学院医学信息学系) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态图学习框架,通过交叉注意力机制融合功能和结构影像数据,提升自闭症谱系障碍分类的准确率。

Comments 29 Pages; 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV 81%

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14891 2026-03-17 cs.CL cs.AI 81%

Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models

基于大语言模型的多模态作文评分的决策级序数建模

Han Zhang, Jiamin Su, Li liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DLOM方法,通过显式序数决策提升多模态作文评分的准确性,DLOM-GF和DLOM-DA分别引入门控融合模块和距离感知正则化项,实验表明在多模态和纯文本评分任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14189 2026-03-17 cs.CV cs.AI 81%

Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions

行走更远:基于语义的多模态步态识别在远距离条件下的应用

Zhiyang Lu, Wen Jiang, Tianren Wu, Zhichao Wang, Changwang Zhang, Siqi Shen, Ming Cheng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LRGait基准和EMGaitNet框架,通过语义引导融合和跨模态对齐提升远距离步态识别性能,验证了方法的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12722 2026-03-16 cs.CV cs.AI 81%

CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment

CognitionCapturerPro:通过多模态信息和非对称对齐实现从EEG/MEG的高保真视觉解码

Kaifan Zhang, Lihuo He, Junjie Ke, Yuqi Ji, Lukun Wu, Lizi Wang, Xinbo Gao

机构 * Visual Information Processing Laboratory, School of Electronic Engineering, Xidian University(电子科技大学信息处理实验室,电子工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CognitionCapturerPro框架,通过整合EEG与多模态先验信息,提升EEG视觉重建的保真度与检索准确率,改进Top-1和Top-5准确率达25.9%和10.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12721 2026-03-16 cs.CV cs.AI 81%

CMHANet: A Cross-Modal Hybrid Attention Network for Point Cloud Registration

CMHANet:一种用于点云配准的跨模态混合注意力网络

Dongxu Zhang, Yingsen Wang, Yiding Sun, Haoran Xu, Peilin Fan, Jihua Zhu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMHANet,通过融合2D图像与3D点云信息,提升配准鲁棒性,并引入对比学习优化函数,实验表明在3DMatch和3DLoMatch数据集上效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12625 2026-03-16 cs.IR cs.AI cs.CV 81%

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。

Comments 13 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11220 2026-03-13 cs.CV cs.CL 81%

Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models

频率调制的视觉修复用于Matryoshka大多模态模型

Qingtao Pan, Zhihao Dou, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08208 2026-03-10 cs.CV cs.AI 81%

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

具有对齐意识和可靠性门控的多模态融合用于跨异质热视觉传感器的无人机检测

Ishrat Jahan, Molla E Majid, M Murugappan, Muhammad E. H. Chowdhury, N. B. Prakash, Saad Bin Abul Kashem, Balamurugan Balusamy, Amith Khandakar

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出RGIF和RGMAF两种融合策略,通过注册意识和可靠性门控提升跨异质热视觉传感器的无人机检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06986 2026-03-09 cs.CV cs.CL 81%

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

重新思考多模态大语言模型中视觉编码器混合范式以提升视觉理解

Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LEO通过轻量级融合设计提升多模态大语言模型的视觉理解能力,并在自动驾驶领域展现良好泛化性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01592 2026-03-04 cs.CV cs.AI 81%

DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter

DMTrack: 基于双适配器的时空多模态跟踪

Weihong Li, Shaohua Dong, Haonan Lu, Yanhao Zhang, Heng Fan, Libo Zhang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Department of Computer Science and Engineering, University of North Texas(北卡罗来纳州立大学计算机科学与工程系) OPPO AI Center(OPPO人工智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 DMTrack通过双适配器架构实现时空多模态跟踪,利用STMA和PMCA模块提升跨模态融合效果,达到先进性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 81%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03830 2026-02-24 cs.AI cs.CV cs.CY 81%

Decoding Tourist Perception in Historic Urban Quarters with Multimodal Social Media Data: An AI-Based Framework and Evidence from Shanghai

通过多模态社交媒体数据解码历史城市街区的游客感知:一种基于人工智能的框架及上海的实证

Kaizhen Tan, Yufan Wu, Yuxuan Liu, Haoran Zeng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于人工智能的多模态框架,通过分析社交媒体数据解码游客对历史城市街区的感知,揭示感知与现实之间的差距,并为遗产管理和城市设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏