arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2603.10360 2026-03-12 cs.CV 57%

One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

一个token,两种命运:通过视觉token操控构建统一框架以对抗大语言模型幻觉

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Yinghuan Shi

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

AI总结 通过视觉token操控构建统一框架,有效减少大语言模型幻觉,提升POPE准确性2%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08937 2026-03-12 cs.GR cs.CV cs.LG eess.IV stat.ML 57%

Rethinking Few-Shot Image Fusion: Granular Ball Priors Enable General-Purpose Deep Fusion

重新思考少样本图像融合:粒度球先验使通用深度融合成为可能

Minjie Deng, Yan Wei, An Wu, Yuncan Ouyang, Hao Zhai, Qianyao Peng

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 57%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09702 2026-03-11 cs.CV 57%

TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR

TriFusion-SR:联合三模态医学图像融合与超分辨率

Fayaz Ali Dharejo, Sharif S. M. A., Aiman Khalil, Nachiket Chaudhary, Rizwan Ali Naqvi, Radu Timofte

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TriFusion-SR通过联合三模态医学图像融合与超分辨率技术,利用小波引导的条件扩散框架实现频率感知的跨模态交互,提升图像质量和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 57%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09149 2026-03-11 cs.CV 57%

RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation

RTFDNet:用于鲁棒RGB-T分割的融合-解耦

Kunyu Tan, Mingjian Liang

机构 * independent researchers(独立研究人员)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 RTFDNet通过融合与解耦机制提升RGB-T分割的鲁棒性,采用三分支编码器-解码器结构,结合协同特征融合、跨模态解耦正则化和区域解耦正则化,实现高效独立推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 57%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07895 2026-03-10 cs.CV 57%

MINT: Molecularly Informed Training with Spatial Transcriptomics Supervision for Pathology Foundation Models

MINT: 通过空间转录组监督进行病理基础模型的分子引导训练

Minsoo Lee, Jonghyun Kim, Juseung Yun, Sunwoo Yu, Jongseong Jang

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 MINT通过整合空间转录组监督提升病理基础模型的分子信息捕捉能力,实现基因表达预测和病理任务的性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04989 2026-03-10 cs.CV 57%

TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪

Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07272 2026-03-10 cs.AI 57%

VisualDeltas: Learning Preferences from Visual Quality Perturbations

VisualDeltas: 从视觉质量扰动中学习偏好

Hailiang Huang, Yihao Liu, Shengyue Guan, Haoze Li, Sujian Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 VisualDeltas通过利用视觉质量变化影响视觉感知,无需人工标注即可学习偏好,提升多模态数据的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 57%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06925 2026-03-10 cs.CV 57%

Small Target Detection Based on Mask-Enhanced Attention Fusion of Visible and Infrared Remote Sensing Images

基于可见与红外遥感图像的掩码增强注意力融合的小目标检测

Qianqian Zhang, Xiaolong Jia, Ahmed M. Abdelmoniem, Li Zhou, Junshe An

机构 * National Space Science Center, Chinese Academy of Sciences(中国科学院国家空间科学中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文学与空间科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ESM-YOLO+,通过掩码增强注意力融合和结构表示增强方法,实现可见与红外图像中小目标的高效检测,提升检测精度并降低模型复杂度。

Comments The manuscript has been submitted to the journal and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06531 2026-03-09 cs.CV cs.RO 57%

Spatial Calibration of Diffuse LiDARs

扩散式时间飞行激光雷达的空间校准

Nikhil Behari, Ramesh Raskar

机构 * MIT(麻省理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种扩散式时间飞行激光雷达的空间校准方法,通过恢复每像素响应图实现激光雷达与 RGB 的跨模态对齐与融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06081 2026-03-09 cs.CV 57%

Lyapunov Probes for Hallucination Detection in Large Foundation Models

Lyapunov探针用于大型基础模型中的幻觉检测

Bozhi Luan, Gen Li, Yalan Qin, Jifeng Guo, Yun Zhou, Faguo Wu, Hongwei Zheng, Wenjun Wu, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) School of Electronic and Information Engineering, State Key Laboratory of CNS/ATM, Beihang University(电子与信息工程学院, CNS/ATM 国家重点实验室,北航) National Key Laboratory of Information Systems Engineering, National University of Defense Technology(信息系统工程国家重点实验室,国防科技大学) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Shanghai University(上海大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 通过Lyapunov探针检测大型基础模型中的幻觉,利用动力系统稳定性理论分析知识过渡区域的边界特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 57%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22091 2026-03-06 cs.CV 57%

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练

Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan

机构 * Applied Intuition Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06515 2026-03-06 cs.CV 57%

RESAR-BEV: An Explainable Progressive Residual Autoregressive Approach for Camera-Radar Fusion in BEV Segmentation

RESAR-BEV:一种可解释的逐步残差自回归方法用于摄像头-雷达融合的鸟瞰图分割

Zhiwen Zeng, Yunfei Yin, Zheng Yuan, Argho Dey, Xianjian Bao

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, Maharishi University of Management(Maharishi大学管理学院计算机系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 RESAR-BEV通过残差自回归学习和双路径特征编码,实现摄像头-雷达融合的鸟瞰图分割,取得7类驾驶场景54.0% mIoU的最优性能并保持实时处理能力。

Comments This work was submitted to IEEE Transactions on Intelligent Transportation Systems (T-ITS) on 09-May-2025; revised 5 October 2025 and 26 January 2026; accepted 1 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03969 2026-03-05 cs.CV 57%

Scaling Dense Event-Stream Pretraining from Visual Foundation Models

从视觉基础模型扩展密集事件流预训练

Zhiwen Chen, Junhui Hou, Zhiyu Zhu, Jinjian Wu, Guangming Shi

机构 * City University of Hong Kong(香港城市大学) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于视觉基础模型的自监督预训练方法,通过结构感知的蒸馏损失优化密集事件表示,显著提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02924 2026-03-04 cs.CV 57%

HDINO: A Concise and Efficient Open-Vocabulary Detector

HDINO:一种简洁且高效的开放词汇检测器

Hao Zhang, Yiqun Wang, Qinran Lin, Runze Fan, Yong Li

机构 * Chongqing University(重庆大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 HDINO提出了一种简洁高效的开放词汇检测方法,通过两阶段训练策略和轻量级特征融合模块,在无需人工数据编纂的情况下实现了优于现有方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02522 2026-03-04 cs.CV 57%

NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining

NeighborMAE: 利用邻近遥感图像间的空间依赖性在掩码自编码器预训练中进行建模

Liang Zeng, Valerio Marsocci, Wufan Zhao, Andrea Nascetti, Maarten Vergauwen

机构 * KU Leuven(卢森堡大学) ESA Φ \Phi -lab(欧洲航天局Φ实验室) HKUST(GZ)(香港科技大学(珠海)) KTH(皇家理工学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 NeighborMAE通过联合重建邻近遥感图像,利用空间依赖性提升掩码自编码器在遥感图像预训练中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01725 2026-03-03 cs.CV 57%

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

学习多领域任务提示表示以实现多领域一体化图像修复

Guanglu Dong, Chunlei Li, Chao Ren, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * Sichuan University(四川大学) MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出DATPRL-IR,通过多领域任务提示表示学习实现多领域一体化图像修复,优于现有方法并具备强泛化能力

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01135 2026-03-03 cs.AI 57%

FCN-LLM: Empower LLM for Brain Functional Connectivity Network Understanding via Graph-level Multi-task Instruction Tuning

FCN-LLM: 通过图级多任务指令微调赋能LLM理解脑功能连接网络

Xingcan Hu, Wei Wang, Li Xiao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 FCN-LLM通过图级多任务指令微调使LLM理解脑功能连接网络,提升其在临床任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02742 2026-03-03 cs.LG cs.AI 57%

Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding

熵引导的动态令牌用于分子理解中的图-语言模型对齐

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Sun, Boyu Wang, Pingzhao Hu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 EDT-Former通过熵引导的动态令牌生成,在无需微调LLM主干的情况下实现图编码器与LLM的对齐,提升分子图理解的效率和泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16953 2026-03-03 cs.CV 57%

Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations

面向无遮蔽标注的零样本遮蔽物分割

Cheng Lei, Jie Fan, Xinran Li, Tianzhu Xiang, Ao Li, Ce Zhu, Le Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Space42

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种无需遮蔽标注的零样本遮蔽物分割框架,通过结合MIM、M-LLM和MFA机制,实现高效分割与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00793 2026-03-03 cs.CV 57%

Neural Functional Alignment Space: Brain-Referenced Representation of Artificial Neural Networks

神经功能对齐空间:人工神经网络的脑参考表示

Ruiyu Yan, Hanqi Jiang, Yi Pan, Xiaobo Li, Tianming Liu, Xi Jiang, Lin Zhao

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) The Clinical Hospital of Chengdu Brain Science Institute, MOE Key Laboratory for NeuroInformation,School of Life Science and Technology, University of Electronic Science and Technology of China(成都脑科学研究所临床医院,国家神经信息重点实验室,电子科技大学生命科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出神经功能对齐空间,通过建模神经网络的动态表示,揭示了在脑参考空间中的结构化组织,包括模态特定聚类和跨模态收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00609 2026-03-03 cs.CV 57%

Linking Modality Isolation in Heterogeneous Collaborative Perception

异构协作感知中的模态隔离问题

Changxing Liu, Zichen Chao, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CodeAlign通过跨模态特征-代码-特征翻译有效解决异构协作感知中的模态隔离问题,显著降低训练参数和通信负载,提升感知性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19534 2026-03-03 cs.RO cs.AI 57%

Large Language Model-Assisted UAV Operations and Communications: A Multifaceted Survey and Tutorial

大型语言模型辅助的无人机操作与通信:多方面的综述与教程

Yousef Emami, Hao Zhou, Radha Reddy, Atefeh Hajijamali Arani, Biliang Wang, Kai Li, Luis Almeida, Zhu Han

机构 * IEEE

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型在无人机操作与通信中的应用,探讨了LLMs在提升UAV智能方面的多方面技术与未来研究方向。

Comments 40 pages, 10 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15663 2026-03-03 cs.CV 57%

MSSPlace: Multi-Sensor Place Recognition with Visual and Text Semantics

MSSPlace: 多传感器位置识别与视觉和文本语义

Alexander Melekhin, Dmitry Yudin, Ilia Petryashin, Vitaly Bezuglyj

机构 * Intelligent Transport Laboratory, Moscow Institute of Physics and Technology(智能交通实验室,莫斯科物理技术学院) Artificial Intelligence Research Institute (AIRI)(人工智能研究机构(AIRI))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 MSSPlace通过整合多传感器数据和视觉文本语义,提升位置识别性能,达到最先进的效果。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏