arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2507.21524 2026-03-18 cs.AI cs.IT math.IT 57%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15452 2026-03-17 cs.AI 57%

Unlocking the Value of Text: Event-Driven Reasoning and Multi-Level Alignment for Time Series Forecasting

释放文本价值:基于事件驱动推理和多级对齐的时间序列预测

Siyuan Wang, Peng Chen, Yihang Wang, Wanghui Qiu, Chenjuan Guo, Bin Yang, Yang Shu

机构 * East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VoT方法,结合事件驱动推理和多级对齐,利用文本信息提升时间序列预测性能,通过历史上下文学习和自适应频率融合实现文本与数值预测的互补。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14892 2026-03-17 cs.CV 57%

Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs

平衡显著性与覆盖:面向视觉令牌压缩的语义显著性感知预算分配

Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PromPrune框架,通过语义显著性感知预算分配和两阶段选择流程,在视觉令牌压缩中平衡局部显著性保留与全局覆盖,提升性能并减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV 57%

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14086 2026-03-17 cs.CV 57%

Effective Feature Learning for 3D Medical Registration via Domain-Specialized DINO Pretraining

通过领域专用DINO预训练实现有效的3D医学图像特征学习

Eytan Kats, Mattias P. Heinrich

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过领域专用DINO预训练学习3D医学图像密集体积分量特征,提升变形匹配性能,在跨患者腹部注册任务中优于自然图像预训练模型。

Comments Accepted for International Symposium on Biomedical Imaging 2026 (ISBI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14039 2026-03-17 cs.CV 57%

EyeWorld: A Generative World Model of Ocular State and Dynamics

EyeWorld: 一种眼态与动态的生成世界模型

Ziyu Gao, Xinyuan Wu, Xiaolan Chen, Zhuoran Liu, Ruoyu Chen, Bowen Liu, Bingjie Yan, Zhenhan Wang, Kai Jin, Jiancheng Yang, Yih Chung Tham, Mingguang He, Danli Shi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 57%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17343 2026-03-17 cs.CV cs.HC 57%

Ocular Authentication: Fusion of Gaze and Periocular Modalities

眼认证:融合眼动与周睑模态

Dillon Lohr, Michael J. Proulx, Mehedi Hasan Raju, Oleg V. Komogortsev

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态认证系统,通过融合眼动和周睑图像,在无校准认证系统中提升性能,优于单一模态系统,超越FIDO基准。

Comments Supplementary material is available

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 57%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13787 2026-03-17 cs.CV 57%

Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective

从系统生物学视角出发,通过多层次融合基因组、蛋白质组和病理影像数据以推进癌症预后

Junjie Zhou, Bao Xue, Meiling Wang, Wei Shao, Daoqiang Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HFGPI框架,通过分子编码策略和蛋白质引导超图学习,多层次融合基因组、蛋白质组和病理影像数据,提升癌症预后预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13768 2026-03-17 cs.SD cs.CL 57%

Causal Tracing of Audio-Text Fusion in Large Audio Language Models

大型音频语言模型中音频-文本融合的因果追溯

Wei-Chih Chen, Chien-yu Huang, Hung-yi Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 研究通过因果追溯分析大型音频语言模型在音频理解过程中音频特征与文本上下文的融合机制,揭示不同模型在层间和token级的融合策略及信息瓶颈。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 57%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12701 2026-03-16 cs.HC cs.AI 57%

Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human-AI Collaboration

彼此相视:通过共享第一人称视角实现人机协作中的认知对齐

Zhuyu Teng, Pei Chen, Yichen Cai, Ruoqing Lu, Zhaoqu Jiang, Jiayang Li, Weitao You, Lingyun Sun

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Eye2Eye框架,通过共享第一人称视角实现人机认知对齐,解决沟通和理解鸿沟问题,实验表明其能提升协作效率和信任度。

Comments 19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11617 2026-03-13 cs.CV 57%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09480 2026-03-12 cs.CV 57%

Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity

剪枝冗余,保留本质:通过协同重要性-多样性压缩视觉语言模型中的视觉标记

Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PruneSID通过协同重要性-多样性方法有效压缩视觉语言模型中的视觉标记,实现高精度与高效能的平衡。

Comments accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10872 2026-03-12 cs.CV 57%

Bilevel Layer-Positioning LoRA for Real Image Dehazing

双层层位定位LoRA用于真实图像去雾

Yan Zhang, Long Ma, Yuxin Feng, Zhe Huang, Fan Zhou, Zhuo Su

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) National Engineering Research Center of Digital Life(数字生活国家工程研究中心) Dalian University of Technology(大连理工大学) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出双层层位定位LoRA方法,通过文本引导损失和自动层搜索提升真实图像去雾的适应性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10360 2026-03-12 cs.CV 57%

One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

一个token,两种命运:通过视觉token操控构建统一框架以对抗大语言模型幻觉

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Yinghuan Shi

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

AI总结 通过视觉token操控构建统一框架,有效减少大语言模型幻觉,提升POPE准确性2%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08937 2026-03-12 cs.GR cs.CV cs.LG eess.IV stat.ML 57%

Rethinking Few-Shot Image Fusion: Granular Ball Priors Enable General-Purpose Deep Fusion

重新思考少样本图像融合:粒度球先验使通用深度融合成为可能

Minjie Deng, Yan Wei, An Wu, Yuncan Ouyang, Hao Zhai, Qianyao Peng

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 57%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09702 2026-03-11 cs.CV 57%

TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR

TriFusion-SR:联合三模态医学图像融合与超分辨率

Fayaz Ali Dharejo, Sharif S. M. A., Aiman Khalil, Nachiket Chaudhary, Rizwan Ali Naqvi, Radu Timofte

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TriFusion-SR通过联合三模态医学图像融合与超分辨率技术,利用小波引导的条件扩散框架实现频率感知的跨模态交互,提升图像质量和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 57%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09149 2026-03-11 cs.CV 57%

RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation

RTFDNet:用于鲁棒RGB-T分割的融合-解耦

Kunyu Tan, Mingjian Liang

机构 * independent researchers(独立研究人员)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 RTFDNet通过融合与解耦机制提升RGB-T分割的鲁棒性,采用三分支编码器-解码器结构,结合协同特征融合、跨模态解耦正则化和区域解耦正则化,实现高效独立推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 57%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07895 2026-03-10 cs.CV 57%

MINT: Molecularly Informed Training with Spatial Transcriptomics Supervision for Pathology Foundation Models

MINT: 通过空间转录组监督进行病理基础模型的分子引导训练

Minsoo Lee, Jonghyun Kim, Juseung Yun, Sunwoo Yu, Jongseong Jang

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 MINT通过整合空间转录组监督提升病理基础模型的分子信息捕捉能力,实现基因表达预测和病理任务的性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04989 2026-03-10 cs.CV 57%

TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪

Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07272 2026-03-10 cs.AI 57%

VisualDeltas: Learning Preferences from Visual Quality Perturbations

VisualDeltas: 从视觉质量扰动中学习偏好

Hailiang Huang, Yihao Liu, Shengyue Guan, Haoze Li, Sujian Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 VisualDeltas通过利用视觉质量变化影响视觉感知,无需人工标注即可学习偏好,提升多模态数据的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 57%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06925 2026-03-10 cs.CV 57%

Small Target Detection Based on Mask-Enhanced Attention Fusion of Visible and Infrared Remote Sensing Images

基于可见与红外遥感图像的掩码增强注意力融合的小目标检测

Qianqian Zhang, Xiaolong Jia, Ahmed M. Abdelmoniem, Li Zhou, Junshe An

机构 * National Space Science Center, Chinese Academy of Sciences(中国科学院国家空间科学中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文学与空间科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ESM-YOLO+,通过掩码增强注意力融合和结构表示增强方法,实现可见与红外图像中小目标的高效检测,提升检测精度并降低模型复杂度。

Comments The manuscript has been submitted to the journal and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏