arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2601.17089 2026-01-27 cs.CV 57%

GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing

GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型

Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen

机构 * School of Computing, Kyung Hee University(京畿大学计算机学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院) College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 GRASP通过引导区域感知的稀疏提示方法,提升多模态大语言模型在遥感图像任务中的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 57%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11931 2026-01-26 cs.CV 57%

Language-Guided and Motion-Aware Gait Representation for Generalizable Recognition

基于语言引导和运动感知的通用识别姿态表示

Zhengxian Wu, Chuanrui Zhang, Shenao Jiang, Hangrui Xu, Zirui Liao, Luyuan Zhang, Huaqiu Li, Peng Jiao, Haoqian Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 LMGait通过引入自然语言描述作为语义先验,结合运动感知模块和时间捕获模块,提升了姿态识别的通用性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00778 2026-01-26 stat.ML cs.AI cs.LG stat.CO stat.ME 57%

Bayesian Joint Additive Factor Models for Multiview Learning

贝叶斯联合加性因子模型用于多视图学习

Niccolo Anceschi, Federico Ferrari, David B. Dunson, Himel Mallick

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出贝叶斯联合加性因子模型用于多视图学习,通过分解共享和视图特定成分提升多模态数据预测性能。

Comments To be published in Biometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14797 2026-01-22 cs.CV 57%

UniRoute: Unified Routing Mixture-of-Experts for Modality-Adaptive Remote Sensing Change Detection

UniRoute: 一种统一的路由混合专家模型用于模态自适应的遥感变化检测

Qingling Shu, Sibao Chen, Wei Lu, Zhihui You, Chengzhuang Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 UniRoute通过统一的路由混合专家框架,实现模态自适应的遥感变化检测,提升异质数据下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV 57%

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13502 2026-01-21 cs.CV 57%

DIS2: Disentanglement Meets Distillation with Classwise Attention for Robust Remote Sensing Segmentation under Missing Modalities

DIS2: 通过类级注意机制实现解耦与蒸馏以在缺失模态下实现鲁棒的遥感分割

Nhi Kieu, Kien Nguyen, Arnold Wiliem, Clinton Fookes, Sridha Sridharan

机构 * Queensland University of Technology(昆士兰理工大学) Shield AI

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DIS2通过类级注意机制实现解耦与蒸馏,以在缺失模态下实现鲁棒的遥感分割。

Comments Accepted to WACV 2026 - Computer Vision for Earth Observation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL 57%

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CL

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12303 2026-01-21 cs.CV 57%

Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations

表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型

Shizhan Gong, Xiaofan Zhang, Qi Dou

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12710 2026-01-21 cs.CV 57%

RIS-FUSION: Rethinking Text-Driven Infrared and Visible Image Fusion from the Perspective of Referring Image Segmentation

RIS-FUSION: 重新思考基于文本的红外和可见图像融合:从指代图像分割的角度

Siju Ma, Changsiyu Gong, Xiaofeng Fan, Yong Ma, Chengjie Jiang

机构 * Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 RIS-FUSION通过联合优化融合与指代图像分割,提升基于文本的红外和可见图像融合性能,实现mIoU指标的显著提升。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07266 2026-01-16 cs.CV 57%

RS2-SAM2: Customized SAM2 for Referring Remote Sensing Image Segmentation

RS2-SAM2:为指向遥感图像分割定制的SAM2

Fu Rong, Meng Lan, Qian Zhang, Lefei Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 RS2-SAM2通过结合遥感特征和文本特征,改进SAM2以实现更精确的遥感图像分割。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09859 2026-01-16 cs.CV cs.LG 57%

Breaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIP

突破开放权重CLIP的限制:一种用于CLIP自监督微调的优化框架

Anant Mehta, Xiyuan Wei, Xingyu Chen, Tianbao Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TuneCLIP通过自监督微调框架提升开放权重CLIP模型在多种下游任务上的性能,实现显著的性能提升。

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09812 2026-01-16 cs.CV cs.RO 57%

LCF3D: A Robust and Real-Time Late-Cascade Fusion Framework for 3D Object Detection in Autonomous Driving

LCF3D: 一种用于自动驾驶中3D物体检测的鲁棒且实时的后期级联融合框架

Carlo Sgaravatti, Riccardo Pieroni, Matteo Corno, Sergio M. Savaresi, Luca Magri, Giacomo Boracchi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LCF3D通过结合RGB图像和LiDAR点云的后期级联融合方法,提升自动驾驶中3D物体检测的鲁棒性和实时性。

Comments 35 pages, 14 figures. Published at Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25677 2026-01-16 cs.CR cs.CL 57%

ZK-SenseLM: Verifiable Large-Model Wireless Sensing with Selective Abstention and Zero-Knowledge Attestation

ZK-SenseLM:基于选择性回避和零知识证明的可验证大模型无线传感

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 ZK-SenseLM通过选择性回避和零知识证明提升无线传感的安全性和可验证性,实现高精度和鲁棒性。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08764 2026-01-14 cs.IR cs.SD eess.AS 57%

FusID: Modality-Fused Semantic IDs for Generative Music Recommendation

FusID: 多模态融合的语义ID用于生成音乐推荐

Haven Kim, Yupeng Hou, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

AI总结 FusID通过多模态融合、表示学习和产品量化技术,解决生成音乐推荐中跨模态交互和ID冲突问题,提升推荐准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08619 2026-01-14 cs.CV 57%

CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion

CtrlFuse: 基于掩码提示的可控红外与可见图像融合

Yiming Sun, Yuan Ruan, Qinghua Hu, Pengfei Zhu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 CtrlFuse通过基于掩码提示的可控融合框架,实现红外与可见图像的交互式动态融合,提升任务性能与融合质量。

Comments 18 pages,22 figures,published to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08336 2026-01-14 cs.CV 57%

Tissue Classification and Whole-Slide Images Analysis via Modeling of the Tumor Microenvironment and Biological Pathways

通过建模肿瘤微环境和生物通路进行组织分类和全片图像分析

Junzhuo Liu, Xuemei Du, Daniel Reisenbuchler, Ye Chen, Markus Eckstein, Christian Matek, Friedrich Feuerhake, Dorit Merhof

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 BioMorphNet通过整合肿瘤微环境和生物通路信息,提升全片图像中组织分类和差异基因分析的准确性。

Comments 19 pages, 8 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06400 2026-01-14 cs.CV 57%

Perceptual Region-Driven Infrared-Visible Co-Fusion for Extreme Scene Enhancement

感知驱动的红外可见联合融合用于极端场景增强

Jing Tao, Yonghong Zong, Banglei Guan, Pengju Sun, Taihang Lei, Yang Shanga, Qifeng Yu

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(航天科学与工程学院,国防科技大学) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室) Beijing Institute of Tracking and Telecommunication Technology(北京跟踪与电信技术研究所) National Key Laboratory of Space Integrated Information System(空间一体化信息系统国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于区域感知的红外可见联合融合框架,通过多曝光和多模态成像技术,在极端条件下提升图像清晰度和融合性能。

Comments The paper has been accepted and officially published by OPTICS AND LASER TECHNOLOGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06282 2026-01-09 cs.CV 57%

From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning

从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测

Shuangzhi Li, Junlong Shen, Lei Ma, Xingyu Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。

Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03526 2026-01-08 cs.CV 57%

Physics-Constrained Cross-Resolution Enhancement Network for Optics-Guided Thermal UAV Image Super-Resolution

具有物理约束的跨分辨率增强网络用于光学引导的热无人机图像超分辨率

Zhicheng Zhao, Fengjiao Peng, Jinquan Yan, Wei Lu, Chenglong Li, Jin Tang

机构 * School of Artificial Intelligence, Anhui University, Hefei, 230601, China(人工智能学院,安徽大学,合肥,230601,中国) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥,230601,中国) School of Computer Science and Technology, Anhui University, Hefei, 230601, China(计算机科学与技术学院,安徽大学,合肥,230601,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PCNet通过物理约束的跨分辨率增强模块和热传导模块,提升光学引导的热无人机图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03747 2026-01-08 cs.LG cs.CL stat.AP 57%

Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series

上下文对齐:在时间序列中激活和增强大语言模型的能力

Yuxiao Hu, Qian Li, Dongxiao Zhang, Jinyue Yan, Yuntian Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出上下文对齐方法,通过多模态输入和图神经网络增强LLMs在时间序列任务中的能力,提升逻辑和结构理解,提高预测性能。

Comments This paper has been accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02315 2026-01-06 cs.CV 57%

Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping

普里提维-互补自适应融合编码器(CAFE):解锁洪水淹没制图的全部潜力

Saurabh Kaushik, Lalit Maurya, Beth Tellman

机构 * Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(可持续性与全球环境中心(SAGE),威斯康星大学麦迪逊分校) Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(波特兰人工智能与数据科学中心(PAIDS),计算学院,波特兰大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 普里提维-互补自适应融合编码器(CAFE)通过融合多通道多模态数据提升洪水制图的分割性能。

Comments Accepted at CV4EO Workshop @ WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02038 2026-01-06 cs.CV 57%

AlignVTOFF: Texture-Spatial Feature Alignment for High-Fidelity Virtual Try-Off

AlignVTOFF: 基于纹理-空间特征对齐的高保真虚拟试穿

Yihan Zhu, Mengying Ge

机构 * Sino-European School of Technology, Shanghai University(上海大学 sino-欧洲技术学院) National Demonstration Center for Experimental Engineering Training Education, Shanghai University(上海大学国家级实验工程培训教育示范中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AlignVTOFF通过纹理-空间特征对齐提升虚拟试穿的高保真生成效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01926 2026-01-06 cs.CV 57%

MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering

MacVQA: 适应性内存分配与全局噪声过滤用于连续视觉问答

Zhifei Li, Yiran Wang, Chenyi Xiong, Yujing Xia, Xiaoju Hou, Yue Zhao, Miao Zhang, Kui Xiao, Bing Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 MacVQA通过适应性内存分配和全局噪声过滤提升持续视觉问答的性能,实现更高的准确率和更低的遗忘率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01925 2026-01-06 cs.CV 57%

AR-MOT: Autoregressive Multi-object Tracking

AR-MOT:自回归多目标跟踪

Lianjie Jia, Yuhan Wu, Binghao Ran, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 AR-MOT通过自回归范式将多目标跟踪建模为序列生成任务,利用灵活的序列构建实现结构化输出,引入物体分词器和区域感知对齐模块,提升多模态和长期跟踪能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01870 2026-01-06 cs.CV 57%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 57%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24284 2026-01-01 cs.RO cs.AI 57%

DRL-TH: Jointly Utilizing Temporal Graph Attention and Hierarchical Fusion for UGV Navigation in Crowded Environments

DRL-TH:联合利用时序图注意力和层次融合用于拥挤环境下的无人地面车辆导航

Ruitong Li, Lin Zhang, Yuenan Zhao, Chengxin Liu, Ran Song, Wei Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 DRL-TH通过结合时序图注意力和层次融合,提升无人地面车辆在拥挤环境中的导航性能和动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏