arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 31 篇

2603.14039 2026-03-17 cs.CV 57%

EyeWorld: A Generative World Model of Ocular State and Dynamics

EyeWorld: 一种眼态与动态的生成世界模型

Ziyu Gao, Xinyuan Wu, Xiaolan Chen, Zhuoran Liu, Ruoyu Chen, Bowen Liu, Bingjie Yan, Zhenhan Wang, Kai Jin, Jiancheng Yang, Yih Chung Tham, Mingguang He, Danli Shi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 57%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17343 2026-03-17 cs.CV cs.HC 57%

Ocular Authentication: Fusion of Gaze and Periocular Modalities

眼认证:融合眼动与周睑模态

Dillon Lohr, Michael J. Proulx, Mehedi Hasan Raju, Oleg V. Komogortsev

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态认证系统,通过融合眼动和周睑图像,在无校准认证系统中提升性能,优于单一模态系统,超越FIDO基准。

Comments Supplementary material is available

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 57%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13787 2026-03-17 cs.CV 57%

Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective

从系统生物学视角出发,通过多层次融合基因组、蛋白质组和病理影像数据以推进癌症预后

Junjie Zhou, Bao Xue, Meiling Wang, Wei Shao, Daoqiang Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HFGPI框架,通过分子编码策略和蛋白质引导超图学习,多层次融合基因组、蛋白质组和病理影像数据,提升癌症预后预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13768 2026-03-17 cs.SD cs.CL 57%

Causal Tracing of Audio-Text Fusion in Large Audio Language Models

大型音频语言模型中音频-文本融合的因果追溯

Wei-Chih Chen, Chien-yu Huang, Hung-yi Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 研究通过因果追溯分析大型音频语言模型在音频理解过程中音频特征与文本上下文的融合机制,揭示不同模型在层间和token级的融合策略及信息瓶颈。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08522 2026-03-17 cs.LG physics.ao-ph 50%

Fuxi-DA: A Generalized Deep Learning Data Assimilation Framework for Assimilating Satellite Observations

Fuxi-DA: 一种通用的深度学习数据同化框架,用于同化卫星观测数据

Xiaoze Xu, Xiuyu Sun, Wei Han, Xiaohui Zhong, Lei Chen, Hao Li

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出Fuxi-DA框架,利用深度学习技术同化卫星观测数据,有效降低分析误差并提升预报性能,通过单观测实验验证其一致性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 12 篇

2603.13978 2026-03-17 cs.CV 83%

When Visual Privacy Protection Meets Multimodal Large Language Models

当视觉隐私保护与多模态大语言模型相遇

Xiaofei Hui, Qian Wu, Haoxuan Qu, Majid Mirmehdi, Hossein Rahmani, Jun Liu

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在提供便利性的同时如何保护视觉隐私,提出基于黑盒模型的优化框架,通过帕累托最优和关键历史增强优化实现隐私与性能的平衡。

Journal ref Int J Comput Vis (IJCV) 134, 167 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25934 2026-03-17 cs.CV 83%

UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression

UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架

Yuan Zhao, Youwei Pang, Lihe Zhang, Hanqi Liu, Jiaming Zuo, Huchuan Lu, Xiaoqi Zhao

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14175 2026-03-17 cs.LG cs.CV 79%

Balancing Multimodal Domain Generalization via Gradient Modulation and Projection

通过梯度调节与投影平衡多模态领域泛化

Hongzhao Li, Guohao Shen, Shupan Li, Mingliang Xu, Muhammad Haris Khan

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GMP方法,通过解耦分类与领域不变目标的梯度,调节模态梯度基于语义和领域置信度,并动态调整梯度投影以平衡多模态领域泛化中的优化不均衡问题。

Comments AAAI 2026 Oral Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01403 2026-03-17 eess.SY cs.SY 78%

Risk Aware Safe Control with Multi-Modal Sensing for Dynamic Obstacle Avoidance

具有多模感知的动态障碍物避让风险感知安全控制

Pei Yu Chang, Qizhe Xu, Vishnu Renganathan, Qadeer Ahmed

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出一种融合概率状态估计与条件风险值控制障碍函数的安全框架,通过 Wasserstein barycenter 结合多模感知数据,提升自动驾驶在动态环境中的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13766 2026-03-17 cs.CV 57%

LHM++: An Efficient Large Human Reconstruction Model for Pose-free Images to 3D

LHM++:一种高效的大型人类重建模型,用于从无姿态图像到3D

Lingteng Qiu, Peihao Li, Heyuan Li, Qi Zuo, Xiaodong Gu, Yuan Dong, Weihao Yuan, Rui Peng, Siyu Zhu, Xiaoguang Han, Guanying Chen, Zilong Dong

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LHM++模型,通过编码器-解码器点图像变换器高效生成高质量可动画3D人像,融合多模态注意力提升效率与视觉真实性。

Comments HomePage: https://lingtengqiu.github.io/LHM++/ Online Demo: https://huggingface.co/spaces/Lingteng/LHMPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12117 2026-03-17 cs.LG cs.AI 57%

KAN-FIF: Spline-Parameterized Lightweight Physics-based Tropical Cyclone Estimation on Meteorological Satellite

KAN-FIF: 基于样条参数化的轻量级物理引导型热带气旋估计方法用于气象卫星

Jiakang Shen, Qinghui Chen, Runtong Wang, Chenrui Xu, Jinglin Zhang, Cong Bai, Feng Zhang

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出KAN-FIF框架,通过整合MLP和CNN层与样条参数化的KAN层,实现轻量级多模态架构,在减少参数量和提升推理速度的同时保持高精度,适用于边缘设备的热带气旋监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03895 2026-03-17 cs.NE 50%

Parameter efficient hybrid spiking-quantum convolutional neural network with surrogate gradient and quantum data-reupload

参数高效混合脉冲-量子卷积神经网络与替代梯度和量子数据重传

Luu Trong Nhan, Luu Trung Duong, Pham Ngoc Nam, Truong Cong Thang

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种参数高效的混合脉冲-量子卷积神经网络,通过统一优化策略实现脉冲神经网络和量子电路的联合训练,无需依赖预训练的脉冲编码器和子集数据集,提高了模型性能和可扩展性。

Comments Work under review

Journal ref PeerJ Computer Science 12 (2026): e3554

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06431 2026-03-17 quant-ph stat.OT 50%

Nonparametric Learning Non-Gaussian Quantum States of Continuous Variable Systems

非参数学习连续变量系统的非高斯量子态

Liubov A. Markovich, Xiaoyu Liu, Jordi Tura

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出非参数核量子态估计方法,用于从噪声数据中重建量子态及其迹特征,适用于多模非高斯态的鲁棒估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22556 2026-03-17 physics.flu-dyn physics.geo-ph 50%

Influence of Fluid Rheology on Fluid Flow in a Natural Fracture Network

流体流变性对自然裂缝网络中流体流动的影响

Cuong Mai Bui, Stephan K. Matthai

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究非牛顿流体在自然裂缝网络中的流动行为,探讨流变性、裂缝几何和流体惯性之间的复杂相互作用,揭示非牛顿流体对裂缝连通性和流动模式的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09677 2026-03-17 cs.LG stat.ML 50%

Boosted GFlowNets: Improving Exploration via Sequential Learning

增强型GFlowNets:通过顺序学习提升探索

Pedro Dall'Antonia, Tiago da Silva, Daniel Augusto de Souza, César Lincoln C. Mattos, Diego Mesquita

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出增强型GFlowNets,通过顺序训练多个模型,补偿已捕捉的奖励,提升探索效率和样本多样性。

Comments 11 pages, 3 figures (22 pages total including supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12015 2026-03-17 physics.chem-ph cs.LG 50%

All-in-one foundational models learning across quantum chemical levels

跨量子化学层级的统一基础模型学习

Yuxinxin Chen, Pavlo O. Dral

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种多模态学习架构,能够学习任意数量的量子化学层级,提供更通用且易用的替代方案,通过训练AIO-ANI-UIP模型,展示了其在有机分子中的泛化能力,同时设计了更准确的Δ-AIO-ANI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13633 2026-03-17 cs.HC 50%

Towards Fluent Interaction with Cyber-Physical Architecture

迈向与物理架构流畅交互的领域

Jesse T. Gonzalez, Neeta Khanuja, Michael Li, Maggie Guo, Layomi Olaitan, Emily Lau, Jennifer Pugh, Alexandra Ion, Scott E. Hudson

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文探讨了人机交互在大规模可变形环境中的设计,通过两项研究揭示了用户需求与自动化与自主性之间的矛盾,以及多模态协作的核心挑战,提出了一种无模态依赖的用户意图演化模型。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏