arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2511.16990 2025-11-24 cs.HC 82%

Senti-iFusion: An Integrity-centered Hierarchical Fusion Framework for Multimodal Sentiment Analysis under Uncertain Modality Missingness

Senti-iFusion: 一种以完整性为中心的多模态情感分析多模态融合框架,用于在不确定模态缺失情况下

Liling Li, Guoyang Xu, Xiongri Shen, Zhifei Xu, Yanbo Zhang, Zhiguo Zhang, Zhenxi Song

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 Senti-iFusion提出了一种以完整性为中心的多模态融合框架,通过分层结构处理模态缺失问题,提升多模态情感分析的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17308 2025-11-24 cs.CV 79%

SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion

SpatialGeo:通过几何-语义融合提升多模态大语言模型的空间推理能力

Jiajie Guo, Qingpeng Zhu, Jin Zeng, Xiaolong Wu, Changyong He, Weida Wang

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SpatialGeo通过几何-语义融合提升多模态大语言模型的空间推理能力,实验表明在空间推理任务中准确率提升8.0%且内存消耗减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16816 2025-11-24 stat.AP stat.CO 71%

Trust-Aware Multimodal Data Fusion for Yield Estimation: A Case Study of the 2020 Beirut Explosion

具有信任意识的多模态数据融合用于产量估计:贝鲁特2020爆炸的案例研究

Lekha Patel, Craig Ulmer, Stephen J. Verzi, Daniel J. Krofcheck, Indu Manickam, Asmeret Naugle, Jaideep Ray

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 本文提出一种基于贝叶斯分数后验框架的多模态数据融合方法,用于估计爆炸产量,通过信任权重校准不同观测数据,提升不确定性量化和抗偏差能力。

Comments 19 pages, 4 figures, supplementary material, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16991 2025-11-24 cs.CV 70%

DReX: Pure Vision Fusion of Self-Supervised and Convolutional Representations for Image Complexity Prediction

DReX:纯视觉融合自监督和卷积表示以预测图像复杂度

Jonathan Skaza, Parsa Madinei, Ziqi Wen, Miguel Eckstein

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 DReX通过融合自监督和卷积表示,实现图像复杂度预测,取得最佳性能并减少参数量。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17358 2025-11-24 cs.CL 57%

Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding

不要学习,而是依托:自然语言推理与视觉依托的案例

Daniil Ignatev, Ayman Santeer, Albert Gatt, Denis Paperno

机构 * Utrecht University(乌特勒支大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种基于视觉依托的零样本自然语言推理方法,通过生成视觉表示并比较与假设的相似度,实现高精度推理,展示了对文本偏见的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10518 2025-11-24 cs.LG 50%

Holographic Knowledge Manifolds: A Novel Pipeline for Continual Learning Without Catastrophic Forgetting in Large Language Models

全息知识流形:一种实现大语言模型持续学习中无灾难性遗忘的新型流程

Justin Arndt

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 全息知识流形通过分形量化等技术实现大语言模型持续学习中零灾难性遗忘,提升知识压缩效率并降低训练成本。

Comments This paper includes significant errors discovered post publication by the author

详情

展开后加载摘要…

URL PDF HTML 收藏