arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-05 至 2026-01-05 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2505.02586 2026-01-05 cs.CV 83%

RGBX-DiffusionDet: A Framework for Multi-Modal RGB-X Object Detection Using DiffusionDet

RGBX-DiffusionDet: 一种利用DiffusionDet进行多模态RGB-X目标检测的框架

Eliraz Orfaig, Inna Stainvas, Igal Bilik

机构 * School of Electrical and Computer Engineering, Ben Gurion University of the Negev, Beer Sheva, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 RGBX-DiffusionDet通过自适应多模态编码器融合RGB与X数据,提升多模态目标检测性能,实现高效且紧凑的特征嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00519 2026-01-05 cs.LG 78%

A Sparse-Attention Deep Learning Model Integrating Heterogeneous Multimodal Features for Parkinson's Disease Severity Profiling

一种整合异构多模态特征的稀疏注意力深度学习模型用于帕金森病严重程度评估

Dristi Datta, Tanmoy Debnath, Minh Chau, Manoranjan Paul, Gourab Adhikary, Md Geaur Rahman

机构 * School of Computing, Mathematics, and Engineering, Charles Sturt University(计算、数学与工程学院,查尔斯·斯特劳特大学) School of Dentistry and Medical Sciences, Charles Sturt University(牙科学院与医学科学学院,查尔斯·斯特劳特大学) AI and Cyber Futures Centre (AICF)(人工智能与未来技术中心(AICF)) Hawkins Clinic General Medical Practice(霍金斯诊所普通医疗实践)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种整合异构多模态特征的稀疏注意力深度学习模型,用于提高帕金森病严重程度评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00478 2026-01-05 q-fin.RM q-fin.CP 78%

Multimodal Insights into Credit Risk Modelling: Integrating Climate and Text Data for Default Prediction

多模态视角下的信用风险建模:整合气候与文本数据用于违约预测

Zongxiao Wu, Ran Liu, Jiang Dai, Dan Luo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出多模态框架整合气候与文本数据,通过LSTM、GRU和Transformer模型提升信用违约预测精度,发现物理气候风险,特别是内涝,是关键影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 77%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00626 2026-01-05 cs.CV cs.LG 57%

HyperPriv-EPN: Hypergraph Learning with Privileged Knowledge for Ependymoma Prognosis

HyperPriv-EPN: 基于超图学习的特权知识用于室管膜瘤预后预测

Shuren Gabriel Yu, Sikang Ren, Yongji Tian

机构 * School of Software, Tsinghua University(清华大学软件学院) Beijing Tiantan Hospital(北京天坛医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 HyperPriv-EPN通过基于超图的学习利用特权信息框架,利用术后数据提升术前室管膜瘤预后预测的准确性和生存分层能力。

Comments 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00561 2026-01-05 cs.CV 57%

AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Mulitmodal Models

AEGIS:探索统一多模态模型世界知识能力的极限

Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu

机构 * University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 AEGIS通过多任务基准测试和确定性检查表评估,揭示统一多模态模型在世界知识推理中的不足,并指出简化推理模块可缓解其缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00277 2026-01-05 q-bio.QM cs.AI 57%

Benchmarking Preprocessing and Integration Methods in Single-Cell Genomics

单细胞组学中预处理和整合方法的基准测试

Ali Anaissi, Seid Miad Zandavi, Weidong Huang, Junaid Akram, Basem Suleiman, Ali Braytee, Jie Hua

机构 * University of Technology Sydney, Australia(悉尼科技大学) University of Sydney, Australia(悉尼大学) Broad Institute, United States(Broad研究所) University of New South Wales, Australia(新南威尔士大学) Shaoyang University, China(韶阳大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究评估了单细胞数据预处理和整合方法的性能,发现Seurat和Harmony在整合效果上表现优异,Harmony在大数据集处理上更高效,UMAP是与整合技术最兼容的降维方法。

Comments The 23rd Australasian Data Science and Machine Learning Conference (AusDM'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 57%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03958 2026-01-05 cs.RO 50%

MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation

MDE-AgriVLN: 农业视觉与语言导航与单目深度估计

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 MDE-AgriVLN通过单目深度估计提升农业机器人视觉与语言导航性能,提高成功率并降低导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏