arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2602.05590 2026-02-06 cs.CV cs.ET cs.GR 74%

EgoPoseVR: Spatiotemporal Multi-Modal Reasoning for Egocentric Full-Body Pose in Virtual Reality

EgoPoseVR:用于虚拟现实中的自体空间时间多模态推理以实现中心全身体姿

Haojie Cheng, Shaun Jing Heng Ong, Shaoyu Cai, Aiden Tat Yang Koh, Fuxi Ouyang, Eng Tat Khoo

机构 * National University of Singapore(新加坡国立大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 EgoPoseVR通过融合头戴设备运动信息与中心RGB-D观测,实现了在虚拟现实中的准确全身姿态跟踪,提高了姿态估计的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21479 2026-01-30 cs.CV 74%

Hypernetwork-Based Adaptive Aggregation for Multimodal Multiple-Instance Learning in Predicting Coronary Calcium Debulking

基于超网络的自适应聚合用于多模态多实例学习在预测冠状动脉钙化去除中的应用

Kaito Shiku, Ichika Seo, Tetsuya Matoba, Rissei Hino, Yasuhiro Nakano, Ryoma Bise

机构 * Department of Advanced Information Technology, Kyushu University(九州大学先进信息技术系) Department of Cardiovascular Medicine, Kyushu University(九州大学心血管医学系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出HyperAdAgFormer,通过超网络自适应聚合策略,用于多模态多实例学习预测冠状动脉钙化去除的必要性。

Comments Accepted to ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11139 2026-01-26 cs.LG cs.AI cs.SC 74%

ViSymRe: Vision Multimodal Symbolic Regression

ViSymRe:视觉多模态符号回归

Da Li, Junping Yin, Jin Xu, Xinxin Li, Juan Zhang

机构 * Academy for Advanced Interdisciplinary Studies, Northeast Normal University(先进跨学科研究院,东北师范大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院,北航) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究院) National Key Laboratory of Computational Physics(计算物理国家重点实验室) School of Mathematical Sciences, East China Normal University(数学科学学院,华东师范大学) Shanghai Zhangjiang Institute of Mathematics(上海张江数学研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 ViSymRe通过引入视觉模态提升基于Transformer的符号回归性能,采用多视图随机切片技术解决高维场景下的训练难题,实现高效且稳定的模型收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18457 2026-01-23 cs.LG cs.CV 74%

Radiation-Preserving Selective Imaging for Pediatric Hip Dysplasia: A Cross-Modal Ultrasound-Xray Policy with Limited Labels

辐射保护的儿童髋关节发育不良选择性成像:一种跨模态超声-X射线策略(有限标注)

Duncan Stothers, Ben Stothers, Emily Schaeffer, Kishore Mulpuri

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 本文提出了一种跨模态超声-X光策略,通过有限标注实现儿童髋关节发育不良的可解释测量和选择性成像。

Comments Accepted (with oral presentation) to the AAAI 2026 AI for Medicine and Healthcare Bridge Program Awarded Best Paper Runner-Up at the AAAI 2026 AI for Medicine and Healthcare Bridge Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24866 2026-01-21 cs.CV 74%

TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake Detection

TalkingHeadBench: 一个多模态基准及谈话头深度伪造检测分析

Xinqi Xiong, Prakrut Patel, Qingyuan Fan, Amisha Wadhwa, Sarathy Selvam, Xiao Guo, Luchao Qi, Xiaoming Liu, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 TalkingHeadBench是一个多模态基准,用于评估和分析最先进的谈话头深度伪造检测方法,通过精心设计的协议和数据集提升检测模型的鲁棒性和泛化能力。

Comments WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12256 2026-01-21 cs.AI 74%

Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration

通过关系感知的多模态协作改进大型分子语言模型

Jinyoung Park, Minseong Bae, Jeehye Na, Hyunwoo J. Kim

机构 * Korea University(韩国大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 CoLLaMo通过关系感知的多模态协作机制提升分子语言模型的泛化能力,优化分子模态整合并改进评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03587 2026-01-08 cs.CR cs.AI cs.DB 74%

Deontic Knowledge Graphs for Privacy Compliance in Multimodal Disaster Data Sharing

德性知识图谱用于多模态灾难数据共享中的隐私合规

Kelvin Uzoma Echenim, Karuna Pande Joshi

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出基于德性知识图谱的框架,用于多模态灾难数据共享中的隐私合规,通过整合灾难管理知识图谱和政策知识图谱,实现更灵活的访问控制和合规验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00843 2026-01-06 cs.AI 74%

OmniNeuro: A Multimodal HCI Framework for Explainable BCI Feedback via Generative AI and Sonification

OmniNeuro:一种通过生成式AI和声音化实现可解释BCI反馈的多模态人机交互框架

Ayda Aghaei Nia

机构 * Institute for Artificial Intelligence Researcher(人工智能研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 OmniNeuro通过生成式AI和声音化技术,提供可解释的BCI反馈,提升用户神经可塑性与解码准确性。

Comments 16 pages, 7 figures, 3 tables. Source code and implementation available at: https://github.com/ayda-aghaei/OmniNeuro. Highlights the use of LLMs (Gemini) and Quantum probability formalism for real-time BCI explainability

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV 74%

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16103 2025-12-19 cs.LG cs.AI 74%

AIMM: An AI-Driven Multimodal Framework for Detecting Social-Media-Influenced Stock Market Manipulation

AIMM:一种基于人工智能的多模态框架,用于检测受社交媒体影响的股市操纵

Sandeep Neela

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 AIMM通过融合社交媒体和市场数据,提出了一种人工智能驱动的多模态框架,用于检测社交媒体影响的股市操纵,并展示了其在GME事件中的早期预警能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14489 2025-12-17 cs.CV 74%

SignIT: A Comprehensive Dataset and Multimodal Analysis for Italian Sign Language Recognition

SignIT:一个全面的数据集和多模态分析用于意大利手语识别

Alessia Micieli, Giovanni Maria Farinella, Francesco Ragusa

机构 * Computer Science - University of Catania, Italy(计算机科学 - 卡塔尼亚大学,意大利) Next Vision s.r.l., Spin-off of the University of Catania, Italy(2 Next Vision s.r.l.,卡塔尼亚大学分校,意大利)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 SignIT数据集通过多模态分析提升意大利手语识别的性能研究

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00369 2025-12-01 cs.CV 74%

Automated segmentation of pediatric neuroblastoma on multi-modal MRI: Results of the SPPIN challenge at MICCAI 2023

多模态MRI上儿科神经母细胞瘤自动分割:2023年MICCAI SPPIN挑战赛结果

M. A. D. Buser, D. C. Simons, M. Fitski, M. H. W. A. Wijnen, A. S. Littooij, A. H. ter Brugge, I. N. Vos, M. H. A. Janse, M. de Boer, R. ter Maat, J. Sato, S. Kido, S. Kondo, S. Kasai, M. Wodzinski, H. Muller, J. Ye, J. He, Y. Kirchhoff, M. R. Rokkus, G. Haokai, S. Zitong, M. Fernández Patón, D. Veiga-Canuto, D. G. Ellis, M. R. Aizenberg, B. H. M. van der Velden, H. Kuijf, A. De Luca, A. F. W. van der Steeg

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 SPPIN挑战赛通过多模态MRI自动分割神经母细胞瘤,展示了预训练网络在小数据集中的有效性,但小肿瘤分割仍需改进。

Comments 23 pages, 6 figures

Journal ref Bioengineering, 12(11), 1157 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18842 2025-12-01 cs.CV 74%

Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset

通过大规模多模态数据集增强描述性图像质量评估

Zhiyuan You, Jinjin Gu, Xin Cai, Zheyuan Li, Kaiwen Zhu, Chao Dong, Tianfan Xue

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Sofia University(索菲亚大学) University of Macau(澳门大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 本研究提出DepictQA-Wild模型,通过构建大规模多模态数据集提升图像质量评估的准确性和实用性。

Comments Accepted by TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16711 2025-11-14 cs.RO cs.CV cs.LG 74%

Depth Matters: Multimodal RGB-D Perception for Robust Autonomous Agents

Mihaela-Larisa Clement, Mónika Farsang, Felix Resch, Mihai-Teodor Stanusoiu, Radu Grosu

机构 * CPS, Technische Universität Wien (TU Wien)(CPS,维也纳技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14668 2025-11-05 cs.CV 74%

WeCKD: Weakly-supervised Chained Distillation Network for Efficient Multimodal Medical Imaging

Md. Abdur Rahman, Mohaimenul Azam Khan Raiaan, Sami Azam, Asif Karim, Jemima Beissbarth, Amanda Leach

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Faculty of Science and Technology(科学与技术学院) Child Health Division(儿童健康部)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27094 2025-11-03 cs.AI 74%

CombiGraph-Vis: A Curated Multimodal Olympiad Benchmark for Discrete Mathematical Reasoning

Hamed Mahdavi, Pouria Mahdavinia, Alireza Farhadi, Pegah Mohammadipour, Samira Malek, Majid Daliri, Pedram Mohammadipour, Alireza Hashemi, Amir Khasahmadi, Vasant Honavar

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments Code/data: https://github.com/ref-grader/ref-grader, https://huggingface.co/datasets/combviz/inoi

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18029 2025-10-22 cs.DB cs.AI 74%

DynaQuery: A Self-Adapting Framework for Querying Structured and Multimodal Data

Aymane Hassini

机构 * Al Akhawayn University(阿尔阿克哈文大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments 15 pages, 2 figures, 10 tables. Source code and experimental artifacts are available at: https://github.com/aymanehassini/DynaQuery . The 'DynaQuery-Eval-5K' benchmark, introduced in this work, is also publicly available at: https://www.kaggle.com/datasets/aymanehassini/dynaquery-eval-5k-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10765 2025-10-14 cs.CV 74%

EGD-YOLO: A Lightweight Multimodal Framework for Robust Drone-Bird Discrimination via Ghost-Enhanced YOLOv8n and EMA Attention under Adverse Condition

Sudipto Sarkar, Mohammad Asif Hasan, Khondokar Ashik Shahriar, Fablia Labiba, Nahian Tasnim, Sheikh Anawarul Haq Fattah

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21396 2025-09-29 cs.CV cs.LG 74%

mmHSense: Multi-Modal and Distributed mmWave ISAC Datasets for Human Sensing

Nabeel Nisar Bhat, Maksim Karnaukh, Stein Vandenbroeke, Wouter Lemoine, Jakob Struye, Jesus Omar Lacruz, Siddhartha Kumar, Mohammad Hossein Moghaddam, Joerg Widmer, Rafael Berkvens, Jeroen Famaey

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13542 2025-09-23 cs.MM eess.SP 74%

A multimodal stress detection dataset with facial expressions and physiological signals

Majid Hosseini, Fahad Sohrab, Raju Gottumukkala, Ravi Teja Bhupatiraju, Satya Katragadda, Jenni Raitoharju, Alexandros Iosifidis, Moncef Gabbouj

专题命中 多模态评测 :multimodal(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07994 2025-09-11 eess.IV cs.CV cs.LG 74%

STROKEVISION-BENCH: A Multimodal Video And 2D Pose Benchmark For Tracking Stroke Recovery

David Robinson, Animesh Gupta, Rizwan Quershi, Qiushi Fu, Mubarak Shah

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,佛罗里达中央大学) Mechanical and Aerospace Engineering, University of Central Florida(机械与航空航天工程,佛罗里达中央大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06830 2025-09-09 cs.CV cs.LG 74%

Curia: A Multi-Modal Foundation Model for Radiology

Corentin Dancette, Julien Khlaut, Antoine Saporta, Helene Philippe, Elodie Ferreres, Baptiste Callard, Théo Danielou, Léo Alberge, Léo Machado, Daniel Tordjman, Julie Dupuis, Korentin Le Floch, Jean Du Terrail, Mariam Moshiri, Laurent Dercle, Tom Boeken, Jules Gregory, Maxime Ronot, François Legou, Pascal Roux, Marc Sapoval, Pierre Manceron, Paul Hérent

机构 * Raidium Hôpital Européen Georges Pompidou, AP-HP(欧洲乔治·蓬皮杜医院, AP-HP) Université Paris-Cité(巴黎城市大学) INRIA(法国国家信息与自动化技术研究所) INSERM(法国国家卫生与医学研究中心) Beaujon Hospital(贝琼医院) Medical University of South Carolina(南卡罗来纳医科大学) Columbia University Irving Medical Center(哥伦比亚大学伊万斯医学中心) Centre Cardiologique du Nord(北心脑血管中心)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06351 2025-09-09 cs.CV cs.LG 74%

A Multi-Modal Deep Learning Framework for Colorectal Pathology Diagnosis: Integrating Histological and Colonoscopy Data in a Pilot Study

Krithik Ramesh, Ritvik Koneru

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17290 2025-08-26 cs.AI cs.LG 74%

MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment

Omid Ghahroodi, Arshia Hemmat, Marzia Nouri, Seyed Mohammad Hadi Hosseini, Doratossadat Dastgheib, Mohammad Vali Sanian, Alireza Sahebi, Reihaneh Zohrabi, Mohammad Hossein Rohban, Ehsaneddin Asgari, Mahdieh Soleymani Baghshah

机构 * Computer Engineering Department, Sharif University of Technology, Iran(谢尔盖大学计算机工程系,伊朗) Qatar Computing Research Institute, Qatar(卡塔尔计算研究所,卡塔尔) Computer Engineering Department, University of Isfahan, Iran(伊斯法罕大学计算机工程系,伊朗) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16812 2025-08-26 cs.CV 74%

Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes

Xinhao Xiang, Kuan-Chuan Peng, Suhas Lohit, Michael J. Jones, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments This paper is accepted to BMVC 2025 as an oral paper. The OVAD dataset is available at https://doi.org/10.5281/zenodo.16904069

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10916 2025-08-18 cs.HC cs.AI cs.CY cs.MA 74%

Multimodal Quantitative Measures for Multiparty Behaviour Evaluation

Ojas Shirekar, Wim Pouw, Chenxu Hao, Vrushank Phadnis, Thabo Beeler, Chirag Raman

机构 * TU Delft(代尔夫特理工大学) Tilburg University(蒂尔堡大学) Google(谷歌公司)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03497 2025-08-15 cs.CV 74%

EditGarment: An Instruction-Based Garment Editing Dataset Constructed with Automated MLLM Synthesis and Semantic-Aware Evaluation

Deqiang Yin, Junyi Guo, Huanda Lu, Fangyu Wu, Dongming Lu

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00938 2025-08-14 cs.IR cs.AI cs.DB 74%

WebArXiv: Evaluating Multimodal Agents on Time-Invariant arXiv Tasks

Zihao Sun, Ling Chen

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments 10 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12463 2025-07-17 cs.CV 74%

MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding

Renjie Li, Ruijie Ye, Mingyang Wu, Hao Frank Yang, Zhiwen Fan, Hezhen Hu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Brown University(布朗大学) Johns Hopkins University(约翰霍普金斯大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06972 2025-07-10 cs.CV 74%

A multi-modal dataset for insect biodiversity with imagery and DNA at the trap and individual level

Johanna Orsholm, John Quinto, Hannu Autto, Gaia Banelyte, Nicolas Chazot, Jeremy deWaard, Stephanie deWaard, Arielle Farrell, Brendan Furneaux, Bess Hardwick, Nao Ito, Amlan Kar, Oula Kalttopää, Deirdre Kerdraon, Erik Kristensen, Jaclyn McKeown, Tommi Mononen, Ellen Nein, Hanna Rogers, Tomas Roslin, Paula Schmitz, Jayme Sones, Maija Sujala, Amy Thompson, Evgeny V. Zakharov, Iuliia Zarubiieva, Akshita Gupta, Scott C. Lowe, Graham W. Taylor

机构 * Department of Ecology, Swedish University of Agricultural Sciences(生态系,瑞典农业科学大学) University of Guelph(圭尔夫大学) Vector Institute(向量研究所) University of Helsinki(赫尔辛基大学) Department of Entomology, National Museum of Natural History, Smithsonian Institution(昆虫学系,国家自然历史博物馆,史密松尼研究所) Department of Biological and Environmental Science, University of Jyväskylä(生物与环境科学系,于韦斯屈埃大学) Faculty of Biological and Environmental Sciences, University of Helsinki(生物与环境科学学院,赫尔辛基大学) Centre for Biodiversity Genomics, University of Guelph(生物多样性基因组中心,圭尔夫大学) NVIDIA(NVIDIA公司) University of Toronto(多伦多大学) Kilpisjärvi Biological Station, University of Helsinki(基利皮斯杰里生物学站,赫尔辛基大学) Unit for Field-based Forest Research, Swedish University of Agricultural Sciences(基于现场的森林研究单位,瑞典农业科学大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments 13 pages, 6 figures, submitted to Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏