arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2404.08990 2024-04-16 cs.CV cs.AI cs.RO 76%

A Fourier-enhanced multi-modal 3D small object optical mark recognition and positioning method for percutaneous abdominal puncture surgical navigation

Zezhao Guo, Yanzhong Guo, Zhanfang Zhao

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

Comments 19 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03836 2024-04-08 cs.CV cs.AI 76%

PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model

Amrin Kareem, Jean Lahoud, Hisham Cholakkal

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17040 2023-12-29 cs.CV cs.AI cs.LG 76%

AI Powered Road Network Prediction with Multi-Modal Data

Necip Enes Gengec, Ergin Tari, Ulas Bagci

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12424 2023-12-13 cs.CV cs.CL 76%

VisoGender: A dataset for benchmarking gender bias in image-text pronoun resolution

Siobhan Mackenzie Hall, Fernanda Gonçalves Abrantes, Hanwen Zhu, Grace Sodunke, Aleksandar Shtedritski, Hannah Rose Kirk

专题命中 多模态评测 :image-text(title);分类 cs.CV、cs.CL

Comments NeurIPS Datasets and Benchmarks 2023. Data and code available at https://github.com/oxai/visogender

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12995 2023-10-23 cs.CV cs.AI 76%

Comprehensive Multimodal Segmentation in Medical Imaging: Combining YOLOv8 with SAM and HQ-SAM Models

Sumit Pandey, Kuan-Fu Chen, Erik B. Dam

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08613 2023-09-19 cs.IR cs.AI cs.CL cs.LG 76%

Multimodal Recommender Systems in the Prediction of Disease Comorbidity

Aashish Cheruvu

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

Comments 2022 Fourth International Conference on Transdisciplinary AI (TransAI)

Journal ref Fourth International Conference on Transdisciplinary AI (TransAI), Laguna Hills, CA, USA, 2022, pp. 79-82

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14889 2023-07-28 cs.CV cs.AI 76%

Weakly Supervised Multi-Modal 3D Human Body Pose Estimation for Autonomous Driving

Peter Bauer, Arij Bouazizi, Ulrich Kressel, Fabian B. Flohr

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

Comments 7 pages, Accepted at IEEE-IV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14264 2023-06-27 cs.CV cs.CL cs.LG 76%

Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck

Jayesh Songara, Shivam Pande, Shabnam Choudhury, Biplab Banerjee, Rajbabu Velmurugan

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04361 2023-03-09 cs.CL cs.CV 76%

Sample Efficient Multimodal Semantic Augmentation for Incremental Summarization

Sumanta Bhattacharyya, Ramesh Manuvinakurike, Sahisnu Mazumder, Saurav Sahay

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10080 2022-11-15 q-bio.QM cs.AI cs.CL cs.IR cs.LG 76%

Multi-modal Protein Knowledge Graph Construction and Applications

Siyuan Cheng, Xiaozhuan Liang, Zhen Bi, Huajun Chen, Ningyu Zhang

专题命中 多模态评测 :multi-modal(title);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2023 (Student Abstract). Dataset available in https://zjunlp.github.io/project/ProteinKG65/

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12522 2022-10-11 cs.CV cs.CL 76%

Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset

Ashish V. Thapliyal, Jordi Pont-Tuset, Xi Chen, Radu Soricut

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13156 2022-09-28 cs.CV cs.AI 76%

Towards Multimodal Multitask Scene Understanding Models for Indoor Mobile Agents

Yao-Hung Hubert Tsai, Hanlin Goh, Ali Farhadi, Jian Zhang

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

Comments Submitted to ICRA2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.03030 2022-08-08 cs.CL cs.CV 76%

ChiQA: A Large Scale Image-based Real-World Question Answering Dataset for Multi-Modal Understanding

Bingning Wang, Feiyang Lv, Ting Yao, Yiming Yuan, Jin Ma, Yu Luo, Haijin Liang

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.CL

Comments CIKM2022 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13403 2022-07-12 cs.CV cs.CL cs.LG 76%

A Multimodal German Dataset for Automatic Lip Reading Systems and Transfer Learning

Gerald Schwiebert, Cornelius Weber, Leyuan Qu, Henrique Siqueira, Stefan Wermter

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

Comments Accepted to LREC 2022

Journal ref Proceedings of the 13th Conference on Language Resources and Evaluation (LREC 2022), pages 6829-6836

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.12377 2021-08-02 cs.CV cs.CL cs.LG 76%

Multimodal Attention Networks for Low-Level Vision-and-Language Navigation

Federico Landi, Lorenzo Baraldi, Marcella Cornia, Massimiliano Corsini, Rita Cucchiara

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

Comments Computer Vision and Image Understanding (CVIU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13042 2021-05-13 cs.CL cs.AI cs.SI 76%

Multi-modal Identification of State-Sponsored Propaganda on Social Media

Xiaobo Guo, Soroush Vosoughi

专题命中 多模态评测 :multi-modal(title);分类 cs.CL、cs.AI

Comments Proceedings of the 25th International Conference on Pattern Recognition (ICPR 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02636 2021-05-07 cs.CV cs.MM 76%

Estimating Presentation Competence using Multimodal Nonverbal Behavioral Cues

Ömer Sümer, Cigdem Beyan, Fabian Ruth, Olaf Kramer, Ulrich Trautwein, Enkelejda Kasneci

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.12404 2021-02-01 cs.CV cs.AI eess.IV physics.med-ph 76%

Multi-Threshold Attention U-Net (MTAU) based Model for Multimodal Brain Tumor Segmentation in MRI scans

Navchetan Awasthi, Rohit Pardasani, Swati Gupta

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.09667 2020-12-18 cs.CV cs.AI 76%

Multi-Modal Depth Estimation Using Convolutional Neural Networks

Sadique Adnan Siddiqui, Axel Vierling, Karsten Berns

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

Comments submitted to IEEE International Symposium on Safety, Security, and Rescue Robotics (SSRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.13769 2020-09-01 cs.HC cs.AI cs.MM 76%

Vyaktitv: A Multimodal Peer-to-Peer Hindi Conversations based Dataset for Personality Assessment

Shahid Nawaz Khan, Maitree Leekha, Jainendra Shukla, Rajiv Ratn Shah

专题命中 多模态评测 :multimodal(title);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.10915 2020-05-25 cs.CV cs.CL cs.LG 76%

Team Neuro at SemEval-2020 Task 8: Multi-Modal Fine Grain Emotion Classification of Memes using Multitask Learning

Sourya Dipta Das, Soumil Mandal

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.CL

Comments Proceedings of the International Workshop on Semantic Evaluation (SemEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.02805 2019-06-05 cs.CL cs.CV 76%

Faithful Multimodal Explanation for Visual Question Answering

Jialin Wu, Raymond J. Mooney

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

Comments In ACL 2019 BlackboxNLP workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.01010 2019-01-15 cs.CL cs.AI cs.DL 76%

A Joint Model for Multimodal Document Quality Assessment

Aili Shen, Bahar Salehi, Timothy Baldwin, Jianzhong Qi

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24129 2026-06-24 cs.AI 新提交 76%

OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility

OmniPath: 用于审计轮椅可达性的多模态智能体框架

ASM Mobarak Hossain, Nadim Mahmud, Vaskar Raychoudhury, Md Osman Gani

机构 * Causal AI Lab, Department of Information Systems, University of Maryland Baltimore County(因果AI实验室,信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science & Software Engineering, Miami University(计算机科学与软件工程系,迈阿密大学)

专题命中 多模态评测 :multi-modal(title,comments);分类 cs.AI

AI总结 提出OmniPath框架,融合OSM网络拓扑与机载LiDAR数据,通过虚拟遍历量化坡度、横坡等物理摩擦点,按ADA标准分级评估轮椅可达性,经实地验证有效识别标准地图遗漏的障碍。

Comments 10 pages, 13 figures. Submitted to IEEE COMPSAC 2026. OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08255 2024-06-13 cs.CL 76%

M3T: A New Benchmark Dataset for Multi-Modal Document-Level Machine Translation

Benjamin Hsu, Xiaoyu Liu, Huayang Li, Yoshinari Fujinuma, Maria Nadejde, Xing Niu, Yair Kittenplon, Ron Litman, Raghavendra Pappagari

专题命中 多模态评测 :multi-modal(title,comments);分类 cs.CL

Comments NAACL 2024, dataset at https://github.com/amazon-science/m3t-multi-modal-translation-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14728 2026-08-21 cs.MM cs.CL cs.CV cs.CY 版本更新 75%

Mitigating GenAI-Powered Evidence Pollution for Out-Of-Context Misinformation Detection

缓解生成式人工智能(GenAI)驱动的证据污染以检测脱离上下文的虚假信息

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 该研究针对GenAI污染证据削弱OOC多模态虚假信息检测的问题,提出跨模态证据重排序与声明-证据推理策略,在基准数据集上验证了其对现有检测器鲁棒性的提升效果。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 75%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 75%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 75%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 75%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏