arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2511.17477 2025-11-24 cs.SD cs.AI 79%

Enhancing Quranic Learning: A Multimodal Deep Learning Approach for Arabic Phoneme Recognition

增强《古兰经》学习:一种多模态深度学习方法用于阿拉伯语音素识别

Ayhan Kucukmanisa, Derya Gelmez, Sukru Selim Calik, Zeynep Hilal Kilimci

机构 * Department of Electronics and Communication Engineering, Kocaeli University, 41001, Kocaeli, Turkey(电子与通信工程系,科拉尔大学) Department of Information Systems Engineering, Kocaeli University, 41001, Kocaeli, Turkey(信息系统工程系,科拉尔大学) Maviay Consultancy Company, Kocaeli University Technopark, 41275, Kocaeli, Turkey(Maviay咨询公司,科拉尔大学技术园区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于变压器的多模态框架,结合声学和文本表示,用于阿拉伯语音素误发音检测,通过融合策略提升精度与鲁棒性。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV 79%

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15675 2025-11-24 cs.CV cs.AI 62%

MF-GCN: A Multi-Frequency Graph Convolutional Network for Tri-Modal Depression Detection Using Eye-Tracking, Facial, and Acoustic Features

MF-GCN:一种多频图卷积网络用于利用眼动、面部和音频特征的三模态抑郁检测

Sejuti Rahman, Swakshar Deb, MD. Sameer Iqbal Chowdhury, MD. Jubair Ahmed Sourov, Mohammad Shamsuddin

机构 * Department of Computer Science, New Uzbekistan University, Tashkent, Uzbekistan(计算机科学系,新乌兹别克斯坦大学) Department of Robotics and Mechatronics Engineering, University of Dhaka, Bangladesh(机器人与机电工程系,达卡大学) Department of Electrical and Computer Engineering, University of Virginia, USA(电气与计算机工程系,弗吉尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MF-GCN通过整合眼动、面部和音频多模态数据,利用多频图卷积网络提升抑郁症检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 62%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22300 2025-11-24 cs.CR cs.AI cs.CV 62%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17056 2025-11-24 cs.AI 57%

Patient-level Information Extraction by Consistent Integration of Textual and Tabular Evidence with Bayesian Networks

通过贝叶斯网络一致整合文本和表格证据进行患者层面的信息提取

Paloma Rabaey, Adrick Tench, Stefan Heytens, Thomas Demeester

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出通过整合文本和表格证据,利用贝叶斯网络和神经分类器,提升患者信息提取的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 57%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04079 2025-11-24 cs.CL 57%

Improving the Performance of Radiology Report De-identification with Large-Scale Training and Benchmarking Against Cloud Vendor Methods

通过大规模训练和与云服务提供商方法的基准测试来改进放射学报告去标识化性能

Eva Prakash, Maayane Attias, Pierre Chambon, Justin Xu, Steven Truong, Jean-Benoit Delbrouck, Tessa Cook, Curtis Langlotz

机构 * Stanford University(斯坦福大学) JP Morgan Chase & Co(摩根大通公司) Sorbonne University(索邦大学) University of Oxford(牛津大学) NVIDIA(英伟达) HOPPR University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种基于变压器的去标识化模型,通过大规模训练和与商业系统的基准测试,实现了在放射学报告中更高效的PHI检测性能。

Comments In submission to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏