arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-24 至 2025-12-24 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2512.20168 2025-12-24 cs.CR cs.AI cs.LG 85%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19716 2025-12-24 cs.LG cs.AI 79%

Development and external validation of a multimodal artificial intelligence mortality prediction model of critically ill patients using multicenter data

基于多模态人工智能的危重患者死亡风险预测模型的开发与外部验证

Behrooz Mamandipoor, Chun-Nan Hsu, Martin Krause, Ulrich H. Schmidt, Rodney A. Gabriel

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究开发了多模态人工智能模型,用于预测危重患者院内死亡风险,并通过外部验证展示了其有效性。

Comments 75 pages (33 main text + references, 35 supplementary materials), 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10229 2025-12-24 cs.LG cs.AI 79%

Adaptive Information Routing for Multimodal Time Series Forecasting

自适应信息路由用于多模态时间序列预测

Jun Seo, Hyeokjun Choe, Seohui Bae, Soyeon Park, Wonbin Ahn, Taeyoon Lim, Junhyeok Kang, Sangjun Han, Jaehoon Lee, Dongwan Kang, Minjae Kim, Sungdong Yoo, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出自适应信息路由框架,通过动态利用文本信息优化时间序列模型,提升多模态预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20595 2025-12-24 cs.CL cs.AI cs.CV 75%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20344 2025-12-24 cs.AI 57%

A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice

基于DeepSeek的AI系统用于临床实践中自动胸部X光解读

Yaowei Bai, Ruiheng Zhang, Yu Lei, Xuhua Duan, Jingfeng Yao, Shuguang Ju, Chaoyang Wang, Wei Yao, Yiwan Guo, Guilin Zhang, Chao Wan, Qian Yuan, Lei Chen, Wenjuan Tang, Biqiang Zhu, Xinggang Wang, Tao Sun, Wei Zhou, Dacheng Tao, Yongchao Xu, Chuansheng Zheng, Huangxuan Zhao, Bo Du

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 基于DeepSeek的AI系统在临床实践中实现自动胸部X光解读,提升诊断可靠性与效率,减少解读时间并获得专家认可。

Comments arXiv admin note: substantial text overlap with arXiv:2507.19493

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 57%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19743 2025-12-24 cs.LG cs.AI cs.CG 57%

From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning

从理论到吞吐量:用于大规模批量3D学习的CUDA优化APML

Sasan Sharifipour, Constantino Álvarez Casado, Manuel Lage Cañellas, Miguel Bordallo López

机构 * Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(机器视觉与信号分析中心(CMVS),奥卢大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 CUDA-APML通过稀疏GPU实现优化大规模批量3D学习的APML,显著降低内存使用并保持模型精度。

Comments 5 pages, 2 figures, 2 tables, 5 formulas, 34 references, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 57%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏