arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-14 至 2025-11-14 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2511.05534 2025-11-14 cs.CL 88%

FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference

Kunxi Li, Yufan Xiong, Zhonghua Jiang, Yiyun Zhou, Zhaode Wang, Chengfei Lv, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Huazhong Agricultural University(华中农业大学) Alibaba(阿里巴巴)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02034 2025-11-14 cs.CV cs.AI 73%

Abn-BLIP: Abnormality-aligned Bootstrapping Language-Image Pre-training for Pulmonary Embolism Diagnosis and Report Generation from CTPA

Zhusi Zhong, Yuli Wang, Lulu Bi, Zhuoqi Ma, Sun Ho Ahn, Christopher J. Mullin, Colin F. Greineder, Michael K. Atalay, Scott Collins, Grayson L. Baird, Cheng Ting Lin, Webster Stayman, Todd M. Kolb, Ihab Kamel, Harrison X. Bai, Zhicheng Jiao

机构 * Department of Diagnostic Imaging, Brown University Health(布朗大学健康中心诊断影像科) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学院) Department of Biomedical Engineering, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院生物医学工程系) Department of Radiology and Radiological Sciences, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院放射科) Johns Hopkins University Division of Pulmonary and Critical Care Medicine(约翰霍普金斯大学肺科与重症医学科) Department of Radiology, University of Colorado School of Medicine(科罗拉多大学医学院放射科)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10154 2025-11-14 cs.CV cs.AI 62%

GEA: Generation-Enhanced Alignment for Text-to-Image Person Retrieval

Hao Zou, Runqing Zhang, Xue Zhou, Jianxiao Zou

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(自动化工程学院,电子科学与技术大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高级研究学院,电子科学与技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 8pages,3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10020 2025-11-14 cs.CV cs.AI 62%

Anomagic: Crossmodal Prompt-driven Zero-shot Anomaly Generation

Yuxin Jiang, Wei Luo, Hui Zhang, Qiyu Chen, Haiming Yao, Weiming Shen, Yunkang Cao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18638 2025-11-14 cs.CR cs.AI cs.CL 62%

Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation

Daniel Schwartz, Dmitriy Bespalov, Zhe Wang, Ninad Kulkarni, Yanjun Qi

机构 * Amazon Bedrock Science(亚马逊Bedrock科学) Drexel University(德雷塞尔大学) University of Virginia(弗吉尼亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏