arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 10 篇

2511.20494 2025-12-02 cs.CL 83%

Adversarial Confusion Attack: Disrupting Multimodal Large Language Models

对抗混淆攻击:破坏多模态大语言模型

Jakub Hoscilowicz, Artur Janicki

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出对抗混淆攻击,通过生成扰动破坏多模态大语言模型的可靠性,展示其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00395 2025-12-02 cs.CV 83%

Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction

更优、更强、更快:在基于多模态大语言模型的分割中解决三重困境

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 STAMP通过同时预测文本和分割掩码,解决了多模态大语言模型在保持对话能力、高分割性能和快速推理间的三重困境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00725 2025-12-02 cs.LG 82%

ESMC: MLLM-Based Embedding Selection for Explainable Multiple Clustering

ESMC: 基于多模态大语言模型的可解释多聚类嵌入选择

Xinyue Wang, Yuheng Jia, Hui Liu, Junhui Hou

专题命中 跨模态检索 :MLLM(title,abstract);multi-modal(abstract)

AI总结 ESMC利用多模态大语言模型实现用户驱动的可解释多聚类,通过嵌入选择和伪标签学习提升聚类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17507 2025-12-02 cs.IR 82%

CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling

CART:基于粗到细语义建模的生成式跨模态检索框架

Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

AI总结 CART通过生成式模型和粗到细语义建模提升跨模态检索的效率与性能。

Comments Updated a few baseline metrics based on original publications. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04741 2025-12-02 cs.AI cs.CL cs.HC 81%

Question Answering for Decisionmaking in Green Building Design: A Multimodal Data Reasoning Method Driven by Large Language Models

绿色建筑设计中的决策制定问答:一种由大语言模型驱动的多模态数据推理方法

Yihui Li, Xiaoyue Yan, Hao Zhou, Borong Lin

机构 * School of Architecture(建筑学院) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GreenQA,一种由大语言模型驱动的多模态数据推理方法,用于提升绿色建筑设计决策效率。

Comments Published at Association for Computer Aided Design in Architecture (ACADIA) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 62%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01636 2025-12-02 cs.CV 57%

Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval

联合视觉-语言空间中的生成编辑用于零样本复合图像检索

Xin Wang, Haipeng Zhang, Mang Li, Zhaohui Xia, Yueguo Chen, Yu Zhang, Chunyu Wei

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 Fusion-Diff通过联合视觉-语言空间中的生成编辑策略,实现了高效的零样本复合图像检索,提升了多模态对齐的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01653 2025-12-02 eess.SP cs.LG 50%

Cuffless Blood Pressure Estimation from Six Wearable Sensor Modalities in Multi-Motion-State Scenarios

无袖带血压估计:基于六种可穿戴传感器模态在多运动状态场景中的应用

Yiqiao Chen, Fazheng Xu, Zijian Huang, Juchi He, Zhenghui Feng

机构 * Faculty of Frontier Sciences, Harbin Institute of Technology, Shenzhen(前沿科学学院,哈尔滨工业大学深圳校区) University of Melbourne(墨尔本大学) University of New South Wales(新南威尔士大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出了一种基于六种可穿戴传感器模态的无袖带血压估计框架,通过联合利用ECG、PPG、压力、温度和运动传感器数据,实现多运动状态下的血压准确估计。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06478 2025-12-02 eess.SP 50%

Retrieving Filter Spectra in CNN for Explainable Sleep Stage Classification

在CNN中检索滤波器光谱以实现可解释的睡眠阶段分类

Stephan Goerttler, Yucheng Wang, Fei He, Min Wu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本研究提出了一种在CNN中检索滤波器光谱的工具,用于提高睡眠阶段分类的可解释性,通过分析EEG通道的光谱信息来增强模型性能。

Comments 6 pages, 3 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00379 2025-12-02 q-bio.BM cs.LG 50%

EnzyCLIP: A Cross-Attention Dual Encoder Framework with Contrastive Learning for Predicting Enzyme Kinetic Constants

EnzyCLIP:一种基于对比学习的跨注意力双编码框架,用于预测酶动力学常数

Anas Aziz Khan, Md Shah Fahad, Priyanka, Ramesh Chandra, Guransh Singh

机构 * SCOPE Vellore Institute of Technology(维洛雷理工学院) BIT Department of Computer Science(计算机科学系) Department of Bioengineering and Biotechnology(生物工程与生物技术系)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 EnzyCLIP通过对比学习和跨注意力机制,结合蛋白质序列和底物分子结构预测酶动力学参数,提升Kcat和Km预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏