arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-16 至 2025-12-16 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2512.12824 2025-12-16 cs.CV cs.AI 88%

Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners

为少样本学习适应多模态基础模型:对比captioners的全面研究

N. K. B. M. P. K. B. Narasinghe, Uthayasanker Thayasivam

机构 * Department of Computer Science and Engineering, University of Moratuwa, Sri Lanka(计算机科学与工程系,穆塔瓦大学,斯里兰卡)

专题命中 跨模态检索 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了如何通过对比captioners适应少样本学习,探讨了参数高效微调策略及生成-对比基础模型的高效适应方法。

Comments 9 pages, 3 figures. Accepted to VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12935 2025-12-16 cs.CV cs.AI cs.IR 81%

Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion

通过级联嵌入-重排序和时间感知得分融合实现统一的交互式多模态时刻检索

Toan Le Ngo Thanh, Phat Ha Huu, Tan Nguyen Dang Duy, Thong Nguyen Le Minh, Anh Nguyen Nhu Tinh

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过级联嵌入-重排序和时间感知得分融合实现统一的多模态时刻检索系统,解决跨模态噪声、时间序列连贯性和模态选择问题。

Comments Accepted at AAAI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02454 2025-12-16 cs.CL cs.AI 81%

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

多模态深度研究员:从零开始生成文本-图表交织报告的代理框架

Zhaorui Yang, Bo Pan, Han Wang, Yiyao Wang, Xingyu Liu, Luoxuan Weng, Yingchaojie Feng, Haozhe Feng, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 多模态深度研究员通过代理框架实现从零开始生成文本-图表交织报告,利用FDV结构化文本表示提升可视化生成质量。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23316 2025-12-16 cs.CV 79%

C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection

C3-OWD: 一种用于开放世界检测的课程跨模态对比学习框架

Siheng Wang, Zhengdao Li, Yanshu Li, Canran Xiao, Haibo Zhan, Zhengtao Yao, Xuzhi Zhang, Jiale Kang, Linshan Li, Weiming Liu, Zhikang Dong, Jifeng Shen, Junhao Dong, Qiang Sun, Piotr Koniusz

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 C3-OWD提出一种课程跨模态对比学习框架,通过预训练和视觉-语言对齐提升目标检测的鲁棒性和泛化能力。

Comments one of the authors doesn't agree any more

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02792 2025-12-16 cs.CV cs.MM 73%

HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval

HUD: 用于组合视频检索的层次不确定性感知网络

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Haokun Wen, Weili Guan

机构 * School of Software Shandong University Jinan China(软件学院 山东大学 济南 中国) School of Data Science City University of Hong Kong Hong Kong China(数据科学学院 香港城市大学 香港 中国) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 HUD通过层次不确定性感知网络提升组合视频检索的多模态查询理解与特征学习精度。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13072 2025-12-16 cs.CV 70%

Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

锻造动态记忆:基于检索的持续学习用于通用医学基础模型

Zizhi Chen, Yizhen Gao, Minghao Han, Yizhou Liu, Zhaoyu Chen, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(Fysics智能技术有限公司(Fysics AI)) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学)

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于检索的持续学习方法,通过动态知识蒸馏和RAG技术,解决多模态医学模型在领域迁移和细粒度特征保留中的核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12309 2025-12-16 cs.CV 57%

WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

WeDetect:快速开放词汇物体检测作为检索

Shenghao Fu, Yukun Su, Fengyun Rao, Jing Lyu, Xiaohua Xie, Wei-Shi Zheng

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 WeDetect通过检索框架实现快速开放词汇物体检测,结合双塔架构和LMMs,提升检测效率和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13102 2025-12-16 cs.CV 57%

CapeNext: Rethinking and Refining Dynamic Support Information for Category-Agnostic Pose Estimation

CapeNext: 重新思考和细化用于类别无关姿态估计的动态支持信息

Yu Zhu, Dan Zeng, Shuiwang Li, Qijun Zhao, Qiaomu Shen, Bo Tang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 CapeNext通过整合层次交叉模态交互与双流特征细化,提升了类别无关姿态估计中动态支持信息的鲁棒性和鉴别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏