arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-01 至 2026-01-01 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 6 篇

2512.23906 2026-01-01 eess.SP cs.AI cs.CV cs.LG 81%

A multimodal Transformer for InSAR-based ground deformation forecasting with cross-site generalization across Europe

基于InSAR的地面形变预测的多模态Transformer及欧洲跨站点泛化

Wendong Yao, Binhua Huang, Soumyabrata Dev

机构 * The ADAPT SFI Research Centre, Dublin, Ireland(ADAPT SFI研究机构,都柏林,爱尔兰) School of Computer Science, University College Dublin, Belfield, Dublin, Ireland(计算机科学学院,都柏林大学学院,贝尔菲德,都柏林,爱尔兰)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态Transformer模型,用于基于InSAR的地面形变预测,实现欧洲跨站点泛化,提升预测精度和稳定性。

Comments submitted to ISPRS Journal of Photogrammetry and Remote Sensing for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 79%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24023 2026-01-01 cs.CV cs.AI 79%

RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations

RSAgent: 通过多轮工具调用学习推理与行动进行文本引导的分割

Xingqi He, Yujie Zhang, Shuyong Gao, Wenjie Li, Lingyi Hong, Mingxi Chen, Kaixun Jiang, Jiyuan Fu, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) Artificial Intelligence, Fudan University(人工智能,复旦大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RSAgent通过多轮工具调用实现文本引导分割的推理与行动,采用两阶段框架提升分割性能,达到领域内和领域外基准的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24404 2026-01-01 cs.LG cs.CV 57%

Lifting Vision: Ground to Aerial Localization with Reasoning Guided Planning

提升视觉:基于推理引导的地面到空中定位

Soham Pahari, M. Srinivas

机构 * School of Computer Science, UPES(UPES计算机科学学院) Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17821 2026-01-01 cs.RO cs.AI cs.LG 57%

CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems

CAML: 多智能体系统中的协同辅助模态学习

Rui Liu, Yu Shen, Peng Gao, Pratap Tokekar, Ming Lin

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Adobe Research(Adobe 研究院) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 CAML通过多智能体协作和共享多模态数据,提升多模态学习在资源受限环境下的性能,实现事故检测和语义分割的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24645 2026-01-01 cs.SD 50%

AudioFab: Building A General and Intelligent Audio Factory through Tool Learning

通过工具学习构建通用且智能的音频工厂

Cheng Zhu, Jing Han, Qianshuai Xue, Kehan Wang, Huan Zhao, Zixing Zhang

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 AudioFab通过工具学习构建通用智能音频处理框架,提供模块化设计和自然语言接口,提升音频任务的效率和准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏