arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-08 至 2026-01-08 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2509.01217 2026-01-08 eess.IV cs.CV 57%

Learn2Reg 2024: New Benchmark Datasets Driving Progress on New Challenges

Learn2Reg 2024:新基准数据集推动新挑战的进步

Lasse Hansen, Wiebke Heyer, Christoph Großbröhmer, Frederic Madesta, Thilo Sentker, Wang Jiazheng, Yuxi Zhang, Hang Zhang, Min Liu, Junyi Wang, Xi Zhu, Yuhua Li, Liwen Wang, Daniil Morozov, Nazim Haouchine, Joel Honkamaa, Pekka Marttinen, Yichao Zhou, Zuopeng Tan, Zhuoyuan Wang, Yi Wang, Hongchao Zhou, Shunbo Hu, Yi Zhang, Qian Tao, Lukas Förner, Thomas Wendler, Bailiang Jian, Christian Wachinger, Jin Kim, Dan Ruan, Marek Wodzinski, Henning Müller, Tony C. W. Mok, Xi Jia, Jinming Duan, Mikael Brudfors, Seyed-Ahmad Ahmadi, Yunzheng Zhu, William Hsu, Tina Kapur, William M. Wells, Alexandra Golby, Aaron Carass, Harrison Bai, Yihao Liu, Perrine Paul-Gilloteaux, Joakim Lindblad, Nataša Sladoje, Andreas Walter, Junyu Chen, Reuben Dorent, Alessa Hering, Mattias P. Heinrich

机构 * EchoScout GmbH Institute of Medical Informatics(医学信息学研究所) Institute of Applied Medical Informatics(应用医学信息学研究所) Institute of Computational Neuroscience(计算神经科学研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院) Cornell University(康奈尔大学) University of Electronic Science and Technology of China(电子科技大学) Mechanical Engineering Department(机械工程系) Harvard Medical School(哈佛医学院) Technical University of Munich(慕尼黑技术大学) Aalto University(阿德莱德大学) Canon Medical Systems (China) Co., Ltd.(佳能医疗系统(中国)有限公司) Smart Medical Imaging, Learning and Engineering (SMLE) Lab(智能医学影像、学习和工程实验室) School of Information Science and Engineering(信息科学与工程学院) Department of Imaging Physics(影像物理系) Clinical Computational Medical Imaging Research(临床计算医学成像研究) TUM Klinikum Rechts der Isar(慕尼黑工业大学医院) University of California(加州大学) AGH University of Krakow(克拉科夫应用科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 Learn2Reg 2024通过引入新任务和数据集,推动医学图像配准领域在模态多样性和任务复杂性方面的进展。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:034

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2512.23412 2026-01-08 cs.AI 79%

MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning

MindWatcher:迈向更智能的多模态工具集成推理

Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Handong Cui, Chaoqun Du, Li Gong, Feng Gu, Xuefeng Hao, Wei He, Jiabang He, Yi Hu, Bin Huang, Shanshan Li, Qizhen Li, Jing Luo, Zide Liu, Xiaobo Liu, Ning Mao, Lifu Mu, Xuhao Pan, Zhiheng Qu, Chang Ren, Xudong Rao, Haoyi Sun, Qian Wang, Shuai Wang, Zhichao Wang, Wei Wang, Lian Wen, Jiqing Zhan, Hongfu Yang, Sheng Yang, Jiajun Yang, Pengfei Yu, Hongyuan Zhang, Bin Zhang, Chunpeng Zhou, Zheng Zhou, Shucheng Zhou, Shuo Xie, Yun Zhu, Hao Ma, Tao Wei, Pan Zhou, Wei Chen

机构 * Li Auto Inc(力汽车公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 MindWatcher是一种能够自主调用工具并进行多模态推理的智能体,通过高效训练和高质量数据集提升了多步骤决策任务的性能。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03777 2026-01-08 stat.ME cs.SY eess.SY 78%

Multi-agent Optimization of Non-cooperative Multimodal Mobility Systems

非合作多模式移动系统的多智能体优化

Md Nafees Fuad Rafi, Zhaomiao Guo

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出了一种多智能体优化框架,用于分析非合作多模式移动系统中旅行者和司机的市场互动,通过均衡定价平衡供需并优化系统效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22351 2026-01-08 cs.CV cs.AI 73%

VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

VULCAN:工具增强的多智能体用于迭代3D物体排列

Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo

机构 * Stanford University(斯坦福大学) Google(谷歌) New York University(纽约大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VULCAN通过引入MCP API、视觉工具和多智能体框架,提升了3D物体排列任务中MLLMs的视觉接地能力与迭代处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2504.16942 2026-01-08 cs.SI cs.AI cs.CV 62%

S2Vec: Self-Supervised Geospatial Embeddings for the Built Environment

S2Vec: 自监督的建成环境地理嵌入

Shushman Choudhury, Elad Aharoni, Chandrakumari Suvarna, Iveel Tsogsuren, Abdul Rahman Kreidieh, Chun-Ta Lu, Neha Arora

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 S2Vec通过自监督学习生成通用的地理空间嵌入,适用于建成环境特征的表示,并在社会经济任务中表现优异,同时支持多模态融合提升性能。

Journal ref ACM Transactions on Spatial Algorithms and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03490 2026-01-08 cs.CV cs.AI 62%

CroBIM-U: Uncertainty-Driven Referring Remote Sensing Image Segmentation

CroBIM-U: 基于不确定性的遥感图像分割

Yuzhe Sun, Zhe Dong, Haochen Jiang, Tianzhu Liu, Yanfeng Gu

机构 * School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CroBIM-U通过不确定性引导框架提升遥感图像分割的鲁棒性和几何精度,采用不确定性图和即插即用模块实现自适应推理与局部细化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03460 2026-01-08 cs.CV cs.AI 62%

FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder

FROST-Drive: 可扩展且高效的端到端驾驶方法,采用冻结的视觉编码器

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(Sunrise技术公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FROST-Drive通过冻结预训练视觉编码器,结合适配器和解码器,实现高效端到端驾驶,优于全微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03526 2026-01-08 cs.CV 57%

Physics-Constrained Cross-Resolution Enhancement Network for Optics-Guided Thermal UAV Image Super-Resolution

具有物理约束的跨分辨率增强网络用于光学引导的热无人机图像超分辨率

Zhicheng Zhao, Fengjiao Peng, Jinquan Yan, Wei Lu, Chenglong Li, Jin Tang

机构 * School of Artificial Intelligence, Anhui University, Hefei, 230601, China(人工智能学院,安徽大学,合肥,230601,中国) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥,230601,中国) School of Computer Science and Technology, Anhui University, Hefei, 230601, China(计算机科学与技术学院,安徽大学,合肥,230601,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PCNet通过物理约束的跨分辨率增强模块和热传导模块,提升光学引导的热无人机图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03747 2026-01-08 cs.LG cs.CL stat.AP 57%

Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series

上下文对齐:在时间序列中激活和增强大语言模型的能力

Yuxiao Hu, Qian Li, Dongxiao Zhang, Jinyue Yan, Yuntian Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出上下文对齐方法,通过多模态输入和图神经网络增强LLMs在时间序列任务中的能力,提升逻辑和结构理解,提高预测性能。

Comments This paper has been accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 3 篇

2601.03579 2026-01-08 cs.CV 79%

SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization

SpatiaLoc: 借助多级空间增强描述符进行跨模态定位

Tianyi Shang, Pengjie Xu, Zhaojun Deng, Zhenyu Li, Zhicong Chen, Lijun Wu

机构 * Fuzhou University(福州大学) Shandong Academy of Sciences(山东省科学院) Qingdao University(青岛大学) Tongji University(同济大学)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 SpatiaLoc通过多级空间增强描述符提升跨模态定位性能,采用粗到细策略结合贝塞尔曲线和频率域建模,实现更精确的机器人定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14435 2026-01-08 cs.CV cs.LG 79%

MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models

MoTE:混合三元专家用于内存高效的大型多模态模型

Hongyu Wang, Jiayu Xu, Ruiping Wang, Yan Feng, Yitao Zhai, Peng Pei, Xunliang Cai, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MoTE通过训练更多低精度三元专家,实现内存高效的大规模多模态模型训练,提升端任务性能并降低内存需求。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02108 2026-01-08 cs.LG stat.ME stat.ML 50%

Correcting Mode Proportion Bias in Generalized Bayesian Inference via a Weighted Kernel Stein Discrepancy

通过加权核Stein散度纠正通用贝叶斯推断中的模式比例偏差

Elham Afzali, Saman Muthukumarana, Liqun Wang

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出加权KSD方法,用于纠正通用贝叶斯推断中的模式比例偏差,提升多模式后验处理能力。

Comments This version contains errors and ambiguities identified after posting in the formulation and exposition of the weighted Stein discrepancy and its use in generalized Bayesian inference (Sections 3-5). The manuscript is being substantially revised to correct these issues and improve theoretical clarity

详情

展开后加载摘要…

URL PDF HTML 收藏