arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2506.08477 2026-01-29 cs.CL 57%

Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection

读取即可见:引导单模LLM进行低资源可解释有害迷因检测

Fengjun Pan, Xiaobao Wu, Tho Quan, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Ho Chi Minh City University of Technology(胡志明市技术大学) VinUniversity(文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 U-CoT+通过轻量级单模LLM和高保真迷因到文本管道,实现低资源、可解释的有害迷因检测,有效提升模型灵活性和适应性。

Comments Accepted to ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2601.20676 2026-01-29 cs.CL 79%

Efficient Multimodal Planning Agent for Visual Question-Answering

高效的多模态规划代理用于视觉问答

Zhuo Chen, Xinyu Geng, Xinyu Wang, Yong Jiang, Zhen Zhang, Pengjun Xie, Kewei Tu

机构 * ShanghaiTech University(上海科技大学) Alibaba Tongyi Lab(阿里云通义实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种高效的多模态规划代理,通过动态分解mRAG流程,提升视觉问答任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 75%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA 67%

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20831 2026-01-29 cs.AI cs.RO 57%

MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents

MemCtrl: 使用 MLLMs 作为具身智能体的主动内存控制器

Vishnu Sashank Dorbala, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MemCtrl 通过使用 MLLMs 的可训练内存头 μ 实现在线内存修剪,提升具身智能体在复杂指令下的任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 57%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13251 2026-01-29 cs.AI cond-mat.mtrl-sci 57%

"DIVE" into Hydrogen Storage Materials Discovery with AI Agents

深入探索氢储存材料发现的AI智能体

Di Zhang, Xue Jia, Tran Ba Hung, Seong Hoon Jang, Linda Zhang, Ryuhei Sato, Yusuke Hashimoto, Toyoto Sato, Kiyoe Konno, Shin-ichi Orimo, Hao Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 DIVE通过多智能体工作流提升氢储存材料数据提取效率,实现快速逆向设计。

Comments 23 pages, 5 figures. The supplementary video is available at the GitHub link provided in the manuscript

Journal ref Chemical Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2511.20258 2026-01-29 cs.CV cs.LG 83%

Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization

模态平衡的协同蒸馏用于多模态领域泛化

Xiaohan Wang, Zhangtao Cheng, Ting Zhong, Leiting Chen, Fan Zhou

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MBCD框架,通过自适应模态丢弃、梯度一致性约束和跨模态蒸馏,解决多模态领域泛化中模态不平衡问题,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20305 2026-01-29 cs.AI 79%

Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models

内生再提示:面向统一多模态模型的自进化认知对齐

Zhenchen Tang, Songlin Yang, Zichuan Wang, Bo Peng, Yang Li, Beibei Dong, Jing Dong

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 内生再提示通过自进化框架提升统一多模态模型的认知对齐能力,有效解决生成过程引导问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 79%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19908 2026-01-29 cs.AR cs.LG 78%

CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference

基于芯片组的异构近内存加速用于边缘多模态大语言模型推理

Yanru Chen, Runyang Tian, Yue Pan, Zheyu Li, Weihong Xu, Tajana Rosing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04655 2026-01-29 cs.CV cs.AI 73%

X-SAM: From Segment Anything to Any Segmentation

X-SAM:从Segment Anything到Any Segmentation

Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, Xiaodan Liang

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 X-SAM通过引入统一框架和VGD分割任务,提升多模态大语言模型的像素级视觉理解能力,实现更广泛的分割任务整合。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20742 2026-01-29 cs.CV 70%

Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification

压缩揭示智能:视觉编码、视觉令牌技术与统一

Xin Jin, Jinming Liu, Yuntao Wei, Junyan Lin, Zhicheng Wang, Jianguo Huang, Xudong Yang, Yanxiao Liu, Wenjun Zeng

机构 * Eastern Institute of Technology, Ningbo(宁波东部技术研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文探讨了视觉编码与视觉令牌技术的统一,揭示压缩效率与模型性能的权衡,并预测了下一代视觉编解码器和令牌技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20168 2026-01-29 cs.CV 70%

Efficient Token Pruning for LLaDA-V

LLaDA-V的高效令牌修剪

Zhewen Wan, Tianchen Song, Chen Lin, Zhiyong Zhao, Xianpeng Lang

机构 * Li Auto Inc.(利自动公司) SJTU(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种针对LLaDA-V的结构化令牌修剪方法,通过在中层到后期层移除部分视觉令牌,减少计算开销并保持95%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12603 2026-01-29 cs.CV cs.AI cs.CL 67%

Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space

在暗中推理:在潜在空间中交织的视觉-文本推理

Chao Chen, Zhixin Ma, Yongqi Li, Yupeng Hu, Yinwei Wei, Wenjie Li, Liqiang Nie

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡管理学院) Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出IVT-LR方法,通过在潜在空间中交织视觉和文本信息,提升多模态推理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03461 2026-01-29 eess.IV cs.CV 57%

Evaluating the Predictive Value of Preoperative MRI for Erectile Dysfunction Following Radical Prostatectomy

术前MRI对根治性前列腺切除术后勃起功能障碍预测价值的评估

Gideon N. L. Rouwendaal, Daniël Boeke, Inge L. Cox, Henk G. van der Poel, Margriet C. van Dijk-de Haan, Regina G. H. Beets-Tan, Thierry N. Boellaard, Wilson Silva

机构 * University of Amsterdam(阿姆斯特丹大学) Antoni van Leeuwenhoek-Netherlands Cancer Institute(安托尼·范·列文霍克-荷兰癌症研究所) Department of Urology(泌尿科部) AI Technology for Life(人工智能技术生命) Utrecht University(乌特勒支大学) GROW School for Oncology and Developmental Biology(GROW肿瘤学与发育生物学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究评估了术前MRI对根治性前列腺切除术后勃起功能障碍预测价值,发现MRI模型在某些方面略优于传统方法,但未超越临床特征。

Comments 13 pages, 5 figures, 2 tables. Accepted at PRedictive Intelligence in MEdicine workshop @ MICCAI 2025 (PRIME-MICCAI). This is the submitted manuscript with added link to github repo, funding acknowledgements and authors' names and affiliations. No further post submission improvements or corrections were integrated. Final version not published yet

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2506.04207 2026-01-29 cs.LG cs.AI cs.CL cs.CV 85%

Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning

推动多模态推理:从优化冷启动到分阶段强化学习

Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Soochow University(苏州大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ReVisual-R1,通过优化冷启动和分阶段强化学习提升多模态推理能力,在多个挑战性基准测试中取得新突破。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏