arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-04 至 2025-12-04 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2512.02895 2025-12-04 cs.CV 83%

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

MindGPT-4ov: 一种通过多阶段训练范式增强的多模态大语言模型

Wei Chen, Chaoqun Du, Feng Gu, Wei He, Qizhen Li, Zide Liu, Xuhao Pan, Chang Ren, Xudong Rao, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Yufei Zheng, Chunpeng Zhou, Pan Zhou, Xuhan Zhu

机构 * MindGPT-4o Team(MindGPT-4o 团队) Li Auto Inc.(利汽车公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MindGPT-4ov通过多阶段训练范式提升多模态大语言模型的性能与泛化能力,实现低成本高效率的训练与部署。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09854 2025-12-04 cs.CL cs.AI cs.LG 81%

Scaling Multimodal Search and Recommendation with Small Language Models via Upside-Down Reinforcement Learning

通过倒置强化学习扩展小语言模型以支持多模态搜索与推荐

Yu-Chen Lin, Sanat Sharma, Hari Manikandan, Jayant Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe(Adobe公司) Meta

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过倒置强化学习和合成数据蒸馏,利用小语言模型实现高效多模态搜索与推荐,显著降低推理延迟和内存开销。

Comments Accepted by ICDM 2025 MMSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03125 2025-12-04 cs.LG cs.AI 79%

Mitigating Intra- and Inter-modal Forgetting in Continual Learning of Unified Multimodal Models

缓解统一多模态模型持续学习中的模态内和模态间遗忘

Xiwen Wei, Mustafa Munir, Radu Marculescu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MoDE,通过解耦模态以缓解统一多模态模型中的模态内和模态间遗忘问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03375 2025-12-04 cs.LG 78%

MAGE-ID: A Multimodal Generative Framework for Intrusion Detection Systems

MAGE-ID:一种多模态生成框架用于入侵检测系统

Mahdi Arab Loodaricheh, Mohammad Hossein Manshaei, Anita Raja

机构 * Department of Computer Science, Hunter College and The Graduate Center, City University of New York(计算机科学系,亨特学院和研究生中心,纽约市立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MAGE-ID通过多模态生成框架提升入侵检测系统的数据增强效果,实现更平衡和一致的多模态合成,显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03623 2025-12-04 cs.LG cs.AI physics.ao-ph 70%

The promising potential of vision language models for the generation of textual weather forecasts

视觉语言模型在生成文本天气预报中的巨大潜力

Edward C. C. Steele, Dinesh Mane, Emilio Monti, Luis Orus, Rebecca Chantrill-Cheyette, Matthew Couch, Kirstine I. Dale, Simon Eaton, Govindarajan Rangarajan, Amir Majlesi, Steven Ramsdale, Michael Sharpe, Craig Smith, Jonathan Smith, Rebecca Yates, Holly Ellis, Charles Ewen

机构 * Met Office(英国气象局) Amazon Web Services(亚马逊网络服务) University of East Anglia(东安格利亚大学)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在直接生成文本天气预报中的潜力,通过视频编码的格网天气数据提升气象服务的生产效率与创新。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR 62%

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04082 2025-12-04 cs.CV 57%

PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design

PosterCopilot: 向专业图形设计中的布局推理与可控编辑迈进

Jiazhe Wei, Ken Li, Tianyu Lao, Haofan Wang, Liang Wang, Caifeng Shan, Chenyang Si

机构 * PRLab, Nanjing University(南京大学PRLab) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PosterCopilot通过三阶段训练策略和完整工作流程,实现专业图形设计中布局推理与可控编辑的提升。

Comments Project page: https://postercopilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14206 2025-12-04 cs.LG cs.AI 57%

Challenges and Limitations of Generative AI in Synthesizing Wearable Sensor Data

生成式AI在合成可穿戴传感器数据中的挑战与局限性

Flavio Di Martino, Franca Delmastro

机构 * Institute for Informatics and Telematics of the Nationa Research Council (IIT-CNR)(意大利国家研究 council 信息与电信研究所)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在合成可穿戴传感器数据中的挑战与局限,评估了现有模型在多模态处理、长依赖性和条件生成方面的不足,并提出了未来研究方向以提升生成模型的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03430 2025-12-04 cs.CV 57%

Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features

通过低级预训练扩散特征的光谱FiLM调制实现标签高效的超光谱图像分类

Yuzhen Hu, Biplab Banerjee, Saurabh Prasad

机构 * University of Houston, Texas, USA(德克萨斯大学) Indian Institute of Technology Bombay, Mumbai, India(印度班加罗尔理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于预训练扩散模型的标签高效超光谱图像分类方法,通过光谱FiLM调制融合空间和光谱信息,提升分类性能。

Comments Accepted to the ICML 2025 TerraBytes Workshop (June 9, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03335 2025-12-04 cs.CV cs.LG 57%

Step-by-step Layered Design Generation

逐步分层设计生成

Faizan Farooq Khan, K J Joseph, Koustava Goswami, Mohamed Elhoseiny, Balaji Vasan Srinivasan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出逐步分层设计生成方法,通过分层变化建模设计生成过程,引入新评估套件并验证其有效性。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03073 2025-12-04 cs.CY cs.AI 57%

Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem

开源智能的经济效应:追踪模型生态系统中的权力与参与

Shayne Longpre, Christopher Akiki, Campbell Lund, Atharva Kulkarni, Emily Chen, Irene Solaiman, Avijit Ghosh, Yacine Jernite, Lucie-Aimée Kaffee

机构 * MIT Data Provenance Initiative(MIT数据溯源计划) Data Provenance Initiative(数据溯源计划) ScaDS.AI Leipzig(ScaDS.AI莱比锡) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Hugging Face

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究分析了开放模型经济中权力和参与的变化,揭示了开发者中介者的作用及市场权力的重新分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 57%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03874 2025-12-04 cs.RO cs.LG 50%

OmniDexVLG: Learning Dexterous Grasp Generation from Vision Language Model-Guided Grasp Semantics, Taxonomy and Functional Affordance

OmniDexVLG: 从视觉语言模型引导的抓取语义、分类法和功能可及性中学习灵巧抓取生成

Lei Zhang, Diwen Zheng, Kaixin Bai, Zhenshan Bing, Zoltan-Csaba Marton, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 OmniDexVLG通过多模态语义推理和统一视觉语言模型,实现从自然语言指令中生成多样且语义连贯的灵巧抓取。

Comments Project Website: https://sites.google.com/view/omnidexvlg, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏