arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 12 篇

2601.15906 2026-01-23 cs.CV 88%

Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models

揭开黑箱:多模态基础模型中情感建模的初步洞察

Zhen Zhang, Runhao Zeng, Sicheng Zhao, Xiping Hu

机构 * Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学) Tsinghua University, Beijing, China(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 本研究揭示多模态基础模型中情感建模的关键机制,发现前馈门控投影模块对情感理解和生成至关重要,通过参数高效调整实现高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 84%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04548 2026-01-23 cs.CV 79%

Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model

Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型

Hongyang Wei, Baixin Xu, Hongbo Liu, Size Wu, Jie Liu, Yi Peng, Peiyu Wang, Zexiang Liu, Jingwen He, Yidan Xietian, Chuanxin Tang, Zidong Wang, Yichen Wei, Liang Hu, Boyi Jiang, Wei Li, Ying He, Yang Liu, Xuchen Song, Yangguang Li, Yahui Zhou

机构 * Skywork Multimodality Team(Skywork多模态团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15392 2026-01-23 cs.AI cs.CV cs.LG 76%

GeMM-GAN: A Multimodal Generative Model Conditioned on Histopathology Images and Clinical Descriptions for Gene Expression Profile Generation

GeMM-GAN: 一种基于组织病理图像和临床描述的多模态生成模型,用于基因表达谱生成

Francesca Pia Panaccione, Carlo Sgaravatti, Pietro Pinoli

专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI

AI总结 GeMM-GAN通过结合图像和文本信息生成逼真的基因表达谱,提升疾病预测准确性。

Comments 12 pages, 2 figures. Published at Image Analysis and Processing - ICIAP 2025 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 70%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16007 2026-01-23 cs.CV cs.AI 62%

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试

Chak-Wing Mak, Guanyu Zhu, Boyi Zhang, Hongji Li, Xiaowei Chi, Kevin Zhang, Yichen Wu, Yangfan He, Chun-Kai Fan, Wentao Lu, Kuangzhi Ge, Xinyu Fang, Hongyang He, Kuan Lu, Tianxiang Xu, Li Zhang, Yongxin Ni, Youhua Li, Shanghang Zhang

机构 * Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学) Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15664 2026-01-23 cs.CV cs.AI 62%

Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling

Skywork UniPic 3.0:通过序列建模实现统一的多图像合成

Hongyang Wei, Hongbo Liu, Zidong Wang, Yi Peng, Baixin Xu, Size Wu, Xuying Zhang, Xianglong He, Zexiang Liu, Peiyu Wang, Xuchen Song, Yangguang Li, Yang Liu, Yahui Zhou

机构 * Skywork

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16208 2026-01-23 cs.CV 57%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16024 2026-01-23 cs.CV 57%

PAINT: Pathology-Aware Integrated Next-Scale Transformation for Virtual Immunohistochemistry

PAINT: 用于虚拟免疫组化病理学的路径感知集成下尺度转换

Rongze Ma, Mengkang Lu, Zhenyu Xiang, Yongsheng Pan, Yicheng Wu, Qingjie Zeng, Yong Xia

机构 * School of Computer Science and Engineering, Northwestern Polytechnical University(计算机科学与工程学院,西北工业大学) Monash University(墨尔本大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 PAINT通过结构优先的自回归框架,提升虚拟免疫组化合成的结构保真度和临床应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15729 2026-01-23 cs.RO cs.AI cs.SY eess.SY 57%

DualShield: Safe Model Predictive Diffusion via Reachability Analysis for Interactive Autonomous Driving

DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散

Rui Yang, Lei Zheng, Ruoyu Yao, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15578 2026-01-23 cs.NI cs.AI cs.LG cs.RO 57%

MapViT: A Two-Stage ViT-Based Framework for Real-Time Radio Quality Map Prediction in Dynamic Environments

MapViT:一种基于视觉Transformer的两阶段框架,用于动态环境中实时无线电质量地图预测

Cyril Shih-Huan Hsu, Xi Li, Lanfranco Zanzi, Zhiheng Yang, Chrysa Papagianni, Xavier Costa Pérez

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) NEC Laboratories Europe(NEC欧洲实验室) i2CAT Foundation(i2CAT基金会) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构(ICREA))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 MapViT通过两阶段ViT框架实现实时动态环境中无线信号质量预测,结合预训练和微调方法提升准确性和效率,适用于资源受限的移动机器人场景。

Comments This paper has been accepted for publication at IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08893 2026-01-23 cs.LG cs.CL 57%

Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models

谱生成流模型:一种受物理启发的向量大语言模型替代方案

Andrew Kiruluta

机构 * UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏