arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2601.02204 2026-01-06 cs.CV cs.AI 81%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01363 2026-01-06 cs.AI 79%

A unified multimodal understanding and generation model for cross-disciplinary scientific research

面向跨学科科学研究的统一多模态理解和生成模型

Xiaomeng Yang, Zhiyu Tan, Xiaohui Zhong, Mengping Yang, Qiusheng Huang, Lei Chen, Libo Wu, Hao Li

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 FuXi-Uni是一种统一多模态模型,能跨学科领域理解和生成科学数据,通过自然语言和科学数值预测提升跨学科研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG 78%

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01792 2026-01-06 cs.LG cs.AI cs.CL cs.SD 73%

HyperCLOVA X 8B Omni

HyperCLOVA X 8B Omni:首个支持文本、音频和视觉的任何到任何多模态模型

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI

AI总结 HyperCLOVA X 8B Omni是首个支持文本、音频和视觉的任何到任何多模态模型,通过统一的多模态处理实现高效且灵活的多模态交互。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 57%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17984 2026-01-06 cs.CV 57%

RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model

RS-vHeat:基于热传导的高效远程传感基础模型

Huiyang Hu, Peijin Wang, Hanbo Bi, Boyuan Tong, Zhaozhi Wang, Wenhui Diao, Hao Chang, Yingchao Feng, Ziqi Zhang, Yaowei Wang, Qixiang Ye, Kun Fu, Xian Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-vHeat通过热传导运算符和自监督策略,实现高效多模态遥感基础模型,提升效率和性能。

Comments 19 pages, 8 figures and 10 tables

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01507 2026-01-06 cs.CV 57%

DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation

DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测

Tao Li, Qing Li, Na Li, Hui Xie

机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01181 2026-01-06 cs.CV 57%

GenCAMO: Scene-Graph Contextual Decoupling for Environment-aware and Mask-free Camouflage Image-Dense Annotation Generation

GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成

Chenglizhao Chen, Shaojiang Yuan, Xiaoxue Lu, Mengke Song, Jia Song, Zhenyu Wu, Wenfeng Song, Shuai Li

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Southwest Jiaotong University(西南交通大学) Beijing Information Science and Technology University(北京信息科技大学) Beihang University(北航)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14681 2026-01-06 eess.IV cs.CV 57%

Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model

使用标记条件扩散模型进行虚拟多标记染色

Hyun-Jic Oh, Junsik Kim, Zhiyi Shi, Yichen Wu, Yu-An Chen, Peter K Sorger, Hanspeter Pfister, Won-Ki Jeong

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02043 2026-01-06 cs.CV 57%

Conditional Diffusion Model with Anatomical-Dose Dual Constraints for End-to-End Multi-Tumor Dose Prediction

具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测

Hui Xie, Haiqin Hu, Lijuan Ding, Qing Li, Yue Sun, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) Affiliated Hospital of Xiangnan University(湘南大学附属医院) Jiangxi Cancer Hospital(江西省肿瘤医院) Chenzhou Third People's Hospital(郴州第三人民医院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏