arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2602.18055 2026-02-23 cs.LG 67%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02437 2026-02-23 cs.CV cs.AI 62%

UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑

Dianyi Wang, Chaofan Ma, Feng Han, Size Wu, Wei Song, Yibin Wang, Zhixiong Zhang, Tianhang Wang, Siyuan Wang, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Southern California(美国南加州大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14514 2026-02-23 cs.CV 57%

Efficient Text-Guided Convolutional Adapter for the Diffusion Model

高效的文本引导卷积适配器用于扩散模型

Aryan Das, Koushik Biswas, Swalpa Kumar Roy, Badri Narayana Patro, Vinay Kumar Verma

机构 * VIT Bhopal(维特大学博帕尔分校) IIIT Delhi(德里印度理工学院) Tezpur University Assam(泰朱普大学阿萨姆分校) IIT Kanpur(坎普尔印度理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Nexus Prime和Slim适配器,通过文本引导提升扩散模型的结构保持条件生成性能,显著减少参数量并保持高效果。

Comments Accepted in WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18016 2026-02-23 cs.CV 57%

Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating

面向高效精准情感操控的基于大语言模型的有情感视觉定制

Jiamin Luo, Xuqian Gu, Jingjing Wang, Jiahong Lu

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的有情感视觉定制任务,通过高效精准的情感操控方法实现图像主观情感的生成与修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13567 2026-02-23 cs.AI 57%

On the Value of Labeled Data and Symbolic Methods for Hidden Neuron Activation Analysis

关于标记数据和符号方法在隐藏神经元激活分析中的价值

Abhilekha Dalal, Rushrukh Rayan, Adrita Barua, Eugene Y. Vasserman, Md Kamruzzaman Sarker, Pascal Hitzler

机构 * Kansas State University(堪萨斯州立大学) Bowie State University(比弗州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于符号方法和背景知识的可解释人工智能方法,能够为卷积神经网络中的神经元提供有意义的解释,并在定量和定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏