arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-11 至 2025-12-11 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2509.20427 2025-12-11 cs.CV 83%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09610 2025-12-11 cs.HC cs.AI cs.CV 81%

ImageTalk: Designing a Multimodal AAC Text Generation System Driven by Image Recognition and Natural Language Generation

ImageTalk: 设计一种由图像识别和自然语言生成驱动的多模态AAC文本生成系统

Boyin Yang, Puming Jiang, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ImageTalk通过图像识别和自然语言生成设计多模态AAC文本生成系统,实现95.6%的按键节省率和高用户满意度。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 70%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 多模态生成 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10287 2025-12-11 cs.SD cs.CV cs.GR eess.AS 62%

MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment

MACS:基于上下文意义和语义对齐的多源音频到图像生成

Hao Zhou, Xiaobao Guo, Yuzhe Zhu, Adams Wai-Kin Kong

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 MACS通过分离多源音频并利用语义对齐提升音频到图像生成的质量和表现。

Comments Accepted at AAAI 2026. Code available at https://github.com/alxzzhou/MACS

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14499 2025-12-11 cs.CL cs.AI cs.LG 62%

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型的全面综述

Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。

Comments Extended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09814 2025-12-11 cs.CV 57%

DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03506 2025-12-11 cs.AI 57%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏