arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-18 至 2025-12-18 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2512.15261 2025-12-18 cs.CV 83%

MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement

MMMamba: 一种多功能跨模态在上下文融合框架用于全色锐化和零样本图像增强

Yingying Wang, Xuanhua He, Chen Wu, Jialing Huang, Suiyun Zhang, Rui Liu, Xinghao Ding, Haoxuan Che

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MMMamba通过跨模态在上下文融合框架实现全色锐化和零样本图像增强,结合Mamba架构和多模态交错扫描机制,提升跨模态交互能力与计算效率。

Comments \link{Code}{https://github.com/Gracewangyy/MMMamba}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15069 2025-12-18 cs.CV cs.AI 81%

PMMD: A pose-guided multi-view multi-modal diffusion for person generation

PMMD: 一种基于姿态的多视角多模态扩散用于人物生成

Ziyu Shang, Haoran Liu, Rongchao Zhang, Zhiqian Wei, Tongtong Feng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Hong Kong, Hong Kong, China(香港城市大学) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 75%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 多模态生成 :MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14855 2025-12-18 cs.CE cs.AI 57%

A Roadmap for Applying Graph Neural Networks to Numerical Data: Insights from Cementitious Materials

将图神经网络应用于数值数据的路线图:从水泥材料中获得的见解

Mahmuda Sharmin, Taihao Han, Jie Huang, Narayanan Neithalath, Gaurav Sant, Aditya Kumar

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用图神经网络(GNN)设计混凝土,通过K-NN方法将表格数据转化为图表示,并优化参数以实现可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05005 2025-12-18 cs.CV cs.LG cs.RO 57%

Diff-2-in-1: Bridging Generation and Dense Perception with Diffusion Models

Diff-2-in-1:通过扩散模型弥合生成与密集感知的鸿沟

Shuhong Zheng, Zhipeng Bao, Ruoyu Zhao, Martial Hebert, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Diff-2-in-1通过结合扩散模型的生成与感知能力,实现多模态数据生成与密集视觉感知的统一框架,提升视觉感知的判别能力。

Comments 26 pages, 14 figures

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏