arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2511.18780 2025-11-27 cs.CV cs.AI 84%

ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection

ConceptGuard:通过多模态风险检测实现文本-图像到视频生成的主动安全

Ruize Ma, Minghong Cai, Yilei Jiang, Jiaming Han, Yi Feng, Yingshui Tan, Xiaoyong Zhu, Bo Zhang, Bo Zheng, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) Future Lab, Alibaba Group(阿里巴巴集团未来实验室) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 ConceptGuard通过多模态风险检测实现文本-图像到视频生成的主动安全,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21691 2025-11-27 cs.CV 79%

Canvas-to-Image: Compositional Image Generation with Multimodal Controls

画布到图像:利用多模态控制的组合图像生成

Yusuf Dalva, Guocheng Gordon Qian, Maya Goldenberg, Tsai-Shien Chen, Kfir Aberman, Sergey Tulyakov, Pinar Yanardag, Kuan-Chieh Jackson Wang

机构 * Snap Inc. UC Merced(加州大学默塞德分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Canvas-to-Image通过统一框架整合多模态控制,提升图像生成的组合性和控制精度。

Comments 24 pages; webpage: https://snap-research.github.io/canvas-to-image/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21129 2025-11-27 cs.CV cs.GR 79%

CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion

通过统一多模态视频扩散实现可控视频生成

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Jialun Liu, Hao Pan, Yuchi Huo, Rui Wang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 CtrlVDiff通过统一多模态视频扩散模型,实现可控视频生成,支持多模态输入并提升生成的可控性和保真度。

Comments 27 pages, 18 figures, 9 tables. Project page: https://tele-ai.github.io/CtrlVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09298 2025-11-27 cs.CV cs.AI 62%

DensiCrafter: Physically-Constrained Generation and Fabrication of Self-Supporting Hollow Structures

DensiCrafter: 基于物理约束的自支撑空心结构生成与制造

Shengqi Dang, Fu Chai, Jiaxin Li, Chao Yuan, Wei Ye, Nan Cao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DensiCrafter通过优化密度场生成轻量自支撑空心结构,结合物理约束和预训练模型,提升3D打印稳定性与几何保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10382 2025-11-27 cs.CV 57%

Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models

迈向空间一致的图像生成:将内在场景属性纳入扩散模型

Hyundo Lee, Suhyung Choi, Inwoo Hwang, Byoung-Tak Zhang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种基于内在场景属性的图像生成方法,通过同时生成图像和其内在属性,提升生成图像的空间一致性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏