arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2504.13074 2025-04-22 cs.CV 70%

SkyReels-V2: Infinite-length Film Generative Model

Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, Weiming Xiong, Wei Wang, Nuo Pang, Kang Kang, Zhiheng Xu, Yuzhe Jin, Yupeng Liang, Yubing Song, Peng Zhao, Boyuan Xu, Di Qiu, Debang Li, Zhengcong Fei, Yang Li, Yahui Zhou

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments 31 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10291 2025-04-18 cs.CL cs.AI cs.CV cs.LG cs.MM 70%

Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective

Xiangru Zhu, Penglei Sun, Yaoxian Song, Yanghua Xiao, Zhixu Li, Chengyu Wang, Jun Huang, Bei Yang, Xiaoxiao Xu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08603 2025-04-10 cs.GR cs.CV 70%

Design2GarmentCode: Turning Design Concepts to Tangible Garments Through Program Synthesis

Feng Zhou, Ruiyang Liu, Chen Liu, Gaofeng He, Yong-Lu Li, Xiaogang Jin, Huamin Wang

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06256 2025-04-09 cs.CV 70%

Transfer between Modalities with MetaQueries

Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, Ji Hou, Saining Xie

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://xichenpan.com/metaquery

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01218 2025-04-03 cs.LG cs.CV 70%

Prompting Forgetting: Unlearning in GANs via Textual Guidance

Piyush Nagasubramaniam, Neeraj Karamchandani, Chen Wu, Sencun Zhu

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23715 2025-04-01 cs.CV 70%

HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation

Kun Liu, Qi Liu, Xinchen Liu, Jie Li, Yongdong Zhang, Jiebo Luo, Xiaodong He, Wu Liu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17536 2025-03-25 cs.CV 70%

DermDiff: Generative Diffusion Model for Mitigating Racial Biases in Dermatology Diagnosis

Nusrat Munia, Abdullah-Al-Zubaer Imran

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Paper presented at ADSMI@MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09703 2025-03-25 cs.CV 70%

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Zhiheng Liu, Qifeng Chen, Yujun Shen

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Code and demo available at https://magic-quill.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00895 2025-03-21 cs.CV 70%

Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model

Chenyang Liu, Keyan Chen, Rui Zhao, Zhengxia Zou, Zhenwei Shi

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15264 2025-03-20 cs.CV 70%

LEGION: Learning to Ground and Explain for Synthetic Image Detection

Hengrui Kang, Siwei Wen, Zichen Wen, Junyan Ye, Weijia Li, Peilin Feng, Baichuan Zhou, Bin Wang, Dahua Lin, Linfeng Zhang, Conghui He

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://opendatalab.github.io/LEGION

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15005 2025-03-20 cs.CV 70%

Universal Scene Graph Generation

Shengqiong Wu, Hao Fei, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10831 2025-03-20 cs.CV 70%

Low-Biased General Annotated Dataset Generation

Dengyang Jiang, Haoyu Wang, Lei Zhang, Wei Wei, Guang Dai, Mengmeng Wang, Jingdong Wang, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments CVPR2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09962 2025-03-14 cs.CV 70%

Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification

Jiayu Jiang, Changxing Ding, Wentao Tan, Junhong Wang, Jin Tao, Xiangmin Xu

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://github.com/sssaury/HAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14282 2025-03-12 cs.CV 70%

Image Super-Resolution with Text Prompt Diffusion

Zheng Chen, Yulun Zhang, Jinjin Gu, Xin Yuan, Linghe Kong, Guihai Chen, Xiaokang Yang

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Code is available at https://github.com/zhengchen1999/PromptSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09855 2025-02-18 cs.CV 70%

Text4Seg: Reimagining Image Segmentation as Text Generation

Mengcheng Lan, Chaofeng Chen, Yue Zhou, Jiaxing Xu, Yiping Ke, Xinjiang Wang, Litong Feng, Wayne Zhang

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments ICLR 2025. Project page: https://mc-lan.github.io/Text4Seg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19534 2025-01-23 cs.CV 70%

Locate, Assign, Refine: Taming Customized Promptable Image Inpainting

Yulin Pan, Chaojie Mao, Zeyinzi Jiang, Zhen Han, Jingfeng Zhang, Xiangteng He

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09279 2025-01-17 cs.AI 70%

Text Semantics to Flexible Design: A Residential Layout Generation Method Based on Stable Diffusion Model

Zijin Qiu, Jiepeng Liu, Yi Xia, Hongtuo Qi, Pengkun Liu

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14505 2025-01-16 cs.CV 70%

T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation

Kaiyue Sun, Kaiyi Huang, Xian Liu, Yue Wu, Zihan Xu, Zhenguo Li, Xihui Liu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://t2v-compbench-2025.github.io/ Code: https://github.com/KaiyueSun98/T2V-CompBench/tree/V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05427 2025-01-10 cs.CV 70%

TextToucher: Fine-Grained Text-to-Touch Generation

Jiahang Tu, Hao Fu, Fengyu Yang, Hanbin Zhao, Chao Zhang, Hui Qian

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments This paper has been accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03567 2025-01-09 cs.CV 70%

Evaluating Image Caption via Cycle-consistent Text-to-Image Generation

Tianyu Cui, Jinbin Bai, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Ye Shi

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06322 2024-12-10 cs.CV 70%

LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations

Mingjie Xu, Mengyang Wu, Yuzhi Zhao, Jason Chun Lok Li, Weifeng Ou

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by the WACV 2025, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01343 2024-12-03 cs.CV 70%

MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models

Xiaomin Li, Xu Jia, Qinghe Wang, Haiwen Diao, Mengmeng Ge, Pengxiang Li, You He, Huchuan Lu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024, code will be released in https://github.com/XiaominLi1997/MoTrans

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17323 2024-11-27 cs.CV 70%

InsightEdit: Towards Better Instruction Following for Image Editing

Yingjing Xu, Jie Kong, Jiazhi Wang, Xiao Pan, Bo Lin, Qiang Liu

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14715 2024-11-25 cs.CV 70%

Any-to-3D Generation via Hybrid Diffusion Supervision

Yijun Fan, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13025 2024-11-21 cs.CV 70%

ORID: Organ-Regional Information Driven Framework for Radiology Report Generation

Tiancheng Gu, Kaicheng Yang, Xiang An, Ziyong Feng, Dongnan Liu, Weidong Cai

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 13 pages, 11 figures, WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21708 2024-10-30 cs.CV 70%

Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation

Ruihao Xia, Yu Liang, Peng-Tao Jiang, Hao Zhang, Bo Li, Yang Tang, Pan Zhou

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16364 2024-10-24 cs.CV 70%

Harmonizing Visual Text Comprehension and Generation

Zhen Zhao, Jingqun Tang, Binghong Wu, Chunhui Lin, Shu Wei, Hao Liu, Xin Tan, Zhizhong Zhang, Can Huang, Yuan Xie

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11262 2024-10-04 cs.CV 70%

Generative Visual Instruction Tuning

Jefferson Hernandez, Ruben Villegas, Vicente Ordonez

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Add more results using task tokens, expand the introduction and related work FIX: error in LLM-as-judge evaluation that was over-inflating the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08251 2024-09-13 cs.CV 70%

Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding

Hongyu Li, Tianrui Hui, Zihan Ding, Jing Zhang, Bin Ma, Xiaoming Wei, Jizhong Han, Si Liu

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏