arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2503.13730 2025-03-19 cs.CV cs.CL 62%

TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark

Forouzan Fallah, Maitreya Patel, Agneet Chatterjee, Vlad I. Morariu, Chitta Baral, Yezhou Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21301 2025-03-19 eess.IV cs.AI cs.CV cs.LG 62%

Evaluating the Posterior Sampling Ability of Plug&Play Diffusion Methods in Sparse-View CT

Liam Moroy, Guillaume Bourmaud, Frédéric Champagnat, Jean-François Giovannelli

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12018 2025-03-18 cs.CV cs.AI 62%

Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art

Zhe Jin, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11958 2025-03-18 cs.CV cs.AI cs.LG cs.RO 62%

CHOrD: Generation of Collision-Free, House-Scale, and Organized Digital Twins for 3D Indoor Scenes with Controllable Floor Plans and Optimal Layouts

Chong Su, Yingbin Fu, Zheyuan Hu, Jing Yang, Param Hanji, Shaojun Wang, Xuan Zhao, Cengiz Öztireli, Fangcheng Zhong

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Chong Su and Yingbin Fu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11096 2025-03-17 cs.CV cs.AI cs.HC 62%

Augmenting Image Annotation: A Human-LMM Collaborative Framework for Efficient Object Selection and Label Generation

He Zhang, Xinyi Fu, John M. Carroll

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This paper will appear at ICLR 2025 Workshop on Bidirectional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08280 2025-03-12 cs.CV cs.AI 62%

OminiControl2: Efficient Conditioning for Diffusion Transformers

Zhenxiong Tan, Qiaochu Xue, Xingyi Yang, Songhua Liu, Xinchao Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08269 2025-03-12 cs.CV cs.AI 62%

Adv-CPG: A Customized Portrait Generation Framework with Facial Adversarial Attacks

Junying Wang, Hongyuan Zhang, Yuan Yuan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08014 2025-03-12 cs.CV cs.AI 62%

MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents

Yun Xing, Nhat Chung, Jie Zhang, Yue Cao, Ivor Tsang, Yang Liu, Lei Ma, Qing Guo

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19973 2025-03-11 cs.CV cs.AI 62%

Can Large Language Models Unveil the Mysteries? An Exploration of Their Ability to Unlock Information in Complex Scenarios

Chao Wang, Luning Zhang, Zheng Wang, Yang Zhou

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 11pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15232 2025-03-11 cs.CV cs.CL 62%

DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception

Run Luo, Yunshui Li, Longze Chen, Wanwei He, Ting-En Lin, Ziqiang Liu, Lei Zhang, Zikai Song, Xiaobo Xia, Tongliang Liu, Min Yang, Binyuan Hui

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 25 pages. arXiv admin note: text overlap with arXiv:2401.10208 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13982 2025-03-06 cs.CV cs.AI 62%

Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction

Jordan Vice, Naveed Akhtar, Mubarak Shah, Richard Hartley, Ajmal Mian

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This research is supported by the NISDRG project #20100007, funded by the Australian Government

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17049 2025-03-05 cs.HC cs.CL cs.CY cs.MM 62%

Modular Conversational Agents for Surveys and Interviews

Jiangbo Yu, Jinhua Zhao, Luis Miranda-Moreno, Matthew Korp

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07864 2025-03-04 cs.RO cs.AI cs.CV cs.LG 62%

RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, Jun Zhu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03550 2025-03-03 cs.CV cs.AI cs.LG 62%

DKDM: Data-Free Knowledge Distillation for Diffusion Models with Any Architecture

Qianlong Xiang, Miao Zhang, Yuzhang Shang, Jianlong Wu, Yan Yan, Liqiang Nie

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10676 2025-02-26 cs.SD cs.CV eess.AS 62%

Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation

Peiwen Sun, Sitong Cheng, Xiangtai Li, Zhen Ye, Huadai Liu, Honggang Zhang, Wei Xue, Yike Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、eess.AS

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14887 2025-02-24 cs.CV cs.AI 62%

Vision-Enhanced Time Series Forecasting via Latent Diffusion Models

Weilin Ruan, Siru Zhong, Haomin Wen, Yuxuan Liang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11307 2025-02-18 cs.CV cs.AI 62%

Exploiting Point-Language Models with Dual-Prompts for 3D Anomaly Detection

Jiaxiang Wang, Haote Xu, Xiaolu Chen, Haodi Xu, Yue Huang, Xinghao Ding, Xiaotong Tu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05772 2025-02-11 cs.CV cs.AI 62%

Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails

Yijun Yang, Lichao Wang, Xiao Yang, Lanqing Hong, Jun Zhu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06625 2025-02-11 cs.CV cs.CL cs.LG 62%

ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time

Yi Ding, Bolian Li, Ruqi Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 29pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12784 2025-02-11 cs.CV cs.AI 62%

Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering

Youngsun Lim, Hojun Choi, Hyunjung Shim

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04923 2025-02-10 cs.CV cs.AI 62%

Cached Multi-Lora Composition for Multi-Concept Image Generation

Xiandong Zou, Mingzhu Shen, Christos-Savvas Bouganis, Yiren Zhao

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI

Comments The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03070 2025-02-10 cs.CV cs.AI 62%

A-Bench: Are LMMs Masters at Evaluating AI-generated Images?

Zicheng Zhang, Haoning Wu, Chunyi Li, Yingjie Zhou, Wei Sun, Xiongkuo Min, Zijian Chen, Xiaohong Liu, Weisi Lin, Guangtao Zhai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00992 2025-02-04 cs.CV cs.MM 62%

FCBoost-Net: A Generative Network for Synthesizing Multiple Collocated Outfits via Fashion Compatibility Boosting

Dongliang Zhou, Haijun Zhang, Jianghong Ma, Jicong Fan, Zhao Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

Comments This paper has been accepted for presentation at ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00708 2025-02-04 cs.CV cs.AI 62%

PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation

Qixuan Li, Chao Wang, Zongjin He, Yan Peng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages.8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01705 2025-02-03 cs.CV cs.AI 62%

Long Tail Image Generation Through Feature Space Augmentation and Iterated Learning

Rafael Elberg, Denis Parra, Mircea Petrache

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16778 2025-01-29 cs.CV cs.AI cs.GR cs.LG 62%

FlexMotion: Lightweight, Physics-Aware, and Controllable Human Motion Generation

Arvin Tashakori, Arash Tashakori, Gongbo Yang, Z. Jane Wang, Peyman Servati

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14204 2025-01-27 cs.CV cs.AI 62%

Dynamic Token Reduction during Generation for Vision Language Models

Xiaoyu Liang, Chaofeng Guan, Jiaying Lu, Huiyao Chen, Huan Wang, Haoji Hu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03335 2025-01-15 cs.SD cs.CV cs.LG eess.AS 62%

Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition

Zixuan Wang, Chi-Keung Tang, Yu-Wing Tai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07260 2025-01-14 cs.CV cs.AI 62%

Skip Mamba Diffusion for Monocular 3D Semantic Scene Completion

Li Liang, Naveed Akhtar, Jordan Vice, Xiangrui Kong, Ajmal Saeed Mian

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06394 2025-01-14 cs.SD cs.AI eess.AS 62%

Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation

Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏