arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2501.01973 2025-01-10 cs.CV cs.AI cs.CY 62%

INFELM: In-depth Fairness Evaluation of Large Text-To-Image Models

Di Jin, Xing Liu, Yu Liu, Jia Qing Yap, Andrea Wong, Adriana Crespo, Qi Lin, Zhiyuan Yin, Qiang Yan, Ryan Ye

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Di Jin and Xing Liu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02552 2025-01-07 cs.CL cs.CV 62%

Multi-LLM Collaborative Caption Generation in Scientific Documents

Jaeyoung Kim, Jongho Lee, Hong-Jun Choi, Ting-Yao Hsu, Chieh-Yang Huang, Sungchul Kim, Ryan Rossi, Tong Yu, Clyde Lee Giles, Ting-Hao 'Kenneth' Huang, Sungchul Choi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to AAAI 2025 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12198 2025-01-07 cs.CV cs.AI 62%

CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis

Yifan Xie, Jingge Wang, Tao Feng, Fei Ma, Yang Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01109 2025-01-03 cs.CV cs.AI 62%

BatStyler: Advancing Multi-category Style Generation for Source-free Domain Generalization

Xiusheng Xu, Lei Qi, Jingyang Zhou, Xin Geng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18150 2024-12-30 cs.CV cs.AI 62%

EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation

Shuhao Han, Haotian Fan, Jiachen Fu, Liang Li, Tao Li, Junhui Cui, Yunqiu Wang, Yang Tai, Jingwei Sun, Chunle Guo, Chongyi Li

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16839 2024-12-25 cs.CV cs.AI 62%

Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets

Changjian Chen, Fei Lv, Yalong Guan, Pengcheng Wang, Shengjie Yu, Yifan Zhang, Zhuo Tang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by TVCG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16364 2024-12-24 cs.CV cs.CL 62%

A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation

Shijie Zhou, Ruiyi Zhang, Yufan Zhou, Changyou Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12129 2024-12-18 cs.LG cs.AI cs.CV 62%

SceneDiffuser: Efficient and Controllable Driving Simulation Initialization and Rollout

Chiyu Max Jiang, Yijing Bai, Andre Cornman, Christopher Davis, Xiukun Huang, Hong Jeon, Sakshum Kulshrestha, John Lambert, Shuangyu Li, Xuanyu Zhou, Carlos Fuertes, Chang Yuan, Mingxing Tan, Yin Zhou, Dragomir Anguelov

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11196 2024-12-17 cs.CL cs.CV 62%

Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal

Yuhao Wang, Zhiyuan Zhu, Heyang Liu, Yusheng Liao, Hongcheng Liu, Yanfeng Wang, Yu Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10958 2024-12-17 cs.MM cs.CR cs.CV eess.IV 62%

Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending

Yongyang Pan, Xiaohong Liu, Siqi Luo, Yi Xin, Xiao Guo, Xiaoming Liu, Xiongkuo Min, Guangtao Zhai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10429 2024-12-17 cs.CV cs.AI 62%

GPTDrawer: Enhancing Visual Synthesis through ChatGPT

Kun Li, Xinwei Chen, Tianyou Song, Hansong Zhang, Wenzhe Zhang, Qing Shan

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09656 2024-12-16 cs.CV cs.AI 62%

From Noise to Nuance: Advances in Deep Generative Image Models

Benji Peng, Chia Xin Liang, Ziqian Bi, Ming Liu, Yichao Zhang, Tianyang Wang, Keyu Chen, Xinyuan Song, Pohsun Feng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06742 2024-12-11 cs.CV cs.AI 62%

ContRail: A Framework for Realistic Railway Image Synthesis using ControlNet

Andrei-Robert Alexandrescu, Razvan-Gabriel Petec, Alexandru Manole, Laura-Silvia Diosan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06643 2024-12-10 cs.CV cs.AI 62%

Detecting Facial Image Manipulations with Multi-Layer CNN Models

Alejandro Marco Montejano, Angela Sanchez Perez, Javier Barrachina, David Ortiz-Perez, Manuel Benavent-Lledo, Jose Garcia-Rodriguez

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17572 2024-12-10 cs.CV cs.AI 62%

CityX: Controllable Procedural Content Generation for Unbounded 3D Cities

Shougao Zhang, Mengqi Zhou, Yuxi Wang, Chuanchen Luo, Rongyu Wang, Yiwei Li, Zhaoxiang Zhang, Junran Peng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05694 2024-12-10 cs.MM cs.GR cs.SD eess.AS 62%

Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation

Leonardo Pina, Yongmin Li

专题命中 多模态生成 :audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13853 2024-12-10 cs.RO cs.AI cs.CV 62%

RealDex: Towards Human-like Grasping for Robotic Dexterous Hand

Yumeng Liu, Yaxun Yang, Youzhuo Wang, Xiaofei Wu, Jiamin Wang, Yichen Yao, Sören Schwertfeger, Sibei Yang, Wenping Wang, Jingyi Yu, Xuming He, Yuexin Ma

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://4dvlab.github.io/RealDex_page/

Journal ref Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04086 2024-12-09 cs.CV cs.AI 62%

BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation

Nefeli Andreou, Varsha Vivek, Ying Wang, Alex Vorobiov, Tiffany Deng, Raja Bala, Larry Davis, Betty Mohler Tesch

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00769 2024-12-09 cs.CV cs.AI 62%

GameGen-X: Interactive Open-world Game Video Generation

Haoxuan Che, Xuanhua He, Quande Liu, Cheng Jin, Hao Chen

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Homepage: https://gamegen-x.github.io/ Github: https://github.com/GameGen-X/GameGen-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03837 2024-12-06 cs.AI cs.CV 62%

Movie Gen: SWOT Analysis of Meta's Generative AI Foundation Model for Transforming Media Generation, Advertising, and Entertainment Industries

Abul Ehtesham, Saket Kumar, Aditi Singh, Tala Talaei Khoei

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03011 2024-12-05 cs.CV cs.AI 62%

Human Multi-View Synthesis from a Single-View Model:Transferred Body and Face Representations

Yu Feng, Shunsi Zhang, Jian Shu, Hanfeng Zhao, Guoliang Pang, Chi Zhang, Hao Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00053 2024-12-03 cs.LG cs.AI cs.CL 62%

LeMoLE: LLM-Enhanced Mixture of Linear Experts for Time Series Forecasting

Lingzheng Zhang, Lifeng Shen, Yimin Zheng, Shiyuan Piao, Ziyue Li, Fugee Tsung

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19786 2024-12-02 cs.CV cs.CL cs.LG 62%

MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks

Yiming Wu, Wei Ji, Kecheng Zheng, Zicheng Wang, Dong Xu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Five figures, six tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02791 2024-12-02 cs.CV cs.AI 62%

Efficient Text-driven Motion Generation via Latent Consistency Training

Mengxian Hu, Minghao Zhu, Xun Zhou, Qingqing Yan, Shu Li, Chengju Liu, Qijun Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13579 2024-11-27 cs.CV cs.AI 62%

LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions

Xiaoran Zhao, Tianhao Wu, Yu Lai, Zhiliang Tian, Zhen Huang, Yahui Liu, Zejiang He, Dongsheng Li

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16080 2024-11-26 cs.CV cs.AI cs.GR cs.LG 62%

Boosting 3D Object Generation through PBR Materials

Yitong Wang, Xudong Xu, Li Ma, Haoran Wang, Bo Dai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to SIGGRAPH Asia 2024 Conference Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02256 2024-11-26 cs.CV cs.AI cs.GR 62%

EMDM: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation

Wenyang Zhou, Zhiyang Dou, Zeyu Cao, Zhouyingcheng Liao, Jingbo Wang, Wenjia Wang, Yuan Liu, Taku Komura, Wenping Wang, Lingjie Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ECCV 2024. Project Page: https://frank-zy-dou.github.io/projects/EMDM/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08666 2024-11-19 cs.CV cs.AI 62%

A Survey on Vision Autoregressive Model

Kai Jiang, Jiaxing Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This work will be integrated into another project

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10004 2024-11-18 eess.IV cs.AI cs.CV 62%

EyeDiff: text-to-image diffusion model improves rare eye disease diagnosis

Ruoyu Chen, Weiyi Zhang, Bowen Liu, Xiaolan Chen, Pusheng Xu, Shunming Liu, Mingguang He, Danli Shi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08642 2024-11-14 cs.CV cs.AI 62%

Towards More Accurate Fake Detection on Images Generated from Advanced Generative and Neural Rendering Models

Chengdong Dong, Vijayakumar Bhagavatula, Zhenyu Zhou, Ajay Kumar

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏