arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2505.16314 2025-05-23 cs.CV cs.AI 62%

NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment

Shuhao Han, Haotian Fan, Fangyuan Kong, Wenjie Liao, Chunle Guo, Chongyi Li, Radu Timofte, Liang Li, Tao Li, Junhui Cui, Yunqiu Wang, Yang Tai, Jingwei Sun, Jianhui Sun, Xinli Yue, Tianyi Wang, Huan Hou, Junda Lu, Xinyang Huang, Zitang Zhou, Zijian Zhang, Xuhui Zheng, Xuecheng Wu, Chong Peng, Xuezhi Cao, Trong-Hieu Nguyen-Mau, Minh-Hoang Le, Minh-Khoa Le-Phan, Duy-Nam Ly, Hai-Dang Nguyen, Minh-Triet Tran, Yukang Lin, Yan Hong, Chuanbiao Song, Siyuan Li, Jun Lan, Zhichao Zhang, Xinyue Li, Wei Sun, Zicheng Zhang, Yunhao Li, Xiaohong Liu, Guangtao Zhai, Zitong Xu, Huiyu Duan, Jiarui Wang, Guangji Ma, Liu Yang, Lu Liu, Qiang Hu, Xiongkuo Min, Zichuan Wang, Zhenchen Tang, Bo Peng, Jing Dong, Fengbin Guan, Zihao Yu, Yiting Lu, Wei Luo, Xin Li, Minhao Lin, Haofeng Chen, Xuanxuan He, Kele Xu, Qisheng Xu, Zijian Gao, Tianjiao Wan, Bo-Cheng Qiu, Chih-Chung Hsu, Chia-ming Lee, Yu-Fan Lin, Bo Yu, Zehao Wang, Da Mu, Mingxiu Chen, Junkang Fang, Huamei Sun, Wending Zhao, Zhiyu Wang, Wang Liu, Weikang Yu, Puhong Duan, Bin Sun, Xudong Kang, Shutao Li, Shuai He, Lingzhi Fu, Heng Cong, Rongyu Zhang, Jiarong He, Zhishan Qiao, Yongqing Huang, Zewen Chen, Zhe Pang, Juan Wang, Jian Guo, Zhizhuo Shao, Ziyu Feng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Zeming Liu, Qingsong Xie, Ruichen Wang, Zhihao Li, Yuqi Liang, Jianqi Bi, Jun Luo, Junfeng Yang, Can Li, Jing Fu, Hongwei Xu, Mingrui Long, Lulin Tang

机构 * NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment(NTIRE 2025挑战)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19722 2025-05-20 cs.LG cs.AI cs.CV 62%

JetFormer: An Autoregressive Generative Model of Raw Images and Text

Michael Tschannen, André Susano Pinto, Alexander Kolesnikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025. Code available at https://github.com/google-research/big_vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08854 2025-05-15 cs.CV cs.AI cs.RO 62%

Generative AI for Autonomous Driving: Frontiers and Opportunities

Yuping Wang, Shuo Xing, Cui Can, Renjie Li, Hongyuan Hua, Kexin Tian, Zhaobin Mo, Xiangbo Gao, Keshu Wu, Sulong Zhou, Hengxu You, Juntong Peng, Junge Zhang, Zehao Wang, Rui Song, Mingxuan Yan, Walter Zimmer, Xingcheng Zhou, Peiran Li, Zhaohan Lu, Chia-Ju Chen, Yue Huang, Ryan A. Rossi, Lichao Sun, Hongkai Yu, Zhiwen Fan, Frank Hao Yang, Yuhao Kang, Ross Greer, Chenxi Liu, Eun Hak Lee, Xuan Di, Xinyue Ye, Liu Ren, Alois Knoll, Xiaopeng Li, Shuiwang Ji, Masayoshi Tomizuka, Marco Pavone, Tianbao Yang, Jing Du, Ming-Hsuan Yang, Hua Wei, Ziran Wang, Yang Zhou, Jiachen Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Purdue University(普渡大学) Columbia University(哥伦比亚大学) University of Florida(佛罗里达大学) Technische Universität München(慕尼黑技术大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Notre Dame(诺特丹大学) Adobe Research(Adobe研究) Lehigh University(莱斯利大学) Cleveland State University(克利夫兰州立大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) University of Utah(犹他大学) Texas A&M Transportation Institute(德克萨斯农工大学交通研究所) Bosch Research North America(博世北美研究) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) NVIDIA(英伟达) Arizona State University(亚利桑那州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07460 2025-05-13 cs.AI cs.CL 62%

A Survey on Collaborative Mechanisms Between Large and Small Language Models

Yi Chen, JiaHao Zhao, HaoHao Han

机构 * Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05501 2025-05-12 cs.CV cs.AI eess.IV 62%

Preliminary Explorations with GPT-4o(mni) Native Image Generation

Pu Cao, Feng Zhou, Junyi Ji, Qingye Kong, Zhixiang Lv, Mingjian Zhang, Xuekun Zhao, Siqi Wu, Yinghui Lin, Qing Song, Lu Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03859 2025-05-08 cs.CY cs.AI cs.CV 62%

Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators

Will Hawkins, Chris Russell, Brent Mittelstadt

机构 * Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages

Journal ref FAccT '25: Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10316 2025-05-06 cs.CV cs.AI 62%

BrushEdit: All-In-One Image Inpainting and Editing

Yaowei Li, Yuxuan Bian, Xuan Ju, Zhaoyang Zhang, Junhao Zhuang, Ying Shan, Yuexian Zou, Qiang Xu

机构 * Peking University(北京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments WebPage available at https://liyaowei-stu.github.io/project/BrushEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00019 2025-05-02 cs.CL cs.AI 62%

An Empirical Study on Prompt Compression for Large Language Models

Zheng Zhang, Jinyi Li, Yihuai Lan, Xiang Wang, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by Building Trust Workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20998 2025-04-30 cs.CV cs.AI 62%

YoChameleon: Personalized Vision and Language Generation

Thao Nguyen, Krishna Kumar Singh, Jing Shi, Trung Bui, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025; Project page: https://thaoshibe.github.io/YoChameleon

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04907 2025-04-30 cs.CV cs.AI 62%

Video-Bench: Human-Aligned Video Generation Benchmark

Hui Han, Siyuan Li, Jiaqi Chen, Yiwen Yuan, Yuling Wu, Chak Tou Leong, Hanwen Du, Junchen Fu, Youhua Li, Jie Zhang, Chi Zhang, Li-jia Li, Yongxin Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) Fellou AI(Fellou人工智能) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) University of Glasgow(格拉斯哥大学) City University of Hong Kong(香港城市大学) Westlake University(西湖大学) LiveX AI(LiveX人工智能) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07199 2025-04-29 cs.CV cs.AI 62%

OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision

Cong Wei, Zheyang Xiong, Weiming Ren, Xinrun Du, Ge Zhang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Vector Institute(向量研究所) M-A-P

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10475 2025-04-24 cs.CR cs.AI cs.CV 62%

X-SG$^2$S: Safe and Generalizable Gaussian Splatting with X-dimensional Watermarks

Zihang Cheng, Huiping Zhuang, Chun Li, Xin Meng, Ming Li, Fei Richard Yu, Liqiang Nie

机构 * South China University of Technology(南方科技大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Peking University(北京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14871 2025-04-24 cs.CV cs.AI 62%

BrainVis: Exploring the Bridge between Brain and Visual Signals via Image Reconstruction

Honghao Fu, Zhiqi Shen, Jing Jih Chin, Hao Wang

机构 * Honghao Fu 1, 2(Fu Honghao 1, 2) Zhiqi Shen 2(Shen Zhiqi 2) Jing Jih Chin 2(Chin Jing Jih 2) Hao Wang 1(Wang Hao 1)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14260 2025-04-22 cs.CV cs.CL 62%

Cross-attention for State-based model RWKV-7

Liu Xiao, Li Zhiyuan, Lin Yueyu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00238 2025-04-18 cs.AI cs.CV cs.LG q-bio.NC 62%

Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem

Declan Campbell, Sunayana Rane, Tyler Giallanza, Nicolò De Sabbata, Kia Ghods, Amogh Joshi, Alexander Ku, Steven M. Frankland, Thomas L. Griffiths, Jonathan D. Cohen, Taylor W. Webb

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08033 2025-04-11 cs.CV cs.AI cs.GR 62%

GaussianAnything: Interactive Point Cloud Flow Matching For 3D Object Generation

Yushi Lan, Shangchen Zhou, Zhaoyang Lyu, Fangzhou Hong, Shuai Yang, Bo Dai, Xingang Pan, Chen Change Loy

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025 project page: https://nirvanalan.github.io/projects/GA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07046 2025-04-10 cs.CV cs.CL 62%

A Unified Agentic Framework for Evaluating Conditional Image Generation

Jifang Wang, Xue Yang, Longyue Wang, Zhenran Xu, Yiyu Wang, Yaowei Wang, Weihua Luo, Kaifu Zhang, Baotian Hu, Min Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Work in progress. GitHub: https://github.com/HITsz-TMG/Agentic-CIGEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01081 2025-04-10 cs.CV cs.CL eess.IV 62%

ShieldGemma 2: Robust and Tractable Image Content Moderation

Wenjun Zeng, Dana Kurniawan, Ryan Mullins, Yuchi Liu, Tamoghna Saha, Dirichi Ike-Njoku, Jindong Gu, Yiwen Song, Cai Xu, Jingjing Zhou, Aparna Joshi, Shravan Dheep, Mani Malek, Hamid Palangi, Joon Baek, Rick Pereira, Karthik Narasimhan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17550 2025-04-10 cs.LG cs.MM cs.SD eess.AS 62%

A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji

专题命中 多模态生成 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments IJCNN 2025. The source code is available: https://github.com/SonyResearch/SVG_baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05800 2025-04-09 cs.CV cs.LG cs.MM 62%

Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling

Jaskirat Singh, Junshen Kevin Chen, Jonas Kohler, Michael Cohen

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00915 2025-04-04 cs.CV cs.AI 62%

Empower Vision Applications with LoRA LMM

Liang Mi, Weijun Wang, Wenming Tu, Qingfeng He, Rui Kong, Xinyu Fang, Yazhu Dong, Yikang Zhang, Yunchun Li, Meng Li, Haipeng Dai, Guihai Chen, Yunxin Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments EuroSys'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22796 2025-04-01 cs.CV cs.AI 62%

DiTFastAttnV2: Head-wise Attention Compression for Multi-Modality Diffusion Transformers

Hanling Zhang, Rundong Su, Zhihang Yuan, Pengtao Chen, Mingzhu Shen Yibo Fan, Shengen Yan, Guohao Dai, Yu Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22200 2025-03-31 cs.SD cs.CV eess.AS 62%

Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization

Haomin Zhang, Sizhe Shan, Haoyu Wang, Zihao Chen, Xiulong Liu, Chaofan Ding, Xinhan Di

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08814 2025-03-31 cs.AI cs.CL cs.CY 62%

SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector

Kyeongryul Lee, Heehyeon Kim, Joyce Jiyoung Whang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 2 figures, 1 tables. AI for Public Missions (AIPM) Workshop at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18627 2025-03-25 cs.CV cs.AI 62%

Dig2DIG: Dig into Diffusion Information Gains for Image Fusion

Bing Cao, Baoshuo Cai, Changqing Zhang, Qinghua Hu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16770 2025-03-25 cs.CL cs.AI cs.LG 62%

Persona-Coded Poly-Encoder: Persona-Guided Multi-Stream Conversational Sentence Scoring

Junfeng Liu, Christopher Symons, Ranga Raju Vatsavai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments The 35th IEEE International Conference on Tools with Artificial Intelligence (ICTAI)

Journal ref 2023 IEEE 35th International Conference on Tools with Artificial Intelligence (ICTAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15855 2025-03-21 cs.CV cs.AI 62%

VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling

Hyojun Go, Byeongjun Park, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, Changick Kim

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Project page: https://gohyojun15.github.io/VideoRFSplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11989 2025-03-21 cs.CL cs.AI 62%

Applications of Large Language Model Reasoning in Feature Generation

Dharani Chandra

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments I just updated the format of the references in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15176 2025-03-20 cs.HC cs.CL cs.CV 62%

A Review on Large Language Models for Visual Analytics

Navya Sonal Agarwal, Sanjay Kumar Sonbhadra

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14503 2025-03-19 cs.CV cs.AI cs.LG 62%

The Power of Context: How Multimodality Improves Image Super-Resolution

Kangfu Mei, Hossein Talebi, Mojtaba Ardakani, Vishal M. Patel, Peyman Milanfar, Mauricio Delbracio

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏