arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2412.20800 2024-12-31 cs.CV 57%

VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control

Shaojin Wu, Fei Ding, Mengqi Huang, Wei Liu, Qian He

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Codes and models are available at https://github.com/fenfenfenfan/VMix

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19806 2024-12-31 cs.CV cs.HC 57%

Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing

Hao Fei, Shengqiong Wu, Hanwang Zhang, Tat-Seng Chua, Shuicheng Yan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19712 2024-12-30 cs.CV 57%

From Elements to Design: A Layered Approach for Automatic Graphic Design Composition

Jiawei Lin, Shizhao Sun, Danqing Huang, Ting Liu, Ji Li, Jiang Bian

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project Page: $\href{https://elements2design.github.io/}{\text{elements2design}}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03178 2024-12-30 cs.SD eess.AS 57%

POPDG: Popular 3D Dance Generation with PopDanceSet

Zhenye Luo, Min Ren, Xuecai Hu, Yongzhen Huang, Li Yao

专题命中 多模态生成 :cross-modal(abstract);分类 eess.AS

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09706 2024-12-30 cs.CV 57%

Diffusion-Enhanced Test-time Adaptation with Text and Image Augmentation

Chun-Mei Feng, Yuanyang He, Jian Zou, Salman Khan, Huan Xiong, Zhen Li, Wangmeng Zuo, Rick Siow Mong Goh, Yong Liu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by International Journal of Computer Vision

Journal ref International Journal of Computer Vision, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18255 2024-12-25 cs.CV 57%

AdaCo: Overcoming Visual Foundation Model Noise in 3D Semantic Segmentation via Adaptive Label Correction

Pufan Zou, Shijia Zhao, Weijie Huang, Qiming Xia, Chenglu Wen, Wei Li, Cheng Wang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 2025 AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18149 2024-12-25 cs.CV 57%

Dense-Face: Personalized Face Generation Model via Dense Annotation Prediction

Xiao Guo, Manh Tran, Jiaxin Cheng, Xiaoming Liu

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 15 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18139 2024-12-25 cs.CL 57%

Ensuring Consistency for In-Image Translation

Chengpeng Fu, Xiaocheng Feng, Yichong Huang, Wenshuai Huo, Baohang Li, Zhirui Zhang, Yunfei Lu, Dandan Tu, Duyu Tang, Hui Wang, Bing Qin, Ting Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15177 2024-12-24 cs.LG cs.AI 57%

Diffusion Actor-Critic with Entropy Regulator

Yinuo Wang, Likun Wang, Yuxuan Jiang, Wenjun Zou, Tong Liu, Xujie Song, Wenxuan Wang, Liming Xiao, Jiang Wu, Jingliang Duan, Shengbo Eben Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments NeurIPS2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15491 2024-12-23 cs.CV 57%

GCA-3D: Towards Generalized and Consistent Domain Adaptation of 3D Generators

Hengjia Li, Yang Liu, Yibo Zhao, Haoran Cheng, Yang Yang, Linxuan Xia, Zekai Luo, Qibo Qiu, Boxi Wu, Tu Zheng, Zheng Yang, Deng Cai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14630 2024-12-20 cs.CV 57%

Unified Image Restoration and Enhancement: Degradation Calibrated Cycle Reconstruction Diffusion Model

Minglong Xue, Jinhong He, Shivakumara Palaiahnakote, Mingliang Zhou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14168 2024-12-20 cs.CV 57%

FashionComposer: Compositional Fashion Image Generation

Sihui Ji, Yiyang Wang, Xi Chen, Xiaogang Xu, Hao Luo, Hengshuang Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments https://sihuiji.github.io/FashionComposer-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13635 2024-12-19 cs.CV 57%

Self-control: A Better Conditional Mechanism for Masked Autoregressive Model

Qiaoying Qu, Shiyu Shen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12095 2024-12-18 cs.CV 57%

Causal Diffusion Transformers for Generative Modeling

Chaorui Deng, Deyao Zhu, Kunchang Li, Shi Guang, Haoqi Fan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 22 figures, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11070 2024-12-17 cs.CV 57%

HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation

Tengfei Liu, Jiapu Wang, Yongli Hu, Mingjie Li, Junfei Yi, Xiaojun Chang, Junbin Gao, Baocai Yin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13181 2024-12-17 cs.CV 57%

The Impact of Auxiliary Patient Data on Automated Chest X-Ray Report Generation and How to Incorporate It

Aaron Nicolson, Shengyao Zhuang, Jason Dowling, Bevan Koopman

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16667 2024-12-16 cs.CL 57%

A Character-Centric Creative Story Generation via Imagination

Kyeongman Park, Minbeom Kim, Kyomin Jung

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 57%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12004 2024-12-13 cs.CV 57%

Direct Consistency Optimization for Robust Customization of Text-to-Image Diffusion Models

Kyungmin Lee, Sangkyung Kwak, Kihyuk Sohn, Jinwoo Shin

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2024. Project page: https://dco-t2i.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06295 2024-12-10 cs.CV 57%

See Further When Clear: Curriculum Consistency Model

Yunpeng Liu, Boxiao Liu, Yi Zhang, Xingzhong Hou, Guanglu Song, Yu Liu, Haihang You

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06249 2024-12-10 cs.CL cs.LG 57%

Optimizing Multi-Task Learning for Enhanced Performance in Large Language Models

Zhen Qi, Jiajing Chen, Shuo Wang, Bingying Liu, Hongye Zheng, Chihang Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07974 2024-12-10 cs.CV 57%

SignAvatar: Sign Language 3D Motion Reconstruction and Generation

Lu Dong, Lipisha Chaudhary, Fei Xu, Xiao Wang, Mason Lary, Ifeoma Nwogu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments This work was accepted to the 2024 IEEE FG Conference. The final version is available at 10.1109/FG59268.2024.10581934

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04448 2024-12-06 cs.CV 57%

MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation

Longtao Zheng, Yifan Zhang, Hanzhong Guo, Jiachun Pan, Zhenxiong Tan, Jiahao Lu, Chuanxin Tang, Bo An, Shuicheng Yan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Project Page: https://memoavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04440 2024-12-06 cs.CV 57%

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration

Kaiyi Huang, Yukun Huang, Xuefei Ning, Zinan Lin, Yu Wang, Xihui Liu

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

Comments Project website: https://karine-h.github.io/GenMAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04036 2024-12-06 cs.AI 57%

SocialMind: LLM-based Proactive AR Social Assistive System with Human-like Perception for In-situ Live Interactions

Bufang Yang, Yunqi Guo, Lilin Xu, Zhenyu Yan, Hongkai Chen, Guoliang Xing, Xiaofan Jiang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04003 2024-12-06 cs.CL 57%

Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual Enhancement

Lingfeng Ming, Bo Zeng, Chenyang Lyu, Tianqi Shi, Yu Zhao, Xue Yang, Yefeng Liu, Yiyu Wang, Linlong Xu, Yangyang Liu, Xiaohu Zhao, Hao Wang, Heng Liu, Hao Zhou, Huifeng Yin, Zifu Shang, Haijun Li, Longyue Wang, Weihua Luo, Kaifu Zhang

专题命中 多模态生成 :any-to-any(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03878 2024-12-06 cs.CV 57%

DiffSign: AI-Assisted Generation of Customizable Sign Language Videos With Enhanced Realism

Sudha Krishnamurthy, Vimal Bhat, Abhinav Jain

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Published in Proceedings of ECCV, Workshop on Assistive Computer Vision and Robotics, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03430 2024-12-05 cs.CV cs.LG cs.SD 57%

SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model

Yan Li, Ziya Zhou, Zhiqiang Wang, Wei Xue, Wenhan Luo, Yike Guo

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01027 2024-12-04 cs.CV 57%

Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation

Bolin Lai, Felix Juefei-Xu, Miao Liu, Xiaoliang Dai, Nikhil Mehta, Chenguang Zhu, Zeyi Huang, James M. Rehg, Sangmin Lee, Ning Zhang, Tong Xiao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 18 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00887 2024-12-03 cs.AI 57%

Playable Game Generation

Mingyu Yang, Junyou Li, Zhongbin Fang, Sheng Chen, Yangbin Yu, Qiang Fu, Wei Yang, Deheng Ye

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏