arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2405.18801 2024-05-30 cs.CV 57%

SketchTriplet: Self-Supervised Scenarized Sketch-Text-Image Triplet Generation

Zhenbei Wu, Qiang Wang, Jie Yang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13910 2024-05-29 cs.LG cs.CV stat.ML 57%

Learning Latent Space Hierarchical EBM Diffusion Models

Jiali Cui, Tian Han

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09022 2024-05-29 eess.IV cs.CV q-bio.NC 57%

BDHT: Generative AI Enables Causality Analysis for Mild Cognitive Impairment

Qiankun Zuo, Ling Chen, Yanyan Shen, Michael Kwok-Po Ng, Baiying Lei, Shuqiang Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 13pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16803 2024-05-28 cs.CV 57%

TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing

Xinyu Zhang, Mengxue Kang, Fei Wei, Shuang Xu, Yuhe Liu, Lin Ma

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12779 2024-05-22 cs.LG cs.AI 57%

Transformer in Touch: A Survey

Jing Gao, Ning Cheng, Bin Fang, Wenjuan Han

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

Comments 27 pages, 2 tables, 5 figures, accepted by ICIC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11913 2024-05-21 cs.CV 57%

Diff-BGM: A Diffusion Model for Video Background Music Generation

Sizhe Li, Yiming Qin, Minghang Zheng, Xin Jin, Yang Liu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024(Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11802 2024-05-21 cs.HC cs.AI cs.LG 57%

Counterfactual Explanation-Based Badminton Motion Guidance Generation Using Wearable Sensors

Minwoo Seong, Gwangbin Kim, Yumin Kang, Junhyuk Jang, Joseph DelPreto, SeungJun Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments ICRA Wearable Workshop 2024 - 1st Workshop on Advancing Wearable Devices and Applications through Novel Design, Sensing, Actuation, and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04012 2024-05-21 cs.CV 57%

Progressive Volume Distillation with Active Learning for Efficient NeRF Architecture Conversion

Shuangkang Fang, Yufeng Wang, Yi Yang, Weixin Xu, Heng Wang, Wenrui Ding, Shuchang Zhou

专题命中 多模态生成 :any-to-any(abstract);分类 cs.CV

Comments Project website: https://sk-fun.fun/PVD-AL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08748 2024-05-15 cs.CV 57%

Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Zhimin Li, Jianwei Zhang, Qin Lin, Jiangfeng Xiong, Yanxin Long, Xinchi Deng, Yingfang Zhang, Xingchao Liu, Minbin Huang, Zedong Xiao, Dayou Chen, Jiajun He, Jiahao Li, Wenyue Li, Chen Zhang, Rongwei Quan, Jianxiang Lu, Jiabin Huang, Xiaoyan Yuan, Xiaoxiao Zheng, Yixuan Li, Jihong Zhang, Chao Zhang, Meng Chen, Jie Liu, Zheng Fang, Weiyan Wang, Jinbao Xue, Yangyu Tao, Jianchen Zhu, Kai Liu, Sihuan Lin, Yifu Sun, Yun Li, Dongdong Wang, Mingtao Chen, Zhichao Hu, Xiao Xiao, Yan Chen, Yuhong Liu, Wei Liu, Di Wang, Yong Yang, Jie Jiang, Qinglin Lu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://dit.hunyuan.tencent.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08037 2024-05-15 cs.HC cs.AI 57%

Layout Generation Agents with Large Language Models

Yuichi Sasazawa, Yasuhiro Sogawa

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00434 2024-05-15 cs.CV cs.GR 57%

DiffPoseTalk: Speech-Driven Stylistic 3D Facial Animation and Head Pose Generation via Diffusion Models

Zhiyao Sun, Tian Lv, Sheng Ye, Matthieu Lin, Jenny Sheng, Yu-Hui Wen, Minjing Yu, Yong-Jin Liu

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

Comments SIGGRAPH 2024 (Journal Track). Project page: https://diffposetalk.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07044 2024-05-14 cs.CV 57%

Semantic Guided Large Scale Factor Remote Sensing Image Super-resolution with Generative Diffusion Prior

Ce Wang, Wanjie Sun

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08367 2024-05-14 cs.CV 57%

Uncertainty-Aware Pedestrian Trajectory Prediction via Distributional Diffusion

Yao Liu, Zesheng Ye, Rui Wang, Binghao Li, Quan Z. Sheng, Lina Yao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04534 2024-05-08 cs.CV 57%

Tactile-Augmented Radiance Fields

Yiming Dou, Fengyu Yang, Yi Liu, Antonio Loquercio, Andrew Owens

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024, Project page: https://dou-yiming.github.io/TaRF, Code: https://github.com/Dou-Yiming/TaRF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12422 2024-05-07 cs.CV cs.GR cs.LG 57%

DreamTime: An Improved Optimization Strategy for Diffusion-Guided 3D Generation

Yukun Huang, Jianan Wang, Yukai Shi, Boshi Tang, Xianbiao Qi, Lei Zhang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15957 2024-05-07 cs.CV 57%

DiffCLIP: Leveraging Stable Diffusion for Language Grounded 3D Classification

Sitian Shen, Zilin Zhu, Linqian Fan, Harry Zhang, Xinxiao Wu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00878 2024-05-03 cs.CV 57%

SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models

Burak Can Biner, Farrin Marouf Sofian, Umur Berkay Karakaş, Duygu Ceylan, Erkut Erdem, Aykut Erdem

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00797 2024-05-03 cs.RO cs.CV 57%

ADM: Accelerated Diffusion Model via Estimated Priors for Robust Motion Prediction under Uncertainties

Jiahui Li, Tianle Shen, Zekai Gu, Jiawei Sun, Chengran Yuan, Yuhang Han, Shuo Sun, Marcelo H. Ang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06464 2024-05-03 cs.CV 57%

PARASOL: Parametric Style Control for Diffusion Image Synthesis

Gemma Canet Tarrés, Dan Ruta, Tu Bui, John Collomosse

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19752 2024-05-01 cs.CV 57%

Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation

Yunhao Ge, Xiaohui Zeng, Jacob Samuel Huffman, Tsung-Yi Lin, Ming-Yu Liu, Yin Cui

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19427 2024-05-01 cs.CV 57%

InstantFamily: Masked Attention for Zero-shot Multi-ID Image Generation

Chanran Kim, Jeongin Lee, Shichang Joung, Bongmo Kim, Yeul-Min Baek

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00372 2024-05-01 cs.CV 57%

HyperSDFusion: Bridging Hierarchical Structures in Language and Geometry for Enhanced 3D Text2Shape Generation

Zhiying Leng, Tolga Birdal, Xiaohui Liang, Federico Tombari

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Journal ref IEEE/CVF conference on computer vision and pattern recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18620 2024-04-30 cs.CV 57%

FlexiFilm: Long Video Generation with Flexible Conditions

Yichen Ouyang, jianhao Yuan, Hao Zhao, Gaoang Wang, Bo zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17254 2024-04-29 cs.CV 57%

Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection

Jiawei Song, Dengpan Ye, Yunming Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10722 2024-04-26 cs.CV 57%

Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners

Xuehai He, Weixi Feng, Tsu-Jui Fu, Varun Jampani, Arjun Akula, Pradyumna Narayana, Sugato Basu, William Yang Wang, Xin Eric Wang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12760 2024-04-22 cs.AI cs.HC 57%

Food Development through Co-creation with AI: bread with a "taste of love"

Takuya Sera, Izumi Kuwata, Yuki Taya, Noritaka Shimura, Yosuke Motohashi

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Accepted to GenAICHI: CHI 2024 Workshop on Generative AI and HCI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06542 2024-04-11 cs.CV 57%

Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation

Luca Barsellotti, Roberto Amoroso, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://aimagelab.github.io/freeda/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10240 2024-04-10 cs.CV 57%

Rich Human Feedback for Text-to-Image Generation

Youwei Liang, Junfeng He, Gang Li, Peizhao Li, Arseniy Klimovskiy, Nicholas Carolan, Jiao Sun, Jordi Pont-Tuset, Sarah Young, Feng Yang, Junjie Ke, Krishnamurthy Dj Dvijotham, Katie Collins, Yiwen Luo, Yang Li, Kai J Kohlhoff, Deepak Ramachandran, Vidhya Navalpakkam

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments CVPR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05580 2024-04-09 cs.CV 57%

Responsible Visual Editing

Minheng Ni, Yeli Shen, Lei Zhang, Wangmeng Zuo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04860 2024-04-09 cs.CV 57%

ByteEdit: Boost, Comply and Accelerate Generative Image Editing

Yuxi Ren, Jie Wu, Yanzuo Lu, Huafeng Kuang, Xin Xia, Xionghui Wang, Qianqian Wang, Yixing Zhu, Pan Xie, Shiyin Wang, Xuefeng Xiao, Yitong Wang, Min Zheng, Lean Fu

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏