arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2312.12090 2024-10-23 cs.CV 57%

GazeMoDiff: Gaze-guided Diffusion Model for Stochastic Human Motion Prediction

Haodong Yan, Zhiming Hu, Syn Schmitt, Andreas Bulling

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted at PG 2024. Link: https://zhiminghu.net/yan24_gazemodiff.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15027 2024-10-22 cs.CV 57%

Group Diffusion Transformers are Unsupervised Multitask Learners

Lianghua Huang, Wei Wang, Zhi-Fan Wu, Huanzhang Dou, Yupeng Shi, Yutong Feng, Chen Liang, Yu Liu, Jingren Zhou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10629 2024-10-22 cs.CV 57%

SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers

Enze Xie, Junsong Chen, Junyu Chen, Han Cai, Haotian Tang, Yujun Lin, Zhekai Zhang, Muyang Li, Ligeng Zhu, Yao Lu, Song Han

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12538 2024-10-22 cs.LG cs.AI cs.RO 57%

Variational Distillation of Diffusion Policies into Mixture of Experts

Hongyi Zhou, Denis Blessing, Ge Li, Onur Celik, Xiaogang Jia, Gerhard Neumann, Rudolf Lioutikov

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Accepted by the 38th Annual Conference on Neural Information Processing Systems,

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13242 2024-10-21 cs.CV 57%

Fundus to Fluorescein Angiography Video Generation as a Retinal Generative Foundation Model

Weiyi Zhang, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Pusheng Xu, Xiaolan Chen, Shanfu Lu, Hongyu Cao, Mingguang He, Danli Shi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11795 2024-10-17 cs.CV 57%

Efficient Diffusion Models: A Comprehensive Survey from Principles to Practices

Zhiyuan Ma, Yuzhu Zhang, Guoli Jia, Liangliang Zhao, Yichao Ma, Mingjie Ma, Gaofeng Liu, Kaiyan Zhang, Jianjun Li, Bowen Zhou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17357 2024-10-16 eess.IV cs.CV 57%

Simultaneous Tri-Modal Medical Image Fusion and Super-Resolution using Conditional Diffusion Model

Yushen Xu, Xiaosong Li, Yuchan Jie, Haishu Tan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by MICCAI 2024

Journal ref International Conference on Medical Image Computing and Computer-Assisted Intervention. Cham: Springer Nature Switzerland, 2024: 635-645

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16683 2024-10-15 cs.LG cs.CV 57%

Repulsive Latent Score Distillation for Solving Inverse Problems

Nicolas Zilberstein, Morteza Mardani, Santiago Segarra

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01512 2024-10-14 cs.CL 57%

Distractor Generation in Multiple-Choice Tasks: A Survey of Methods, Datasets, and Evaluation

Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang, Munazza Zaib, Ahoud Alhazmi

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments Accepted (Main) at EMNLP 2024 : The 2024 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07884 2024-10-11 cs.CV cs.CY 57%

Generated Bias: Auditing Internal Bias Dynamics of Text-To-Image Generative Models

Abhishek Mandal, Susan Leavy, Suzanne Little

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07265 2024-10-11 cs.AR cs.AI cs.LG cs.SE 57%

A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models

Cong Guo, Feng Cheng, Zhixu Du, James Kiessling, Jonathan Ku, Shiyu Li, Ziru Li, Mingyuan Ma, Tergel Molom-Ochir, Benjamin Morris, Haoxuan Shan, Jingwei Sun, Yitu Wang, Chiyue Wei, Xueying Wu, Yuhao Wu, Hao Frank Yang, Jingyang Zhang, Junyao Zhang, Qilin Zheng, Guanglei Zhou, Hai, Li, Yiran Chen

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Accepted by IEEE Circuits and Systems Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06231 2024-10-11 cs.CV cs.GR cs.LG 57%

RelitLRM: Generative Relightable Radiance for Large Reconstruction Models

Tianyuan Zhang, Zhengfei Kuang, Haian Jin, Zexiang Xu, Sai Bi, Hao Tan, He Zhang, Yiwei Hu, Milos Hasan, William T. Freeman, Kai Zhang, Fujun Luan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments webpage: https://relit-lrm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07155 2024-10-10 cs.CV 57%

Trans4D: Realistic Geometry-Aware Transition for Compositional Text-to-4D Synthesis

Bohan Zeng, Ling Yang, Siyu Li, Jiaming Liu, Zixiang Zhang, Juanxi Tian, Kaixin Zhu, Yongzhen Guo, Fu-Yun Wang, Minkai Xu, Stefano Ermon, Wentao Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Project: https://github.com/YangLing0818/Trans4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12139 2024-10-10 cs.CV 57%

DTLLM-VLT: Diverse Text Generation for Visual Language Tracking Based on LLM

Xuchen Li, Xiaokun Feng, Shiyu Hu, Meiqi Wu, Dailing Zhang, Jing Zhang, Kaiqi Huang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR Workshop 2024, Oral Presentation, Best Paper Honorable Mention Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05873 2024-10-10 cs.CV 57%

Implicit Concept Removal of Diffusion Models

Zhili Liu, Kai Chen, Yifan Zhang, Jianhua Han, Lanqing Hong, Hang Xu, Zhenguo Li, Dit-Yan Yeung, James Kwok

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by ECCV2024. Project Page: https://kaichen1998.github.io/projects/geom-erasing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03234 2024-10-07 cs.SE cs.CL 57%

Showing LLM-Generated Code Selectively Based on Confidence of LLMs

Jia Li, Yuqi Zhu, Yongmin Li, Ge Li, Zhi Jin

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13248 2024-10-07 cs.CV 57%

Mora: Enabling Generalist Video Generation via A Multi-Agent Framework

Zhengqing Yuan, Yixin Liu, Yihan Cao, Weixiang Sun, Haolong Jia, Ruoxi Chen, Zhaoxu Li, Bin Lin, Li Yuan, Lifang He, Chi Wang, Yanfang Ye, Lichao Sun

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04109 2024-10-02 cs.CV 57%

From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models

Changming Xiao, Qi Yang, Feng Zhou, Changshui Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments A revised version of this paper will be published in Neurocomputing, see https://doi.org/10.1016/j.neucom.2024.128437

Journal ref Neurocomputing, Volume 610, 2024, 128437

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19686 2024-10-01 cs.CV 57%

Text-driven Human Motion Generation with Motion Masked Diffusion Model

Xingyu Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00558 2024-09-30 cs.CV 57%

Compositional 3D-aware Video Generation with LLM Director

Hanxin Zhu, Tianyu He, Anni Tang, Junliang Guo, Zhibo Chen, Jiang Bian

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07937 2024-09-27 cs.CV 57%

BOTH2Hands: Inferring 3D Hands from Both Text Prompts and Body Dynamics

Wenqian Zhang, Molin Huang, Yuxuan Zhou, Juze Zhang, Jingyi Yu, Jingya Wang, Lan Xu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2024, pp. 2393-2404.

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04629 2024-09-25 cs.CV 57%

DifFUSER: Diffusion Model for Robust Multi-Sensor Fusion in 3D Object Detection and BEV Segmentation

Duy-Tho Le, Hengcan Shi, Jianfei Cai, Hamid Rezatofighi

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13551 2024-09-23 cs.SE cs.CL cs.DB 57%

Contextualized Data-Wrangling Code Generation in Computational Notebooks

Junjie Huang, Daya Guo, Chenglong Wang, Jiazhen Gu, Shuai Lu, Jeevana Priya Inala, Cong Yan, Jianfeng Gao, Nan Duan, Michael R. Lyu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments To appear at ASE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09384 2024-09-20 cs.GR cs.CV cs.LG 57%

Diverse Part Synthesis for 3D Shape Creation

Yanran Guan, Oliver van Kaick

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10180 2024-09-17 cs.CV 57%

RealDiff: Real-world 3D Shape Completion using Self-Supervised Diffusion Models

Başak Melis Öcal, Maxim Tatarchenko, Sezer Karaoglu, Theo Gevers

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09569 2024-09-17 cs.LG cs.CV cs.CY 57%

Bias Begets Bias: The Impact of Biased Embeddings on Diffusion Models

Sahil Kuchlous, Marvin Li, Jeffrey G. Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12169 2024-09-17 cs.NI cs.AI cs.LG 57%

Rail-only: A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters

Weiyang Wang, Manya Ghobadi, Kayvon Shakeri, Ying Zhang, Naader Hasani

专题命中 多模态生成 :any-to-any(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08500 2024-09-16 eess.IV cs.CV 57%

Cross-conditioned Diffusion Model for Medical Image to Image Translation

Zhaohu Xing, Sicheng Yang, Sixiang Chen, Tian Ye, Yijun Yang, Jing Qin, Lei Zhu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments miccai24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08472 2024-09-16 eess.SY cs.AI cs.RO cs.SY 57%

An Intent Modeling and Inference Framework for Autonomous and Remotely Piloted Aerial Systems

Kesav Kaza, Varun Mehta, Hamid Azad, Miodrag Bolic, Iraj Mantegh

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 8 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05642 2024-09-10 cs.CV 57%

Prototype-Driven Multi-Feature Generation for Visible-Infrared Person Re-identification

Jiarui Li, Zhen Qiu, Yilin Yang, Yuqi Li, Zeyu Dong, Chuanguang Yang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏