arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2501.09042 2025-02-11 cs.CV cs.GR cs.LG 57%

CookingDiffusion: Cooking Procedural Image Generation with Stable Diffusion

Yuan Wang, Bin Zhu, Yanbin Hao, Chong-Wah Ngo, Yi Tan, Xiang Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15328 2025-02-11 cs.CV 57%

Iterative Ensemble Training with Anti-Gradient Control for Mitigating Memorization in Diffusion Models

Xiao Liu, Xiaoliu Guan, Yu Wu, Jiaxu Miao

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Accepted in ECCV 2024, 20 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03240 2025-02-11 cs.CV 57%

Adaptive Generation of Privileged Intermediate Information for Visible-Infrared Person Re-Identification

Mahdi Alehdaghi, Arthur Josi, Pourya Shamsolmoali, Rafael M. O. Cruz, Eric Granger

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05165 2025-02-10 cs.CV 57%

Multitwine: Multi-Object Compositing with Text and Layout Control

Gemma Canet Tarrés, Zhe Lin, Zhifei Zhang, He Zhang, Andrew Gilbert, John Collomosse, Soo Ye Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04370 2025-02-10 cs.CL cs.GR cs.LG 57%

DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization

Zhenglin Zhou, Xiaobo Xia, Fan Ma, Hehe Fan, Yi Yang, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01507 2025-02-04 cs.CV 57%

End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings

Yeruru Asrar Ahmed, Anurag Mittal

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00826 2025-02-04 cs.CL 57%

Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models

Julian Perry, Frank Sanders, Carter Scott

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09594 2025-02-04 cs.AI 57%

Moonshine: Distilling Game Content Generators into Steerable Generative Models

Yuhe Nie, Michael Middleton, Tim Merino, Nidhushan Kanagaraja, Ashutosh Kumar, Zhan Zhuang, Julian Togelius

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19042 2025-02-03 cs.RO cs.AI 57%

Swarm-Gen: Fast Generation of Diverse Feasible Swarm Behaviors

Simon Idoko, B. Bhanu Teja, K. Madhava Krishna, Arun Kumar Singh

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Submitted to RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18954 2025-02-03 cs.CV 57%

LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models

Shenghao Fu, Qize Yang, Qijie Mo, Junkai Yan, Xihan Wei, Jingke Meng, Xiaohua Xie, Wei-Shi Zheng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18033 2025-01-31 cs.CV 57%

Generative AI for Vision: A Comprehensive Study of Frameworks and Applications

Fouad Bousetouane

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 53 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01097 2025-01-31 cs.CV 57%

EliGen: Entity-Level Controlled Image Generation with Regional Attention

Hong Zhang, Zhongjie Duan, Xingjun Wang, Yingda Chen, Yu Zhang

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12920 2025-01-31 cs.CV cs.LG 57%

Zero-Shot Medical Phrase Grounding with Off-the-shelf Diffusion Models

Konstantinos Vilouras, Pedro Sanchez, Alison Q. O'Neil, Sotirios A. Tsaftaris

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments 10 pages, 3 figures, IEEE J-BHI Special Issue on Foundation Models in Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14680 2025-01-28 eess.AS cs.SD 57%

Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning

Jisi Zhang, Pablo Peso Parada, Md Asif Jalal, Karthikeyan Saravanan

专题命中 多模态生成 :cross-modal(abstract);分类 eess.AS

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17644 2025-01-22 cs.CV 57%

DreamFit: Garment-Centric Human Generation via a Lightweight Anything-Dressing Encoder

Ente Lin, Xujie Zhang, Fuwei Zhao, Yuxuan Luo, Xin Dong, Long Zeng, Xiaodan Liang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09826 2025-01-20 cs.CV 57%

PIXELS: Progressive Image Xemplar-based Editing with Latent Surgery

Shristi Das Biswas, Matthew Shreve, Xuelu Li, Prateek Singhal, Kaushik Roy

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09055 2025-01-17 cs.CV 57%

SHYI: Action Support for Contrastive Learning in High-Fidelity Text-to-Image Generation

Tianxiang Xia, Lin Xiao, Yannick Montorfani, Francesco Pavia, Enis Simsar, Thomas Hofmann

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Main content 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08900 2025-01-16 cs.CV 57%

Enhanced Multi-Scale Cross-Attention for Person Image Generation

Hao Tang, Ling Shao, Nicu Sebe, Luc Van Gool

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted to TPAMI, an extended version of a paper published in ECCV2020. arXiv admin note: substantial text overlap with arXiv:2007.09278

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20062 2025-01-16 cs.CV 57%

MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion

Zechao Zhan, Dehong Gao, Jinxia Zhang, Jiale Huang, Yang Hu, Xin Wang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12238 2025-01-16 cs.CV 57%

MGF: Mixed Gaussian Flow for Diverse Trajectory Prediction

Jiahe Chen, Jinkun Cao, Dahua Lin, Kris Kitani, Jiangmiao Pang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by Neurips 2024. Code: https://github.com/mulplue/MGF

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20971 2025-01-14 cs.LG cs.CV 57%

Amortizing intractable inference in diffusion models for vision, language, and control

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Nikolay Malkin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2024; code: https://github.com/GFNOrg/diffusion-finetuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06942 2025-01-14 cs.LG cs.CV 57%

Comparison of Autoencoders for tokenization of ASL datasets

Vouk Praun-Petrovic, Aadhvika Koundinya, Lavanya Prahallad

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 9 pages, 2 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05839 2025-01-13 cs.CV 57%

Poetry in Pixels: Prompt Tuning for Poem Image Generation via Diffusion Models

Sofia Jamil, Bollampalli Areen Reddy, Raghvendra Kumar, Sriparna Saha, K J Joseph, Koustava Goswami

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05680 2025-01-13 cs.AR cs.AI cs.LG 57%

EXION: Exploiting Inter- and Intra-Iteration Output Sparsity for Diffusion Models

Jaehoon Heo, Adiwena Putra, Jieon Yoon, Sungwoong Yune, Hangyeol Lee, Ji-Hoon Kim, Joo-Young Kim

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments To appear in 2025 IEEE International Symposium on High-Performance Computer Architecture (HPCA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01996 2025-01-09 cs.CV 57%

ViG-Bias: Visually Grounded Bias Discovery and Mitigation

Badr-Eddine Marani, Mohamed Hanini, Nihitha Malayarukil, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03490 2025-01-08 cs.CV 57%

SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation

Shang Chai, Zihang Lin, Min Zhou, Xubin Li, Liansheng Zhuang, Houqiang Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24091 2025-01-08 cs.RO cs.AI cs.LG 57%

3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing

Binghao Huang, Yixuan Wang, Xinyi Yang, Yiyue Luo, Yunzhu Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Accepted at Conference on Robot Learning (CoRL) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01223 2025-01-06 cs.CV cs.LG 57%

Conditional Consistency Guided Image Translation and Enhancement

Amil Bhagat, Milind Jain, A. V. Subramanyam

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 6 pages, 5 figures, 4 tables, The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01832 2025-01-06 cs.CL cs.LG 57%

Time Series Language Model for Descriptive Caption Generation

Mohamed Trabelsi, Aidan Boyd, Jin Cao, Huseyin Uzunalioglu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15115 2025-01-06 cs.CL 57%

Qwen2.5 Technical Report

Qwen, :, An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Haoran Wei, Huan Lin, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jingren Zhou, Junyang Lin, Kai Dang, Keming Lu, Keqin Bao, Kexin Yang, Le Yu, Mei Li, Mingfeng Xue, Pei Zhang, Qin Zhu, Rui Men, Runji Lin, Tianhao Li, Tianyi Tang, Tingyu Xia, Xingzhang Ren, Xuancheng Ren, Yang Fan, Yang Su, Yichang Zhang, Yu Wan, Yuqiong Liu, Zeyu Cui, Zhenru Zhang, Zihan Qiu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏