arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2410.21629 2025-03-04 cs.CV 57%

OFER: Occluded Face Expression Reconstruction

Pratheba Selvaraju, Victoria Fernandez Abrevaya, Timo Bolkart, Rick Akkerman, Tianyu Ding, Faezeh Amjadi, Ilya Zharkov

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18860 2025-03-03 cs.CL 57%

Exploring Rewriting Approaches for Different Conversational Tasks

Md Mehrab Tanjim, Ryan A. Rossi, Mike Rimer, Xiang Chen, Sungchul Kim, Vaishnavi Muppala, Tong Yu, Zhengmian Hu, Ritwik Sinha, Wei Zhang, Iftikhar Ahamath Burhanuddin, Franck Dernoncourt

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20176 2025-02-28 cs.SD cs.GR eess.AS 57%

DGFM: Full Body Dance Generation Driven by Music Foundation Models

Xinran Liu, Zhenhua Feng, Diptesh Kanojia, Wenwu Wang

专题命中 多模态生成 :cross-modal(abstract);分类 eess.AS

Comments Accepted to the Audio Imagination Workshop of NeurlPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19247 2025-02-28 cs.CV 57%

ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding

Qihang Peng, Henry Zheng, Gao Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 3 figures. Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11430 2025-02-28 cs.LG cs.AI 57%

A Survey on Diffusion Models for Anomaly Detection

Jing Liu, Zhenchao Ma, Zepu Wang, Chenxuanyin Zou, Jiayang Ren, Zehua Wang, Liang Song, Bo Hu, Yang Liu, Victor C. M. Leung

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20587 2025-02-28 cs.LG cs.AI 57%

Generator Matching: Generative modeling with arbitrary Markov processes

Peter Holderrieth, Marton Havasi, Jason Yim, Neta Shaul, Itai Gat, Tommi Jaakkola, Brian Karrer, Ricky T. Q. Chen, Yaron Lipman

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15278 2025-02-28 cs.CV 57%

PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions

Weifeng Lin, Xinyu Wei, Renrui Zhang, Le Zhuo, Shitian Zhao, Siyuan Huang, Huan Teng, Junlin Xie, Yu Qiao, Peng Gao, Hongsheng Li

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Code is released at https://github.com/AFeng-x/PixWizard

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18302 2025-02-26 cs.CV 57%

LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation

Pengzhi Li, Pengfei Yu, Zide Liu, Wei He, Xuhao Pan, Xudong Rao, Tao Wei, Wei Chen

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09248 2025-02-25 cs.CV 57%

FPGA: Flexible Portrait Generation Approach

Zhaoli Deng, Fanyi Wang, Junkang Zhang, Fan Chen, Meng Zhang, Wendong Zhang, Wen Liu, Zhenpeng Mi

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00980 2025-02-25 cs.CV 57%

Controlling Structured Output Representations from Attributes using Conditional Generative Models

Mohamed Debbagh

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14162 2025-02-25 cs.CV 57%

OrthoGAN:High-Precision Image Generation for Teeth Orthodontic Visualization

Feihong Shen, JIngjing Liu, Jianwen Lou, Haizhen Li, Bing Fang, Chenglong Ma, Jin Hao, Yang Feng, Youyi Zheng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14994 2025-02-24 cs.CV 57%

LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection

Qingyuan Liu, Yun-Yun Tsai, Ruijian Zha, Victoria Li, Pengyuan Shi, Chengzhi Mao, Junfeng Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11515 2025-02-18 cs.CV 57%

SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion

Junxian Ma, Shiwen Wang, Jian Yang, Junyi Hu, Jian Liang, Guosheng Lin, Jingbo chen, Kai Li, Yu Meng

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10957 2025-02-18 cs.CV physics.ao-ph 57%

Skillful Nowcasting of Convective Clouds With a Cascade Diffusion Model

Haoming Chen, Xiaohui Zhong, Qiang Zhai, Xiaomeng Li, Ying Wa Chan, Pak Wai Chan, Yuanyuan Huang, Hao Li, Xiaoming Shi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07701 2025-02-18 cs.CV 57%

Magic 1-For-1: Generating One Minute Video Clips within One Minute

Hongwei Yi, Shitong Shao, Tian Ye, Jiantong Zhao, Qingyu Yin, Michael Lingelbach, Li Yuan, Yonghong Tian, Enze Xie, Daquan Zhou

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Serious updates are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09897 2025-02-17 cs.AI cs.LG 57%

Artificial Intelligence in Spectroscopy: Advancing Chemistry from Prediction to Generation and Beyond

Kehan Guo, Yili Shen, Gisela Abigail Gonzalez-Montiel, Yue Huang, Yujun Zhou, Mihir Surve, Zhichun Guo, Prayel Das, Nitesh V Chawla, Olaf Wiest, Xiangliang Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11752 2025-02-17 cs.LG cs.AI 57%

Learning a Diffusion Model Policy from Rewards via Q-Score Matching

Michael Psenka, Alejandro Escontrela, Pieter Abbeel, Yi Ma

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments ICML 2024. 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09533 2025-02-14 cs.CV 57%

Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model

Fei Shen, Cong Wang, Junyao Gao, Qin Guo, Jisheng Dang, Jinhui Tang, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09434 2025-02-14 cs.CV 57%

Redistribute Ensemble Training for Mitigating Memorization in Diffusion Models

Xiaoliu Guan, Yu Wu, Huayang Huang, Xiao Liu, Jiaxu Miao, Yi Yang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 12 pages,9 figures. arXiv admin note: substantial text overlap with arXiv:2407.15328

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03635 2025-02-14 cs.CV 57%

SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration

Yuhong Zhang, Hengsheng Zhang, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments To be published in IEEE TCSVT

Journal ref Y. Zhang, H. Zhang, Z. Cheng, R. Xie, L. Song and W. Zhang, "SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration," in IEEE Transactions on Circuits and Systems for Video Technology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02371 2025-02-14 cs.CV 57%

OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang, Zhijie Chen, Xiang Li, Jian Yang, Ying Tai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 20 pages, 15 figures, Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06822 2025-02-12 cs.LG cs.CL cs.GR 57%

DiffListener: Discrete Diffusion Model for Listener Generation

Siyeol Jung, Taehwan Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10782 2025-02-11 cs.CV 57%

Bidirectional Multi-Step Domain Generalization for Visible-Infrared Person Re-Identification

Mahdi Alehdaghi, Pourya Shamsolmoali, Rafael M. O. Cruz, Eric Granger

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05534 2025-02-11 cs.CV 57%

Fg-T2M++: LLMs-Augmented Fine-Grained Text Driven Human Motion Generation

Yin Wang, Mu Li, Jiapeng Liu, Zhiying Leng, Frederick W. B. Li, Ziyao Zhang, Xiaohui Liang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15564 2025-02-11 cs.RO cs.AI cs.LG 57%

Diffusion-Based Planning for Autonomous Driving with Flexible Guidance

Yinan Zheng, Ruiming Liang, Kexin Zheng, Jinliang Zheng, Liyuan Mao, Jianxiong Li, Weihao Gu, Rui Ai, Shengbo Eben Li, Xianyuan Zhan, Jingjing Liu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09042 2025-02-11 cs.CV cs.GR cs.LG 57%

CookingDiffusion: Cooking Procedural Image Generation with Stable Diffusion

Yuan Wang, Bin Zhu, Yanbin Hao, Chong-Wah Ngo, Yi Tan, Xiang Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15328 2025-02-11 cs.CV 57%

Iterative Ensemble Training with Anti-Gradient Control for Mitigating Memorization in Diffusion Models

Xiao Liu, Xiaoliu Guan, Yu Wu, Jiaxu Miao

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Accepted in ECCV 2024, 20 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03240 2025-02-11 cs.CV 57%

Adaptive Generation of Privileged Intermediate Information for Visible-Infrared Person Re-Identification

Mahdi Alehdaghi, Arthur Josi, Pourya Shamsolmoali, Rafael M. O. Cruz, Eric Granger

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05165 2025-02-10 cs.CV 57%

Multitwine: Multi-Object Compositing with Text and Layout Control

Gemma Canet Tarrés, Zhe Lin, Zhifei Zhang, He Zhang, Andrew Gilbert, John Collomosse, Soo Ye Kim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04370 2025-02-10 cs.CL cs.GR cs.LG 57%

DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization

Zhenglin Zhou, Xiaobo Xia, Fan Ma, Hehe Fan, Yi Yang, Tat-Seng Chua

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏