arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2503.10738 2025-03-18 cs.CV cs.LG econ.EM 57%

Visual Polarization Measurement Using Counterfactual Image Generation

Mohammad Mosaffa, Omid Rafieian, Hema Yoganarasimhan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11038 2025-03-17 cs.CV 57%

ACMo: Attribute Controllable Motion Generation

Mingjie Wei, Xuemei Xie, Guangming Shi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08377 2025-03-17 cs.CV 57%

Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens

Qingsong Xie, Zhao Zhang, Zhe Huang, Yanhao Zhang, Haonan Lu, Zhenyu Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08179 2025-03-14 q-bio.BM cs.AI 57%

ProtTeX: Structure-In-Context Reasoning and Editing of Proteins with Large Language Models

Zicheng Ma, Chuanliu Fan, Zhicong Wang, Zhenyu Chen, Xiaohan Lin, Yanheng Li, Shihao Feng, Jun Zhang, Ziqiang Cao, Yi Qin Gao

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08307 2025-03-13 cs.CV 57%

$^R$FLAV: Rolling Flow matching for infinite Audio Video generation

Alex Ergasti, Giuseppe Gabriele Tarollo, Filippo Botti, Tomaso Fontanini, Claudio Ferrari, Massimo Bertozzi, Andrea Prati

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06955 2025-03-13 cs.CV 57%

Motion Anything: Any to Motion Generation

Zeyu Zhang, Yiran Wang, Wei Mao, Danning Li, Rui Zhao, Biao Wu, Zirui Song, Bohan Zhuang, Ian Reid, Richard Hartley

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08619 2025-03-12 cs.CV 57%

LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization

Xianfeng Wu, Yajing Bai, Haoze Zheng, Harold Haodong Chen, Yexin Liu, Zihao Wang, Xuran Ma, Wen-Jie Shu, Xianzu Wu, Harry Yang, Ser-Nam Lim

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Code: https://github.com/XianfengWu01/LightGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08168 2025-03-12 cs.CV 57%

TSCnet: A Text-driven Semantic-level Controllable Framework for Customized Low-Light Image Enhancement

Miao Zhang, Jun Yin, Pengyu Zeng, Yiqing Shen, Shuai Lu, Xueqian Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12371 2025-03-12 cs.RO cs.AI cs.LG 57%

IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation

Krishan Rana, Robert Lee, David Pershouse, Niko Suenderhauf

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Videos and code are available at https://imle-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06089 2025-03-12 cs.CV 57%

GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis

Ashish Goswami, Satyam Kumar Modi, Santhosh Rishi Deshineni, Harman Singh, Prathosh A. P, Parag Singla

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21826 2025-03-12 cs.CV 57%

Volumetric Conditioning Module to Control Pretrained Diffusion Models for 3D Medical Images

Suhyun Ahn, Wonjung Park, Jihoon Cho, Seunghyuck Park, Jinah Park

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 17 pages, 18 figures, accepted @ WACV 2025

Journal ref Proceedings of the Winter Conference on Applications of Computer Vision (WACV), pp. 85-95, Feb. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17525 2025-03-12 cs.CV 57%

Diffusion Model-Based Image Editing: A Survey

Yi Huang, Jiancheng Huang, Yifan Liu, Mingfu Yan, Jiaxi Lv, Jianzhuang Liu, Wei Xiong, He Zhang, Liangliang Cao, Shifeng Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06860 2025-03-11 cs.CV 57%

Towards Generalization of Tactile Image Generation: Reference-Free Evaluation in a Leakage-Free Setting

Cagri Gungor, Derek Eppinger, Adriana Kovashka

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04684 2025-03-11 cs.LG cs.AI 57%

G2PDiffusion: Cross-Species Genotype-to-Phenotype Prediction via Evolutionary Diffusion

Mengdi Liu, Zhangyang Gao, Hong Chang, Stan Z. Li, Shiguang Shan, Xilin Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16855 2025-03-11 cs.CV 57%

DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation

Yuang Peng, Yuxin Cui, Haomiao Tang, Zekun Qi, Runpei Dong, Jing Bai, Chunrui Han, Zheng Ge, Xiangyu Zhang, Shu-Tao Xia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025, Project page: https://dreambenchplus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02082 2025-03-11 cs.CV 57%

WcDT: World-centric Diffusion Transformer for Traffic Scene Generation

Chen Yang, Yangfan He, Aaron Xuxiang Tian, Dong Chen, Jianhui Wang, Tianyu Shi, Arsalan Heydarian, Pei Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 7 pages, 5 figures

Journal ref ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09268 2025-03-11 cs.CV 57%

LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space

Guanwen Feng, Zhihao Qian, Yunan Li, Siyu Jin, Qiguang Miao, Chi-Man Pun

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04919 2025-03-10 cs.CV 57%

FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement

Ian Huang, Yanan Bao, Karen Truong, Howard Zhou, Cordelia Schmid, Leonidas Guibas, Alireza Fathi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10309 2025-03-10 cs.CV 57%

Modification Takes Courage: Seamless Image Stitching via Reference-Driven Inpainting

Ziqi Xie, Xiao Lai, Weidong Zhao, Siqi Jiang, Xianhui Liu, Wenlong Hou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03689 2025-03-06 cs.CV 57%

DualDiff+: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance

Zhao Yang, Zezhong Qian, Xiaofan Li, Weixiang Xu, Gongpeng Zhao, Ruohong Yu, Lingsi Zhu, Longjun Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02701 2025-03-05 cs.AI 57%

MindBridge: Scalable and Cross-Model Knowledge Editing via Memory-Augmented Modality

Shuaike Li, Kai Zhang, Qi Liu, Enhong Chen

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02206 2025-03-05 cs.CV 57%

Language-Guided Visual Perception Disentanglement for Image Quality Assessment and Conditional Image Generation

Zhichao Yang, Leida Li, Pengfei Chen, Jinjian Wu, Giuseppe Valenzise

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02127 2025-03-05 cs.CV 57%

HanDrawer: Leveraging Spatial Information to Render Realistic Hands Using a Conditional Diffusion Model in Single Stage

Qifan Fu, Xu Chen, Muhammad Asad, Shanxin Yuan, Changjae Oh, Gregory Slabaugh

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02048 2025-03-05 cs.RO cs.AI 57%

FRMD: Fast Robot Motion Diffusion with Consistency-Distilled Movement Primitives for Smooth Action Generation

Xirui Shi, Jun Jin

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2406.01586 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01873 2025-03-05 cs.LG cs.AI cs.NA cs.PF math.NA 57%

Online Pseudo-average Shifting Attention(PASA) for Robust Low-precision LLM Inference: Algorithms and Numerical Analysis

Long Cheng, Qichen Liao, Fan Wu, Junlin Mu, Tengfei Han, Zhe Qiu, Lianqiang Li, Tianyi Liu, Fangzheng Miao, Keming Gao, Liang Wang, Zhen Zhang, Qiande Yin

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 21 Pages, 14 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19047 2025-03-04 cs.CV 57%

A Dual-Purpose Framework for Backdoor Defense and Backdoor Amplification in Diffusion Models

Vu Tuan Truong, Long Bao Le

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17436 2025-03-04 cs.LG cs.CV 57%

Towards Hierarchical Rectified Flow

Yichi Zhang, Yici Yan, Alex Schwing, Zhizhen Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2025; Project Page: https://riccizz.github.io/HRF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13426 2025-03-04 cs.CV 57%

HMD^2: Environment-aware Motion Generation from Single Egocentric Head-Mounted Device

Vladimir Guzov, Yifeng Jiang, Fangzhou Hong, Gerard Pons-Moll, Richard Newcombe, C. Karen Liu, Yuting Ye, Lingni Ma

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments International Conference on 3D Vision 2025 (3DV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11909 2025-03-04 cs.LG cs.AI 57%

Mixture-of-Subspaces in Low-Rank Adaptation

Taiqiang Wu, Jiahao Wang, Zhe Zhao, Ngai Wong

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments EMNLP 2024 Main, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04465 2025-03-04 cs.CV 57%

FitDiff: Robust monocular 3D facial shape and reflectance estimation using Diffusion Models

Stathis Galanakis, Alexandros Lattas, Stylianos Moschoglou, Stefanos Zafeiriou

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏