arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2506.18527 2025-07-15 cs.CV 57%

Auto-Regressively Generating Multi-View Consistent Images

JiaKui Hu, Yuxiao Yang, Jialun Liu, Jinbo Wu, Chen Zhao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center, Peking University(北京大学医学部医学技术研究所) Baidu VIS(百度VIS) Biomedical Engineering Department, College of Future Technology, Peking University(未来技术学院生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Tsinghua University(清华大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Code is at https://github.com/MILab-PKU/MVAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01381 2025-07-14 cs.LG cs.AI 57%

Distributional Soft Actor-Critic with Diffusion Policy

Tong Liu, Yinuo Wang, Xujie Song, Wenjun Zou, Liangfa Chen, Likun Wang, Bin Shuai, Jingliang Duan, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动学院,清华大学) School of Mechanical Engineering, University of Science and Technology Beijing(机械工程学院,北京科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Accepted IEEE ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07079 2025-07-10 cs.CV 57%

Evaluating Attribute Confusion in Fashion Text-to-Image Generation

Ziyue Liu, Federico Girella, Yiming Wang, Davide Talon

机构 * University of Verona(威尼斯大学) Polytechnic University of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Accepted to ICIAP25. Project page: site [https://intelligolabs.github.io/L-VQAScore/\

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06651 2025-07-10 cs.CV 57%

Diff$^2$I2P: Differentiable Image-to-Point Cloud Registration with Diffusion Prior

Juncheng Mu, Chengwei Ren, Weixiang Zhang, Liang Pan, Xiao-Ping Zhang, Yue Gao

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05963 2025-07-10 cs.CV 57%

Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation

Zhenghao Zhang, Junchao Liao, Xiangyu Meng, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments ACM MM25 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05588 2025-07-09 cs.CV 57%

Semi-Supervised Defect Detection via Conditional Diffusion and CLIP-Guided Noise Filtering

Shuai Li, Shihan Chen, Wanru Geng, Zhaohua Xu, Xiaolu Liu, Can Dong, Zhen Tian, Changlin Chen

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04151 2025-07-08 cs.CV 57%

Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation

Fernando Gabriela Garcia, Spencer Burns, Ryan Shaw, Hunter Young

机构 * Autonomous University of Nuevo León(新莱昂自治大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03908 2025-07-08 cs.CV 57%

Bridging Vision and Language: Optimal Transport-Driven Radiology Report Generation via LLMs

Haifeng Zhao, Yufei Zhang, Leilei Ma, Shuo Xu, Dengdi Sun

机构 * School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) School of Artificial Intelligence(人工智能学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01961 2025-07-08 cs.RO cs.AI 57%

AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation

Sixiang Chen, Jiaming Liu, Siyuan Qian, Han Jiang, Lily Li, Renrui Zhang, Zhuoyang Liu, Chenyang Gu, Chengkai Hou, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Nanjing University(南京大学) CUHK(香港中文大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Project website: https://ac-dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05344 2025-07-08 cs.CV 57%

SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs

Jiahui Wang, Zuyan Liu, Yongming Rao, Jiwen Lu

机构 * Tsinghua University(清华大学) Tencent Hunyuan X(腾讯混元实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20129 2025-07-08 cs.CV cs.GR 57%

Agentic 3D Scene Generation with Spatially Contextualized VLMs

Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project page: https://spatctxvlm.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03275 2025-07-08 cs.CV cs.LG 57%

ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization

Haosheng Gan, Berk Tinaz, Mohammad Shahab Sepehri, Zalan Fabian, Mahdi Soltanolkotabi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments An earlier version appeared in the CVPR 2025 Workshop on Generative Models for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02410 2025-07-08 eess.IV cs.CV 57%

Neuroverse3D: Developing In-Context Learning Universal Model for Neuroimaging in 3D

Jiesi Hu, Chenfei Ye, Yanwu Yang, Xutao Guo, Yang Shang, Pengcheng Shi, Hanyang Peng, Ting Ma

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) University Hospital Tübingen(图宾根大学医院) German Center for Mental Health (DZPG)(德国心理健康中心(DZPG))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02743 2025-07-04 cs.CV 57%

Prompt learning with bounding box constraints for medical image segmentation

Mélanie Gaillochet, Mehrdad Noori, Sahar Dastani, Christian Desrosiers, Hervé Lombaert

机构 * École de Technologie Supérieure Mila - Quebec AI Institute Polytechnique Montréal

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Biomedical Engineering (TMBE), 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20808 2025-07-04 cs.RO cs.AI cs.LG 57%

SoccerDiffusion: Toward Learning End-to-End Humanoid Robot Soccer from Gameplay Recordings

Florian Vahl, Jörn Griepenburg, Jan Gutsche, Jasper Güldenstein, Jianwei Zhang

机构 * University of Hamburg(汉堡大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01496 2025-07-03 cs.CV 57%

ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation

Jimyeong Kim, Jungwon Park, Yeji Song, Nojun Kwak, Wonjong Rhee

机构 * Department of Intelligence and Information(智能与信息系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Published at ICCV 2025. Project page: https://wlaud1001.github.io/ReFlex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00868 2025-07-03 cs.CV 57%

Is Visual in-Context Learning for Compositional Medical Tasks within Reach?

Simon Reiß, Zdravko Marinov, Alexander Jaus, Constantin Seibold, M. Saquib Sarfraz, Erik Rodner, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新) University of Applied Sciences Berlin(柏林应用技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04320 2025-07-03 cs.CV cs.LG 57%

ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features

Alec Helbling, Tuna Han Salih Meral, Ben Hoover, Pinar Yanardag, Duen Horng Chau

机构 * ibm(IBM研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Oral Presentation at ICML 2025, Best Paper Award at CVPR Workshop on Visual Concepts

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10685 2025-07-02 cs.CV cs.CR 57%

Defensive Adversarial CAPTCHA: A Semantics-Driven Framework for Natural Adversarial Example Generation

Xia Du, Xiaoyuan Liu, Jizhe Zhou, Zheng Lin, Chi-man Pun, Cong Wu, Tao Li, Zhe Chen, Wei Ni, Jun Luo

机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机科学学院、机器学习与工业智能工程研究中心) Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院计算机与信息科学系) Institute of Space Internet, Fudan University(复旦大学空间互联网研究所) Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) School of Computer Engineering, Nanyang Technological University(南洋理工大学计算机工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23295 2025-07-01 cs.CV 57%

DiffFit: Disentangled Garment Warping and Texture Refinement for Virtual Try-On

Xiang Xu

机构 * China Jiliang University(中国嘉兴大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10105 2025-07-01 cs.CV 57%

High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity

Qian Yu, Peng-Tao Jiang, Hao Zhang, Jinwei Chen, Bo Li, Lihe Zhang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02691 2025-07-01 cs.HC cs.AI 57%

LLM-Assisted Visual Analytics: Opportunities and Challenges

Maeve Hutchinson, Radu Jianu, Aidan Slingsby, Pranava Madhyastha

机构 * Department of Computer Science, City University of London(伦敦城市大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Accepted at EG UK Computer Graphics & Visual Computing 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11718 2025-06-30 cs.AI 57%

REMOR: Automated Peer Review Generation with LLM Reasoning and Multi-Objective Reinforcement Learning

Pawin Taechoyotin, Daniel Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Department of Information Science(信息科学系) ReviewerZero AI Inc.(ReviewerZero AI公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21276 2025-06-27 cs.CV 57%

WordCon: Word-level Typography Control in Scene Text Rendering

Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21245 2025-06-27 eess.IV cs.CV 57%

GANet-Seg: Adversarial Learning for Brain Tumor Segmentation with Hybrid Generative Models

Qifei Cui, Xinyu Lu

机构 * seas(海斯学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21022 2025-06-27 cs.CV 57%

Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation

Ze Wang, Hao Chen, Benran Hu, Jiang Liu, Ximeng Sun, Jialian Wu, Yusheng Su, Xiaodong Yu, Emad Barsoum, Zicheng Liu

机构 * AMD GenAI(AMD 生成人工智能)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20969 2025-06-27 cs.RO cs.CV 57%

ThermalDiffusion: Visual-to-Thermal Image-to-Image Translation for Autonomous Navigation

Shruti Bansal, Wenshan Wang, Yifei Liu, Parv Maheshwari

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted at Thermal Infrared in Robotics (TIRO) Workshop, ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14677 2025-06-25 cs.HC cs.AI 57%

Human-Centered Editable Speech-to-Sign-Language Generation via Streaming Conformer-Transformer and Resampling Hook

Yingchao Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17747 2025-06-24 physics.geo-ph cs.CE cs.CV cs.LG cs.NE 57%

Pix2Geomodel: A Next-Generation Reservoir Geomodeling with Property-to-Property Translation

Abdulrahman Al-Fakih, Ardiansyah Koeshidayatullah, Nabil A. Saraih, Tapan Mukerji, Rayan Kanfar, Abdulmohsen Alali, SanLinn I. Kaka

机构 * Departments of Energy Science & Engineering, Earth & Planetary Sciences, and Geophysics University, Stanford, CA, USA(能源科学与工程、地球与行星科学及地球物理大学,斯坦福大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17705 2025-06-24 cs.CV 57%

DreamJourney: Perpetual View Generation with Video Diffusion Models

Bo Pan, Yang Chen, Yingwei Pan, Ting Yao, Wei Chen, Tao Mei

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Laboratory of Art and Archaeology Image(艺术与考古图像实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏