arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2506.02419 2025-06-04 cs.CV 57%

Guiding Registration with Emergent Similarity from Pre-Trained Diffusion Models

Nurislam Tursynbek, Hastings Greer, Basar Demir, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) UCSD(加州大学圣地亚哥分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02073 2025-06-04 cs.SE cs.AI 57%

Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability

Mengliang He, Jiayi Zeng, Yankai Jiang, Wei Zhang, Zeming Liu, Xiaoming Shi, Aimin Zhou

机构 * East China Normal University(华东师范大学) Shanghai AI Lab(上海人工智能实验室) Beihang University(北航大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01014 2025-06-02 cs.CV 57%

AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction

Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23675 2025-05-30 eess.IV cs.CV 57%

ImmunoDiff: A Diffusion Model for Immunotherapy Response Prediction in Lung Cancer

Moinak Bhattacharya, Judy Huang, Amna F. Sher, Gagandeep Singh, Chao Chen, Prateek Prasanna

机构 * Stony Brook University(石溪大学) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23119 2025-05-30 cs.CV 57%

TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance

Keren Ye, Ignacio Garcia Dorado, Michalis Raptis, Mauricio Delbracio, Irene Zhu, Peyman Milanfar, Hossein Talebi

机构 * Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22869 2025-05-30 cs.CV cs.LG q-bio.BM 57%

CFP-Gen: Combinatorial Functional Protein Generation via Diffusion Language Models

Junbo Yin, Chao Zha, Wenjia He, Chencheng Xu, Xin Gao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICML 2025. Code is available at https://github.com/yinjunbo/cfpgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22866 2025-05-30 cs.LG cs.AI 57%

Scaling Offline RL via Efficient and Expressive Shortcut Models

Nicolas Espinosa-Dice, Yiyi Zhang, Yiding Chen, Bradley Guo, Owen Oertell, Gokul Swamy, Kiante Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 32 pages, 5 figures. Under review at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22101 2025-05-29 cs.CL 57%

MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models

Zhiyu Li, Shichao Song, Hanyu Wang, Simin Niu, Ding Chen, Jiawei Yang, Chenyang Xi, Huayi Lai, Jihao Zhao, Yezhaohui Wang, Junpeng Ren, Zehao Lin, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhiqiang Yin, Qingchen Yu, Bo Tang, Hongkang Yang, Zhi-Qin John Xu, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Research Institute of China Telecom(中国电信研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18869 2025-05-29 cs.CV 57%

Eye-See-You: Reverse Pass-Through VR and Head Avatars

Ankan Dash, Jingyi Gu, Guiling Wang, Chen Chen

机构 * New Jersey Institute of Technology(新泽西理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 34th International Joint Conference on Artificial Intelligence, IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21146 2025-05-28 cs.GR cs.CV 57%

IKMo: Image-Keyframed Motion Generation with Trajectory-Pose Conditioned Motion Diffusion Model

Yang Zhao, Yan Zhang, Xubo Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07538 2025-05-28 cs.CV 57%

Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning

Bohan Wang, Zhongqi Yue, Fengda Zhang, Shuo Chen, Li'an Bi, Junzhe Zhang, Xue Song, Kennard Yanting Chan, Jiachun Pan, Weijia Wu, Mingze Zhou, Wang Lin, Kaihang Pan, Saining Zhang, Liyu Jia, Wentao Hu, Wei Zhao, Hanwang Zhang

机构 * Selftok Team(Selftok团队) Media Technology Institute(媒体技术研究所) Huawei(华为)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09441 2025-05-28 cs.CV eess.IV 57%

Structure-Accurate Medical Image Translation via Dynamic Frequency Balance and Knowledge Guidance

Jiahua Xu, Dawei Zhou, Lei Hu, Zaiyi Liu, Nannan Wang, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Guangdong Provincial People’s Hospital(广东省人民医院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Medical image translation, Diffusion model, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20106 2025-05-27 cs.CV 57%

From Data to Modeling: Fully Open-vocabulary Scene Graph Generation

Zuyao Chen, Jinlin Wu, Zhen Lei, Chang Wen Chen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) CAIR, HKISI-CAS(中国科学院香港创新研究院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所马克思主义学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18142 2025-05-27 cs.CV cs.DB 57%

TokBench: Evaluating Your Visual Tokenizer before Visual Generation

Junfeng Wu, Dongliang Luo, Weizhi Zhao, Zhihao Xie, Yuanhao Wang, Junyi Li, Xudong Xie, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Benchmark, homepagee: https://wjf5203.github.io/TokBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19239 2025-05-27 cs.CV 57%

DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving

Chen Shi, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18730 2025-05-27 cs.CV 57%

Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation

Wenchao Zhang, Jiahe Tian, Runze He, Jizhong Han, Jiao Dai, Miaomiao Feng, Wei Mi, Xiaodan Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Code: https://github.com/smile365317/ABP

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06814 2025-05-27 cs.LG cs.AI cs.GR 57%

Diffusion Instruction Tuning

Chen Jin, Ryutaro Tanno, Amrutha Saseendran, Tom Diethe, Philip Teare

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Project page at https://astrazeneca.github.io/vlm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17311 2025-05-26 cs.CV cs.LG 57%

Harnessing EHRs for Diffusion-based Anomaly Detection on Chest X-rays

Harim Kim, Yuhan Wang, Minkyu Ahn, Heeyoul Choi, Yuyin Zhou, Charmgil Hong

机构 * Handong Global University(Handong Global大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments MICCAI 2025 early accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16829 2025-05-26 cs.AI 57%

Visual Prompting with Iterative Refinement for Design Critique Generation

Peitong Duan, Chin-Yi Cheng, Bjoern Hartmann, Yang Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10590 2025-05-26 cs.LG cs.AI 57%

Bidirectional Generation of Structure and Properties Through a Single Molecular Foundation Model

Jinho Chang, Jong Chul Ye

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Journal ref Nature Communications, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16982 2025-05-23 cs.AI physics.med-ph 57%

Beyond Correlation: Towards Causal Large Language Model Agents in Biomedicine

Adib Bazgir, Amir Habibdoust Lafmajani, Yuwen Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16094 2025-05-23 cs.LG cs.CL 57%

A Survey of Large Language Models for Text-Guided Molecular Discovery: from Molecule Generation to Optimization

Ziqing Wang, Kexin Zhang, Zihan Zhao, Yibo Wen, Abhishek Pandey, Han Liu, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14785 2025-05-23 cs.CV 57%

DC4CR: When Cloud Removal Meets Diffusion Control in Remote Sensing

Zhenyu Yu, Mohd Yamani Idna Idris, Pei Wang

机构 * Kunming University of Science and Technology(昆明理工大学) Universiti Malaya(马来亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15145 2025-05-22 cs.CV 57%

CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation

Xinran Wang, Songyu Xu, Xiangxuan Shan, Yuxuan Zhang, Muxi Diao, Xueyan Duan, Yanhua Huang, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Research Institute(中国移动研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14139 2025-05-21 cs.LG cs.AI cs.RO 57%

FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning

Marvin Alles, Nutan Chen, Patrick van der Smagt, Botond Cseke

机构 * Machine Learning Research Lab, Volkswagen Group(大众集团机器学习研究实验室) Technical University of Munich(慕尼黑技术大学) Foundation Robotics Labs, Munich(慕尼黑基础机器人实验室) Eötvös Loránd University(劳尔·艾尔多迪大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12098 2025-05-20 cs.CV 57%

LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation

Jiarui Wang, Huiyu Duan, Ziheng Jia, Yu Zhao, Woo Yi Yang, Zicheng Zhang, Zijian Chen, Juntong Wang, Yuke Xing, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) MoE Key Lab of Artificial Intelligence(人工智能MoE重点实验室) AI Institute(人工智能研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11610 2025-05-20 cs.AI cs.LG q-bio.BM q-bio.GN 57%

Foundation Models for AI-Enabled Biological Design

Asher Moldwin, Amarda Shehu

机构 * Asher Moldwin(1 阿什尔·莫尔德温) Amarda Shehu(1 阿玛尔达·谢胡)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Published as part of the workshop proceedings at AAAI 2025 in the workshop "Foundation Models for Biological Discoveries"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10584 2025-05-19 cs.CV 57%

Aquarius: A Family of Industry-Level Video Generation Models for Marketing Scenarios

Huafeng Shi, Jianzhong Liang, Rongchang Xie, Xian Wu, Cheng Chen, Chang Liu

机构 * ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10046 2025-05-16 cs.CV 57%

Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis

Bingda Tang, Boyang Zheng, Xichen Pan, Sayak Paul, Saining Xie

机构 * New York University(纽约大学) Hugging Face

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06512 2025-05-16 cs.CV 57%

HCMA: Hierarchical Cross-model Alignment for Grounded Text-to-Image Generation

Hang Wang, Zhi-Qi Cheng, Chenhao Lin, Chao Shen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏