arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2510.00428 2025-10-02 cs.LG cs.AI 57%

Automated Structured Radiology Report Generation with Rich Clinical Context

Seongjae Kang, Dong Bok Lee, Juho Jung, Dongseop Kim, Won Hwa Kim, Sunghoon Joo

机构 * VUNO Inc.(VUNO公司) KAIST(韩国科学技术院) POSTECH(POSTECH大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 34 pages, 30 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25401 2025-10-01 cs.LG cs.AI cs.PF 57%

FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers

Liang Qiao, Yue Dai, Yeqi Huang, Hongyu Kan, Jun Shi, Hong An

机构 * University of Science and Technology of China(中国科学技术大学) University of Edinburgh(爱丁堡大学) University of Virginia(弗吉尼亚大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25229 2025-10-01 cs.AI 57%

Blueprint-Bench: Comparing spatial intelligence of LLMs, agents and image models

Lukas Petersson, Axel Backlund, Axel Wennstöm, Hanna Petersson, Callum Sharrock, Arash Dabiri

机构 * Andon Labs(安登实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 8 figures, submitted for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24903 2025-09-30 cs.RO cs.CV eess.IV 57%

DRCP: Diffusion on Reinforced Cooperative Perception for Perceiving Beyond Limits

Lantao Li, Kang Yang, Rui Song, Chen Sun

机构 * Sony (China) Limited(索尼(中国)有限公司) Renmin University of China(中国人民大学) Fraunhofer IVI(弗劳恩霍夫IVI研究所)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24875 2025-09-30 cs.CV cs.LG 57%

Environment-Aware Satellite Image Generation with Diffusion Models

Nikos Kostagiolas, Pantelis Georgiades, Yannis Panagakis, Mihalis A. Nicolaou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24514 2025-09-30 cs.CV 57%

Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency

Jiaqi Tan, Fangyu Li, Yang Liu

机构 * Beijing University of Posts(北京邮电大学) Telecommunications School of Digital Media(电信数字媒体学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24299 2025-09-30 cs.CV 57%

SVGThinker: Instruction-Aligned and Reasoning-Driven Text-to-SVG Generation

Hanqi Chen, Zhongyin Zhao, Ye Chen, Zhujin Liang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23955 2025-09-30 cs.CV 57%

ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation

Shilan Zhang, Jirui Huang, Ruilin Yao, Cong Wang, Yaxiong Chen, Peng Xu, Shengwu Xiong

机构 * Wuhan University of Technology(武汉理工大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10036 2025-09-30 cs.CL 57%

DataPuzzle: Breaking Free from the Hallucinated Promise of LLMs in Data Analysis

Zhengxuan Zhang, Zhuowen Liang, Yin Wu, Teng Lin, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22573 2025-09-29 cs.RO cs.CV 57%

MINT-RVAE: Multi-Cues Intention Prediction of Human-Robot Interaction using Human Pose and Emotion Information from RGB-only Camera Data

Farida Mohsen, Ali Safa

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22485 2025-09-29 cs.CV 57%

Group Critical-token Policy Optimization for Autoregressive Image Generation

Guohui Zhang, Hu Yu, Xiaoxiao Ma, JingHao Zhang, Yaning Pan, Mingde Yao, Jie Xiao, Linjiang Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) CUHK(香港中文大学) Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Code is available at https://github.com/zghhui/GCPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21997 2025-09-29 cs.CV 57%

Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21760 2025-09-29 cs.CV 57%

UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models

Lan Chen, Yuchao Gu, Qi Mao

机构 * MIPG, Communication University of China(信息与通信大学) Show Lab, National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20253 2025-09-29 cs.RO cs.AI 57%

AnchDrive: Bootstrapping Diffusion Policies with Hybrid Trajectory Anchors for End-to-End Driving

Jinhao Chai, Anqing Jiang, Hao Jiang, Shiyi Mu, Zichong Gu, Hao Sun, Shugong Xu

机构 * School of Communication and Information Engineering, Shanghai University, Shanghai 200444, China(信息工程学院,上海大学) Bosch Corporate Research, Bosch (China) Investment Ltd., Shanghai, China(博世企业研究,博世(中国)投资有限公司) School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai, China(机械工程学院,上海交通大学) Xi'an Jiaotong-Liverpool University, Suzhou, China(西安交通大学利物浦大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17094 2025-09-26 cond-mat.mtrl-sci cs.AI cs.LG 57%

DiffSyn: A Generative Diffusion Approach to Materials Synthesis Planning

Elton Pan, Soonhyoung Kwon, Sulin Liu, Mingrou Xie, Alexander J. Hoffman, Yifei Duan, Thorben Prein, Killian Sheriff, Yuriy Roman-Leshkov, Manuel Moliner, Rafael Gomez-Bombarelli, Elsa Olivetti

机构 * Instituto de Tecnología Química, Universitat Politècnica de València-Consejo Superior de Investigaciones Científicas(化学技术研究所,瓦伦西亚理工大学-西班牙高等科学研究理事会)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17223 2025-09-25 cs.CV 57%

DreamMix: Decoupling Object Attributes for Enhanced Editability in Customized Image Inpainting

Yicheng Yang, Pengxiang Li, Lu Zhang, Liqian Ma, Ping Hu, Siyu Du, Yunzhi Zhuge, Xu Jia, Huchuan Lu

机构 * Information and Communication Engineering(信息与通信工程) Dalian University of Technology(大连理工大学) ZMO.AI Inc.(ZMO.AI公司) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19937 2025-09-25 cs.CV 57%

GS-RoadPatching: Inpainting Gaussians via 3D Searching and Placing for Driving Scenes

Guo Chen, Jiarun Liu, Sicong Du, Chenming Wu, Deqi Li, Shi-Sheng Huang, Guofeng Zhang, Sheng Yang

机构 * Beijing Normal University China Unmanned Vehicle Dept., Cainiao, Alibaba \& State Key Lab of CAD\&CG, Zhejiang University China Unmanned Vehicle Dept., Cainiao, Alibaba China Baidu China State Key Lab of CAD\&CG, Zhejiang University China Beijing Normal University Unmanned Vehicle Dept., Cainiao, Alibaba \& State Key Lab of CAD\&CG, Zhejiang University Unmanned Vehicle Dept., Cainiao, Alibaba Baidu State Key Lab of CAD\&CG, Zhejiang University

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04545 2025-09-24 cs.CV 57%

PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting

Linqing Wang, Ximing Xing, Yiji Cheng, Zhiyuan Zhao, Donghao Li, Tiankai Hang, Jiale Tao, Qixun Wang, Ruihuang Li, Comi Chen, Xin Li, Mingrui Wu, Xinchi Deng, Shuyang Gu, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://hunyuan-promptenhancer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17281 2025-09-23 cs.LG cs.AI cs.CY 57%

Training the next generation of physicians for artificial intelligence-assisted clinical neuroradiology: ASNR MICCAI Brain Tumor Segmentation (BraTS) 2025 Lighthouse Challenge education platform

Raisa Amiruddin, Nikolay Y. Yordanov, Nazanin Maleki, Pascal Fehringer, Athanasios Gkampenis, Anastasia Janas, Kiril Krantchev, Ahmed Moawad, Fabian Umeh, Salma Abosabie, Sara Abosabie, Albara Alotaibi, Mohamed Ghonim, Mohanad Ghonim, Sedra Abou Ali Mhana, Nathan Page, Marko Jakovljevic, Yasaman Sharifi, Prisha Bhatia, Amirreza Manteghinejad, Melisa Guelen, Michael Veronesi, Virginia Hill, Tiffany So, Mark Krycia, Bojan Petrovic, Fatima Memon, Justin Cramer, Elizabeth Schrickel, Vilma Kosovic, Lorenna Vidal, Gerard Thompson, Ichiro Ikuta, Basimah Albalooshy, Ali Nabavizadeh, Nourel Hoda Tahon, Karuna Shekdar, Aashim Bhatia, Claudia Kirsch, Gennaro D'Anna, Philipp Lohmann, Amal Saleh Nour, Andriy Myronenko, Adam Goldman-Yassen, Janet R. Reid, Sanjay Aneja, Spyridon Bakas, Mariam Aboian

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 23 pages, 9 figures, 1 table, 3 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21535 2025-09-23 eess.IV cs.CV cs.LG 57%

Exploring the Design Space of 3D MLLMs for CT Report Generation

Mohammed Baharoon, Jun Ma, Congyu Fang, Augustin Toma, Bo Wang

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Peter Munk Cardiac Centre, University Health Network(皮特·蒙克心脏中心,大学健康网络) Medical Biophysics, University of Toronto(医学生物物理系,多伦多大学) Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Department of Laboratory Medicine and Pathobiology, University of Toronto(实验室医学与病理学系,多伦多大学) AI Hub, University Health Network(人工智能中心,大学健康网络)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16806 2025-09-23 cs.CV 57%

FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation

Fan Yang, Yousong Zhu, Xin Li, Yufei Zhan, Hongyin Zhao, Shurong Zheng, Yaowei Wang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00455 2025-09-23 cs.RO cs.AI cs.LG 57%

Diffusion Graph Neural Networks and Dataset for Robust Olfactory Navigation in Hazard Robotics

Kordel K. France, Ovidiu Daescu

机构 * Dept. of Computer Science University of Texas at Dallas Richardson, TX, USA(计算机科学系 德州大学达拉斯分校 Richardson, TX, USA)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16436 2025-09-23 cs.CV 57%

Improved mmFormer for Liver Fibrosis Staging via Missing-Modality Compensation

Zhejia Zhang, Junjie Wang, Le Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14638 2025-09-19 cs.CV 57%

MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks

Mingsong Li, Lin Liu, Hongjun Wang, Haoxing Chen, Xijun Gu, Shizhan Liu, Dong Gong, Junbo Zhao, Zhenzhong Lan, Jianguo Li

机构 * University of New South Wales(新南威尔士大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14303 2025-09-19 cs.RO cs.AI 57%

FlowDrive: Energy Flow Field for End-to-End Autonomous Driving

Hao Jiang, Zhipeng Zhang, Yu Gao, Zhigang Sun, Yiru Wang, Yuwen Heng, Shuo Wang, Jinhao Chai, Zhuo Chen, Hao Zhao, Hao Sun, Xi Zhang, Anqing Jiang, Chuan Hu

机构 * Shanghai Jiao Tong University(上海交通大学) Bosch Corporate Research, Shanghai, China(博世股份有限公司上海研究院) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai University, Shanghai, China(上海大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11277 2025-09-19 cs.CV cs.LG 57%

Probing the Representational Power of Sparse Autoencoders in Vision Models

Matthew Lyle Olson, Musashi Hinck, Neale Ratzlaff, Changbai Li, Phillip Howard, Vasudev Lal, Shao-Yen Tseng

机构 * Oracle Intel Labs(英特尔实验室) Oregon State University(俄勒冈州立大学) Thoughtworks

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13760 2025-09-18 cs.CV 57%

Iterative Prompt Refinement for Safer Text-to-Image Generation

Jinwoo Jeon, JunHyeok Oh, Hayeong Lee, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13696 2025-09-18 cs.CL 57%

Integrating Text and Time-Series into (Large) Language Models to Predict Medical Outcomes

Iyadh Ben Cheikh Larbi, Ajay Madhavan Ravichandran, Aljoscha Burchardt, Roland Roller

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Technical University Berlin(柏林技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments Presented and published at BioCreative IX

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13235 2025-09-17 cs.AI 57%

A Scenario-Driven Cognitive Approach to Next-Generation AI Memory

Linyue Cai, Yuyang Cheng, Xiaoding Shao, Huiming Wang, Yong Zhao, Wei Zhang, Kang Li

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Cyber Science and Engineering, Sichuan University(四川大学网络科学与工程学院) West China Biomedical Big Data Center, Sichuan University West China Hospital(四川大学华西生物医学大数据中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11865 2025-09-16 cs.RO cs.AI 57%

Tenma: Robust Cross-Embodiment Robot Manipulation with Diffusion Transformer

Travis Davies, Yiqi Huang, Yunxin Liu, Xiang Chen, Huxian Liu, Luhui Hu

机构 * ZhiCheng AI(智成人工智能) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏