arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 26 篇

2603.00426 2026-03-03 cs.CL cs.CV 84%

LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation

基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成

Cunyuan Yang, Dejuan Song, Xiaotao Pang, Qianqian Shen, Wenjie Nie, Yifan Huang, Lei Wu, Wei Han, Haishuai Wang, Jiajun Bu

机构 * Zhejiang University(浙江大学) The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI 84%

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03292 2026-03-03 cs.SE cs.AI cs.HC 83%

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01965 2026-03-03 cs.LG q-bio.QM 82%

CoVAE: correlated multimodal generative modeling

CoVAE:相关多模态生成建模

Federico Caretti, Guido Sanguinetti

机构 * Scuola Internazionale Superiore di Studi Avanzati(国际先进研究学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 CoVAE通过捕捉多模态之间的相关性,改进了多模态生成建模,实现了准确的跨模态重建和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15281 2026-03-03 cs.IR cs.LG 82%

MMQ: Multimodal Mixture-of-Quantization Tokenization for Semantic ID Generation and User Behavioral Adaptation

MMQ: 多模态混合量化标记化用于语义ID生成和用户行为适应

Yi Xu, Moyu Zhang, Chenxuan Li, Zhihao Liao, Haibo Xing, Hao Deng, Jinxin Hu, Yu Zhang, Xiaoyi Zeng, Jing Zhang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Wuhan University, School of Computer Science(武汉大学计算机学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MMQ通过多模态混合量化标记化方法,解决推荐系统中多模态协同、特定性和行为适应的挑战,提升语义ID生成和用户行为适应能力。

Journal ref Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 81%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI 81%

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01253 2026-03-03 cs.CV 79%

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

跨模态引导用于快速扩散基于计算机断层扫描

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种无需重新训练扩散模型的跨模态引导方法,用于提升稀疏视图中子CT的重建质量。

Comments Accepted at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00905 2026-03-03 cs.CV 70%

pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning

pySpatial: 为零样本空间推理生成3D视觉程序

Zhanpeng Luo, Ce Zhang, Silong Yong, Cunxi Dai, Qianwei Wang, Haoxi Ran, Guanya Shi, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) University of Michigan(密歇根大学)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。

Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07940 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM:测试时优化与记忆化用于组合视频生成

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。

Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10941 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

VINCIE: Unlocking In-context Image Editing from Video

VINCIE:从视频中解锁上下文图像编辑

Leigang Qu, Feng Cheng, Ziyan Yang, Qi Zhao, Shanchuan Lin, Yichun Shi, Yicong Li, Wenjie Wang, Tat-Seng Chua, Lu Jiang

机构 * National University of Singapore(国立新加坡大学) ByteDance Seed(字节跳动种子)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VINCIE通过视频直接训练模型,实现了强大的上下文图像编辑能力,并在多轮图像编辑基准中取得最佳成绩。

Comments ICLR 2026 Camera-ready. Project page: https://vincie2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 67%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14341 2026-03-03 cs.CV cs.AI cs.CY cs.LG 62%

Towards Transferable Defense Against Malicious Image Edits

面向恶意图像编辑的可迁移防御

Jie Zhang, Shuai Dong, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 TDAE通过双模优化提升图像对恶意编辑的免疫性,实现跨模型的可迁移防御。

Comments 14 pages, 5 figures, accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02253 2026-03-03 cs.CV cs.AI cs.LG 62%

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑

Zihan Zhou, Shilin Lu, Shuli Leng, Shaocong Zhang, Zhuming Lian, Xinlei Yu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16145 2026-03-03 cs.AI cs.CL 62%

SpiroLLM: Finetuning Pretrained LLMs to Understand Spirogram Time Series with Clinical Validation in COPD Reporting

SpiroLLM:通过临床验证在COPD报告中微调预训练大语言模型以理解肺功能时间序列

Shuhao Mei, Yongchao Long, Xiaoyu Xiao, Shan Cao, Xiaobo Han, Shijia Geng, Jinbo Sun, Yuxi Zhou, Shenda Hong

机构 * Guangzhou Institute of Technology, Xidian University, Xi’an, China(广州科技研究院,西安电子科技大学,中国) Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院,天津,中国) Department of Respiratory, The Second Hospital of Tianjin Medical University, China(天津医科大学第二医院呼吸科,中国) College of Pulmonary and Critical Care Medicine, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院呼吸与危重症医学科,北京,中国) HeartVoice Medical Technology, Hefei, China(合肥心声医疗技术有限公司,中国) School of Life Science and Technology, Xidian University, Xi’an, China(西安电子科技大学生命科学与技术学院,中国) National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院,北京,中国) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院,北京,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SpiroLLM通过融合生理信号与大语言模型,实现对肺功能时间序列的解读,并在COPD诊断中展现出高准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12734 2026-03-03 cs.SD cs.AI cs.GR cs.HC eess.AS 62%

SounDiT: Geo-Contextual Soundscape-to-Landscape Generation

SounDiT:基于地理情境的声音景观到景观生成

Junbo Wang, Haofeng Tan, Bowen Liao, Albert Jiang, Teng Fei, Qixing Huang, Bing Zhou, Zhengzhong Tu, Shan Ye, Yuhao Kang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Tennessee, Knoxville(田纳西大学基洛纳分校) University of South Carolina(南卡罗来纳大学) Arizona State University(亚利桑那州立大学) University of Canterbury(坎特伯雷大学) Texas A&M University(德克萨斯A&M大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 SounDiT通过结合环境声音景观和地理情境条件,生成地理上一致的景观图像,并引入Place Similarity Score评估生成一致性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00155 2026-03-03 cs.CV cs.AI cs.IR 62%

EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection

EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成

Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan University(武汉大学) Beijing University of Posts and Telecommunications(北京邮电大学) Dalian Maritime University(大连海事大学) Renmin University of China(中国人民大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 EfficientPosterGen通过语义感知检索、视觉上下文压缩和无代理布局检测技术,实现高效且可靠的学术海报自动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02138 2026-03-03 cs.CV 57%

OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

OmniLottie:通过参数化Lottie令牌生成向量动画

Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。

Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01552 2026-03-03 cs.CV 57%

Align-cDAE: Alzheimer's Disease Progression Modeling with Attention-Aligned Conditional Diffusion Auto-Encoder

Align-cDAE: 利用注意力对齐的条件扩散自编码器进行阿尔茨海默病进展建模

Ayantika Das, Keerthi Ram, Mohanasankar Sivaprakasam

机构 * Department of Electrical Engineering, Indian Institute of Technology Madras, Chennai, India(电子工程系,印度理工学院马德拉斯,钦奈,印度) Sudha Gopalakrishnan Brain Centre, Indian Institute of Technology Madras, Chennai, India(苏达·戈帕拉克里希南脑中心,印度理工学院马德拉斯,钦奈,印度) Department of Electrical Engineering, Indian Institute of Technology Madras Chennai, India(电子工程系,印度理工学院马德拉斯钦奈,印度)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Align-cDAE通过引入注意力对齐和结构化潜在空间,提升扩散自编码器在阿尔茨海默病进展建模中的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01068 2026-03-03 cs.CV cs.LG 57%

LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model

LLaDA-o:一种高效且长度自适应的多模态扩散模型

Zebin You, Xiaolu Zhang, Jun Zhou, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China.(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LLaDA-o通过混合扩散框架和数据驱动的长度适应策略,实现了高效且灵活的多模态扩散建模,展示了在文本到图像生成任务中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11758 2026-03-03 q-bio.QM cs.AI 57%

Protein Structure Tokenization via Geometric Byte Pair Encoding

通过几何字对编码进行蛋白质结构分词

Michael Sun, Weize Yuan, Gang Liu, Wojciech Matusik, Marinka Zitnik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Harvard Medical School(哈佛医学院) Apple(苹果公司) Notre Dame(诺特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 GeoBPE通过几何字对编码实现蛋白质结构分词,提供压缩、数据效率和泛化能力,支持多架构应用并增强功能解释性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00521 2026-03-03 cs.LG cs.AI 57%

Phys-Diff: A Physics-Inspired Latent Diffusion Model for Tropical Cyclone Forecasting

Phys-Diff:一种基于物理的潜在扩散模型用于热带气旋预测

Lei Liu, Xiaoning Yu, Kang Chen, Jiahui Huang, Tengyuan Liu, Hongwei Zhao, Bin Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 Phys-Diff通过结合物理启发的归纳偏置和多模态数据整合,提升热带气旋预测的物理一致性与性能

Comments 5 pages, 4 figures. Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00266 2026-03-03 cs.CV 57%

Adversarial Patch Generation for Visual-Infrared Dense Prediction Tasks via Joint Position-Color Optimization

为视觉-红外密集预测任务生成对抗性补丁的联合位置-颜色优化

He Li, Wenyue He, Weihang Kong, Xingchen Zhang

机构 * Yanshan University(燕山大学) University of Exeter(埃克塞特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AP-PCO框架,通过联合优化位置和颜色生成对抗性补丁,提升视觉-红外密集预测任务中的攻击性能和隐蔽性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10980 2026-03-03 cs.CV 57%

TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation

TrueSkin: 向公平和准确的皮肤色调识别与生成迈进

Haoming Lu

机构 * Topaz Labs(Topaz实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 TrueSkin通过系统化的皮肤色调数据集,提升模型在公平性和准确性上的表现,验证了其在识别和生成任务中的有效性。

Comments The dataset is available for download at https://drive.google.com/file/d/1_ndw5uyY4h4DLL5iGTL4bVDKdE_g_H4B/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00116 2026-03-03 cs.CV 57%

VoxelDiffusionCut: Non-destructive Internal-part Extraction via Iterative Cutting and Structure Estimation

VoxelDiffusionCut:通过迭代切割和结构估计实现非破坏性内部部件提取

Takumi Hachimine, Yuhwan Kwon, Cheng-Yu Kuo, Tomoya Yamanokuchi, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology(信息科学系,科学技术研究生学校,奈良科学技术研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VoxelDiffusionCut通过迭代切割和结构估计方法,利用扩散模型估计体素结构以实现非破坏性内部部件提取。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏