The Multimodal And Modular Ai Chef: Complex Recipe Generation From Imagery
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 多模态生成 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 多模态生成 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments First Version, 16 pages
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2022 Workshop on Vision Transformers: Theory and Application, New Orleans, LA, December 2022
专题命中 多模态生成 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 36th Conference on Neural Information Processing Systems (NeurIPS 2022), Track on Datasets and Benchmarks. OpenReview: https://openreview.net/forum?id=M3Y74vmsMcY
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments EMNLP 2021
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments To appear at WACV 2019
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
统一的多模态理解和生成模型:进展、挑战与机遇
机构 * Alibaba Group(阿里巴巴集团) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Nanjing University(南京大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。
Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; Transcengram ; DeepSeek AI ; University of Hong Kong(香港大学)
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
Comments Project page: https://cad-mllm.github.io/
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 52 Pages with 16 Figures, 12 Tables, and 545 References. GitHub Repository at: https://github.com/YingqingHe/Awesome-LLMs-meet-Multimodal-Generation
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 多模态生成 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
面向表达性与忠实性的音频到图像生成:一个统一的多模态数据集与合成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; China Telecom (TeleAI)(中国电信(电信人工智能研究院)) ; Northwest Polytechnical University(西北工业大学)
专题命中 多模态生成 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对音频到图像生成受限于传统数据集的问题,提出A2I-Set数据集与AudioCanvas模型,实现了更优的跨模态对齐与视觉表达性。
Comments 23 pages, 16 figures
Ripple:基于跨模态循环记忆的实时流音频-视频生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)
专题命中 多模态生成 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。
FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Central South University(中南大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Microsoft(微软)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。
Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables
个性化多模态大语言模型中的群体偏好崩溃
机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 研究个性化多模态大语言模型中群体偏好崩溃问题,提出PrefMoE框架,它分离配置文件信息与偏好表示,分解偏好,保留个性化残差并通过单独路径路由因素,实验表明该框架能改善偏好敏感个性化并减少偏好崩溃。
用指南引导的多模态语言模型增强可解释的心脏诊断
机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) ; A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) ; VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) ; FPT University(FPT大学) ; Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。
Comments 12 pages, 3 figures, accepted at CITA 2026
LaViDa:用于多模态理解的大型扩散语言模型
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Adobe Research(Adobe研究) ; Salesforce Research(Salesforce研究)
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。
Comments 26 pages, 8 figures
UniICL:通过能力导向的分类系统化统一多模态上下文学习
机构 * Zhejiang University(浙江大学) ; Shanghai Jiaotong University(上海交通大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。
DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成
机构 * Kuaishou Technology(快手科技) ; AIM for Health Lab, Monash University(Monash大学AIM健康实验室)
专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。
MMControl: 多模态控制用于联合音频视频生成
机构 * Zhejiang University(浙江大学)
专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出MMControl,通过双流条件注入机制实现联合音频视频生成的多模态控制,支持视觉和听觉信号的精细控制,提升跨模态对齐效果。
Comments Accepted to ECCV 2026. Project page: https://aim-uofa.github.io/MMControl/
基于多模态大语言模型的放射科报告生成与临床知识增强
机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出一种融合多模态大语言模型与临床知识的放射科报告生成方法,通过解剖学特征提取、多模态报告生成及多任务学习提升报告的临床相关性与准确性。
CMDS-AD: 跨模态双流解耦用于少样本异常检测
机构 * Shenzhen University(深圳大学) ; Guangzhou Maritime University(广州航海学院) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。
Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/
MM-TRELLIS: 自动驾驶中基于点云引导的多模态3D车辆生成
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) ; Academy of Military Science(军事科学院) ; Bosch innovation software development (Wuxi) Co., Ltd.(博世创新软件开发(无锡)有限公司) ; College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) ; Shopee Pte. Ltd.(Shopee私人有限公司)
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出MM-TRELLIS,融合多视图图像与LiDAR点云,通过点云引导和体素过滤策略,实现高质量3D车辆生成,在Waymo数据集上优于现有方法。
TailorMind: 面向偏好对齐的多模态内容生成
机构 * South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出TailorMind框架,通过超图协同过滤和文本梯度下降建模用户偏好,结合检索增强风格控制和跨模态一致性反射,实现无候选池的个性化多模态内容生成,在TailorBench上优于基线。
Comments 18 pages, 13 figures, 6 tables. Code available at https://github.com/iLearn-Lab/TailorMind
使用多模态混合专家病理基础模型预测免疫生物标志物,赋能精准肿瘤学
机构 * Program of Computational Biology and Bioinforamtics, Yale University(耶鲁大学计算生物学与生物信息学项目) ; Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) ; Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) ; Department of Computer Science, Northeastern University(东北大学计算机科学系) ; Department of Computer Science, Harvard University(哈佛大学计算机科学系) ; Department of Pathology, Yale University(耶鲁大学病理学系) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(宾夕法尼亚大学医院解剖病理学与检验医学系) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(加州大学旧金山分校病理学与检验医学系) ; Department of Pathology and Laboratory Medicine, KK Women’s and Children’s Hospital(竹脚妇幼医院病理学与检验医学系) ; Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院生物统计学、流行病学与信息学系)
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 提出MixTIME多模态基础模型,采用混合专家架构整合不同模态的病理基础模型,从HE全切片图像预测多重免疫荧光蛋白表达,在17个蛋白标记物上达到最优性能,并增强空间域识别、生存预测等下游任务。
Comments 5 figures
UniDDT: 使用解耦扩散变换器统一多模态理解与生成
机构 * Nanjing University(南京大学) ; ByteDance Seed(字节跳动Seed) ; University of Hong Kong(香港大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。
Comments This work was completed in \textbf{November 2025}
TIGER: 基于图证据路由的可追踪推理用于减轻多模态生成中的幻觉
机构 * Brigham Young University ; Florida State University
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出TIGER框架,通过从输入和输出中独立提取观测图与声明图,并基于图条件风险评分修复高风险声明,以减轻多模态生成中的事实级幻觉。
Comments 25 pages, 7 figures, 16 tables. Under review
多模态大语言模型在复杂交互网页代码生成上的基准测试
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 针对现有基准忽略复杂交互行为的问题,提出WebIGBench基准,包含103个真实复杂网页和871个交互动作,并设计新评估流程,测试多模态大语言模型在交互式网页代码生成上的性能。