arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-16 至 2026-02-16 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2505.01091 2026-02-16 cs.CV cs.AI 87%

Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation

任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成

Daniele Molino, Francesco di Feola, Linlin Shen, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(title);分类 cs.CV、cs.AI

AI总结 本文提出了一种任意到任意的视觉-语言模型,用于多模态X射线成像和放射学报告生成,通过生成高质量图像和语义连贯的报告,提升了医疗领域生成模型的临床应用价值。

Comments arXiv admin note: substantial text overlap with arXiv:2501.04614

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 84%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 84%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04614 2026-02-16 cs.AI cs.LG 83%

XGeM: A Multi-Prompt Foundation Model for Multimodal Medical Data Generation

XGeM:一种多提示基础模型,用于多模态医学数据生成

Daniele Molino, Francesco Di Feola, Eliodoro Faiella, Deborah Fazzini, Domiziana Santucci, Linlin Shen, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与辐射物理,乌梅大学) Department of Diagnostic Imaging and Stereotactic Radiosurgey, Centro Diagnostico Italiano S.p.A.(诊断影像与立体放射外科部门,意大利诊断中心股份有限公司) Department of Radiology and Interventional Radiology, Fondazione Policlinico Universitario Campus Bio-Medico(放射科与介入放射科,大学医学中心生物医学校园基金会) Research Unit of Radiology and Interventional Radiology, Department of Medicine and Surgery, Università Campus Bio-Medico di Roma(放射科与介入放射科研究单位,医学与外科系,罗马生物医学大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);分类 cs.AI

AI总结 XGeM是一种多模态生成模型,通过多提示训练策略实现灵活的医学数据合成,解决多模态数据生成中的临床一致性与数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12987 2026-02-16 cs.HC 50%

GroundLink: Exploring How Contextual Meeting Snippets Can Close Common Ground Gaps in Editing 3D Scenes for Virtual Production

GroundLink:探索上下文会议片段如何在虚拟制作3D场景编辑中弥合常见共识差距

Gun Woo, Park, Frederik Brudy, George Fitzmaurice, Fraser Anderson

专题命中 多模态生成 :cross-modal(abstract)

AI总结 GroundLink通过在虚拟制作3D场景编辑中引入会议知识仪表板和跨模态同步功能,帮助专业人员更高效地建立团队共识。

Comments 27 pages, 13 figures, to appear at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12932 2026-02-16 stat.ML cs.LG 50%

TFTF: Training-Free Targeted Flow for Conditional Sampling

TFTF:无训练目标流用于条件采样

Qianqian Qu, Jun S. Liu

机构 * Zhili College, Tsinghua University, Beijing, China(清华大学紫荆学院) Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系) Department of Statistics, Harvard University, Cambridge, MA, USA(哈佛大学统计系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 TFTF通过引入随机流和重采样技术,实现无训练条件采样,提升高维和多模态场景下的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01504 2026-02-16 cs.LG 50%

Instruction-based Time Series Editing

基于指令的时间序列编辑

Jiaxing Qiu, Dongliang Guo, Brynne Sullivan, Teague R. Henry, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 InstructTime是一种基于指令的时间序列编辑器,通过自然语言指令实现灵活且可控的编辑,能够生成高质量的编辑结果并适应新条件。

Comments (KDD 26) Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1

详情

展开后加载摘要…

URL PDF HTML 收藏