arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4 篇

2602.15758 2026-02-18 cs.CL cs.AI 81%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15650 2026-02-18 cs.CV 79%

Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation

概念增强的多模态RAG:迈向可解释且准确的放射科报告生成

Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Department of Engineering(工程系) Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) Università Campus Bio-Medico of Roma(罗马大学生物医学校园) Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) Umeå University(乌梅拉大学) UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15776 2026-02-18 cs.AI 57%

GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems

GlobeDiff:多智能体系统中部分可观测性的状态扩散过程

Yiqin Yang, Xu Yang, Yuhua Jiang, Ni Mu, Hao Hu, Runpeng Xie, Ziyou Zhang, Siyuan Li, Yuan-Hua Ni, Qianchuan Zhao, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) Tsinghua University(清华大学) Moonshot AI Nankai University(南开大学) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 GlobeDiff通过多模态扩散过程解决多智能体系统中部分可观测性问题,实现高保真度的全局状态推断。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16594 2026-02-18 cs.CL 57%

A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives

基于语言模型生成合成数据在生物医学研究与应用中的综述:数据效用和质量视角

Hanshu Rao, Weisi Liu, Haohan Wang, I-Chan Huang, Zhe He, Xiaolei Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了语言模型在生物医学领域生成合成数据的应用,分析了不同模态下的数据效用与质量挑战,指出需建立标准化评估框架以提升生物医学研究的应用效果。

Journal ref Journal of Healthcare Informatics Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏