arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2503.08723 2026-03-17 cs.LG cs.CV 57%

Is CLIP ideal? No. Can we fix it? Yes!

CLIP是否理想?不。我们能否修复它?是的!

Raphi Kang, Yue Song, Georgia Gkioxari, Pietro Perona

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文分析了CLIP潜在空间的几何局限性,提出DCSM方法以解决其根本问题,提升了CLIP-like模型在多个基准上的性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 57%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 57%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13951 2026-03-17 cs.CV 57%

DCP-CLIP:A Coarse-to-Fine Framework for Open-Vocabulary Semantic Segmentation with Dual Interaction

DCP-CLIP:一种面向开放词汇语义分割的粗到细框架

Jing Wang, Huimin Shi, Quan Zhou, Qibo Liu, Suofei Zhang, Huimin Lu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DCP-CLIP框架,通过动态生成文本特征和显式建模双交互,解决开放词汇语义分割中的跨模态通信不足和计算成本高的问题,提升分割精度和效率。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13437 2026-03-17 cs.CV eess.SP 57%

Vision-Language Based Expert Reporting for Painting Authentication and Defect Detection

基于视觉-语言的专家报告用于绘画认证和缺陷检测

Eman Ouda, Mohammed Salah, Arsenii O. Chulkov, Gianfranco Gargiulo, Gian Luca Tartaglia, Stefano Sfarra, Yusra Abdulrahman

机构 * organization= Khalifa University of Science Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates organization= National Research Tomsk Polytechnic University , country= Russia organization= Academy of Fine Arts of Naples , city= Naples , country= Italy organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy organization= Department of Industrial Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy organization= Advanced Research Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。

Comments Submitted to Journal of Cultural Heritage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 57%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12659 2026-03-16 cs.CV 57%

AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

AVION:从离线教师到提示调优网络的空域视觉-语言指令

Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) The Ohio State University(俄亥俄州立大学) TerraSense Analytics(TerraSense分析)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05869 2026-03-16 cs.CV 57%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 57%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12208 2026-03-13 cs.CV 57%

ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models

ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

机构 * Great Bay University(大湾大学) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11441 2026-03-13 cs.CV 57%

Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection

实时检测任意目标:从单提示分割到多类检测

Mehmet Kerem Turkcan

机构 * Columbia University(哥伦比亚大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 57%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV 57%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09566 2026-03-11 cs.CV 57%

GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning

GeoAlignCLIP: 通过多粒度一致性学习增强遥感中的细粒度视觉-语言对齐

Xiao Yang, Ronghao Fu, Zhuoran Duan, Zhiwen Lin, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室,吉林大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 GeoAlignCLIP通过多粒度一致性学习提升遥感中细粒度视觉-语言对齐,构建RSFG-100k数据集并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03930 2026-03-11 cs.CV 57%

N-gram Injection into Transformers for Dynamic Language Model Adaptation in Handwritten Text Recognition

基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应

Florent Meyer, Laurent Guichard, Yann Soullard, Denis Coquenet, Guillaume Gravier, Bertrand Coüasnon

机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。

Comments Fix order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG 57%

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 57%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 57%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08124 2026-03-10 cs.RO cs.AI cs.LG 57%

SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action

SaiVLA-0:基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作

Xiang Shi, Wenlong Huang, Menglin Zou, Xinhai Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 SaiVLA-0提出基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作系统,通过模块化设计提升效率与稳定性,初步实验显示训练时间减少且成功率显著提升。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10932 2026-03-10 cs.CR cs.AI cs.RO 57%

DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

DropVLA: 对视觉-语言-动作模型的行动级后门攻击

Zonghuan Xu, Jiayu Li, Yunhan Zhao, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。

Comments 8 pages, 6 tables, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05202 2026-03-10 cs.CV 57%

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型

Dongchen Si, Di Wang, Erzhong Gao, Xiaolei Qin, Liu Zhao, Jing Zhang, Minqiang Xu, Jianbo Zhan, Jianshe Wang, Lin Liu, Bo Du, Liangpei Zhang

机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) iFlytek Co., Ltd.(iFlytek公司) National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。

Comments Accepted to IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07343 2026-03-10 cs.LG cs.AI 57%

Learning Concept Bottleneck Models from Mechanistic Explanations

从机制解释学习概念瓶颈模型

Antonio De Santis, Schrasing Tong, Marco Brambilla, Lalana Kagal

机构 * Politecnico di Milano(米兰理工大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出机制CBM模型,通过从黑盒模型自身学习的概念构建瓶颈层,提升模型的可解释性和预测性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05732 2026-03-09 cs.CV 57%

From Phase Grounding to Intelligent Surgical Narratives

从相位接地到智能手术叙述

Ethan Peterson, Huixin Zhan

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多模态框架,通过自动创建手术时间线和叙述,减少手动标注的需要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03580 2026-03-05 cs.CV 57%

An Effective Data Augmentation Method by Asking Questions about Scene Text Images

通过提问场景文本图像来实现有效的数据增强方法

Xu Yao, Lei Kang

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出了一种基于问答的场景文本数据增强方法,通过生成字符级问题提升OCR模型的推理能力,实验表明在WordArt和Esposalles数据集上有效降低了CER和WER。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02959 2026-03-04 cs.CV 57%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12678 2026-03-03 cs.CV 57%

$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment

$β$-CLIP:多粒度视觉-语言对齐的文本条件对比学习

Fatimah Zohra, Chen Zhao, Hani Itani, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学科学与技术研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 $β$-CLIP通过多粒度文本条件对比学习提升视觉-语言对齐,实现从完整描述到短语的层次化对齐,改进细粒度和长文本检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08919 2026-03-03 cs.CV cs.LG 57%

PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性

Daiki Yoshikawa, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。

Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01029 2026-03-03 cs.CV 57%

Vision-Language Feature Alignment for Road Anomaly Segmentation

视觉-语言特征对齐用于道路异常分割

Zhuolin He, Jiacheng Tang, Jian Pu, Xiangyang Xue

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL 57%

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏