arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-12 至 2025-12-12 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2512.10336 2025-12-12 cs.CL cs.AI 79%

Multilingual VLM Training: Adapting an English-Trained VLM to French

多语言视觉语言模型训练:将英语训练的VLM适应到法语

Jules Lahmi, Alexis Roger

机构 * Ecole Polytechnique(巴黎政治学院) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

AI总结 本文研究了将英语训练的视觉语言模型适应到法语等其他语言的挑战,通过比较不同方法的性能和计算成本,发现数据翻译是多语言VLM性能的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10262 2025-12-12 cs.CV 74%

VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models

基于视觉大语言模型的新型类别发现

Yuetong Su, Baoguo Wei, Xinyu Wang, Xu Li, Lixin Li

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

AI总结 基于视觉大语言模型的新型类别发现方法,通过融合视觉-文本语义和原型引导聚类,提升未知类别分类准确率25.3%,并展现对长尾分布的鲁棒性。

Comments 8 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10596 2025-12-12 cs.CV cs.AI 73%

Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval

超越像素:一种无训练的文本到文本框架用于遥感图像检索

J. Xiao, Y. Guo, X. Zi, K. Thiyagarajan, C. Moreira, M. Prasad

机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) The Data Science Institute Faculty of Engineering(数据科学学院工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19575 2025-12-12 cs.CV cs.AI 73%

HunyuanOCR Technical Report

HunyuanOCR 技术报告

Hunyuan Vision Team, Pengyuan Lyu, Xingyu Wan, Gengluo Li, Shangpin Peng, Weinong Wang, Liang Wu, Huawen Shen, Yu Zhou, Canhui Tang, Qi Yang, Qiming Peng, Bin Luo, Hower Yang, Xinsong Zhang, Jinnian Zhang, Houwen Peng, Hongming Yang, Senhao Xie, Longsha Zhou, Ge Pei, Binghong Wu, Rui Yan, Kan Wu, Jieneng Yang, Bochao Wang, Kai Liu, Jianchen Zhu, Jie Jiang, Linus, Han Hu, Chengquan Zhang

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 HunyuanOCR是一款轻量级视觉-语言模型,通过统一通用性与效率、简化端到端架构、采用数据驱动和强化学习策略,在OCR任务中实现卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10894 2025-12-12 cs.CV 70%

DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

DuetSVG:基于内部视觉引导的统一多模态SVG生成

Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu

机构 * City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DuetSVG通过端到端生成图像和SVG标记,结合内部视觉引导提升SVG生成质量,实现视觉忠实与语义一致的统一多模态生成。

Comments Project page: https://intchous.github.io/DuetSVG-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10750 2025-12-12 cs.CV 57%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10741 2025-12-12 cs.CL 50%

TRIDENT: A Redundant Architecture for Caribbean-Accented Emergency Speech Triage

TRIDENT:一种用于加勒比口音紧急语音分诊的冗余架构

Elroy Galbraith, Chadwick Sutherland, Donahue Morgan

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 TRIDENT通过结合加勒比口音优化的ASR、实体提取和生物声学检测,为调度员提供三种信号以提高紧急分诊效率,解决非标准英语变体识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏