arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-17 至 2025-12-17 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2512.14661 2025-12-17 cs.AR 85%

Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models

聚焦:一种高效的视觉-语言模型流式集中架构

Chiyue Wei, Cong Guo, Junyao Zhang, Haoxuan Shan, Yifan Xu, Ziyue Zhang, Yudong Liu, Qinsi Wang, Changchun Zhou, Hai "Helen" Li, Yiran Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 Focus提出了一种高效的视觉-语言模型流式集中架构,通过分层压缩和细粒度冗余消除,实现2.4倍速度提升和3.3倍能效提升。

Comments HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI 73%

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18638 2025-12-17 cs.CV cs.AI 73%

Learning neuroimaging models from health system-scale data

从健康系统级数据中学习神经影像模型

Yiwei Lyu, Samir Harake, Asadur Chowdury, Soumyanil Banerjee, Rachel Gologorsky, Shixuan Liu, Anna-Katharina Meissner, Akshay Rao, Chenhui Zhao, Akhil Kondepudi, Cheng Jiang, Xinhai Hou, Rushikesh S. Joshi, Volker Neuschmelting, Ashok Srinivasan, Dawn Kleindorfer, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) University of Michigan Neurosugery(密歇根大学神经外科) University of Cologne Neurosugery(科隆大学神经外科) University of Michigan Radiology(密歇根大学放射学) University of Michigan Neurology(密歇根大学神经病学) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Prima是一款基于健康系统级数据训练的视觉语言模型,用于神经影像学,实现了高准确率的诊断和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14336 2025-12-17 cs.CV 70%

Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure

向量棱柱:通过分层语义结构来动画化向量图形

Jooyeol Yun, Jaegul Choo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种通过分层语义结构来提升向量图形动画质量的框架,通过统计汇总弱预测来恢复语义,从而提高VLMs动画生成的连贯性和准确性。

Comments yeolj00.github.io/personal-projects/vector-prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15464 2025-12-17 cs.CV cs.LG 62%

SIGMMA: Hierarchical Graph-Based Multi-Scale Multi-modal Contrastive Alignment of Histopathology Image and Spatial Transcriptome

SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组

Dabin Jeong, Amirhossein Vahidi, Ciro Ramírez-Suástegui, Marie Moullet, Kevin Ly, Mohammad Vali Sanian, Sebastian Birk, Yinshui Chang, Adam Boxall, Daniyal Jafree, Lloyd Steele, Vijaya Baskar MS, Muzlifah Haniffa, Mohammad Lotfollahi

机构 * Wellcome Sanger Institute(沃森桑格研究所) Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) Institute of AI for Health(人工智能与健康研究所) Cambridge Stem Cell Institute(剑桥干细胞研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13731 2025-12-17 cs.CV cs.AI 62%

Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline

复杂数学表达式识别:基准测试、大规模数据集和强大基线

Weikang Bai, Yongkun Du, Yuchen Su, Yazhen Xie, Zhineng Chen

机构 * \equalcontrib(机构1)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMER-Bench基准测试和大规模数据集MER-17M和CMER-3M,开发了CMERNet模型,有效提升了复杂数学表达式识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏