arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-17 至 2025-12-17 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 3 篇

2512.14102 2025-12-17 cs.CV cs.AI cs.IR 62%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04960 2025-12-17 cs.CV cs.AI 62%

MIMIR: Masked Image Modeling for Mutual Information-based Adversarial Robustness

MIMIR:基于互信息的对抗鲁棒性图像建模

Xiaoyun Xu, Shujian Yu, Zhuoran Liu, Stjepan Picek

机构 * Radboud University Nijmegen(拉德博德大学尼姆维根分校) Vrije Universiteit Amsterdam(自由大学阿姆斯特丹) University of Zagreb Faculty of Electrical Engineering and Computing(Zagreb大学电子工程与计算学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MIMIR通过互信息惩罚和自编码器的遮蔽图像建模,提升视觉变换器的对抗鲁棒性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 6 篇

2512.14661 2025-12-17 cs.AR 85%

Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models

聚焦:一种高效的视觉-语言模型流式集中架构

Chiyue Wei, Cong Guo, Junyao Zhang, Haoxuan Shan, Yifan Xu, Ziyue Zhang, Yudong Liu, Qinsi Wang, Changchun Zhou, Hai "Helen" Li, Yiran Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 Focus提出了一种高效的视觉-语言模型流式集中架构,通过分层压缩和细粒度冗余消除,实现2.4倍速度提升和3.3倍能效提升。

Comments HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI 73%

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18638 2025-12-17 cs.CV cs.AI 73%

Learning neuroimaging models from health system-scale data

从健康系统级数据中学习神经影像模型

Yiwei Lyu, Samir Harake, Asadur Chowdury, Soumyanil Banerjee, Rachel Gologorsky, Shixuan Liu, Anna-Katharina Meissner, Akshay Rao, Chenhui Zhao, Akhil Kondepudi, Cheng Jiang, Xinhai Hou, Rushikesh S. Joshi, Volker Neuschmelting, Ashok Srinivasan, Dawn Kleindorfer, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) University of Michigan Neurosugery(密歇根大学神经外科) University of Cologne Neurosugery(科隆大学神经外科) University of Michigan Radiology(密歇根大学放射学) University of Michigan Neurology(密歇根大学神经病学) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Prima是一款基于健康系统级数据训练的视觉语言模型,用于神经影像学,实现了高准确率的诊断和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14336 2025-12-17 cs.CV 70%

Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure

向量棱柱:通过分层语义结构来动画化向量图形

Jooyeol Yun, Jaegul Choo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种通过分层语义结构来提升向量图形动画质量的框架,通过统计汇总弱预测来恢复语义,从而提高VLMs动画生成的连贯性和准确性。

Comments yeolj00.github.io/personal-projects/vector-prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15464 2025-12-17 cs.CV cs.LG 62%

SIGMMA: Hierarchical Graph-Based Multi-Scale Multi-modal Contrastive Alignment of Histopathology Image and Spatial Transcriptome

SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组

Dabin Jeong, Amirhossein Vahidi, Ciro Ramírez-Suástegui, Marie Moullet, Kevin Ly, Mohammad Vali Sanian, Sebastian Birk, Yinshui Chang, Adam Boxall, Daniyal Jafree, Lloyd Steele, Vijaya Baskar MS, Muzlifah Haniffa, Mohammad Lotfollahi

机构 * Wellcome Sanger Institute(沃森桑格研究所) Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) Institute of AI for Health(人工智能与健康研究所) Cambridge Stem Cell Institute(剑桥干细胞研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13731 2025-12-17 cs.CV cs.AI 62%

Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline

复杂数学表达式识别:基准测试、大规模数据集和强大基线

Weikang Bai, Yongkun Du, Yuchen Su, Yazhen Xie, Zhineng Chen

机构 * \equalcontrib(机构1)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMER-Bench基准测试和大规模数据集MER-17M和CMER-3M,开发了CMERNet模型,有效提升了复杂数学表达式识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 2 篇

2503.09143 2025-12-17 cs.CV 83%

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解

Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, Liqiang Nie

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。

Comments This paper is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04540 2025-12-17 cs.CV 57%

VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management

VideoMem: 通过自适应内存管理增强超长视频理解

Hongbo Jin, Qingyuan Wang, Wenhao Zhang, Yang Liu, Sijie Cheng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏