arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-01 至 2026-01-01 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 11 篇

2512.24013 2026-01-01 cs.CV 83%

Bridging the Perception-Cognition Gap:Re-engineering SAM2 with Hilbert-Mamba for Robust VLM-based Medical Diagnosis

弥合感知-认知鸿沟:通过希尔伯特-马amba重新工程SAM2以实现鲁棒的基于VLM的医学诊断

Hao Wu, Hui Li, Yiyun Su

机构 * Southern University of Science and Technology(南方科技大学) School of Informatics, Xiamen University(厦门大学信息学院) Rutgers University(罗格斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract);分类 cs.CV

AI总结 通过重新设计SAM2架构,引入希尔伯特空间填充曲线和希尔伯特-马amba交叉注意力机制,提升基于VLM的医学图像分割与诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 83%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 79%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23105 2026-01-01 cs.CV 79%

Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM

迈向遥感中全面交互变化理解:一个大规模数据集和双粒度增强VLM

Junxiao Xue, Quan Deng, Xuecheng Wu, Kelu Yao, Xinyi Yin, Fei Yu, Wei Zhou, Yanfei Zhong, Yang Liu, Dingkang Yang

机构 * Research Center for Space Computing System, Zhejiang Lab(浙江省实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) Liaoning University of Technology(辽宁科技学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉测绘遥感与信息工程国家重点实验室(LIESMARS)) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出ChangeIMTI数据集和ChangeVG模型,通过双粒度增强方法提升遥感图像变化理解的准确性和交互性。

Comments Junxiao Xue, Quan Deng, and Xuecheng Wu deserve equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24826 2026-01-01 cs.CV cs.AI 62%

Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free Control

用于多物体3D场景的2D系统中视频与语言对齐的多信息无导数控制

Jason Armitage, Rico Sennnrich

机构 * University of Zurich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无导数优化方法,用于在多物体3D场景中实现视频与语言的对齐,通过在线适应物体遮挡和区分特征来提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07307 2026-01-01 cs.CV cs.AI 62%

MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark

MCITlib: 多模态持续指令微调库与基准

Haiyang Guo, Fei Zhu, Hongbo Zhao, Fanhu Zeng, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新科学研究院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology(福建 pattern recognition and image understanding 工程学院,厦门大学科技学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MCITlib提供多模态持续学习的库和基准,支持8种算法并评估3个基准,旨在解决灾难性遗忘和跨模态协调问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03183 2026-01-01 cs.CV cs.LG 62%

MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding

MaxInfo: 一种基于最大体积的无训练关键帧选择方法以提升视频理解

Pengyi Li, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan Oseledets

机构 * AXXX, Russia(AXXX, 俄罗斯) FusionBrain Lab, Russia(融合脑实验室, 俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所, 俄罗斯) Innopolis University, Russia(因诺波利斯大学, 俄罗斯)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 MaxInfo是一种基于最大体积原理的无训练关键帧选择方法,通过提升视频理解性能,有效减少冗余并保持多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23512 2026-01-01 cs.CL cs.AI 57%

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

UniHetero:生成能否在大规模数据下增强视觉-语言模型的理解?

Fengjiao Chen, Minhao Jing, Weitao Lu, Yan Feng, Xiaoyu Li, Xuezhi Cao

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 UniHetero通过大规模预训练探索生成对视觉-语言模型理解的增强作用,发现语义层面生成有效,而像素层面生成会导致理解性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 57%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23787 2026-01-01 cs.LG stat.CO stat.ME 57%

TabMixNN: A Unified Deep Learning Framework for Structural Mixed Effects Modeling on Tabular Data

TabMixNN:一种用于表格数据结构混合效应建模的统一深度学习框架

Deniz Akdemir

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 TabMixNN是一种结合经典混合效应建模与现代神经网络的统一深度学习框架,支持多种结果类型和复杂数据结构,提供灵活的模块化架构和全面的可解释性工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25138 2026-01-01 cs.RO 50%

Learning Spatial-Aware Manipulation Ordering

学习空间感知的操作顺序

Yuxiang Yan, Zhiyuan Zhou, Xin Gao, Guanghao Li, Shenglin Li, Jiaqi Chen, Qunyan Pu, Jian Pu

机构 * Fudan University(复旦大学) Shanghai YinCheng Intelligent CO., LTD(上海英成智能有限公司) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 OrderMind通过空间感知学习在杂乱环境中实现高效鲁棒操作的统一框架。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏