An Architecture-Led Hybrid Report on Body Language Detection Project
以架构为导向的混合报告:身体语言检测项目
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
以架构为导向的混合报告:身体语言检测项目
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。
ICONS: 视觉-语言数据选择中的影响共识
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Google DeepMind(谷歌DeepMind) ; Allen Institute for AI(人工智能研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。
重新审视视觉-语言奖励模型的学习目标
机构 * Polytechnique Montréal(蒙特利尔理工学院) ; École de Technologie Supérieure(高级技术学院) ; Sorbonne Université(索邦大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
AI总结 本文通过统一框架评估了基于VLM的奖励模型,发现简单三元组损失在性能上优于现有方法,表明改进可能源于数据和架构差异。
Comments Published as an extended abstract at World Modeling Workshop 2026
基于提示的持续组成零样本学习
机构 * Intelligent Machines Lab(智能机器实验室) ; Information Technology University(信息技术大学) ; Visual Computing Lab(视觉计算实验室) ; Ontario Tech University(安大略技术大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。
SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。
从健康系统级数据中学习神经影像模型
机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) ; University of Michigan Neurosugery(密歇根大学神经外科) ; University of Cologne Neurosugery(科隆大学神经外科) ; University of Michigan Radiology(密歇根大学放射学) ; University of Michigan Neurology(密歇根大学神经病学) ; University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 Prima是一款基于健康系统级数据训练的视觉语言模型,用于神经影像学,实现了高准确率的诊断和临床决策支持。
SignRAG:一种用于可扩展零样本道路标志识别的检索增强系统
机构 * Computer Engineering The Ohio State University(计算机工程 俄亥俄州立大学) ; Applied Research Transportation Research Center Inc.(应用研究 交通运输研究中心公司) ; Computer Engineering The Ohio State University Columbus, Ohio, USA(计算机工程 俄亥俄州立大学 哥伦布俄亥俄州) ; Applied Research Transportation Research Center Inc. East Liberty, Ohio, USA(应用研究 交通运输研究中心公司 埃斯特利比 俄亥俄州)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 SignRAG通过检索增强生成范式实现可扩展的零样本道路标志识别,结合视觉语言模型和大型语言模型,实现高准确率的标志识别。
Comments Submitted to IV 2026
超越像素:一种无训练的文本到文本框架用于遥感图像检索
机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) ; Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) ; The Data Science Institute Faculty of Engineering(数据科学学院工程学院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。
Comments 6 pages, 1 figure
HunyuanOCR 技术报告
机构 * Tencent(腾讯)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 HunyuanOCR是一款轻量级视觉-语言模型,通过统一通用性与效率、简化端到端架构、采用数据驱动和强化学习策略,在OCR任务中实现卓越性能。
面向视觉语言模型的无损终极视觉标记压缩
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出LUVC框架,通过正交空间轴的迭代合并和频谱修剪单元,实现视觉语言模型中视觉标记的无损压缩,提升推理速度并保持精度。
面向渲染的强化学习用于矢量图形生成
机构 * ServiceNow Research(ServiceNow研究机构) ; Mila ; ÉTS Montréal(蒙特利尔ÉTS) ; Polytechnique Montréal(蒙特利尔Polytechnique) ; Columbia University(哥伦比亚大学) ; Stony Brook University(石溪大学) ; Apple(苹果公司) ; Google Research(谷歌研究) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; McGill University(麦吉尔大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出RLRF方法,通过利用渲染反馈提升自回归VLMs中SVG生成的准确性和效率。
Qwen3-VL 技术报告
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。
Comments 42 pages
机构 * University of Michigan(密歇根大学)
专题命中 VLM训练与架构 :VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2026
机构 * Seoul National University(首尔国立大学) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
Comments This paper is being withdrawn because we have identified a significant error in the implementation of our self-supervised clustering approach. Specifically, our feature aggregation step inadvertently leaked temporal information across frames, which violates the core assumption of our training-free method. We sincerely apologize to the research community
机构 * Meta Reality Labs(Meta 现实实验室) ; Meta FAIR
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted as a spotlight paper at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * Key Lab of Intell. Info. Process., Inst. of Comput. Tech., CAS(智能信息处理重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments Accepted by NeurIPS 2025
机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) ; Zhipu AI(智谱AI) ; The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Preprint, 27 pages, 3 figures
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Appendix will be appended soon
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2025
机构 * Boston University(波士顿大学)
专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025
机构 * NAVER AI Lab(NAVER AI实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Code: https://github.com/naver-ai/prolip HuggingFace Hub: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291 33 pages, 4.5 MB; LongProLIP paper: arXiv:2503.08048; Multiplicity paper for more background: arxiv.org:2505.19614; v4: fix typos
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments accepted to emnlp2025 findings
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; CUHK MMLab(香港大学MMLab) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments Project page: https://hywang66.github.io/bridge/
机构 * AIDAS Laboratory(AIDAS实验室) ; IPAI ; ECE(电子工程系) ; Seoul National University(首尔国立大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted in NeurIPS 2025
机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学) ; Tübingen AI Center(图宾根人工智能中心) ; Universität Tübingen(图宾根大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments This paper was first submitted to NeurIPS 2024 in May 2024
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments 31 pages, 17 figures