arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-15 至 2026-01-15 共收录 32 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2510.21518 2026-01-15 cs.CV cs.CL cs.LG 62%

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

头部追踪:探究多模态转换器中的注意力专业化

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga

机构 * Area Science Park(面积科学公园) Sapienza University of Rome(罗马萨皮恩扎大学) Institute of Science and Technology(科学与技术研究所)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过分析多模态转换器中注意力头的专业化,揭示了模型内部可控的结构,并展示了通过编辑少量头部以增强或抑制特定概念的可行性。

Comments Accepted at NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2509.23311 2026-01-15 cs.CV cs.AI cs.CL 84%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24952 2026-01-15 cs.CV 70%

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning

超越最后一帧:面向生成视频推理的过程感知评估

Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Information, Renmin University of China(中国人民大学信息学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ByteDance(字节跳动)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09136 2026-01-15 cs.CV cs.AI 62%

SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL

SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输

Lijun Liu, Linwei Chen, Zhishou Zhang, Meng Tian, Hengfu Cui, Ruiyang Li, Zhaocheng Liu, Qiang Ju, Qianxi Li, Hong-Yu Zhou

机构 * Baichuan Inc.(百川公司) Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) University of Hong Kong(香港大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09116 2026-01-15 cs.CV cs.AI 62%

LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models

LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别

Haoyan Gong, Hongbin Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV 57%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 57%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09031 2026-01-15 cs.RO cs.AI 57%

Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation

可推广的几何先验与递归脉冲特征学习用于双足机器人操作

Xuetao Li, Wenke Huang, Mang Ye, Jifeng Xuan, Bo Du, Sheng Liu, Miao Li

机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09523 2026-01-15 cs.IR 50%

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

TEMPO:一个用于时间推理密集检索的多领域基准

Abdelrahman Abdallah, Mohammed Ali, Muhammad Abdul-Mageed, Adam Jatowt

专题命中 视觉推理 :grounding(abstract)

AI总结 TEMPO是一个结合时间推理与多领域检索的基准,通过复杂查询和多步骤检索规划,评估检索系统在时间信息处理上的挑战和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2601.08183 2026-01-15 cs.CV cs.AI 84%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09449 2026-01-15 cs.CV 83%

PrivLEX: Detecting legal concepts in images through Vision-Language Models

PrivLEX:通过视觉-语言模型检测图像中的法律概念

Darya Baranouskaya, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 PrivLEX通过视觉-语言模型实现图像中法律概念的检测,无需显式标签即可进行可解释的隐私分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09212 2026-01-15 cs.CV cs.AI cs.LG 67%

Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation

退火放松的投机解码用于更快的自回归图像生成

Xingyao Li, Fengzhuo Zhang, Cunxiao Du, Hui Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出COOL-SD,通过退火放松的投机解码方法提升自回归图像生成的速度与质量。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09663 2026-01-15 cs.CV 57%

Self-Supervised Animal Identification for Long Videos

长时间视频中的自监督动物识别

Xuyang Fang, Sion Hannuna, Edwin Simpson, Neill Campbell

机构 * University of Bristol(布里斯托大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09661 2026-01-15 cs.CV 57%

LiteEmbed: Adapting CLIP to Rare Classes

LiteEmbed: 适应CLIP的稀有类别

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09575 2026-01-15 cs.CV 57%

OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

OpenVoxel: 一种无需训练的稀疏体素分组与标注算法用于开放词汇3D场景理解

Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 OpenVoxel通过无需训练的多模态大语言模型实现稀疏体素的分组与标注,提升开放词汇3D场景理解的性能。

Comments project page: https://peterjohnsonhuang.github.io/openvoxel-pages/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04678 2026-01-15 cs.CV 57%

Tracking and Understanding Object Transformations

跟踪和理解物体变换

Yihong Sun, Xinyu Yang, Jennifer J. Sun, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出TubeletGraph系统,用于跟踪和理解物体在变换中的状态变化,并引入新的基准数据集VOST-TAS,以提升复杂物体变换的跟踪与理解能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04184 2026-01-15 cs.CV 57%

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

MedicalNarratives: 通过局部化叙述连接医学视觉与语言

Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09036 2026-01-15 cs.CL cs.IR 50%

SpectraQuery: A Hybrid Retrieval-Augmented Conversational Assistant for Battery Science

SpectraQuery: 一种用于电池科学的混合检索增强型对话助手

Sreya Vangara, Jagjit Nanda, Yan-Kai Tzeng, Eric Darve

机构 * Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Applied Energy Division, SLAC National Accelerator Laboratory(SLAC国家加速器实验室应用能源部门) Institute of Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SpectraQuery通过结合结构化数据库和文献语料库,为电池科学提供检索增强型对话助手,有效整合数值证据与机理解释,提升科学推理效率。

Comments 11 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08852 2026-01-15 cs.CL 50%

NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models

NewsScope:基于模式的跨领域新闻声明提取与开放模型

Nidhi Pandya

机构 * Pace University(帕克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 NewsScope通过开放模型实现基于模式的跨领域新闻声明提取,展现优于GPT-4o-mini的准确性和泛化能力。

Comments 5 pages, 3 tables. Code, model, and benchmark publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06230 2026-01-15 physics.ed-ph 50%

Introducing the Physics of Complex Systems through Videogames

通过视频游戏引入复杂系统的物理

Alessio Focardi, Franco Bagnoli, Andrea Guazzini, Giorgio Gronchi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过视频游戏教学,帮助高中生理解复杂系统的物理概念,如相变、敏感性和同步,并评估教学效果。

Comments Same as version 1.0, the only changes is Focardi's email address

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 3 篇

2601.02316 2026-01-15 cs.LG cs.AI 84%

DatBench: Discriminative, Faithful, and Efficient VLM Evaluations

DatBench:具有辨别性、忠实性和效率的视觉语言模型评估

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Ricardo Monti, Aldo Carranza, Alex Fang, Alvin Deng, Amro Abbas, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Fan Pan, Haakon Mongstad, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Parth Doshi, Paul Burstein, Pratyush Maini, Scott Loftin, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 DatBench通过转换和过滤现有基准,提升视觉语言模型评估的忠实性和效率,实现13倍加速并保持辨别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08860 2026-01-15 cs.CV cs.AI 81%

Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models

视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解

Tarannum Mithila

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。

Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09165 2026-01-15 cs.LG 57%

Multi-Teacher Ensemble Distillation: A Mathematical Framework for Probability-Domain Knowledge Aggregation

多教师集成蒸馏:概率域知识聚合的数学框架

Aaron R. Flouro, Shawn P. Chadwick

机构 * Sparse-Tech

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种概率域知识聚合的数学框架,通过公理化方法定义了多教师集成蒸馏的核心原理,并提供了理论保障和多种实现策略。

Comments 7 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 6 篇

2601.09385 2026-01-15 cs.SD cs.CL cs.MM 85%

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践

Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, Ruiyang Xu, Tiranrui Wang, Yifan Yang, Yanqiao Zhu, Zhikang Niu, Liumeng Xue, Yinghao Ma, Ruibin Yuan, Shiliang Zhang, Kai Yu, Eng Siong Chng, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tianjin University(天津大学) Hong Kong University of Science and Technology(香港科学大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract)

AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。

Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16148 2026-01-15 cs.CV 83%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 83%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 81%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 73%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17218 2026-01-15 cs.CV 57%

Prototypical Contrastive Learning-based CLIP Fine-tuning for Object Re-identification

基于原型对比学习的CLIP微调用于物体重识别

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University, China(信息科学与电子工程学院,浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于原型对比学习的CLIP微调方法,用于提升物体重识别性能,无需提示学习并实现优于CLIP-ReID的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 3 篇

2601.08871 2026-01-15 cs.SD cs.AI eess.AS 79%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏