Exploring the Zero-Shot Capabilities of Vision-Language Models for Improving Gaze Following
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted at the GAZE Workshop at CVPR 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted at the GAZE Workshop at CVPR 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted on ICML 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Code: https://aka.ms/Kosmos-G Project Page: https://xichenpan.github.io/kosmosg
专题命中 VLM训练与架构 :MLLM(title);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments The project page is available at https://ggg0919.github.io/cantor/
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2311.02692
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Project page: http://val.cds.iisc.ac.in/VL2V-ADiP/
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 19 pages 11 figures
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by WACV 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Camera-ready version for *SEM 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted to MIDL 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments work in progress
机构 * Brown University(布朗大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)
Comments All code and resources are available at: https://github.com/ethahtz/vlm_conflicting_info_processing
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
AlignFace:具有可解释概念关系的人类对齐人脸相似度度量
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。
Comments 10 pages, 10 figures, 2 tables, ACM MM 26
UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器
机构 * NVIDIA Research(英伟达研究院) ; Technion(以色列理工学院) ; Bar-Ilan University(巴伊兰大学) ; University of Groningen(格罗宁根大学)
专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%
Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/
学习扩散模型的采样参数
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。
Comments Code will be released
基于置信度蒸馏的门控关系对齐用于高效视觉语言模型
机构 * Department of Information Technology(信息科技系) ; Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) ; Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) ; Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) ; University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) ; School of Electrical and Electronic Engineering(电气与电子工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。
Comments Accepted to the International Conference on Machine Learning (ICML 2026)
ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成
机构 * Peking University(北京大学) ; Kuaishou Technology(快手科技) ; Xiamen University(厦门大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。
Comments 13 pages, 3 figures
学习实例自适应低秩正交子空间用于换衣行人重识别
机构 * Dongwoo Kim(金东吾) ; Tae-Kyun Kim(金泰勋)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 提出Ortho-ReID方法,通过从VLM文本描述中显式建模低秩服装子空间,并利用几何约束提取服装不变特征,在多个基准数据集上取得最优性能。
Comments Accepted to the ICML 2026 Workshop on CoLoRAI