arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-16 至 2025-12-16 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2512.12268 2025-12-16 cs.CV 79%

MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models

MetaTPT: 用于视觉-语言模型的元测试时间提示微调

Yuqing Lei, Yingjun Du, Yawen Huang, Xiantong Zhen, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academic of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) AIM Lab, University of Amsterdam(阿姆斯特丹大学AIM实验室) Jarvis Research Center, Tencent Youtu Lab(腾讯优图实验室 Jarvis 研究中心) Central Research Institue, United Imaging Healthcare Co., Ltd(联合影像医疗科技有限公司中央研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 MetaTPT通过元学习框架结合自监督任务和提示微调,提升视觉-语言模型在领域偏移下的测试时间适应性,实现领域泛化和跨数据集的高性能表现。

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15871 2025-12-16 cs.CV 79%

Visual symbolic mechanisms: Emergent symbol processing in vision language models

视觉符号机制:视觉语言模型中的涌现符号处理

Rim Assouel, Declan Campbell, Yoshua Bengio, Taylor Webb

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

AI总结 研究揭示了视觉语言模型中通过内容无关空间索引实现的新兴符号机制,用于解决视觉绑定问题并减少模型错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23065 2025-12-16 cs.CL 71%

SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services

SNS-Bench-VL:在社交网络服务中评估多模态大语言模型的基准测试

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Anjie Le, Lei Li, Zhoujun Li

专题命中 其他VLM :multimodal large language model(title)

AI总结 SNS-Bench-VL是一个用于评估多模态大语言模型在社交网络服务中性能的基准测试,涵盖8个多模态任务,包含4001个问题-答案对,评估25种先进模型,揭示多模态社交理解的挑战。

Comments We found problems in the code while rechecking our implementation. These issues led to noticeable numerical discrepancies, making some of the reported results and conclusions potentially unreliable. Therefore, we request to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏