arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-27 至 2025-11-27 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2511.20854 2025-11-27 cs.CV cs.AI cs.CL 62%

Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval Queries

从舌尖上的遗忘检索查询中无监督建模可记忆性

Sree Bhattacharyya, Yaman Kumar Singla, Sudhir Yarram, Somesh Kumar Singh, Harini S, James Z. Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Adobe Media and Data Science Research(Adobe媒体与数据科学研究)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出首个大规模无监督数据集,通过舌尖上的遗忘检索查询建模视觉内容的可记忆性,并展示了其在回忆生成和ToT检索任务中的优越表现。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21389 2025-11-27 cs.IR cs.AI 57%

FITRep: Attention-Guided Item Representation via MLLMs

FITRep: 通过大语言模型实现的注意力引导的项目表示

Guoxiao Zhang, Ao Li, Tan Qu, Qianlong Xie, Xingxing Wang

机构 * Meituan(美团)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 FITRep通过引入注意力引导的白盒表示框架,利用多模态大语言模型实现细粒度项目去重,提升了广告点击率和每千次展示成本。

详情

展开后加载摘要…

URL PDF HTML 收藏