arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-04 至 2026-02-04 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 81%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 其他VLM :vision-language model(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏