CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。
Comments 11 pages
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025