arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 4 篇

2608.27531 2026-08-31 cs.CR cs.CV 新提交 79%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27753 2026-08-31 cs.CV 新提交 77%

What Can Low Resource Languages Learn From Each Other?

低资源语言能从彼此间学到什么?

Achyuth P, Kahaan Shah, Chetan Arora

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对低资源语言OCR数据稀缺问题,提出PSMC框架,通过融合语言特定专家实现知识迁移,在10种印度文字上使词识别率平均提升约2%。

Comments 16 pages, 4 Tables, 6 Figures. To appear at ICDAR 2026. This version predates reviewer revisions. A revised version will be posted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28248 2026-08-31 cs.CV cs.CL 新提交 70%

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

Synth-JDoc:用于OCR的、包含多样布局与嵌入图像的日文文档图像数据集合成

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(信息学研究所) NII LLMC(信息学研究所语言媒体研究中心)

专题命中 文档图表理解 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究构建了含多样布局与嵌入图像的日文文档合成OCR数据集,可有效提升大型视觉语言模型读取竖排日文文本的性能,相关资源已公开。

Comments Accepted to ICDAR 2026, 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-31 cs.IR 版本更新 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Qiyi Jiang, Junwei Zhou, Xiaoyu Cao, Weiyao Wang, Yiwei Xu, Ziyan Zhao, Zhen Sun, Qicheng Zhu, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yunhai Hu, Nan Du

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏