arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 89 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 89 篇

2606.11477 2026-06-11 cs.CV cs.AI 新提交 79%

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

迈向全自动考试评分:基于基础模型的笔迹答案公平性识别

Hartwig Grabowski

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University(奥芬堡大学机器学习和分析研究所(IMLA))

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出使用视觉-语言基础模型(VLM)识别手写答案,在61份考试(3141个答案位置)上达到98.4%准确率,并通过轻量提示将假阴性率降至0.58%,实现公平的全自动评分。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10408 2026-08-12 cs.CL 新提交 78%

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?

Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 78%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06532 2026-08-10 cs.CL 新提交 78%

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

面向图表与文档理解的金融视觉语言模型的置信度估计

Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学) JPMorgan AI Research(摩根大通AI研究院)

专题命中 文档图表理解 :vision-language model(title);grounding(abstract)

AI总结 该研究针对金融视觉语言模型,评估7种置信度估计器的分布外迁移效果,发现仅训练得到的探测模型具备校准能力,其中接地感知探测模型可区分模型未使用图表生成的答案与流畅猜测,为金融场景的决策信任提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16763 2026-08-18 cs.AI 新提交 77%

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架

Ruoqi Shu, Xuhui Wang, Isaac Wang, Yanming Mai, Bo Wan

机构 * BMO Financial Group(蒙特利尔银行金融集团)

专题命中 文档图表理解 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。

Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22200 2026-07-27 cs.CV 新提交 77%

LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

LayoutLite:用于高效文档OCR的令牌级隐式布局分析

Xudong Liu, Bicheng Wan, Yulin Jin

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究基于视觉语言模型的端到端OCR系统效率问题,提出LayoutLite模块,通过令牌级隐式布局分析,聚合视觉表示并预测重要性分数,去除低信息令牌,实验证明其能有效加速OCR系统,提升效率且保证识别质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01609 2026-07-03 cs.LG 新提交 77%

SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence

SINA: 一种使用人工智能的全自动电路原理图图像到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Mohammed Ayman Habib, Finn Murphy, Rishen Cao, Morteza Fayazi

机构 * The Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系) The Department of Electrical, Computer & Energy Engineering, University of Colorado Boulder(科罗拉多大学博尔德分校电气、计算机与能源工程系)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 提出SINA,一种全自动开源流水线,集成深度学习、连通分量标记、OCR和视觉语言模型,实现从电路原理图图像到网表的转换,在IC和PCB级别均达到96.67%的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12898 2026-06-12 cs.CV cs.CL 新提交 77%

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

放大关键信息:面向视觉文本理解的注意力引导自适应渲染

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

机构 * Michigan State University(密歇根州立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09578 2026-06-09 cs.AI cs.CL cs.IR 新提交 77%

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 文档图表理解 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。

Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18839 2026-07-22 cs.CL 新提交 75%

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD解析:分层并行文档解析

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究基于统一视觉语言模型的文档解析器顺序瓶颈问题,提出HPD解析,采用分层并行解码范式,含主要布局分支和P-MTP,实验显示其吞吐量高且精度有竞争力,为高效统一文档解析开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19960 2026-06-19 cs.IR 新提交 75%

Stellar: Scalable Multimodal Document Retrieval for Natural Language Queries

Stellar:面向自然语言查询的可扩展多模态文档检索

Yuxiang Guo, Zhonghao Hu, Yuren Mao, Yuhang Liu, Congcong Ge, Xiaolu Zhang, Jun Zhou, Yunjun Gao

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 提出Stellar框架,通过磁盘存储令牌级文档嵌入并动态加载候选嵌入,结合词汇表示过滤和高效磁盘支持的后交互,在保持检索效果的同时将内存开销和查询延迟降低1-2个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09851 2026-06-10 cs.HC 新提交 75%

ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Refinement

ECHO: 基于人在环操作的可解释协同编辑用于演示文稿优化

Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract)

AI总结 针对演示文稿创作中用户缺乏细粒度控制的问题,提出ECHO系统,通过多模态意图理解和可解释操作计划,结合“自然语言+视觉选择”范式和解耦的“计划-确认-执行”循环,实现可控的局部编辑,显著降低认知负荷并提升意图映射与空间定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交 75%

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

专题命中 文档图表理解 :vision-language model(abstract);vision language model(abstract);VLM(abstract_cn)

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 74%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 73%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 73%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 73%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12133 2026-08-13 cs.AI 新提交 70%

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

GUIDE:企业场景下从文档到制品生成的受控统一智能

Shivali Dalmia, Sumukha Thoppanahalli, Mohammadreza Sediqin, Abhishek Mukherji

机构 * Centific Research(森蒂菲克研究院)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交 70%

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06146 2026-08-07 cs.AI 新提交 70%

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

PaDoc:基于布局的文档并行解码方法

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03464 2026-08-05 cs.AI cs.CL cs.HC 新提交 70%

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

ChartAnno:评估多模态大语言模型的图表标注生成能力

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24554 2026-07-28 cs.IR cs.CV 新提交 70%

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪

Shuo Wang, Kai Zhang, Wenyuan Huang, Yizheng Yu, Xia Liao, Junming Su, Qing Wang, Fang Xi

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究针对复杂文档理解中多模态检索增强生成的难题,提出DeCoRAG方法,通过认知解耦、建立语义锚及区域感知裁剪机制,提升语义通过率,减少提示令牌,在复杂文档基准测试中取得良好效果。

Comments 11 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16131 2026-07-20 cs.CL cs.AI 新提交 70%

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(滑铁卢大学)

专题命中 文档图表理解 :VLM(abstract);InternVL(abstract);分类 cs.AI

AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14005 2026-07-16 cs.CV cs.RO 新提交 70%

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09488 2026-07-13 cs.CV 新提交 70%

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交 70%

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07661 2026-06-09 cs.CV cs.DL 新提交 70%

PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing

PereStruct: 面向鲁棒历史文档解析的多模态语义组装

Maksim Shandybo, Ivan Bespalov, Daniil Yefimov, Marina Kosheleva, Alexander Loukianov

机构 * IGIC RAS(俄罗斯科学院信息传输问题研究所) Yandex Cloud National University of Science and Technology MISIS(莫斯科国立钢铁合金学院) Nekrasov Central Universal Scientific Library(涅克拉索夫中央综合科学图书馆)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对历史报纸复杂多栏布局的解析难题,提出结合微调YOLO与语义组装模块的多模态方法,在块到文章映射上F1达0.904,BLEU约0.96,显著优于通用视觉语言模型。

Comments Code and data available at https://github.com/makSShandybo/PereStruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 67%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07636 2026-08-11 cs.CR cs.AI cs.CV 新提交 62%

Adversarial Attacks on Deep OCR Systems

针对深度OCR系统的对抗攻击

Wenbo Sun, Hongzong LI, Yanyun Wang, Jiahao MA, Shuxin Zhuang, Rong Feng, Shiqin Tang, Zi Liang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出首个针对生成式OCR视觉语言模型的纯黑盒对抗攻击,将其转化为零阶优化问题,在Deep-OCR上验证了攻击有效性并揭示解码器故障,还表明可控有目标改写更难实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 62%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏