arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 59 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2409.12842 2025-11-26 cs.RO cs.AI 85%

Vision Language Models Can Parse Floor Plan Maps

视觉语言模型可以解析平面图

David DeFazio, Hrudayangam Mehta, Meng Wang, Ping Yang, Jeremy Blackburn, Shiqi Zhang

机构 * School of Computing, Binghamton University(计算机学院,宾夕法尼亚州立大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在地图解析任务中的性能,展示了其在复杂室内导航中的高成功率,并指出在大型开放区域中性能下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19768 2025-11-26 cs.CV cs.AI cs.RO 73%

Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering

剪枝后再规划:用于具身问答中稳定前沿探索的分步校准

Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Prune-Then-Plan通过分步校准稳定具身问答中的前沿探索,提升导航效率和回答质量。

Comments webpage: https://noahfrahm.github.io/Prune-Then-Plan-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19557 2025-11-26 cs.CV cs.AI cs.LG 67%

Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment

先思后定(ThiFAN-VQA):一种用于灾后损害评估的两阶段链式思考框架

Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ThiFAN-VQA通过两阶段推理框架提升灾后损害评估的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 62%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20190 2025-11-26 cs.CV 57%

SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA

SFA: 扫描、聚焦与放大以实现面向指导的视频文本VQA回答

Haibin He, Qihuang Zhong, Juhua Liu, Bo Du, Peng Wang, Jing Zhang

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系、曼彻斯特 Metropolitan 大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SFA通过扫描、聚焦与放大机制,提出首个Video-LLM方法,提升视频文本VQA任务的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19648 2025-11-26 cs.CL cs.AI 57%

Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search

通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20227 2025-11-26 cs.IR 50%

HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents

HKRAG:面向视觉丰富文档的综合知识检索增强生成

Anyang Tong, Xiang Niu, ZhiPing Liu, Chang Tian, Yanyan Wei, Zenglin Shi, Meng Wang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 50%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract)

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2511.19526 2025-11-26 cs.CV 83%

Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models

感知分类:评估和引导视觉语言模型中的层次场景推理

Jonathan Lee, Xingrui Wang, Jiawei Peng, Luoxin Ye, Zehan Zheng, Tiezheng Zhang, Tao Wang, Wufei Ma, Siyi Chen, Yu-Cheng Chou, Prakhar Kaushik, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出感知分类基准测试,旨在评估和引导视觉语言模型在层次场景推理中的能力,揭示模型在属性驱动推理上的不足,并展示通过上下文示例提升性能的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20531 2025-11-26 cs.AI cs.CV cs.LG 82%

Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models

超越生成:面向视觉语言模型事实准确性的多跳推理

Shamima Hossain

机构 * Department of Computer Science, Brac University(布鲁尔大学计算机科学系) bKash Limited(bKash公司)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种基于知识图谱的多跳推理框架,提升视觉语言模型在事实准确性上的表现,通过多步骤推理增强模型的逻辑推理能力。

Comments Accepted as poster at NewInML Workshop ICML, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 79%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20145 2025-11-26 cs.CV 74%

Vision-Language Models for Automated 3D PET/CT Report Generation

用于自动化3D PET/CT报告生成的视觉-语言模型

Wenpei Jiao, Kun Shang, Hui Li, Ke Yan, Jiajin Zhang, Guangjie Yang, Lijuan Guo, Yan Wan, Xing Yang, Dakai Jin, Zhaoheng Xie

机构 * Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心) Peking University People’s Hospital(北京大学人民医院) Peking University Third Hospital(北京大学第三医院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) The Affiliated Hospital of Qingdao University(青岛大学附属医院) The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院) Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 本文提出PETRG-3D模型,通过3D双分支框架和风格适应提示,提升PET/CT报告生成的自动化水平,实验显示其在自然语言和临床指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 62%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG 62%

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15948 2025-11-26 cs.CV 57%

Click2Graph: Interactive Panoptic Video Scene Graphs from a Single Click

Click2Graph: 从单次点击生成交互式全景视频场景图

Raphael Ruschel, Hardikkumar Prajapati, Awsafur Rahman, B. S. Manjunath

机构 * UC Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 Click2Graph通过单次点击实现交互式全景视频场景图生成,结合视觉提示与语义推理,提升视频场景理解的可控性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05034 2025-11-26 cs.CV 57%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10007 2025-11-26 cs.AI 57%

Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning

深度隐式认知促进可靠推理链推理

Zijun Chen, Wenbo Hu, Richang Hong

机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。

Comments This paper has been accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV 57%

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13733 2025-11-26 cs.RO 50%

FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph

基于分层多模态场景图的视觉语言导航:快速与慢速推理

Xiaolin Zhou, Tingyang Xiao, Liu Liu, Yucheng Wang, Maiyue Chen, Xinrui Meng, Xinjie Wang, Wei Feng, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 视觉推理 :VLM(abstract)

AI总结 FSR-VLN通过分层多模态场景图与快速-慢速推理机制,提升视觉语言导航的效率与准确性,实现低延迟高成功率的导航性能。

Comments Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2506.06836 2025-11-26 cs.CV cs.AI cs.LG 85%

Harnessing Vision-Language Models for Time Series Anomaly Detection

利用视觉语言模型进行时间序列异常检测

Zelin He, Sarah Alnegheimish, Matthew Reimherr

机构 * Amazon(亚马逊公司)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于视觉语言模型的两阶段方法,无需时间序列训练即可提升时间序列异常检测的准确性和效率。

Comments Accepted at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11177 2025-11-26 cs.CV 77%

Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation

Viper-F1:基于交叉模态状态空间调制的高效细粒度多模态理解

Quoc-Huy Trinh

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Viper-F1通过引入高效液态状态空间动力学和令牌-网格相关模块,实现了高效细粒度多模态理解。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19920 2025-11-26 cs.CV 70%

Intelligent Image Search Algorithms Fusing Visual Large Models

融合视觉大模型的智能图像搜索算法

Kehan Wang, Tingqiong Cui, Yang Zhang, Yu Chen, Shifeng Wu, Zhenzhang Li

机构 * Chongqing University(重庆大学) CRRC Chongqing Co., Ltd.(CRRC重庆公司) Guangdong Polytechnic Normal University(广东 polytechnic 正规大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 DetVLM融合视觉大模型与物体检测,实现细粒度图像检索中的状态搜索和零样本搜索,取得高准确率。

Comments 31 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14421 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

ExDDV: A New Dataset for Explainable Deepfake Detection in Video

ExDDV:用于视频可解释深度伪造检测的新数据集

Vlad Hondru, Eduard Hogea, Darian Onchis, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯大学) West University of Timişoara(蒂米什瓦拉西大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ExDDV通过引入文本和点击监督,开发出可解释的深度伪造检测模型,以提高视频中深度伪造内容的识别能力。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 67%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20590 2025-11-26 cs.MA cs.AI cs.SE 57%

EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids

EnergyTwin: 一种用于模拟和协调能源微电网的多智能体系统

Jakub Muszyński, Ignacy Walużenicz, Patryk Zan, Zofia Wrona, Maria Ganzha, Marcin Paprzycki, Costin Bădică

机构 * Warsaw University of Technology(华沙技术大学) Systems research Institute Polish Academy of Sciences(波兰科学院系统研究 institute) University of Technology and Arts(技术与艺术大学) University of Craiova(克劳日瓦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 EnergyTwin是一种基于智能体的微电网模拟环境,结合物理建模与预测驱动的滚动时间规划,用于提升微电网的韧性和能源自给率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV 57%

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2510.14528 2025-11-26 cs.CV 83%

PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model

PaddleOCR-VL: 通过0.9B超紧凑视觉-语言模型提升多语言文档解析

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Handong Zheng, Jing Zhang, Jun Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 PaddleOCR-VL通过0.9B超紧凑视觉-语言模型实现多语言文档解析的高效准确识别

Comments Github Repo: https://github.com/PaddlePaddle/PaddleOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19806 2025-11-26 cs.CV 79%

Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes

在行之间阅读:通过潜在表示探测避免VLM生成的OCR错误

Jihan Yao, Achin Kulshrestha, Nathalie Rauschmayr, Reed Roberts, Banghua Zhu, Yulia Tsvetkov, Federico Tombari

机构 * University of Washington(华盛顿大学) Google(谷歌)

专题命中 文档图表理解 :VLM(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出通过潜在表示探测提升VLM在OCR任务中的回避准确性,通过内部状态检测置信度信号,提高系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2511.12937 2025-11-26 cs.AI cs.CV 84%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏