arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-19 至 2026-02-19 共收录 49 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2602.15915 2026-02-19 cs.CV cs.AI 84%

MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering

MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架

Xianwei Mao, Kai Ye, Sheng Zhou, Nan Zhang, Haikuan Huang, Bin Li, Jiajun Bu

机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16138 2026-02-19 cs.CV 74%

IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models

IRIS:通过推理时的注视来解决大型视觉-语言模型中开放式视觉问答的意图

Parsa Madinei, Srijita Karmakar, Russell Cohen Hoffing, Felix Gervitz, Miguel P. Eckstein

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,加州大学圣芭芭拉分校) Department of Psychological & Brain Sciences, UC Santa Barbara(心理学与脑科学系,加州大学圣芭芭拉分校) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 IRIS通过实时眼动数据提升大型视觉-语言模型在开放式视觉问答中的意图解析准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25867 2026-02-19 cs.LG 74%

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

从医学文献合成高质量的视觉问答系统:基于生成-验证框架的大型多模态模型

Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Fudan University(复旦大学) Amazon Research(亚马逊研究)

专题命中 视觉问答 :visual question answering(title);分类 cs.LG

AI总结 MedVLSynther通过生成-验证框架从开放文献合成高质量医学VQA数据,提升六个基准测试的准确率,达到77.57的VQA-RAD表现。

Comments Project page, code, data, and models: https://ucsc-vlaa.github.io/MedVLSynther/ ; Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16689 2026-02-19 cs.CV cs.LG 62%

Are Object-Centric Representations Better At Compositional Generalization?

基于对象中心表示的组合泛化能力是否更强?

Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik Johansson, Carsten Marr, Stefan Bauer, Andrea Dittadi

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) KTH Royal Institute of Technology(皇家理工学院) MPI for Intelligent Systems, Tübingen(图宾根人工智能研究所) Institute of AI for Health, Computational Health Center, Helmholtz Munich(健康人工智能研究所,计算健康中心,海德堡慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过三个视觉世界基准,发现对象中心表示在组合泛化任务中表现更优,尤其在数据受限时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12255 2026-02-19 cs.CV 57%

Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets

Fusionista2.0:大规模数据集的高效检索系统

Huy M. Le, Dat Tien Nguyen, Phuc Binh Nguyen, Gia Bao Le Tran, Phu Truong Thien, Cuong Dinh, Minh Nguyen, Nga Nguyen, Thuy T. N. Nguyen, Tan Nhat Nguyen, Binh T. Nguyen

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed Bin Zayed人工智能大学(MBZUAI)) AISIA Research Lab(AISIA研究实验室) University of Information Technology(信息技术大学) Ho Chi Minh University of Science(胡志明科学大学) Vietnam National University, Ho chi Minh City(越南国家大学,胡志明市)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 Fusionista2.0通过优化预处理、识别技术和用户界面,实现了大规模视频检索的高效性和准确性提升。

Journal ref MultiMedia Modeling. MMM 2026. Lecture Notes in Computer Science, vol 16415

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 50%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 视觉问答 :grounding(abstract)

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2602.05023 2026-02-19 cs.CR cs.AI 84%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16157 2026-02-19 cs.HC 82%

Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI

提前窥视田野研究:探索VLM人设作为人机交互领域具身研究的支持工具

Xinyue Gui, Ding Xia, Mark Colley, Yuan Li, Vishal Chauhan, Anubhav Anubhav, Zhongyi Zhou, Ehsan Javanmardi, Stela Hanbyeol Seo, Chia-Ming Chang, Manabu Tsukada, Takeo Igarashi

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出利用VLM人设模拟田野研究结果,验证其在具身研究中的应用潜力,发现其在响应模式上接近人类但缺乏多样性。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16537 2026-02-19 cs.CV cs.AI cs.CL cs.RO 81%

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

RoboSpatial: 教授机器人2D和3D视觉-语言模型空间理解能力

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, Stan Birchfield

机构 * The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 RoboSpatial通过构建大规模空间理解数据集,提升机器人2D和3D视觉-语言模型的空间推理能力。

Comments CVPR 2025 (Oral); Project Website: https://chanh.ee/RoboSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05249 2026-02-19 cs.CV cs.AI 76%

COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization

COGITAO:一个用于研究组合性与泛化能力的视觉推理框架

Yassine Taoudi-Benchekroun, Klim Troyan, Pascal Sager, Stefan Gerber, Lukas Tuggener, Benjamin Grewe

机构 * Institute of Neuroinformatics, University of Zurich(神经信息研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Centre for Artificial Intelligence, Zurich University of Applied Sciences(人工智能中心,应用科学大学)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI

AI总结 COGITAO提出了一种模块化数据生成框架,用于研究视觉领域中的组合性与泛化能力,通过规则任务和灵活的参数控制生成大量任务规则,验证了现有视觉模型在泛化能力上的不足。

Comments 10 main pages, 3 figure, appendix available

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15918 2026-02-19 cs.CV cs.AI 73%

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

EarthSpatialBench: 多模态大语言模型在地球影像上空间推理能力的基准测试

Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

机构 * University of Florida(佛罗里达大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 EarthSpatialBench是一个用于评估多模态大语言模型在地球影像上空间推理能力的综合基准测试,涵盖空间距离、方向、拓扑关系及复杂几何查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16702 2026-02-19 cs.CV 70%

Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning

具有显著性意识的多路由思考:重新审视视觉-语言推理

Mingjia Shi, Yinhan He, Yaochen Zhu, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。

Comments preprint 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16671 2026-02-19 cs.SE cs.AI 57%

SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation

SPARC:面向自动化C单元测试生成的场景规划与推理

Jaid Monwar Chowdhury, Chi-An Fu, Reyhaneh Jabbarvand

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) National Taiwan University(台湾国立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10265 2026-02-19 cs.AI cs.RO 57%

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

SurgRAW:基于链式推理的多智能体工作流用于机器人手术视频分析

Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR)) Wellcome/EPSRC Centre for Interventional and Surgical Sciences (WEISS) and the Department of Medical Physics and Biomedical Engineering, University College London(Wellcome/EPSRC介入与外科科学中心(WEISS)及伦敦大学学院医学物理与生物医学工程系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 SurgRAW通过基于链式推理的多智能体工作流,在机器人手术视频分析中实现零样本多任务推理,提升准确性和临床相关性。

Journal ref IEEE Robotics and Automation Letters, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15882 2026-02-19 cs.RO cs.AI 57%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15858 2026-02-19 cs.CL cs.AI 57%

State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models

状态设计至关重要:表示如何塑造大语言模型中的动态推理

Annie Wong, Aske Plaat, Thomas Bäck, Niki van Stein, Anna V. Kononova

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型中状态表示设计对动态推理的影响,发现自然语言表示和空间编码对性能至关重要,但长期任务仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15242 2026-02-19 cs.CV 57%

Trustworthy and Fair SkinGPT-R1 for Democratizing Dermatological Reasoning across Diverse Ethnicities

可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理

Yuhao Shen, Zhangtianyi Chen, Yuanhao He, Yan Xu, Shuping Zhang, Liyuan Sun, Zijian Wang, Yinghao Zhu, Yuyuan Yang, Jiahe Qian, Ziwen Wang, Xinyuan Zhang, Wenbin Liu, Zongyuan Ge, Tao Lu, Siyuan Yan, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00869 2026-02-19 cs.CL cs.AI 57%

m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models

m1:通过大语言模型的测试时缩放释放医疗推理的潜力

Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Amazon Research(亚马逊研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出m1方法,通过测试时缩放提升医疗推理能力,发现最佳推理预算和医学知识不足是关键瓶颈。

Comments 17 pages; 7 figures; Data, code, and models: https://github.com/UCSC-VLAA/m1 ; Accepted by ML4H'25

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2508.08177 2026-02-19 cs.CV cs.AI 86%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05523 2026-02-19 cs.CV cs.AI 81%

Prompt When the Animal is: Temporal Animal Behavior Grounding with Positional Recovery Training

提示当动物是:基于位置恢复训练的时序动物行为 grounding

Sheng Yan, Xin Du, Zongying Li, Yi Wang, Hongcang Jin, Mengyuan Liu

机构 * School of Artificial Intelligence, Chongqing University of Technology(重庆理工大学人工智能学院) National Key Laboratory of General Artificial Intelligence, Shenzhen Graduate School, Peking University(北京大学深圳研究生院国家通用人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 Port 框架,通过位置恢复训练提升动物行为时序 grounding 的准确性,在 Animal Kingdom 数据集上取得 38.52 的 IoU@0.3 成绩,并在 ICME 2024 挑战赛中表现突出。

Comments Accepted by ICMEW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16317 2026-02-19 cs.GR 67%

CADEvolve: Creating Realistic CAD via Program Evolution

CADEvolve: 通过程序进化创建逼真的CAD

Maksim Elistratov, Marina Barannikov, Gregory Ivanov, Valentin Khrulkov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 CADEvolve通过程序进化生成逼真的CAD,利用VLM引导的编辑和验证,生成8000个复杂零件的可执行参数化生成器,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16173 2026-02-19 cs.AI cs.CL cs.LG 62%

Learning Personalized Agents from Human Feedback

从人类反馈中学习个性化代理

Kaiqu Liang, Julia Kruk, Shengyi Qian, Xianjun Yang, Shengjie Bi, Yuanshun Yao, Shaoliang Nie, Mingyang Zhang, Lijuan Liu, Jaime Fernández Fisac, Shuyan Zhou, Saghar Hosseini

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学) Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PAHF通过整合显式记忆与双反馈通道,实现持续个性化,显著提升学习速度和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00364 2026-02-19 cs.CV cs.LG 62%

LMSeg: Unleashing the Power of Large-Scale Models for Open-Vocabulary Semantic Segmentation

LMSeg:释放大规模模型在开放词汇语义分割中的潜力

Huadong Tang, Youpeng Zhao, Yan Huang, Min Xu, Jun Wang, Qiang Wu

机构 * Huadong Tang(华东唐) Youpeng Zhao(赵有鹏) Yan Huang(黄艳) Min Xu(徐敏) Jun Wang(王俊) Qiang Wu(吴强)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 LMSeg通过结合多个大规模模型提升开放词汇语义分割的性能,利用LLMs生成多样化视觉属性的提示并改进视觉特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10067 2026-02-19 cs.LG 57%

Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability

特征作为奖励:通过可解释性实现开放性任务的可扩展监督

Aaditya Vikram Prasad, Connor Watts, Jack Merullo, Dhruvil Gala, Owen Lewis, Thomas McGrath, Ekdeep Singh Lubana

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出通过特征作为奖励实现开放性任务的可扩展监督,利用强化学习流程减少幻觉并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16633 2026-02-19 q-bio.PE 50%

Behavioral change models for infectious disease transmission: a systematic review (2020-2025)

传染病传播中的行为变化模型:系统综述(2020-2025)

Youngji Jo, Sileshi Sintayehu Sharbayta, Bruno Buonomo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了2020-2025年间关于传染病传播中行为变化模型的研究,分析了行为适应在传播、疫苗接种和合规性中的影响,并提出了一种分类体系以指导行为过程在流行病学建模中的整合。

Comments 23 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16551 2026-02-19 cs.DB 50%

Automated Extraction of Mechanical Constitutive Models from Scientific Literature using Large Language Models: Applications in Cultural Heritage Conservation

利用大语言模型自动化提取科学文献中的机械本构模型:应用于文化遗产保护

Rui Hu, Yue Wu, Tianhao Su, Yin Wang, Shunbo Hu, Jizhong Huang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究利用大语言模型自动化提取科学文献中的机械本构模型,应用于文化遗产保护,构建了结构化数据库并提高了数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2602.16430 2026-02-19 cs.CV cs.AI 62%

Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems

为印度设计生产级OCR:多语言和领域特定系统

Ali Faraz, Raja Kolla, Ashish Kulkarni, Shubham Agarwal

机构 * Krutrim AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种多语言OCR训练策略,通过Chitrapathak系列在印度多语言文档中实现SOTA性能,并展示了Parichay在政府文档中的高效提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16455 2026-02-19 cs.CV 57%

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

视觉自校准:一种像素引导的准确图表解析范式

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII) Shanghai Innovation Institute(上海创新研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏