arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3153 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12255 2026-02-19 cs.CV 57%

Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets

Fusionista2.0:大规模数据集的高效检索系统

Huy M. Le, Dat Tien Nguyen, Phuc Binh Nguyen, Gia Bao Le Tran, Phu Truong Thien, Cuong Dinh, Minh Nguyen, Nga Nguyen, Thuy T. N. Nguyen, Tan Nhat Nguyen, Binh T. Nguyen

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed Bin Zayed人工智能大学(MBZUAI)) AISIA Research Lab(AISIA研究实验室) University of Information Technology(信息技术大学) Ho Chi Minh University of Science(胡志明科学大学) Vietnam National University, Ho chi Minh City(越南国家大学,胡志明市)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 Fusionista2.0通过优化预处理、识别技术和用户界面,实现了大规模视频检索的高效性和准确性提升。

Journal ref MultiMedia Modeling. MMM 2026. Lecture Notes in Computer Science, vol 16415

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV 57%

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10518 2026-02-12 cs.CV 57%

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps

MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试

Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta

机构 * University of Southern California(南加州大学) University of California Los Angeles(加州大学洛杉矶分校) University of Utah(犹他大学) Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07624 2026-02-10 cs.AI 57%

M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions

M2A:具有双层混合记忆的多模态记忆代理用于长期个性化交互

Junyu Feng, Binxiao Xu, Jiayi Chen, Mengyu Dai, Cenyang Wu, Haodong Li, Bohan Zeng, Yunliu Xie, Hao Liang, Ming Lu, Wentao Zhang

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

AI总结 M2A通过双层混合记忆系统实现长期多模态交互中的个性化响应,利用在线更新机制提升用户偏好适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05728 2026-02-06 cs.CL cs.AI 57%

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG: 减少多跳问答中的LLM调用和令牌开销

Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) School of Electronic Information, Central South University(电子信息学院,中南大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 57%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 57%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 57%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19847 2026-01-29 cs.AI cs.DC 57%

DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems

DGRAG:边缘-云计算系统中的分布式图驱动检索增强生成

Wenqing Zhou, Yuxuan Yan, Qianqian Yang

机构 * Zhejiang University(浙江大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DGRAG是一种面向边缘-云计算系统的分布式图驱动检索增强生成框架,通过边缘设备本地知识图和云端轻量级索引实现隐私保护和高效检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12658 2026-01-27 cs.CL cs.AI 57%

Augmenting Question Answering with A Hybrid RAG Approach

通过混合RAG方法增强问答

Tianyi Yang, Nashrah Haque, Vaishnave Jonnalagadda, Yuya Jeremy Ong, Zhehui Chen, Yanzhao Wu, Lei Yu, Divyesh Jadav, Wenqi Wei

机构 * Plastic Lab(塑料实验室) Google(谷歌) Florida International University(佛罗里达国际大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出SSRAG方法,通过混合查询增强、代理路由和结构化检索技术,提升问答任务的响应质量。

Comments 10 pages, 5 tables, 2 figures; presented at IEEE CogMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09396 2026-01-27 cs.CV 57%

Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA

过多的帧,但并非都有用:长视频问答的高效策略

Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 57%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 57%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15457 2026-01-23 cs.CL cs.AI cs.IR 57%

Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering

分块、检索与重排序:RAG架构在政策文件问答中的实证评估

Anuj Maharjan, Umesh Yadav

机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14757 2026-01-22 cs.CV 57%

ReinPath: A Multimodal Reinforcement Learning Approach for Pathology

ReinPath:一种用于病理学的多模态强化学习方法

Kangcheng Zhou, Jun Jiang, Qing Zhang, Shuang Zheng, Qingli Li, Shugong Xu

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 57%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12198 2026-01-19 cs.CV 57%

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models

ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事

Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal

机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 57%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10228 2026-01-16 cs.CV cs.MM eess.IV 57%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 57%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 57%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 57%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 57%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05874 2026-01-12 cs.CL cs.AI 57%

Continual-learning for Modelling Low-Resource Languages from Large Language Models

连续学习用于从大语言模型中建模低资源语言

Santosh Srinath K, Mudit Somani, Varun Reddy Padala, Prajna Devi Upadhyay, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Sciences, Pilani, India(机器智能组,计算机科学与信息系,比拉理工学院和科学学院,印度帕利尼)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出利用基于词性的代码切换和重放适配器策略,解决从大语言模型构建小语言模型时的灾难性遗忘问题,并在视觉语言任务中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 57%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.LG

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03073 2026-01-07 cs.CV 57%

Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA

通过大型语言模型理解多智能体推理用于漫画视觉问答

Tong Wu, Thanet Markchom

机构 * University of Reading(阅读大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02783 2026-01-07 cs.CV 57%

EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework

EarthVL: 一种渐进式地球视觉-语言理解和生成框架

Junjue Wang, Yanfei Zhong, Zihang Chen, Zhuo Zheng, Ailong Ma, Liangpei Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 EarthVL提出一种渐进式视觉-语言框架,通过多任务数据集和语义引导网络提升城市规划中的遥感目标识别与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02683 2026-01-07 cs.AI 57%

Learning from Prompt itself: the Hierarchical Attribution Prompt Optimization

从提示本身学习:层次归因提示优化

Dongyu Chen, Jian Ma, Xianpeng Zhang, Lei Zhang, Haonan Lu, Chen Chen, Chuangchuang Wang, Kai Tang

专题命中 视觉问答 :MLLM(abstract);分类 cs.AI

AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01769 2026-01-06 cs.CV 57%

CTIS-QA: Clinical Template-Informed Slide-level Question Answering for Pathology

CTIS-QA:基于临床模板的滑动切片级问题回答用于病理学

Hao Lu, Ziniu Qian, Yifu Li, Yang Zhou, Bingzheng Wei, Yan Xu

机构 * School of Biological Science(生物科学学院) Medical Engineering Beihang University Beijing, China(医学工程北京航空航天大学北京中国) ByteDance Inc.(字节跳动公司)

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV

AI总结 CTIS-QA通过双流架构实现滑动切片级问题回答,结合临床模板和视觉-语言对齐,提升病理诊断准确性。

Comments The paper has been accepted by BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏