arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2602.08346 2026-02-10 cs.CV 70%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 70%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 70%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 70%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 70%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 70%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 70%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 70%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 70%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV 70%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 70%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18386 2026-01-27 cs.CV 70%

ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks

ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理

Gabriel Lee Jun Rong, Christos Korgialas, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 70%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17197 2026-01-27 cs.CL cs.LG 70%

Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding

超越字面:跨风格多模态推理用于隐喻语言理解

Seyyed Saeid Cheshmi, Hahnemann Ortiz, James Mooney, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出一种三步框架,通过跨风格多模态推理提升隐喻语言理解能力,实验显示推理轨迹和跨风格训练能显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 70%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 70%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 70%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 70%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 70%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 70%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24952 2026-01-15 cs.CV 70%

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning

超越最后一帧:面向生成视频推理的过程感知评估

Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Information, Renmin University of China(中国人民大学信息学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ByteDance(字节跳动)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 70%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20665 2026-01-14 cs.CV 70%

DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving

DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型

Muxi Diao, Lele Yang, Hongbo Yin, Zhexu Wang, Yejie Wang, Daxin Tian, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Beihang University(北航)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03215 2026-01-14 cs.AI 70%

COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence

COSINT-Agent: 一种面向中文开源情报的知识驱动多模态智能体

Wentao Li, Congcong Wang, Xiaoxiao Cui, Zhi Liu, Wei Guo, Lizhen Cui

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 COSINT-Agent通过整合多模态大语言模型与实体-事件-场景知识图谱,提升中文开源情报的多模态推理能力与情报生成效率。

Comments This manuscript (arXiv:2503.03215) is being withdrawn at the supervisor's request. The content is preliminary and needs further internal revision and approval before public release. We will resubmit a revised version after completion. Apologies for the inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05640 2026-01-13 cs.CV 70%

SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving

SGDrive: 场景到目标层次化世界认知用于自动驾驶

Jingyu Li, Junjie Wu, Dongnan Hu, Xiangkai Huang, Bin Sun, Zhihui Hao, Xianpeng Lang, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(利汽车公司) Tongji University(同济大学) University of Surrey(Surrey大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SGDrive通过构建驾驶特定的知识层次结构,改进了视觉语言模型在自动驾驶中的轨迹规划能力,实现了在导航模拟基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04225 2026-01-09 cs.CY cs.AI 70%

Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course

消费者聊天机器人能推理吗?一个嵌入

Amarda Shehu, Adonyas Ababu, Asma Akbary, Griffin Allen, Aroush Baig, Tereana Battle, Elias Beall, Christopher Byrom, Matt Dean, Kate Demarco, Ethan Douglass, Luis Granados, Layla Hantush, Andy Hay, Eleanor Hay, Caleb Jackson, Jaewon Jang, Carter Jones, Quanyang Li, Adrian Lopez, Logan Massimo, Garrett McMullin, Ariana Mendoza Maldonado, Eman Mirza, Hadiya Muddasar, Sara Nuwayhid, Brandon Pak, Ashley Petty, Dryden Rancourt, Lily Rodriguez, Corbin Rogers, Jacob Schiek, Taeseo Seok, Aarav Sethi, Giovanni Vitela, Winston Williams, Jagan Yetukuri

机构 * George Mason University(乔治·马歇尔大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文通过学生主导的实地实验,评估了消费者聊天机器人在推理任务中的表现,揭示了其在不同推理类型上的性能差异及教学意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22836 2026-01-09 cs.AI 70%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 70%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01875 2026-01-06 cs.AI q-bio.QM 70%

Toward Auditable Neuro-Symbolic Reasoning in Pathology: SQL as an Explicit Trace of Evidence

迈向病理学中的可审计神经符号推理:SQL作为证据的显式轨迹

Kewen Cao, Jianxu Chen, Yongbing Zhang, Ye Zhang, Hongxiao Wang

机构 * Capital Normal University, Beijing, China(首都师范大学) Leibniz-Institut für Analytische Wissenschaften-ISAS, Dortmund, Germany(莱比锡分析科学研究所-ISAS) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出一种基于SQL的神经符号推理框架,通过可执行的SQL轨迹实现病理分析的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏