arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2604.23424 2026-04-28 cs.LG cs.CL 57%

Evolve: A Persistent Knowledge Lifecycle for Small Language Models

Evolve:为小型语言模型设计的持久知识生命周期

Dikran Hovagimian

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Evolve通过持久知识库与小型模型结合,提升准确率并降低教师模型调用成本,采用语义连贯的段落存储方式,实现知识的自动合并与刷新,有效提升任务性能。

Comments 35 pages, 1 figure. Code and evaluation data: https://gitlab.com/dikran.hovagimian/evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23344 2026-04-28 cs.CV 57%

Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection

探索开放词汇目标检测中的层次一致性与无偏目标性

Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种新颖的伪标签框架,通过层次一致性校准和LoCLIP模型提升开放词汇目标检测的准确性与可靠性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV 57%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22984 2026-04-28 cs.CV cs.GR 57%

BrickNet: Graph-Backed Generative Brick Assembly

BrickNet:基于图的生成积木组装

Peter Kulits, Cordelia Schmid

机构 * Inria, Ècole Normale Supèrieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学校、CNRS、巴黎萨克雷大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 BrickNet通过图结构生成积木构建序列,解决物理约束下的结构生成问题,提升生成序列的物理合理性。

Comments CVPR 2026; project page: https://kulits.github.io/BrickNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10649 2026-04-27 cs.LG cs.CL 57%

SpectralLoRA: Is Low-Frequency Structure Sufficient for LoRA Adaptation? A Spectral Analysis of Weight Updates

SpectralLoRA: LoRA适应是否仅需低频结构?对权重更新的频谱分析

Rajveer Singh

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文通过频谱分析发现LoRA更新主要由低频成分主导,压缩高频系数可显著降低存储需求,同时保持模型性能。研究还揭示RoBERTa-base在频谱压缩上的优势及任务复杂性对频谱敏感性的影响。

Comments v2: Added SVD-DCT correlation analysis (Pearson r=0.906, p<1e-9) connecting the empirical ~33% spectral constant to the Dyson Brownian Motion framework of Olsen et al. (2025); updated Section 7 and References. 11 pages, 6 figures, 7 tables. Indian Institute of Technology Roorkee

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18734 2026-04-27 cs.CL cs.AI 57%

Rethinking Retrieval-Augmented Generation as a Cooperative Decision-Making Problem

重新思考检索增强生成作为协作决策问题

Lichang Song, Ting Long, Yi Chang

机构 * Jilin University(吉林大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出CoRAG框架,将检索器与生成器视为平等决策者,通过共同优化任务目标提升生成稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19592 2026-04-27 cs.CV 57%

Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation

MLLMs中分解注意力融合用于无训练视频推理分割

Su Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim, Dongyoon Wee, Seon Joo Kim

机构 * Yonsei University(延世大学) Inha University(inha大学) NAVER Cloud(NAVER云)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21144 2026-04-24 cs.CL cs.AI cs.HC 57%

Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue

利用机器心智 imagery 代表情境对话中的共同背景

Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell

机构 * Inria University of Trento(特伦托大学) Inria, Carnegie Mellon University(Inria 和卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种主动视觉支架框架,通过将对话状态转化为持久的视觉历史,减少代表模糊并提高对话理解。

Comments Work under review. Biswesh Mohapatra and Giovanni Duca both contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 57%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20848 2026-04-24 cs.IR cs.AI 57%

MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations

MATRAG:多智能体透明检索增强生成用于可解释推荐

Sushant Mehta

机构 * ACM

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MATRAG通过多智能体协作与知识图谱增强检索,提升推荐系统的透明性和可解释性,实验表明其在准确率和可信度上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 57%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19768 2026-04-23 cs.CL cs.AI 57%

Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models

言多必失:一种量化大语言模型中认知-修辞失配的框架

Asim D. Bakhshi

机构 * National University of Science and Technology(科学与技术国家大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种量化大语言模型认知与修辞失配的框架,通过设计三元认知-修辞标记分类法,发现LLM生成文本在修辞强度和认知基础之间存在系统性失配。

Comments 19 pages, 7 figures, Paper Under Review by the Elsevier Journal Assessing Writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18562 2026-04-23 cs.CV 57%

AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation

AnchorSeg: 语言引导的查询库用于推理分割

Rui Qian, Chuanhang Deng, Qiang Huang, Jian Xiong, Mingxuan Li, Yingbo Zhou, Wei Zhai, Jintao Chen, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AnchorSeg通过结构化语言引导查询库将推理分割建模为图像标记上的条件生成过程,通过显式分离空间定位与语义推理,实现67.7%的gIoU和68.1%的cIoU的SOTA结果。

Comments This work has been accepted to ACL 2026, please refer to https://github.com/rui-qian/AnchorSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 57%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18982 2026-04-22 cs.AI 57%

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR:通过基于Shapley的奖励归因学习社交能力

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出SAVOIR框架,基于合作博弈理论解决语言代理训练中的信用分配问题,通过预期效用转移和Shapley值实现公平奖励分配,实验显示其在SOTOPIA基准上达到新状态-of-the-art性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18713 2026-04-22 cs.CV 57%

Align then Refine: Text-Guided 3D Prostate Lesion Segmentation

对齐后再细化:基于文本的3D前列腺病变分割

Cuiling Sun, Linkai Peng, Adam Murphy, Elif Keles, Hiten D. Patel, Ashley Ross, Frank Miller, Baris Turkbey, Andrea Mia Bejar, Halil Ertugrul Aktas, Gorkem Durak, Ulas Bagci

机构 * Department of Radiology, Northwestern University, Chicago, USA(放射科,西北大学,芝加哥,美国) Department of Urology, Northwestern University, Chicago, USA(泌尿科,西北大学,芝加哥,美国) Center for Cancer Research, National Cancer Institute, Bethesda, USA(癌症研究中心,国家癌症研究所,贝塞斯达,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多编码器U-Net架构,通过引入对齐损失、热图损失和置信度门控多头交叉注意力细化模块,提升前列腺病变分割的精度和多模态融合能力。

Comments Accepted to EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV 57%

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20530 2026-04-22 cs.RO cs.CV 57%

Memory Over Maps: 3D Object Localization Without Reconstruction

记忆超越映射:无需重建的3D物体定位

Rui Zhou, Xander Yap, Jianwen Cao, Allison Lau, Boyang Sun, Marc Pollefeys

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无需重建的3D物体定位方法,通过轻量级视觉记忆实现快速场景索引,显著降低预处理成本,验证了基于图像的场景记忆可替代密集3D重建。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19302 2026-04-22 cs.CV 57%

Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing

弥合语义与几何:一种解耦的LVLM-SAM框架用于光学遥感中的推理分割

Xu Zhang, Junyao Ge, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University, Xi'an, Shaanxi 710071, China(西安电子科技大学电子工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出解耦的LVLM-SAM框架,通过结构化几何提示优化,提升光学遥感中推理分割的性能,实现语义与几何的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18092 2026-04-21 cs.LG 57%

Generalization Boundaries of Fine-Tuned Small Language Models for Graph Structural Inference

微调小语言模型在图结构推断中的泛化边界

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究微调小语言模型在图结构推断中的泛化能力,通过图大小和图族分布两个维度评估其在超出训练条件时的表现,揭示模型在不同架构下的退化特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 57%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17949 2026-04-21 cs.CV 57%

ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection

ZSG-IAD:一种用于零样本 grounded 工业异常检测的多模态框架

Qiuhui Chen, Jiaxiang Song, Shuai Tan, Weimin Zhong

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ZSG-IAD框架,通过多模态数据生成结构化异常报告和像素级掩码,采用语言引导的两跳接地模块和可执行规则GRPO提升可靠性,实现在多个工业异常基准上的强零样本性能和透明解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14548 2026-04-21 cs.SD cs.LG eess.AS 57%

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里

Yuxiang Wang, Hongyu Liu, Yijiang Xu, Qinke Ni, Li Wang, Wan Lin, Kunyu Feng, Dekun Chen, Xu Tan, Lei Wang, Jie Shi, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12554 2026-04-21 cs.CV 57%

EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis

EmoVerse:一种基于大语言模型的emotion表示数据集用于可解释的视觉emotion分析

Yijie Guo, Dexiang Hong, Weidong Chen, Zihan She, Cheng Ye, Xiaojun Chang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出EmoVerse数据集,通过多层知识图谱注释实现可解释的视觉情绪分析,包含219k张图像和双注释,提供离散和连续情绪表示,结合新颖的多阶段流程和可解释模型推动高阶情绪理解。

Comments 11 pages, 7 figures. This is a preprint version of a paper submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17484 2026-04-21 cs.IR cs.LG 57%

Matlas: A Semantic Search Engine for Mathematics

Matlas:数学语义搜索引擎

Haocheng Ju, Leheng Chen, Peihao Wu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) IQuest Research(IQuest研究) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心和新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大亚湾先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Matlas通过构建大规模数学语义库,实现数学陈述的高效检索,提升数学家定理检索效率并为AI系统提供数学知识基础。

Comments Web Service: https://matlas.ai/, API Docs: https://matlas.ai/docs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10741 2026-04-21 cs.CL cs.AI cs.IR 57%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16982 2026-04-21 cs.AI 57%

A phenotype-driven and evidence-governed framework for knowledge graph enrichment and hypotheses discovery in population data

一种以表型驱动和证据为导向的知识图谱丰富与假设发现框架

Adela Bâra, Simona-Vasilica Oprea

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济大学信息与自动化系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种以表型驱动和证据为导向的知识图谱增强与假设发现框架,通过整合图神经网络、因果推理和大语言模型,实现结构化假设发现和受控知识图谱扩展,提升解释性和科学证据一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16506 2026-04-21 cs.CV cs.CL 57%

Medical thinking with multiple images

多图像医学推理

Zonghai Yao, Benlu Wang, Yifan Zhang, Junda Wang, Iris Xia, Zhipeng Tang, Shuo Han, Feiyun Ouyang, Zhichao Yang, Arman Cohan, Hong Yu

机构 * Manning College of Information and Computer Sciences, UMass Amherst(UMass阿默斯特信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗保健中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Miner School of Computer and Information Sciences, UMass Lowell(UMass洛威计算机与信息科学学院) Department of Electrical and Computer Engineering, UMass Lowell(UMass洛威电气与计算机工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出MedThinkVQA多图像医学推理基准,通过专家标注数据验证多图像整合对临床推理的重要性,发现多图像推理瓶颈在于证据提取与对齐,且增加推理时间计算效果有限。

Comments Equal contribution for the first two authors. To appear in the proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026). Code is in https://github.com/benluwang/MedThinkVQA. Dataset is in https://huggingface.co/datasets/bio-nlp-umass/MedThinkVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16411 2026-04-21 cs.LG 57%

CGCMA: Conditionally-Gated Cross-Modal Attention for Event-Conditioned Asynchronous Fusion

CGCMA:基于事件条件的异步融合条件门控跨模态注意力

Yunxiang Guo

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出CGCMA,用于异步融合场景中事件条件下的跨模态注意力,通过分离文本条件接地与滞后感知信任控制,提升异步多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏