NMT-Keras: a Very Flexible Toolkit with a Focus on Interactive NMT and Online Learning
专题命中 视觉问答 :visual question answering(abstract)
Comments To appear at The Prague Bulletin of Mathematical Linguistics 111
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract)
Comments To appear at The Prague Bulletin of Mathematical Linguistics 111
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :visual question answering(abstract)
Comments Submitted to ICLR Workshop 2017
UR²-MLLM:面向放射科报告生成的多模态大语言模型中基于不确定性感知的重访推理
机构 * MedVisAI Lab(MedVisAI实验室) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) ; Centre of AI in Medicine, Singapore(新加坡医学人工智能中心) ; AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)AI方向) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)
专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对放射科报告生成任务,提出UR²-MLLM框架,通过动态重访不确定区域的机制实现最优性能,提升报告的可靠性与临床适配性。
Comments EMNLP 2026 Findings
Immuno-VLM:通过生成式语义抗体实现大型视觉-语言模型的开放世界可信赖性
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV
AI总结 针对大型视觉-语言模型在开放世界部署中因缺乏负面知识而将未知异常高置信度误分类为已知类别的“语义傲慢”问题,提出受生物免疫负选择启发的Immuno-VLM框架,利用大语言模型的生成推理主动产生“语义抗体”(近分布异常文本描述)来约束已知类决策空间,在ImageNet-1K和四个OOD基准上达到新最优。
Comments Accepted by ICML 2026
N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理
机构 * HKUST(香港科技大学) ; Tencent AI Lab(腾讯AI实验室) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; NJU(南京大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);grounding(title,abstract);visual reasoning(abstract)
AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。
Comments Project Page: https://n3d-vlm.github.io
金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解
机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)
专题命中 视觉推理 :VLM(title,title_cn);visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。
用于鲁棒跨数据集图像分类的MLLM路由异质集成模型
机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) ; University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)
专题命中 视觉推理 :MLLM(title,title_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。
Comments 8 pages, 4 figures, 7 tables
自问式视觉语言模型:用于组合视觉推理的强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV
AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
机构 * Fudan University(复旦大学) ; College of Future Information Technology(未来信息技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :MLLM(title,title_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn)
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
基于VLM的方法用于机器人科学实验室中的视觉异常检测
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) ; School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) ; Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。
VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理
机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) ; Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title,abstract);vision-language model(abstract);InternVL(abstract)
AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。
Comments 30 pages, 21 figures, EACL 2026 Findings
零样本长时程灵巧操作:基于多视图3D接地VLM推理
机构 * Seoul National University(首尔国立大学)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract)
AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。
视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力
专题命中 视觉推理 :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。
Comments Accepted at EMNLP 2026 (Findings)
聚焦推理,推断出异常:通过贝叶斯推理引导的聚焦VLM推理实现高速公路视频远场异常检测
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation, Ministry of Education(教育部交通运输大数据与人工智能重点实验室) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence (2018)(北京市交通数据挖掘与具身智能重点实验室)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VIBES框架,通过贝叶斯推理引导的聚焦VLM推理,解决远场目标异常检测中的注意力稀释和计算成本问题,提升检测准确性和实时效率。
回答前分割:用于多模态大语言模型视觉推理的像素定位
专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);MLLM(title);multimodal large language model(abstract)
AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。
从演示到奖励:VLM奖励模型的测试时提示优化
机构 * University of Amsterdam(阿姆斯特丹大学) ; Catholic University of Leuven(鲁汶天主大学) ; Toyota Research Institute(丰田研究院) ; Toyota Motor Europe(丰田欧洲公司)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Demo2Reward方法,利用少量专家演示在测试时优化VLM奖励模型的提示指令,减少假阳性并保持真阳性,无需额外训练即可提升下游策略学习。
衡量跨模态协同:VLM可解释性的一个基准
机构 * University of Luxembourg(卢森堡大学) ; Luxembourg Institute of Health (LIH)(卢森堡健康研究院)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Synergistic Faithfulness作为衡量VLM跨模态协同的指标,解决了传统单模态评估方法在评估VLM可解释性时的不足,通过引入Shapley交互指数,实现了对多模态协同的准确评估,同时提升了计算效率。
看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力
机构 * Baidu Inc.(百度公司) ; Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :VLM(title,title_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。
Comments CVPR2026
视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理
机构 * The Hong Kong University of Science(香港科学与技术大学) ; University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ; ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) ; AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。
Comments 27 pages, 5 figures, accepted at ICML 2026
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract);visual question answering(abstract)
Comments 21 pages
基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。
理解异构多模态大语言模型(MLLM)融合中的知识迁移机制:一种简单线性方法
专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对异构MLLM跨规模知识迁移机制,提出CDPI线性探针,经多组模型与基准测试发现,融合增益集中于高层推理,且正向迁移多发生在小比率区间。
Comments 17 pages, 6 figures; includes supplementary material. Revised presentation and terminology; results unchanged
用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI
AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。
Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。
并非真正的多语言:脚本一致性作为VLM评估中缺失的维度
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Independent Researcher(独立研究员)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。
基于全局图验证的VLM驱动3D室内场景生成优化
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。
Comments 15 pages, 8 figures
MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能
机构 * University of British Columbia(英属哥伦比亚大学) ; Weathon Software(威盛软件)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);vision language model(abstract);visual reasoning(abstract)
AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。
Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures