arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 238 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 64 篇

2606.27499 2026-09-01 cs.CV cs.AI cs.CL 版本更新 82%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments Accepted to EMNLP 2026 Main Conference. 17 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-09-01 cs.LG cs.CL cs.CV cs.SD eess.AS 版本更新 82%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Zinuo Cheng, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Accepted to EMNLP 2026 (System Demonstrations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2026-09-01 cs.CL cs.AI cs.CV 版本更新 82%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

MM-BrowseComp:多模态浏览智能体的综合基准

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。

Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29489 2026-09-01 cs.CR cs.CV 新提交 81%

SpatialTrust: A Benchmark for Environmental Risk Recognition in Secure Authentication

SpatialTrust:安全认证中环境风险识别的基准测试

Junbin Lu, Hsiang-Wei Huang, Saesha Wadhwa, Yu Ting Hsu, Jenq-Neng Hwang

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialTrust基准测试评估MLLM在安全认证场景中环境风险识别等五项能力,发现现有模型表现有限,还引入SpatialTrustGuard流程提升了Qwen3-VL-30B-A3B-Instruct的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29098 2026-09-01 cs.AI cs.CV 新提交 81%

SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

SafeAtlas-VL:基于大规模数据与防护模型的二元多模态安全之外

Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu Zhang, Chunyi Li, Yue Shi, Kaiwei Zhang, Zicheng Zhang, Yuan Tian, Qi Jia, Yan Teng, Wei Sun, Ning Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态安全评估的二元局限,推出含五级标注的SafeAtlas-VL数据集与SafeAtlas Guard系列模型,8B模型F1分数超SOTA约4%,代码数据模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28626 2026-09-01 cs.CL cs.AI 新提交 81%

Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects

大型语言模型是否会仔细审查其评审内容?一项关于评分校准、错误检测及作者身份影响的多模态审计研究

Emad Alharbi

机构 * University of Tabuk(塔布克大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究以两款多模态LLM为评审者评估2026 ICLR投稿,发现其评分高于人类、错误检测率低,提供图表会降低错误检测率,作者身份对评审无影响,编辑决策与简单评分平均一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28623 2026-09-01 cs.CL cs.AI 新提交 81%

Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure

重新审视:压力下多模态模型推理链中的谄媚性测量

Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw, Shivank Garg, Madhur Panwar, Vasu Sharma

机构 * Adelaide University(阿德莱德大学) Akita International University(秋田国际大学) RNA Tech(RNA科技公司) Algoverse AI Research(Algoverse AI研究院) PocketFM(PocketFM公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态推理模型,构建含四类任务与五种压力条件的基准数据集,发现压力下谄媚性普遍存在,多轮压力下临床判断中该现象加剧,且谄媚性可独立破坏推理链,仅答案评估不足。

Comments Accepted to COLM @ AdvML-Frontiers-CoTMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11454 2026-09-01 cs.CV cs.AI 81%

HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

HumaniBench: 一种以人为中心的大型多模态模型评估框架

Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie, Ashmal Vayani, Ahmed Y. Radwan, Mukund S. Chettiar, Amandeep Singh, Mubarak Shah, Deval Pandya

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。

Comments Accepted at Transactions on Intelligent Systems and Technology (Manuscript ID: TIST-2026-02-0123.R2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新 81%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29209 2026-09-01 cs.CL cs.HC 新提交 79%

Toward Cultural Alignment: Human-Centered Evaluation of Multimodal AI Stories Across Five African Communities

迈向文化对齐:五个非洲社区对多模态AI故事的以人为中心的评估

Millicent Ochieng, Felermino D. M. A. Ali, Elizabeth A. Ankrah, Najeeb Gambo Abdulhamid, Migisha Boyd, Stephanie Nyairo, Mercy Muchai, Samuel Chege Maina, Aditya Vashistha, Anja Thieme, Jacki O'Neill

机构 * Microsoft Research Africa(微软研究院非洲分部) Swansea University(斯旺西大学) Cornell University(康奈尔大学) Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文以五个非洲社区为对象,通过混合方法评估AI生成多模态故事的文化对齐情况,构建了相关分类体系,并发现多模态LLM裁判需经社区校准才能可靠评估文化对齐。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27010 2026-09-01 cs.AI 版本更新 79%

A Multi-Modal AI Framework for Real-Time Queue Prediction, Management and Optimisation in Intelligent Border Control Systems

用于智能边检系统中实时队列预测、管理与优化的多模态AI框架

Varvara Mama, Eleni Veroni, Nikolaos Kapsalis, Christos D. Nikolopoulos, Anargyros T. Baklezos

机构 * Hellenic Mediterranean University(希腊地中海大学) National Technical University of Athens(雅典国立技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究针对智能边检系统队列管理问题,提出多模态AI框架,结合LSTM、MPC等技术,经评估可降低预测误差与等待时间、提升吞吐量。

Comments 6 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-09-01 cs.AI 版本更新 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 35 pages, 6 figures. Accepted to Findings of EMNLP 2026. Code and data: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-09-01 cs.AI 版本更新 79%

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26824 2026-09-01 cs.DL cs.AI cs.IR 版本更新 79%

LeMat-Synth: a multi-modal toolbox to curate broad synthesis procedure databases from scientific literature

LeMat-Synth:用于从科学文献中构建广泛合成程序数据库的多模态工具箱

Magdalena Lederbauer, Siddharth Betala, Valerie Gentzke, Anamaria Leonescu, Amine Sehaba, Faris Flaifil, Ayush Jain, Alfonso Amayuelas, Nikhil Yelamarthy, Xiyao Li, Grégoire Germain, Stefano Ribes, Stefan P. Schmid, Alexandre Nozadze, Anna Kelmanson, Sudheesh Kumar Ethirajan, Mohd Zaki, Elton Pan, Georgia Channing, Connor W. Coley, Philippe Schwaller, Rocío Mercado, Alexandre Duval, Mathilde L. D. Franckel, Samuel P. Gleason

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究开发LeMat-Synth Parser多模态工具箱,从8.1万篇文献构建含5.8万种合成方案的最大无机材料合成数据集,验证其质量并通过氨分解、超导领域应用展示其可扩展性,相关工具与数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2026-09-01 cs.CV cs.AI 版本更新 79%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30949 2026-09-01 cs.IR 新提交 78%

MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval

MULTI3IR:多视角、多领域、多模态信息检索基准

Seokwon Song, Sohyeon Kim, Gunhee Kim

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 该研究针对现有IR基准的不足,构建了多视角多领域多模态IR基准Multi³IR,提出SPIN方法提升检索器的视角覆盖度,实验验证其性能优势与泛化性。

Comments EMNLP 2026; code is available at https://github.com/seokwon99/Multi3IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30510 2026-09-01 cs.CV cs.AI cs.CL cs.DL 新提交 78%

Lot Machine: Multimodal Lot Extraction from Auction Catalogs

拍品提取模型:从拍卖目录中进行多模态拍品提取

Mathias Zinnen, Alisha Mund, Sabine Lang, Lukas Hüttner, Thomas Gorges, Vincent Christlein

机构 * FAU Erlangen(埃尔朗根-纽伦堡大学) Pattern Recognition Lab(模式识别实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出基于视觉语言模型(VLM)的流水线,从历史拍卖目录中自动提取结构化拍品级元数据,对比不同部署模式的模型性能,为文化遗产机构提供可行的自动化分析方案。

Comments Accepted at the VISART Workshop (Computer Vision for Art Analysis), ECCV 2026. 19 pages, 6 figures, 5 tables. Supplementary material included as an appendix. Code, benchmark data, and prompt templates: https://github.com/mathiaszinnen/auction-lot-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29193 2026-09-01 cs.LG 新提交 78%

HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide

HalluPrism:多模态不确定性应用于诊断而非决策

Aman Prakash, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(德里印度理工学院) Dhirubhai Ambani University(德鲁巴伊·安巴尼大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出HalluPrism,通过视觉扰动敏感性等三维特征诊断多模态大语言模型的失败类别,提升了失败检测的AUROC,明确多模态不确定性应先诊断再决策。

Comments Accepted to Findings of EMNLP 2026. 52 pages, 1 figure, 46 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-09-01 eess.IV 版本更新 78%

Controlled Evaluation of Graph and Multimodal Augmentation in RAG for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah, Opeoluwa Akinseloyin, Michael Ajao-Olarinoye, Abiola Babatunde

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17809 2026-09-01 cs.IT math.IT 版本更新 78%

A Multi-Modal Channel Sounding System for Environment-Aware Channel Measurements in 6G Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

Comments Substantially revised version after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-09-01 cs.CV cs.AI cs.LG 版本更新 76%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30872 2026-09-01 cs.CV 新提交 74%

SurgSkill-Bench: A Benchmark for Multimodal Surgical Skill Assessment

SurgSkill-Bench:多模态外科手术技能评估基准

Chaohui Dang, Zheheng Jiang, James Glasbey, David Luke, Theodoros Arvanitis, Le Zhang

机构 * University of Birmingham(伯明翰大学) University of Leicester(莱斯特大学) University Hospitals North Midlands(中北部大学医院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究构建了多模态外科手术技能评估基准SurgSkill-Bench,设计两种评估设置,通过实验验证内容自适应采样和专家评论辅助可提升评分预测性能,最佳平均AUROC达0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28605 2026-09-01 cs.AI cs.CV 新提交 73%

MedTVL: Harnessing Vision and Language for Medical Time Series Classification

MedTVL:利用视觉与语言进行医学时间序列分类

Jiexia Ye, Jia Li, Fugee Tsung

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出文本引导双路径架构MedTVL,结合卷积时间路径与Transformer视觉路径,辅以自适应医学文本语义和混合专家机制,支持多模态对比学习,在多医学任务上展现出优越的分类性能与可迁移性。

Comments 12 pages, 10 figures, 7 tables

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-09-01 cs.CV cs.CL 版本更新 73%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28676 2026-09-01 cs.CV 新提交 70%

Automated pipeline for herbarium label digitization

标本馆标签数字化自动化流程

Hiba Abbad, Hanane Ariouat, Eva Perez Pimpare, Nicolas Turenne, Eric Chenin, Abderrazak Sebaa, Edi Prifti, Jean-Daniel Zucker, Youcef Sklab

机构 * École Supérieure en Sciences et Technologies de l’Informatique et du Numérique (ESTIN)(高等计算机与数字科学技术学院(ESTIN)) IRD(法国发展研究所) Sorbonne Université(索邦大学) Muséum national d’histoire naturelle(法国国家自然历史博物馆) INRAE(法国国家农业食品与环境研究院) INSERM(法国国家健康与医学研究院) AP-HP(巴黎公共医疗集团)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本研究提出HERBIOME自动化流程,整合YOLOv8、CRAFT Hezar、TrOCR、GPT-4o Mini等技术,实现标本馆标签的元数据结构化提取,构建图像-文本数据集,推动多模态生物多样性AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-09-01 cs.CL cs.AI cs.CV cs.MM 版本更新 70%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新 67%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31022 2026-09-01 cs.AI cs.CV 新提交 62%

MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

MNIST-PRO:MNIST作为AI智能体的部分可观测世界回归

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出MNIST-PRO基准,将MNIST数字识别转化为带回溯约束的顺序搜索任务,评估多模态模型在部分可观测性下的表现,发现智能体存在感知整合、探索持续性及信念修正三大瓶颈,凸显构建更新可靠感知状态的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30844 2026-09-01 cs.CV cs.AI 新提交 62%

Pretrained, Curriculum-Tuned, and Ensembled: A Tracer-Aware Interactive Segmentation Pipeline for AutoPET V

预训练、课程调优与集成:面向AutoPET V的示踪剂感知交互式分割流程

Xinglong Liang, Chunyao Lu, Tianyu Zhang, Jiaju Huang, Tao Tan, Yunchao Yin, Lishan Cai

机构 * The Netherlands Cancer Institute(荷兰癌症研究所) Radboud University Medical Centre(拉德堡德大学医学中心) Macao Polytechnic University(澳门理工大学) Amsterdam University Medical Center(阿姆斯特丹大学医学中心)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对AutoPET V任务,提出TRIAGE示踪剂感知交互式分割流程,采用预训练、课程训练与集成策略,结合辅助器官分割模型及示踪剂分支,实现FDG与PSMA研究的病变分割。

详情

展开后加载摘要…

URL PDF HTML 收藏