arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 633 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 633 篇

2608.10796 2026-08-12 cs.CV 新提交 79%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10680 2026-08-12 cs.CV 新提交 79%

Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration

缓解严重跨模态错位:通过显式特征域仿射配准实现端到端可见光-红外目标检测

Qi Ming, Yuyang Wang, Mingjing Zhao, Yifan Xiao, Zhixin Guo, Zhiqiang Zhou, Peng Sun, Juan Fang, Fuqiang Yang, Xudong Zhao

机构 * Beijing University of Technology(北京工业大学) Central South University(中南大学) Beijing Electronics Science & Technology Institute(北京电子科学技术研究所) China Aerospace Science & Industry Corporation(中国航天科技集团) Beijing Institute of Technology(北京理工大学) Information Support Force Engineering University(信息支援部队工程大学) Trunk Technology (Beijing) Co., Ltd.(trunk技术(北京)有限公司)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对可见光-红外目标检测的严重跨模态错位问题,提出JFRDet网络,含CMAA、IGCF、AQCG模块,构建DVMA基准,在该基准上达到69.7% mAP₅₀的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09240 2026-08-11 cs.LG cs.AI 新提交 79%

Multimodal Federated Learning under Dual-Axis Modality Missingness

双轴模态缺失下的多模态联邦学习

Adiba Orzikulova, Jaehyun Kwak, Jaemin Shin, Yunqi Guo, Xiaomin Ouyang, Guoliang Xing, Steven Euijong Whang, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态联邦学习的双轴模态缺失问题,提出Flux框架,通过模态感知置信度调温与梯度解耦私有适配,在四个多模态数据集上取得最高平均宏F1,性能优于最强基准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 79%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 79%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08736 2026-08-11 cs.AI 新提交 79%

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

FitAQA:面向多模态大语言模型的健身动作质量评估基准

Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 79%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07188 2026-08-10 cs.AI 新提交 79%

SetEasy: A Multi-Modal Classroom Engagement Assessment and Seating Optimization Framework

SetEasy:多模态课堂参与度评估与座位优化框架

Zhihao Xie, Hongye Yang, Shien Liu

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 SetEasy融合多模态感知与v-Gage模型,通过CP-SAT优化固定座位布局,在23名学生331个班级的四周部署中,将平均参与度从0.30提升至0.70,为课堂空间设计提供了可迁移路径。

Comments 18 pages, 4 figures, 2 tables. Published in the Proceedings of ASCAAD 2025

Journal ref Proceedings of the 13th International Conference of the Arab Society for Computation in Architecture, Art and Design (ASCAAD 2025), Riyadh, Saudi Arabia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06934 2026-08-10 cs.LG cs.CV 新提交 79%

Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

对谁而言是可步行的?使用多模态深度学习捕捉步行感知中的主观变异性

Moloud Damandeh, Meead Saberi

机构 * School of Civil and Environmental Engineering, University of New South Wales (UNSW)(新南威尔士大学土木与环境工程学院) Research Centre for Integrated Transport Innovation (rCITI)(综合交通创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究构建含29870条评分的步行性数据集,提出用户条件多模态深度学习框架,发现人行道图像评分更高,模型一致性提升65%,助力构建更包容的行人环境评估模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 79%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06406 2026-08-10 cs.CV cs.LG 新提交 79%

Deep Evidential Regression for Sparse Forest Height Estimation from Multimodal Satellite Imagery

基于多模态卫星图像的稀疏林高估计的深度证据回归

Laura Bader, Muhammad Ammar Ahmed, Xiao Xiang Zhu, Göran Kauermann

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对TreeUQ基准数据集,采用融合多模态卫星输入的U-Net架构,提出掩码证据损失函数,应用深度证据回归实现了树高与不确定性的联合预测,性能优于确定性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06378 2026-08-10 cs.HC cs.AI 新提交 79%

Multimodal Drivers' Emotion Recognition and Safety-Oriented Intervention for Intelligent Transportation Systems

面向智能交通系统的多模态驾驶员情绪识别与安全导向干预

Chang Liu, Dalai Mengke, Hanbo Zhou, Jia Hu, Peter Mihajlik, Tamas Sziranyi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对智能交通系统,提出安全优先的多模态驾驶员辅助框架,构建多模态数据集并引入CARE分数,实现环境风险报告与情绪感知调节的平衡,提供安全驱动的可行方向。

Comments 6 pages, 2 figures, IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05691 2026-08-07 cs.CV 新提交 79%

SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

SciQNet:面向科学图像质量评估的两阶段多模态适配框架

Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan, Ming Jie Lee

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出SciQNet两阶段多模态适配框架,在ICME 2026科学图像质量评估挑战赛评分赛道获第2,模型在SIQA-S、SIQA-U等指标表现优异,证实预训练数据相关性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 79%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交 79%

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01462 2026-08-04 cs.AI 新提交 79%

Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI

大声还是沉默?一种用于多模态临床AI中模态级失败分析的可复用框架

Quang Bui, Shlok Jaiswal, Samuel Paik-Heintz, Kevin Zhou, Kaushik Madapati, Krittaphas Chaisutyakorn, Noah Dane Hebdon, Dimitrios Proios, Sebastián Andrés Cajas Ordóñez, Kacper Dobek, Boya Zhang, Aly Dhedhi, Ahram Han, Kushul Reddy Palakala, Rahul Gorijavolu, Jacques Kpodonu, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) American International School Vienna(维也纳美国国际学校) Neuqua Valley High School(纽夸谷高中) North Hollywood High School(北好莱坞高中) Hopewell Valley Central High School(霍普韦尔谷中央高中) University of California, Berkeley(加州大学伯克利分校) Siriraj Hospital(诗里拉吉医院) Harvard University(哈佛大学) Agency for Science, Technology and Research(新加坡科技研究局) Johns Hopkins University(约翰斯·霍普金斯大学) University of Geneva(日内瓦大学) Poznan University of Technology(波兹南理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出一种模型无关的多模态临床AI模态级失败分析框架,可复用且仅用部署可观测信号,经植入真实值和MIMIC-IV队列验证,能定位失败模态、区分失败类型,为心脏基础模型部署提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00074 2026-08-04 cs.CV 新提交 79%

Explainable Multimodal AI for Adaptive Calibration of Archaeological Sensing Workflows

面向考古传感工作流自适应校准的可解释多模态人工智能

Nevio Dubbini, Daniel P. van Helden, Claudia Sciuto, Martina Naso, Arthur Leck, Clement Joubert, Heeli C. Schechter, Remy Chapoulie, Gabriele Gattiglia

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种可解释多模态AI框架,用于考古传感工作流的自适应校准、质量评估与采集支持,经多模态考古数据集验证可实现跨模态稳健质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29624 2026-08-03 cs.CY cs.AI cs.HC 新提交 79%

The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

苏格拉底测试的理论基础:动态、多模态、对话式考试

Ilya Mikhelson

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。

Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29039 2026-08-03 cs.CV 新提交 79%

ReMoE: Report-Guided Mixture-of-Experts for Multimodal OCT/OCTA Anomaly Detection

ReMoE:报告引导型混合专家模型用于多模态OCT/OCTA异常检测

Zihan Nie, Qincheng Qiao, Muhao Xu, Wei Feng, Xinguo Hou, Weiye Song, Zongyuan Ge

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态OCT/OCTA异常检测,提出ReMoE模型,融合正常报告语义构建模态感知先验,在两个数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29002 2026-08-03 cs.AI 新提交 79%

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents

MMShopBench:面向多模态多轮购物智能体的真实日志基准

Zeying Hao, Hao Guo, Mengtao Xu, Yimin Hu, Yuheng Song, Zesheng Zhou, Jinsong Lan, Xiaoyong Zhu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究推出首个多模态多轮购物智能体真实日志基准MMShopBench,构建离线购物沙箱,经微调后开源模型性能大幅接近领先专有模型,验证了基准及配套训练数据的有效性。

Comments 16 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28991 2026-08-03 cs.CV 新提交 79%

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27357 2026-07-31 cs.CV eess.IV 新提交 79%

Shared Semantic Codebook Distillation for Unpaired Cross-Modal Medical Classification

用于非配对跨模态医学分类的共享语义码本蒸馏

Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

机构 * Sungkyunkwan University(成均馆大学) Convergence Research Institute, Sungkyunkwan University(成均馆大学融合研究院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对非配对跨模态医学分类的挑战,提出SSCD方法,通过共享语义码本转移知识,在两个医学分类任务中提升学生模型性能,优于各基线方法

Comments 16 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27296 2026-07-31 cs.SD cs.MM 新提交 79%

SKY-Piano: A Multimodal Piano Performance Dataset

SKY-Piano:多模态钢琴演奏数据集

Joonhyung Bae, Dawon Park, Taegyun Kwon, Yoon-Seok Choi, Hyeon Hur, Satoshi Obata, Shigeru Kai, Yohei Wada, Yu Takahashi, Akira Maezawa, Jaebum Park, Jonghwa Park, Juhan Nam

机构 * Seoul National University(首尔大学) KAIST(韩国科学技术院) Yamaha(雅马哈)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 该研究发布SKY-Piano多模态钢琴演奏数据集,含多类数据及标注工具,通过微调实验验证其用于MIDI到动作生成的可用性。

Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026), Abu Dhabi, UAE. Project page: https://joonhyungbae.github.io/skypiano/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-07-30 cs.AI 新提交 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25393 2026-07-29 cs.CV 新提交 79%

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment

迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架

Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li

机构 * East China Normal University(华东师范大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。

Comments 10 pages, accepted by ACMMM2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23633 2026-07-28 eess.IV cs.CV 新提交 79%

A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting

用于多模态短期太阳辐照度预测的可控视觉主干基准测试

Oshadha Samarakoon, Dushan Herath, Ishara Ranmandala, Dilshara Herath, Roshan Godaliyadda, Parakrama Ekanayake, Vijitha Herath

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态短期太阳辐照度预测,固定多模态预测管道,仅改变视觉主干进行基准测试。比较多种主干在不同数据集上的预测表现,给出了各主干的RMSE等结果,提供了可重复的编码器比较,未确立架构优势等。

Comments 6 pages, 3 figures, Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 79%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23972 2026-07-28 cs.CV 新提交 79%

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化

Yu Li, Wengan He, Wenhui Xu, Lihong Jiang, Fan Xiao, Zhuohang Huang, Yuanzhu Liang, Jiayi Liu, Yuxi Chen, Yongsheng Luo

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。

Comments Survey paper, 77 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23870 2026-07-28 cs.MA cs.AI 新提交 79%

MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试

Belal S. Alsinglawi, Weizheng Wang, Junyi Wu, Yi Jiang, Lianhai Lin, Merouane Debbah, Izzat Alsmadi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。

Comments 22 pages, 18 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交 79%

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏