arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9150 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9150 篇

2603.03618 2026-03-05 cs.CV 83%

CoRe-BT: A Multimodal Radiology-Pathology-Text Benchmark for Robust Brain Tumor Typing

CoRe-BT:一种多模态放射科-病理科-文本基准,用于鲁棒性脑肿瘤分类

Juampablo E. Heras Rivera, Daniel K. Low, Xavier Xiong, Jacob J. Ruzevick, Daniel D. Child, Wen-wai Yim, Mehmet Kurt, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Microsoft Health AI(微软健康人工智能)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 CoRe-BT提出一个多模态基准,用于在缺失模态条件下提升脑肿瘤分类的鲁棒性,通过整合MRI、病理图像和报告,推动多模态学习与表示学习的发展。

Comments Under review, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01475 2026-03-03 cs.CV 83%

WildCross: A Cross-Modal Large Scale Benchmark for Place Recognition and Metric Depth Estimation in Natural Environments

WildCross: 一种用于自然环境中地方识别和度量深度估计的跨模态大规模基准

Joshua Knights, Joseph Reid, Kaushik Roy, David Hall, Mark Cox, Peyman Moghadam

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 WildCross是一个用于自然环境中地方识别和度量深度估计的跨模态大规模基准,通过提供大规模数据集和实验验证,推动多模态机器人感知技术的发展。

Comments IEEE International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17237 2026-03-03 cs.CV 83%

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

Grounding-IQA: 多模态语言模型的接地图像质量评估

Zheng Chen, Xun Zhang, Wenbo Li, Renjing Pei, Fenglong Song, Xiongkuo Min, Xiaohong Liu, Xin Yuan, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) Huawei(华为)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出grounding-IQA任务范式,通过结合多模态指称与图像质量评估,实现更细粒度的图像质量感知。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/zhengchen1999/Grounding-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00873 2026-03-03 cs.AI 83%

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

MC-Search:基于结构化长推理链评估和增强多模态代理搜索

Xuying Ning, Dongqi Fu, Tianxin Wei, Mengting Ai, Jiaru Zou, Ting-Wei Li, Hanghang Tong, Yada Zhu, Hendrik Hamann, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院) Stony Brook University(石溪大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00971 2026-03-03 cs.CV 83%

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

揭示认知罗盘:基于理论of-Mind的多模态情感推理

Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HitEmotion基准和TMPO方法,通过理论of-Mind引导多模态情感推理,提升模型情感理解和认知能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00108 2026-03-03 cs.RO cs.AI 83%

SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment

SurgFusion-Net:用于外科技能评估的多样化自适应多模态融合网络

Runlong He, Freweini M. Tesfai, Matthew W. E. Boal, Nazir Sirajudeen, Dimitrios Anastasiou, Jialang Xu, Mobarak I. Hoque, Philip J. Edwards, John D. Kelly, Ashwin Sridhar, Abdolrahim Kadkhodamohammadi, Dhivya Chandrasekaran, Matthew J. Clarkson, Danail Stoyanov, Nader Francis, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute and the Department of Medical Physics & Biomedical Engineering, UCL(UCL哈维斯研究所及UCL医学物理与生物医学工程系) UCL Hawkes Institute and the Department of Computer Science, UCL(UCL哈维斯研究所及UCL计算机科学系) UCL Hawkes Institute and the Division of Informatics, Imaging & Data Sciences, The University of Manchester(UCL哈维斯研究所及信息学、成像与数据科学系,曼彻斯特大学) UCL Hospitals NHS Foundation Trust(UCL医院 NHS基金会信托) Griffin Institute, Northwick Park and St Mark’s Hospital(格里芬研究所,北wick公园及圣马可医院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 SurgFusion-Net通过引入DRA策略和两个新的临床数据集,提升了多模态外科技能评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23614 2026-03-02 cs.LG cs.AI 83%

When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion

多模态学习在医疗领域何时有助于提升性能?基于电子健康记录与胸部X光融合的基准测试

Kejing Yin, Haizhou Xu, Wenfang Yao, Chen Liu, Zijie Chen, Yui Haang Cheung, William K. Cheung, Jing Qin

机构 * Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学) Division of Artificial Intelligence(人工智能 division) Lingnan University(Lingnan 大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过基准测试评估了电子健康记录与胸部X光融合在医疗中的有效性,揭示了多模态学习在不同模态缺失情况下的性能差异及公平性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19756 2026-03-02 cs.CV 83%

Multimodal Dataset Distillation Made Simple by Prototype-Guided Data Synthesis

通过原型引导的数据合成实现多模态数据集蒸馏

Junhyeok Choi, Sangwoo Mo, Minwoo Chae

机构 * Department of Industrial and Management Engineering(工业与管理工程系)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 通过原型引导的数据合成实现多模态数据集蒸馏,无需大规模训练和优化,提升跨架构泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21854 2026-02-26 cs.CL 83%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 83%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23381 2026-02-16 cs.AI 83%

AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning

AutoGPS: 通过多模态形式化和演绎推理实现自动几何问题求解

Bowen Ping, Minnan Luo, Zhuohang Dang, Chenxi Wang, Chengyou Jia

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 AutoGPS通过多模态形式化和演绎推理解决几何问题,提供可靠且可解释的解决方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23276 2026-02-13 cs.CL 83%

A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results

宴会派对基准:多模态数据集和比较评估结果

Thai-Binh Nguyen, Katerina Zmolikova, Pingchuan Ma, Ngoc Quan Pham, Christian Fuegen, Alexander Waibel

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院) Carnegie Mellon University, USA(卡内基梅隆大学) Interactive-AI LLC(Interactive-AI公司) Meta AI, UK(Meta AI)

专题命中 多模态评测 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文提出多模态上下文感知识别任务,通过结合音频和视觉线索提升重叠对话识别性能,展示多模态在解决宴会派对问题中的关键作用。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15897 2026-02-10 cs.CV 83%

ThermoSplat: Cross-Modal 3D Gaussian Splatting with Feature Modulation and Geometry Decoupling

ThermoSplat: 多模态3D高斯点云的特征调制与几何解耦

Zhaoqi Su, Shihai Chen, Xinyan Lin, Liqin Huang, Zhipeng Su, Xiaoqiang Lu

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ThermoSplat通过特征调制和几何解耦实现多模态3D高斯点云的深度光谱感知重建,提升多光谱场景的渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11341 2026-02-10 cs.CV 83%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04260 2026-02-05 cs.CV 83%

Decoupled Hierarchical Distillation for Multimodal Emotion Recognition

解耦层次蒸馏用于多模态情感识别

Yong Li, Yuanzhi Wang, Yi Ding, Shiqing Zhang, Ke Lu, Cuntai Guan

机构 * School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University(计算机科学与工程学院,新一代人工智能技术及跨学科应用重点实验室,东南大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) Institute of Intelligent Information Processing, Taizhou University(智能信息处理研究院,台州大学) School of Engineering Science, University of Chinese Academy of Sciences(工程科学学院,中国科学院大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出解耦层次多模态蒸馏框架,通过两阶段知识蒸馏提升跨模态特征对齐,有效提高多模态情感识别性能。

Comments arXiv admin note: text overlap with arXiv:2303.13802

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 83%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00811 2026-02-03 cs.AI 83%

MissMAC-Bench: Building Solid Benchmark for Missing Modality Issue in Robust Multimodal Affective Computing

MissMAC-Bench: 构建缺失模态问题的坚实基准以提升鲁棒多模态情感计算

Ronghao Lin, Honghao Lu, Ruixing Wu, Aolin Xiong, Qinggong Chu, Qiaolin He, Sijie Mai, Haifeng Hu

机构 * Sun Yat-Sen University(中山大学) South China Normal University(华南师范大学) Pazhou Laboratory(琶洲实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MissMAC-Bench通过构建统一评估标准和跨模态协同原则,系统量化缺失模态问题,提升多模态情感计算的鲁棒性和实际应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21342 2026-01-30 cs.AI 83%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 83%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 83%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11178 2026-01-27 cs.CV cs.CY 83%

BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models

BLEnD-Vis: 评估视觉语言模型在多模态文化理解中的基准测试

Bryan Chen Zhengyu Tan, Zheng Weihua, Zhengyuan Liu, Nancy F. Chen, Hwaran Lee, Kenny Tsu Wei Choo, Roy Ka-Wei Lee

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BLEnD-Vis通过多模态文化基准测试评估视觉语言模型在语言重述和视觉模态下的文化理解稳健性,揭示当前模型在文化知识上的脆弱性,并指导更文化胜任的模型发展。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09327 2026-01-27 cs.CV 83%

MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning

MSSDF:多模态自监督蒸馏用于高分辨率遥感图像学习

Tong Wang, Guanzhou Chen, Xiaodong Zhang, Chenxi Liu, Jiaqi Wang, Xiaoliang Tan, Wenchao Guo, Qingyuan Yang, Kaiqi Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Electronic Information School, Wuhan University(电子信息学院,武汉大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MSSDF通过多模态自监督学习提升高分辨率遥感图像的预训练效果,优于现有方法,尤其在语义分割和深度估计任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14019 2026-01-27 cs.CV eess.SP stat.AP 83%

A Multimodal Feature Distillation with Mamba-Transformer Network for Brain Tumor Segmentation with Incomplete Modalities

一种结合Mamba-Transformer网络的多模态特征蒸馏用于缺失模态的脑肿瘤分割

Ming Kang, Fung Fung Ting, Shier Nee Saw, Raphaël C. -W. Phan, Zongyuan Ge, Chee-Ming Ting

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种结合Mamba-Transformer网络的多模态特征蒸馏方法,用于在缺失模态情况下实现更准确的脑肿瘤分割。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14261 2026-01-22 cs.CV cs.HC cs.LG 83%

Intelligent Power Grid Design Review via Active Perception-Enabled Multimodal Large Language Models

通过主动感知多模态大语言模型实现智能电网设计审查

Taoliang Tan, Chengwei Ma, Zhen Tian, Zhao Lin, Dongdong Li, Si Shi

机构 * Yangjiang Yangxi Power Supply Bureau, Guangdong Power Grid Co., Ltd., Yangjiang, China(阳江阳西供电局,广东电网公司) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出基于主动感知多模态大语言模型的智能电网设计审查方法,通过三阶段框架提升对设计错误的识别准确性和审查可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12346 2026-01-21 cs.CV 83%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13532 2026-01-21 cs.CV 83%

RemoteDet-Mamba: A Hybrid Mamba-CNN Network for Multi-modal Object Detection in Remote Sensing Images

RemoteDet-Mamba: 一种用于遥感图像多模态目标检测的混合Mamba-CNN网络

Kejun Ren, Xin Wu, Lianming Xu, Li Wang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(计算机科学学院,北京邮电大学) School of Electronic Engineering, Beijing University of Posts and Telecommunications, Beijing, China(电子工程学院,北京邮电大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 RemoteDet-Mamba通过融合多模态信息提升遥感图像中小目标的检测性能,采用轻量级融合机制降低计算复杂度,实验证明其在检测精度和效率上的优势。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10513 2026-01-16 cs.CL cs.HC 83%

AEQ-Bench: Measuring Empathy of Omni-Modal Large Models

AEQ-Bench:衡量多模态大模型的共情能力

Xuan Luo, Lewei Yao, Libo Zhao, Lanqing Hong, Kai Chen, Dehua Tao, Daxin Tan, Ruifeng Xu, Jing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) Hong Kong University of Science and Technology(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.CL

AI总结 AEQ-Bench通过评估多模态大模型在情感识别和音频响应共情判断上的能力,揭示了音频输出能力对模型性能的影响及非语言表达评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11134 2026-01-15 cs.AI 83%

GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

GGBench: 一种用于统一多模态模型的几何生成推理基准

Jingxuan Wei, Caijun Jia, Xi Bai, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Lijun Wu, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 GGBench通过几何构造评估统一多模态模型的生成推理能力,推动智能系统发展。

Comments 35 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24160 2026-01-13 cs.CV 83%

Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset

面向大规模多模态数据集的开放词汇工业缺陷理解

TsaiChing Ni, ZhenQi Chen, YuanFu Yang

机构 * Institute of Intelligent Systems, National Yang Ming Chiao Tung University(智能系统研究所,国立阳明交通大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出IMDD-1M大规模多模态数据集,训练了适用于工业场景的视觉-语言基础模型,通过高效微调实现领域适应,提升工业检测与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18291 2026-01-12 cs.CV 83%

Pyramidal Adaptive Cross-Gating for Multimodal Detection

金字塔自适应跨门控用于多模态检测

Zidong Gu, Shoufu Tian

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 PACGNet通过自适应跨门控机制提升多模态检测性能,实现细粒度目标检测与特征层次重建。

Comments 17 pages, 6 figures, submitted to Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏