Detecting Sarcasm in Multimodal Social Platforms
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments 10 pages, 3 figures, final version published in the Proceedings of ACM Multimedia 2016
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments 10 pages, 3 figures, final version published in the Proceedings of ACM Multimedia 2016
基于LLM的多模态推理用于加密流量解释:一个基准
机构 * School of Microelectronics and Communication Engineering, Chongqing University(重庆大学微电子与通信工程学院) ; School of Data Science, Lingnan University(岭南大学数据科学学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM
AI总结 本文提出BGTD基准和mmTraffic框架,通过结合原始字节与结构化注释,实现可解释的加密流量解释,生成高保真的人可读报告,同时保持高分类准确率。
Comments Project page \url{https://github.com/lgzhangzlg/Multimodal-Reasoning-with-LLM-for-Encrypted-Traffic-Interpretation-A-Benchmark}
多模态数据光谱:多模态数据集是多维的
机构 * New York University(纽约大学) ; GenentechCIFAR(基因泰克CIFAR) ; New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL;multimodal(comments)
AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。
Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum
机构 * Department of Computer Science, The University of New Mexico(计算机科学系,新墨西哥大学) ; Comprehensive Cancer Center, The University of New Mexico(综合癌症中心,新墨西哥大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
Journal ref A. Jararweh, M. Adams, A. Sahu, A. Mueen and A. Anwar, "LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code," 2025 5th Intelligent Cybersecurity Conference (ICSC), Tampa, FL, USA, 2025, pp. 232-241
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) ; CPII under InnoHK(创新香港下的CPII)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments Follow-up of EmbodiedScan (camera-ready version). A multi-modal 3D dataset with the most-ever comprehensive language annotations for 3D-LLMs. Project page: https://tai-wang.github.io/mmscan/
机构 * David S. Hippocampus Department of Computer Science(戴维·S·海马科斯部门计算机科学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments UniEval is the first evaluation framework designed for unified multimodal models, including a holistic benchmark UniBench and the UniScore metric
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments The first work to benchmark Large Multimodal Models in safety insight on social media
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Dataset available at https://github.com/facebookresearch/multimodal_rewardbench
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments Pulse thermography, infrared thermography, defect segmentation, multi-modal networks, attention mechanism
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to 24th ACM International Conference on Multimodal Interaction (ICMI 2022)
专题命中 多模态评测 :cross-modal(title);multimodal(abstract,journal_ref);分类 cs.CV、cs.CL
Comments Paper accepted for publication at MMSR 2021; 13 pages, 3 figures, 7 Tables
Journal ref Proceedings of the 1st Workshop on Multimodal Semantic Representations (MMSR), 2021, Groningen, Netherlands (Online), Association for Computational Linguistics, p. 32--44
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、eess.AS;multimodal(comments)
Comments 10 pages, 3 figures, 5 tables; Published in Proceedings of the Second Grand Challenge and Workshop on Multimodal Language (Challenge-HML) in the 58th Annual Meeting of the Association for Computational Linguistics (ACL 2020)
Journal ref Challenge-HML, ACL 2020, 19-28
OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估
专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。
VoLN:仅视觉的长距离导航——范式、基准和方法
机构 * Beihang University(北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.AI
AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。
Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/
X-Stream: 探索多模态大语言模型作为多流理解的多路复用器
机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) ; Huawei Inc.(华为公司)
专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。
Comments Project Page: https://peiwensun2000.github.io/xstream/
SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解
机构 * The University of Queensland(昆士兰大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; University of Technology Sydney(悉尼科技大学) ; Follow Me AI Pty LTD(Follow Me AI有限公司)
专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。
Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $
MVEB:大规模视频嵌入基准
机构 * Harvard University(哈佛大学) ; SaluteDevices ; MIRAI ; Zendesk ; Shanghai University of Finance and Economics(上海财经大学) ; Google LLC ; Salesforce ; Cornell University(康奈尔大学) ; Astera Institute(Astera研究院) ; Independent Contributor(独立贡献者) ; Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) ; Barclays(巴克莱银行) ; Aarhus University(奥胡斯大学) ; Stanford University(斯坦福大学)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。
在值得时询问:面向实例目标导航的成本感知开放式交互
机构 * Adelaide University(阿德莱德大学) ; Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心,澳大利亚机器学习研究所) ; Institute for Infocomm Research (I2R), A*STAR(信息与通信研究院(I2R),A*STAR) ; iMotion ; CSIRO Data61 Project Website(CSIRO Data61项目网站)
专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 针对实例目标导航中语言歧义问题,提出一种成本敏感的不确定性减少方法,通过信息增益分析确定有效问题类型,并构建基准测试和加权成功率指标,实现零样本MLLM导航器仅在预期收益大于成本时查询。
解锁VLMs中的密集度量深度估计
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan LLM(腾讯混元大模型) ; HKUST(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 多模态评测 :multimodal(abstract,abstract_cn);multimodal foundation model(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。
Comments Project Page: https://depthvlm.github.io/
多模态Transformer中线性注意力的应用
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV;any-to-any(comments)
AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。
Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026
一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)
AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。
NepOOC-M:面向OOC检测的尼泊尔语-英语双语基准及多模态架构的对比分析
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 针对尼泊尔语OOC虚假信息检测,构建首个尼泊尔语多语言OOC基准NepOOC,评估多模态等架构发现仅文本mBERT性能最优,数据集扩充比架构优化更有效。
Comments 12 pages, 5 figures
轻量级多模态模型能否评估LLM的推理性能?一项面向计算最优文档推理的研究
机构 * Phi Labs(菲实验室) ; Quantiphi(宽梯斐科技)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出轻量级多模态模型DRB,基于新基准BudgetDoc实现文档任务中LLM推理预算的动态分配,在降低成本的同时多数情况下达到或优于固定最大预算的性能,具备跨模型泛化潜力。
OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准
机构 * East China Normal University(华东师范大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。
Comments CIKM 2026
BEAR-Bench:面向多模态模型的双语企业与学术推理基准
机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。
面向不完整与退化前列腺MRI的跨模态生成模型及多中心临床验证
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究开发MSCNet跨模态生成框架,可重建前列腺MRI缺失对比、恢复退化扫描,经多中心临床验证,其图像质量符合部分非劣效标准,诊断效能优于基线生成图像,可作为前列腺MRI的辅助技术。
GBU-Palm:用于掌纹呈现攻击检测的多模态视频数据集与基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出GBU-Palm多模态掌纹PAD数据集与基准,通过控制泄漏协议分离身份与攻击谱系,测试4种视频架构,发现环境变化下架构性能下降,RGB-NIR融合未始终优于仅RGB输入,为跨环境掌纹PAD研究提供基准。
通用科学人工智能的实现路径:科学图像的多模态理解
机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) ; Eindhoven University of Technology(埃因霍温理工大学) ; Freie Universität Berlin(柏林自由大学) ; International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) ; National University of Sciences and Technology(国家科技大学) ; University of Warwick(华威大学) ; PSG College of Technology(PSG理工学院) ; Aalto University(阿尔托大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。
Comments 15 pages, 1 figure
VLMs在帮助人类推断从多模态简答中获得的思维模型质量的有效性如何?
机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系) ; Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心) ; School of Management, Mahindra University(马恒达大学管理学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出MMGrader方法,通过概念图框架从多模态回答推断学生思维模型质量,发现最佳模型在人类水平上表现不足,但能有效辅助教师改进教学。
P2MFDS:面向浴室环境老年人的隐私保护多模态跌倒检测系统
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对浴室环境老年人跌倒检测的单模态系统准确率受限问题,本文提出P2MFDS多模态系统,融合毫米波雷达与3D振动传感,构建大规模隐私保护数据集,双流网络结合多尺度特征,提升了跌倒检测的准确率与召回率。
Comments Accepted to appear in the 2025 IEEE International Workshop on AIoT and Smart Systems (AIoTSys'25)