SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
SDEval: 多模态大语言模型的安全动态评估
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。
Comments AAAI 2026 poster
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
SDEval: 多模态大语言模型的安全动态评估
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。
Comments AAAI 2026 poster
RGBX-DiffusionDet: 一种利用DiffusionDet进行多模态RGB-X目标检测的框架
机构 * School of Electrical and Computer Engineering, Ben Gurion University of the Negev, Beer Sheva, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 RGBX-DiffusionDet通过自适应多模态编码器融合RGB与X数据,提升多模态目标检测性能,实现高效且紧凑的特征嵌入。
MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?
机构 * Tsinghua University(清华大学) ; Nankai University(南开大学) ; Northwest Polytechnical University(西北工业大学) ; Chinese Academy of Sciences(中国科学院) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。
Comments 25 pages
MME-CC:认知能力多模态评估基准
机构 * Nanjing University(南京大学)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 MME-CC提出一个以视觉为基础的多模态评估基准,系统评估大语言模型在空间、几何和知识推理中的认知能力,揭示封闭源模型在总体表现上的优势及空间几何推理的薄弱环节。
感知与校准:分析和增强医疗多模态大语言模型的鲁棒性
机构 * Department of Computer Science and Engineering, CUHK, Hong Kong, China(计算机科学与工程系,CUHK,香港,中国) ; Institute of Medical Intelligence and XR, CUHK, Hong Kong, China(医学智能与XR研究所,CUHK,香港,中国)
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出IMC框架,通过感知和校准原则提升医疗多模态大语言模型的鲁棒性,针对视觉和文本模态分别设计PDC和SMS进行噪声校正。
推进多模态教师情感分析:大规模T-MED数据集与有效的AAM-TSA模型
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出T-MED数据集和AAM-TSA模型,通过多模态融合提升教师情感分析的准确性和可解释性。
在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Aiwen Technology Co., Ltd.(Aiwen科技有限公司) ; Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。
Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME
从视觉感知到深度共情:一种利用多模态大语言模型和多智能体协作的房屋-树-人绘画自动评估框架
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出利用多模态大语言模型和多智能体协作,开发自动评估房屋-树-人绘画测试的框架,以提升投射评估的标准化和效率。
Comments 16 pages, 8 figures
多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。
Comments Project page: https://jiaying.link/HVSBench/
基于大语言模型的知识增强的多模态癌症生存预测
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) ; Division of Life Science, The Hong Kong University of Science and Technology(香港科技大学生命科学系) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology(香港科技大学深圳-香港协同创新研究院) ; State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出KEMM模型,通过整合专家报告和预后背景知识,利用知识增强的跨模态注意力模块提升癌症生存预测性能。
HumanSense: 从多模态感知到通过推理的 empathetic 上下文感知响应
专题命中 多模态评测 :multimodal(title,abstract);omni-modal(abstract);分类 cs.CV
AI总结 HumanSense通过多阶段模态渐进强化学习提升MLLMs在多模态感知和交互任务中的性能,强调推理能力对共情反馈的重要性。
Comments Accepted by AAAI2026
FlipLLM: 通过强化学习高效攻击多模态大语言模型的位翻转攻击
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; University of Missouri-Columbia(密苏里大学哥伦比亚分校)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 FlipLLM通过强化学习高效识别多模态大语言模型的位翻转攻击漏洞,显著提升攻击检测速度和防御指导价值。
Comments Accepted in IEEE HOST 2026
你看见我:一个多维基准用于评估多模态大语言模型的视觉感知
机构 * Microsoft Research India(微软印度研究院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。
MCMoE:基于专家混合的缺失模态补全用于不完整多模态动作质量评估
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 MCMoE通过专家混合方法解决多模态动作质量评估中缺失模态的问题,实现单阶段训练下的多模态学习和生成。
Comments AAAI 2026
Omni-AutoThink: 通过强化学习实现自适应多模态推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Meituan(美团)
专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.AI
AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。
UAUTrack:迈向统一的多模态反无人机视觉跟踪
机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) ; Fudan University(复旦大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; Zhejiang Normal University(浙江师范大学) ; Department of Mechanical Engineering(机械工程系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 UAUTrack通过统一多模态框架实现反无人机跟踪,结合文本先验提示策略提升跨模态信息整合效率,取得优异性能与效率平衡。
UAV-MM3D: 一种大规模合成基准,用于多模态数据下的无人机三维感知
机构 * Pengcheng Laboratory(鹏城实验室) ; University of Southern California(南加州大学)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 UAV-MM3D通过多模态合成数据提升无人机三维感知能力,提供高保真数据集和多任务基线模型。
SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型
机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 SAMChat通过引入链式推理和GRPO,专为遥感影像分析优化,实现了在开放描述和分类任务上的高精度表现。
Comments Accepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat
MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准
机构 * ETH Zürich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; HUG
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。
Comments Accepted to NeurIPS 2025
MLLMs能否检测钓鱼?一个全面的安全基准套件,聚焦于动态威胁和学术环境中的多模态评估
机构 * School of Computer Science and Engineering(计算机科学与工程学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出AdapT-Bench,一个针对学术环境动态钓鱼攻击的多模态安全基准套件,旨在评估MLLM的防御能力。
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院)
专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments we update the paper supplement
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
Comments Accepted at AAAI 2026
机构 * Interdisciplinary Artificial Intelligence Research Institute, Wuhan College(交叉学科人工智能研究 institute,武汉学院) ; School of Computer and Artificial Intelligence, Wuhan University of Technology(计算机与人工智能学院,武汉理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Sanya Science and Education Innovation Park, Wuhan University of Technology(三亚科学教育创新园,武汉理工大学) ; Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; School of Mathematics and Statistics, Northwestern Polytechnical University(数学与统计学院,西北工业大学) ; Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所(TeleAI))
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL
Comments 12 pages, 9 figures
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; Key Laboratory of Sustainable Tourism Smart Assessment Technology, Ministry of Culture and Tourism, Sun Yat-sen University(文化旅游可持续评估技术重点实验室,中华人民共和国文化和旅游部,中山大学) ; Beijing Normal University(北京师范大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
Comments CCKS 2025 Shared Task Paper
专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 13 pages
机构 * KAUST(卡塔尔科技大学) ; Monash University(墨尔本大学) ; RICE University(里士满大学)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments Accepted for oral presentation at the EMNLP 2025 main conference
机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning