arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-12 至 2026-02-12 共收录 71 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2602.10148 2026-02-12 cs.CR cs.AI 89%

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型

Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23798 2026-02-12 cs.CL cs.AI cs.CV 67%

Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models

揭示'公平性之锯':在视觉-语言模型中发现并缓解性别和种族偏见

Jian Lan, Udo Schlegel, Tanveer Hannan, Gengyuan Zhang, Haokun Chen, Thomas Seidl

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出RES-FAIR框架,通过调整隐藏状态缓解视觉-语言模型中的性别和种族偏见,提升响应公平性和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01304 2026-02-12 cs.AI cs.CL 62%

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

代理拼图交互学习:提升视觉感知与推理能力在视觉-语言模型中

Yu Zeng, Wenxuan Huang, Shiting Huang, Xikun Bao, Yukun Qi, Yiming Zhao, Qiuchen Wang, Lin Chen, Zehui Chen, Huaian Chen, Wanli Ouyang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AGILE通过代理拼图交互学习提升视觉-语言模型的感知与推理能力,显著提高拼图任务性能并增强多模态模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10624 2026-02-12 cs.CV cs.AI 62%

A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology

一种用于零样本临床协作和皮肤病自动概念发现的视觉-语言基础模型

Siyuan Yan, Xieji Li, Dan Mo, Philipp Tschandl, Yiwen Jiang, Zhonghua Wang, Ming Hu, Lie Ju, Cristina Vico-Alonso, Yizhen Zheng, Jiahe Liu, Juexiao Zhou, Camilla Chello, Jen G. Cheung, Julien Anriot, Luc Thomas, Clare Primiero, Gin Tan, Aik Beng Ng, Simon See, Xiaoying Tang, Albert Ip, Xiaoyang Liao, Adrian Bowling, Martin Haskett, Shuang Zhao, Monika Janda, H. Peter Soyer, Victoria Mar, Harald Kittler, Zongyuan Ge

机构 * AIM for Health Lab(AIM for Health实验室) Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学) Department of Dermatology, Medical University of Vienna(皮肤科,维也纳医学大学) Faculty of Engineering, Monash University(工程学院,墨尔本大学) Institute of Ophthalmology, University College London(眼科研究所,伦敦大学学院) Dermatology Department. Fundacion Hospital 12 de Octubre(皮肤科部门,12月12日基金会医院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Frazer Institute, The University of Queensland(弗拉泽研究所,昆士兰大学) Dermatology Research Centre, Brisbane, Australia(皮肤科研究中心,澳大利亚布里斯班) Department of Medical and Cardiovascular Sciences, Sapienza University of Rome(医学与心血管科学系,罗马萨皮恩扎大学) Victorian Melanoma Service, Alfred Care Group, Bayside Health, Melbourne, Australia(维多利亚黑色素瘤服务,阿尔弗雷德护理集团,墨尔本布里斯班健康中心,澳大利亚) SkIIN Discovery Program, Monash University(SkIIN发现计划,墨尔本大学) Claude Bernard Lyon-1 University(克劳德·伯纳德里昂-1大学) Centre Léon Berard, Lyon, France(莱昂·贝拉德中心,法国里昂) Dermatology department, Hôpital Lyon Sud, Hospices Civils de Lyon, Lyons, France(皮肤科部门,里昂南医院,里昂民事医院,法国里昂) Cancer Research Center of Lyon, Lyons, France(里昂癌症研究中心,法国里昂) eResearch Centre, Monash University(eResearch研究中心,墨尔本大学) NVIDIA AI Techno(NVIDIA AI技术)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DermFM-Zero是一种用于皮肤病零样本临床协作和自动概念发现的视觉-语言基础模型,通过掩码潜在建模和对比学习训练,实现了无需任务特定适应的高精度诊断和多模态检索能力。

Comments reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 57%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11093 2026-02-12 cs.CV 57%

OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning

OmniDiff: 一个全面的细粒度图像差异描述基准

Yuan Liu, Saihui Hou, Saijie Hou, Jiabao Du, Shibei Meng, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniDiff提出一个全面的细粒度图像差异描述基准,结合多模态大语言模型与插拔式多尺度差异感知模块,提升跨场景差异识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 57%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2511.10222 2026-02-12 cs.SD cs.AI 79%

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard

针对多模态大语言模型的语音音频组合攻击及其通过SALMONN-Guard的缓解

Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态LLMs的安全性,提出SACRED-Bench评估语音音频组合攻击,并通过SALMONN-Guard将攻击成功率降低至20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04392 2026-02-12 eess.AS 79%

SLM-S2ST: A multimodal language model for direct speech-to-speech translation

SLM-S2ST: 一种用于直接语音到语音翻译的多模态语言模型

Yuxuan Hu, Haibin Wu, Ruchao Fan, Xiaofei Wang, Heng Lu, Yao Qian, Jinyu Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 SLM-S2ST是一种多模态语言模型,通过音频转换器头和流式 vocoder 实现高效的语音到语音翻译,实验表明其性能优于现有模型。

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11025 2026-02-12 cs.HC 78%

Reality Copilot: Voice-First Human-AI Collaboration in Mixed Reality Using Large Multimodal Models

Reality Copilot:基于大多模态模型的混合现实中的语音优先人机协作

Liuchuan Yu, Yongqi Zhang, Lap-Fai Yu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Reality Copilot通过大模型实现混合现实中的语音优先人机协作,支持环境理解、3D生成和实时检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2503.16858 2026-02-12 cs.CL cs.AI 84%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10549 2026-02-12 cs.CV cs.AI 81%

Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance

通过文本引导增强弱监督多模态视频异常检测

Shengyang Sun, Jiashen Hua, Junyi Feng, Xiaojin Gong

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Alibaba Cloud(阿里云) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出文本引导框架,通过多阶段文本增强和多尺度瓶颈Transformer融合模块,提升弱监督多模态视频异常检测的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10897 2026-02-12 hep-ex 78%

Multi-Modal Track Reconstruction using Graph Neural Networks at Belle II

利用图神经网络进行多模态轨迹重建:Belle II实验

Lea Reuter, Tristan Brandes, Giacomo De Pietro, Torben Ferber

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 Belle II实验利用图神经网络和多模态输入提升轨迹重建效率和纯度,通过模拟验证效果。

Comments proceedings for ACAT25

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2504.09221 2026-02-12 cs.HC cs.LG 82%

CMCRD: Cross-Modal Contrastive Representation Distillation for Emotion Recognition

CMCRD:跨模态对比表示蒸馏用于情绪识别

Siyuan Kan, Huanyu Wu, Zhenyao Cui, Fan Huang, Xiaolong Xu, Dongrui Wu

机构 * Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制重点实验室、教育部、自动化学院、华中科技大学) Wuhan Institute of Digital Engineering(武汉数字工程研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 CMCRD通过跨模态对比表示蒸馏提升情绪识别准确性,减少多模态数据需求,实验表明在EEG和眼动数据间相互辅助训练可提高分类准确率约6.2%。

Journal ref IEEE Trans. on Affective Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 62%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10553 2026-02-12 cs.LG cs.AI 57%

Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

基于Jaccard分数的Sigmoid损失的多标签ECG分类对比学习

Junichiro Takahashi, Masataka Sato, Satoshi Kodeta, Norihiko Takeda

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出基于Jaccard分数的Sigmoid损失的对比学习方法,用于提升多标签ECG分类的性能,通过改进损失函数和数据增强技术提高诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23050 2026-02-12 cs.LG cs.AI 57%

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比嵌入链理解LVLMs的语言先验

Lin Long, Changdae Oh, Seongheon Park, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2509.16944 2026-02-12 cs.CV 83%

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

捕捉细节:用于细粒度MLLM感知的自蒸馏RoI预测器

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SD-RPN,通过自蒸馏方法提升MLLM细粒度感知的效率和准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI 79%

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15922 2026-02-12 cs.CL 79%

Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition

通过大语言模型多模态奖励分解对齐对话代理

Dong Won Lee, Hae Won Park, Cynthia Breazeal, Louis-Philippe Morency

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10659 2026-02-12 cs.CV 79%

Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation

多模态先验增强的文本驱动3D人-物交互生成

Yin Wang, Ziyao Zhang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Beihang University(北京航空航天大学) Department of Computer Science, University of Durham(杜伦大学计算机科学系) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MP-HOI框架,通过多模态先验、增强物体表示、模态感知MoE模型和级联扩散技术,提升文本驱动的3D人-物交互生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16871 2026-02-12 cs.RO 78%

HOGraspFlow: Taxonomy-Aware Hand-Object Retargeting for Multi-Modal SE(3) Grasp Generation

HOGraspFlow: 一种基于分类意识的多模态SE(3)抓取生成方法

Yitian Shi, Zicheng Guo, Rosa Wolf, Edgar Welte, Rania Rayyes

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 HOGraspFlow通过多模态SE(3)抓取生成方法,在无需显式几何先验的情况下实现高保真的抓取合成。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11096 2026-02-12 cs.CL cs.AI 62%

Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away

推理模型中的安全恢复仅需几步早期引导步骤

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) IIT, Bombay(孟买印度理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21963 2026-02-12 cs.CY cs.AI cs.CL cs.SI 62%

Industrialized Deception: The Collateral Effects of LLM-Generated Misinformation on Digital Ecosystems

工业化的欺骗:大语言模型生成的虚假信息对数字生态系统的影响

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JudgeGPT和RogueGPT工具,研究人类对AI生成虚假信息的感知与检测,探讨生成与检测之间的竞争及缓解策略。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10891 2026-02-12 cs.NE cs.AI 57%

Interactive LLM-assisted Curriculum Learning for Multi-Task Evolutionary Policy Search

多任务策略搜索中的交互式LLM辅助课程学习

Berfin Sakallioglu, Giorgia Nadizar, Eric Medvet

机构 * MIGe - University of Trieste(MIGe - 乌迪内大学) University Toulouse Capitole, IRIT - CNRS UMR5505(图卢兹大学,IRIT - CNRS UMR5505) DIA - University of Trieste(DIA - 乌迪内大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种交互式LLM辅助的在线课程生成框架,通过多模态反馈提升多任务策略搜索的性能,展示其与专家设计课程的竞争力。

Comments 8 pages, 7 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10587 2026-02-12 stat.ML cs.LG 50%

Deep Bootstrap

深度Bootstrap

Jinyuan Chang, Yuling Jiao, Lican Kang, Junjie Shi

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于条件扩散模型的深度Bootstrap框架,用于非参数回归,通过统一生成框架实现高效采样和准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10544 2026-02-12 cs.LG cs.NA math.NA 50%

Bridging the Compression-Precision Paradox: A Hybrid Architecture for Clinical EEG Report Generation with Guaranteed Measurement Accuracy

弥合压缩-精度悖论:一种用于临床EEG报告生成的混合架构,保证测量精度

Wuyang Zhang, Zhen Luo, Chuqiao Gu, Jianming Ma, Yebo Cao, Wangming Yuan, Yinzhi Jin

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·马歇尔大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本研究提出了一种混合架构,通过信号处理和跨模态翻译实现临床EEG报告生成,保证测量精度,减少误报并提升检测速度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 17 篇

2602.10886 2026-02-12 cs.CL cs.AI cs.CE 81%

The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems

CLEF-2026金融多语言多模态评估实验室:金融AI系统的多语言多模态评估框架

Zhuohan Xie, Rania Elbadry, Fan Zhang, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Dimitar Dimitrov, Vanshikaa Jani, Yuyang Dai, Jiahui Geng, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Preslav Nakov

机构 * MBZUAI The University of Tokyo(东京大学) The Fin AI(Fin AI) University of Arizona(亚利桑那大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CLEF-2026金融多语言多模态评估实验室提出首个多语言多模态金融AI评估框架,涵盖金融理解、推理和决策三个任务,旨在推动全球包容的金融AI发展。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10799 2026-02-12 cs.CV cs.AI 81%

RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation

RSHallu: 远程传感多模态大语言模型的双模式幻觉评估与领域定制缓解

Zihui Zhou, Yong Feng, Yanying Chen, Guofan Duan, Zhenxi Song, Mingliang Zhou, Weijia Jia

机构 * College of Computer Science, Chongqing University(重庆大学计算机科学学院) Heavy Rainfall Research Center of China(中国强降水研究中心) CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院) Chongqing Metropolitan College of Science(重庆科学理工学院) School of Intelligence Science(智能科学学院) College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学) BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院) Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 RSHallu通过双模式检查和领域定制数据集,提升遥感多模态大语言模型的幻觉缓解效果,提高无幻觉率21.63个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 81%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏