arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2512.21337 2025-12-25 cs.CV 79%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 79%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19716 2025-12-24 cs.LG cs.AI 79%

Development and external validation of a multimodal artificial intelligence mortality prediction model of critically ill patients using multicenter data

基于多模态人工智能的危重患者死亡风险预测模型的开发与外部验证

Behrooz Mamandipoor, Chun-Nan Hsu, Martin Krause, Ulrich H. Schmidt, Rodney A. Gabriel

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究开发了多模态人工智能模型,用于预测危重患者院内死亡风险,并通过外部验证展示了其有效性。

Comments 75 pages (33 main text + references, 35 supplementary materials), 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10229 2025-12-24 cs.LG cs.AI 79%

Adaptive Information Routing for Multimodal Time Series Forecasting

自适应信息路由用于多模态时间序列预测

Jun Seo, Hyeokjun Choe, Seohui Bae, Soyeon Park, Wonbin Ahn, Taeyoon Lim, Junhyeok Kang, Sangjun Han, Jaehoon Lee, Dongwan Kang, Minjae Kim, Sungdong Yoo, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出自适应信息路由框架,通过动态利用文本信息优化时间序列模型,提升多模态预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 79%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19354 2025-12-23 cs.CV 79%

ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining

ReasonCD: 一种用于隐含兴趣语义挖掘的多模态推理大模型

Zhenyang Huang, Xiao Yu, Yi Zhang, Decheng Wang, Hang Ruan

机构 * Beijing Institute of Tracking and Telecommunications Technology(北京跟踪与电信技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ReasonCD通过利用预训练大语言模型的推理能力,挖掘用户隐含任务意图,实现更高效的变化检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 79%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 79%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18947 2025-12-23 cs.AI cs.NE 79%

Clustering-based Transfer Learning for Dynamic Multimodal MultiObjective Evolutionary Algorithm

基于聚类的迁移学习用于动态多模态多目标进化算法

Li Yan, Bolun Liu, Chao Li, Jing Liang, Kunjie Yu, Caitong Yue, Xuzhao Chai, Boyang Qu

机构 * School of Automation and Electrical Engineering, Zhongyuan University of Technology(中原文理大学自动化与电气工程学院) School of Electrical Engineering, Zhengzhou University(郑州大学电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于聚类的自编码器预测机制,用于动态多模态多目标优化,通过构建基准测试函数和自适应尼奇策略,提升种群多样性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00086 2025-12-23 cs.CV 79%

Multi-modal On-Device Learning for Monocular Depth Estimation on Ultra-low-power MCUs

多模态设备端学习用于超低功耗MCU上的单目深度估计

Davide Nadalini, Manuele Rusci, Elia Cereda, Luca Benini, Francesco Conti, Daniele Palossi

机构 * Department of Electrical, Electronic, and Information Engineering (DEI), University of Bologna(电气电子与信息工程系,博洛尼亚大学) Department of Control and Computer Engineering (DAUIN), Politecnico di Torino(控制与计算机工程系,托斯卡纳理工学院) Department of Electrical Engineering (ESAT) at KU Leuven(根特大学电子工程系) Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫人工智能研究所(IDSIA),USI-SUPSI) Department of Information Technology and Electrical Engineering (D-ITET), ETH Zurich(信息科技与电气工程系,苏黎世联邦理工学院) Integrated Systems Laboratory, ETH Zurich(集成系统实验室,苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种多模态设备端学习技术,用于在超低功耗MCU上实现单目深度估计,通过减少内存消耗和优化训练过程,显著提升精度和效率。

Comments 14 pages, 9 figures, 3 tables. Associated open-source release available at: https://github.com/idsia-robotics/ultralow-power-monocular-depth-ondevice-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02543 2025-12-23 cs.CV cs.HC cs.LG 79%

A Deep Learning-based Multimodal Depth-Aware Dynamic Hand Gesture Recognition System

基于深度学习的多模态深度感知动态手部姿态识别系统

Hasan Mahmud, Mashrur M. Morshed, Md. Kamrul Hasan

机构 * Systems \& Software Lab (SSL), Department of Computer Science

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于深度学习的多模态深度感知动态手部姿态识别系统,通过量化深度值和改进多模态融合CRNN架构,提高了识别准确性和参数效率。

Journal ref The Visual Computer, Springer Nature, January 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17450 2025-12-22 cs.CV cs.LG 79%

MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation

MULTIAQUA:一种多模态海洋数据集和多模态语义分割的鲁棒训练策略

Jon Muhovič, Janez Perš

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MULTIAQUA数据集和多模态语义分割的鲁棒训练策略,旨在通过多模态数据提升恶劣能见度下的场景解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12142 2025-12-19 cs.CV 79%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 79%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14750 2025-12-18 q-bio.QM cs.AI 79%

Multiscale Cross-Modal Mapping of Molecular, Pathologic, and Radiologic Phenotypes in Lipid-Deficient Clear Cell Renal CellCarcinoma

多尺度跨模态映射分子、病理和放射表型在脂质缺乏型清细胞癌肾癌中的应用

Ying Cui, Dongzhe Zheng, Ke Yu, Xiyin Zheng, Xiaorui Wang, Xinxiang Li, Yan Gu, Lin Fu, Xinyi Chen, Wenjie Mei, Xin-Gui Peng

机构 * Nurturing Center of Jiangsu Province for State Laboratory of AI Imaging & Interventional Radiology, Department of Radiology, Zhongda Hospital, School of Medicine, Southeast University(江苏省人工智能影像与介入放射学 state laboratory 育成中心,放射科,中大医院,东南大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学) School of Automation, Southeast University(自动化学院,东南大学) Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Automation and Electrical Engineering College, Lanzhou University of Technology(自动化与电气工程学院,兰州理工大学) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院,生命科学与医学学院,中国科学技术大学) Lianyungang First People’s Hospital(连云港第一人民医院) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏智校区)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.AI

AI总结 本研究提出多尺度跨模态框架,用于术前识别脂质缺乏型清细胞肾癌的分子、病理和放射表型,实现非侵入性分子表型分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14491 2025-12-17 cs.AI 79%

Sparse Multi-Modal Transformer with Masking for Alzheimer's Disease Classification

用于阿尔茨海默病分类的稀疏多模态Transformer与掩码

Cheng-Han Lu, Pei-Hsuan Tsai

机构 * Cheng-Han Lu(无) Pei-Hsuan Tsai(无)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出SMMT,一种稀疏多模态Transformer架构,通过稀疏注意力和模态掩码提升效率与鲁棒性,应用于阿尔茨海默病分类任务。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01728 2025-12-17 cs.CV 79%

Multimodal classification of forest biodiversity potential from 2D orthophotos and 3D airborne laser scanning point clouds

基于2D正射影像和3D空中激光扫描点云的森林生物多样性潜力多模态分类

Simon B. Jensen, Stefan Oehmcke, Andreas Møgelmose, Meysam Madadi, Christian Igel, Sergio Escalera, Thomas B. Moeslund

机构 * Perception Laboratory, Aalborg University, Denmark Pioneer Centre for Artificial Intelligence, Denmark Department of Computer Science, Copenhagen University, Denmark Institute for Visual \& Analytic Computing, Rostock University, Germany University of Barcelona Computer Vision Center, Spain

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究利用2D正射影像和3D ALS点云数据,通过多模态深度学习融合方法,实现对森林生物多样性潜力的高效评估,实验结果达到82%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07553 2025-12-17 cs.AI 79%

COMMA: A Communicative Multimodal Multi-Agent Benchmark

COMMA:一种基于通信的多模态多智能体基准

Timothy Ossowski, Danyal Maqbool, Jixuan Chen, Zefan Cai, Tyler Bradshaw, Junjie Hu

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13573 2025-12-17 cs.CV 79%

MMhops-R1: Multimodal Multi-hop Reasoning

MMhops-R1: 多模态多跳推理

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。

Comments Acceped by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02677 2025-12-17 eess.IV cs.CV 79%

Multimodal Deep Learning for Stroke Prediction and Detection using Retinal Imaging and Clinical Data

基于视网膜成像和临床数据的多模态深度学习用于中风预测与检测

Saeed Shurrab, Aadim Nepal, Terrence J. Lee-St. John, Nicola G. Ghazi, Bartlomiej Piechowski-Jozwiak, Farah E. Shamout

机构 * Division of Engineering, New York University Abu Dhabi(纽约大学阿布扎赫尔分校工程系) Institute for Healthier Living Abu Dhabi(阿布扎赫尔健康生活研究所) Eye Institute at Cleveland Clinic Abu Dhabi(阿布扎赫尔克利夫兰医学中心眼科研究所) Canberra Hospital(堪培拉医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出一种多模态深度学习方法,利用视网膜成像和临床数据预测中风风险,实验结果显示在中风检测和风险预测方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13297 2025-12-16 cs.AI cs.LG 79%

MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data

MedInsightBench: 通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力

Zhenghao Zhu, Chuxue Cao, Sirui Han, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 MedInsightBench通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力,提出MedInsightAgent框架提升医疗数据洞察发现性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11215 2025-12-15 cs.CV 79%

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection

SmokeBench: 评估多模态大语言模型用于野火烟雾检测

Tianye Qi, Weihao Li, Nick Barnes

机构 * Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10945 2025-12-13 cs.CV 79%

MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation

MeViS:一种多模态数据集,用于指称运动表达视频分割

Henghui Ding, Chang Liu, Shuting He, Kaining Ying, Xudong Jiang, Chen Change Loy, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 MeViS数据集通过多模态数据提升视频分割中运动表达的理解能力,提出LMPM++方法实现新突破。

Comments IEEE TPAMI, Project Page: https://henghuiding.com/MeViS/

Journal ref in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 47, no. 12, pp. 11400-11416, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19366 2025-12-11 cs.LG cs.AI 79%

Grounding the Ungrounded: A Spectral-Graph Framework for Quantifying Hallucinations in Multimodal LLMs

未接地的接地:一种基于谱-图框架的多模态大语言模型幻觉量化方法

Supratik Sarkar, Swagatam Das

机构 * Morgan Stanley(摩根士丹利) Indian Statistical Institute (Kolkata)(印度统计研究所(加尔各答))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于谱-图框架的多模态大语言模型幻觉量化方法,通过谱分解和RKHS本征模式,提供可解释的语义失真度量。

Comments 49 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08751 2025-12-10 cs.CV cs.DC 79%

Skewness-Guided Pruning of Multimodal Swin Transformers for Federated Skin Lesion Classification on Edge Devices

偏度引导的多模态Swin Transformer剪枝用于边缘设备上的联邦皮肤病变分类

Kuniko Paxton, Koorosh Aslansefat, Dhavalkumar Thakker, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出基于偏度的剪枝方法,用于在边缘设备上高效压缩多模态Swin Transformer,实现联邦学习中的隐私保护与高精度皮肤病变分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16205 2025-12-10 cs.AI 79%

ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025

ChemLabs on ChemO:一个用于IChO 2025多模态推理的多智能体系统

Qiang Xu, Shengyuan Bai, Leqing Chen, Zijing Liu, Yu Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ChemLabs通过多智能体系统和SVE技术在ChemO基准测试中实现93.6分,推动化学问题自动解决的新进展。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07853 2025-12-10 cs.LG cs.AI cs.DC 79%

GPU Memory Prediction for Multimodal Model Training

多模态模型训练的GPU内存预测

Jinwoo Jeong, Minchul Kang, Younghun Go, Changyong Shin, Hyunho Lee, Junho Yoon, Gyeongsik Yang, Chuck Yoo

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种用于多模态模型训练的GPU内存预测框架,通过分解模型结构和分析训练行为,实现了高精度的内存预测。

Comments 1st Workshop on Systems for Agentic AI (SAA '25), co-located with SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12522 2025-12-10 cs.CV 79%

MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training

MuSACo: 多模态主体特定选择与适应用于带有协同训练的表情识别

Muhammad Osama Zeeshan, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, Francois Bremond, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ÉTS Montreal(LIVIA,系统工程系,蒙特利尔ÉTS) École Polytechnique, Palaiseau(巴黎政治学院,Palaiseau) Centre INRIA d’Université Côte d’Azur, Sophia Antipolis(法国阿尔卑斯大学INRIA中心,Sophia Antipolis)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MuSACo通过多模态协同训练方法提升主体特定表情识别的准确性和鲁棒性,适用于数字健康中的个性化评估。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08605 2025-12-10 cs.CV 79%

Leveraging Multi-Modal Information to Enhance Dataset Distillation

利用多模态信息提升数据集蒸馏

Zhe Li, Hadrien Reynaud, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃朗根-纽伦堡部门) Department of Computing Imperial College London(伦敦帝国理工学院计算机系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态数据集蒸馏框架,结合标题引导监督和对象中心遮蔽,提升数据集效用并增强隐私保护。

Comments Accepted at BMVC Workshop (Privacy, Fairness, Accountability and Transparency in Computer Vision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 79%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏