arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 633 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 633 篇

2607.15241 2026-07-17 cs.CL cs.CV 新提交 81%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 81%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13826 2026-07-16 cs.CV cs.AI cs.IR cs.LG 新提交 81%

Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning

使用深度学习对胰腺癌可切除性进行多模态评估

Vincent Ochs, Christoph Kuemmerli, Florentin Bieder, Julia Wolleb, Joel L. Lavanchy, Julia Ruppel, Jan Liechti, Stephanie Taha-Mehlitz, Christian Andreas Nebiker, Beat Mueller, Giuseppe Kito Fusai, Joerg-Matthias Pollok, Anas Taha, Philippe C. Cattin, Sebastian Staubli

机构 * University of Basel(巴塞尔大学) Clarunis, University Digestive Health Centre(克拉鲁尼斯大学消化健康中心) Kantonsspital Aarau(阿劳州立医院) Royal Free Hospital(皇家自由医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究利用深度学习框架联合分析CT与临床信息,对胰腺癌可切除性分类。通过Swin-UNETR主干获取图像特征,融合临床嵌入,经动态多任务目标训练,能将患者分入NCCN的三种可切除性类别,提高评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06633 2026-07-09 cs.CV cs.AI 新提交 81%

ProMoE-FL: Prototype-conditioned Mixture of Experts for Multimodal Federated Learning with Missing Modalities

ProMoE-FL:用于具有缺失模态的多模态联邦学习的原型条件专家混合模型

Aavash Chhetri, Bibek Niroula, Eduard Vazquez, Yash Raj Shrestha, Prashnna Gyawali, Loris Bazzani, Binod Bhattarai

机构 * NepAl Applied Mathematics and Informatics Institute(尼泊尔应用数学与信息学研究所) Fogsphere (Redev.AI Ltd)(福格球(Redev.AI有限公司)) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(维罗纳大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态联邦学习中缺失模态问题,提出ProMoE-FL框架,构建全局客户端感知原型库,以原型和模态索引为条件实现专家路由来动态合成缺失特征,在四个胸部X光数据集评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04727 2026-07-07 cs.SE cs.AI cs.CV 新提交 81%

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Dashboard2Code:在重建交互式仪表板上评估多模态模型

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究院)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态模型在交互式仪表板重建任务,介绍Dashboard2Code任务,提出DashboardMimic基准及自动化评估框架,实验发现开源与闭源模型在此任务上有差距。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04010 2026-07-07 cs.AI cs.CL cs.CY cs.LG 新提交 81%

Explainable AI for Screening Abuse-Related Trauma in Bangladeshi Children: A Training-Free Multimodal Framework Evaluated on Noise-Aware Synthetic Data

用于筛查孟加拉国儿童虐待相关创伤的可解释人工智能:基于噪声感知合成数据评估的无训练多模态框架

Salma Hoque Talukdar Koli, Fahima Haque Talukder Jely

机构 * One-Stop Crisis Centres (OCC)(一站式危机中心(OCC)) Department of Social Services (DSS)(社会服务部(DSS))

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉国儿童虐待相关心理创伤筛查工具缺失问题,提出无训练多模态融合框架ShishuRaksha AI,经噪声感知合成数据评估,该融合模型AUC达0.874,为低资源环境下儿童保护筛查提供可行性研究和设计贡献。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 81%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 81%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01365 2026-07-03 cs.LG cs.AI cs.CV 新提交 81%

Multi-modal Rail Crossing Safety Analysis

多模态铁路道口安全分析

Paimon Goulart, Chansong Lim, Nícolas Roque dos Santos, Yue Dong, Sheldon Peterson, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校) Riverside County Transportation Commission(河滨县交通委员会)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出多模态管道,利用视觉线索和事故报告评估铁路道口安全,基于FRA评分实现高风险/低风险分类(F1=0.757)和分数估计(RMSE=0.078)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25375 2026-07-02 cs.CV cs.AI 新提交 81%

Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection

超越视觉取证:审计多模态鲁棒性用于合成医学图像检测

Ching-Hao Chiu, Hao-Wei Chung, Gelei Xu, Xueyang Li, Pin-Yu Chen, John Kheir, Meysam Ghaffari, Carlos Morato, Ahmed Abbasi, Yiyu Shi

机构 * University of Notre Dame(圣母大学) IBM Research(IBM研究院) Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) Optum AI, UnitedHealth Group(Optum AI, 联合健康集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对合成医学图像检测中多模态鲁棒性不足的问题,提出图像-记录配对基准,揭示视觉语言模型因过度依赖记录上下文而导致的预测偏差。

Comments Accepted at MICCAI 2026. Version 2 is a substantial journal extension of the MICCAI 2026 conference version, with additional provenance perturbations, paired statistical analysis, extended SAVC mitigation experiments, and broader deployment discussion. 19 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31367 2026-07-01 cs.MM cs.CV 新提交 81%

Evidence Triangulation for Multimodal Fact-Checking in the Wild

野外多模态事实核查的证据三角测量

Stefanos-Iordanis Papadopoulos, Zacharias Chrysidis, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technologies Institute, Centre for Research & Technology, Hellas(希腊研究与技术中心信息技术研究所) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学电气与计算机工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多模态事实核查中合成数据与真实数据差距大的问题,提出X-POSE基准和TRENT模型,通过三个并行交叉注意力流和关系融合机制进行证据三角测量,在真实数据上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22437 2026-06-26 cs.CV cs.AI 新提交 81%

MMGist: A Comprehensive Multimodal Benchmark for 2027

MMGist:面向2027年的综合多模态基准

Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong, Chengping Zhao, Ting Liu, Yuzhuo Fu

机构 * SJTU(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有视觉语言基准的视觉依赖不足、性能饱和及异常项问题,提出MMGist基准,通过三阶段过滤构建7,262项,覆盖7个能力维度,在保持模型排名高保真度(Spearman ρ=0.98)的同时减少69%评估项并提升78%跨模型区分度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26079 2026-06-25 cs.CL cs.CV cs.LG 新提交 81%

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

相同证据,不同答案:多模态大语言模型中的顺序敏感性审计

Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21613 2026-06-23 cs.CV cs.AI 新提交 81%

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

跨模态验证实现无标注野生动物监测

Bharath Pillai, Varun Viswapriyan, Christopher Stewart, Tanya Berger-Wolf, Jenna Kline

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出利用物种活动模式专家知识作为无标注验证信号,通过视觉和声学管道独立恢复活动模式并与行为先验三方一致,实现无需人工标注的野生动物监测。

Comments Presented at the 2026 CV4Animals Workshop, colocated with CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 81%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14963 2026-06-16 cs.CV cs.AI 新提交 81%

Multi-Modal Attention for Automated Disaster Damage Assessment Using Remote Sensing Imagery and Deep Learning

基于遥感影像和深度学习的多模态注意力自动灾害损伤评估

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

机构 * Built Environment Department, College of Science and Technology, North Carolina A&T State University(北卡罗来纳农工州立大学科技学院建筑环境系) United Nations University Institute for Water, Environment and Health(联合国大学水、环境与健康研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种多模态注意力机制融合双时相遥感影像的深度学习框架,实现建筑物损伤四分类(无/轻微/严重/毁坏),准确率达94.90%。

Comments This paper has been accepted for publication in ISPRS Congress 2026 and the 47th Canadian Symposium on Remote Sensing (CSRS 2026) Annals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14766 2026-06-16 cs.CV cs.AI cs.MA 新提交 81%

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架

Hamza Riaz, Arham Haroon, Maha Baig, Muhammad Dawood Rizwan, Muhammad Naseer Bajwa, Muhammad Moazam Fraz

机构 * National University of Sciences and Technology (NUST)(巴基斯坦国立科技大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出XMedFusion模块化AI框架,通过视觉感知、知识图谱构建和检索引导生成等智能体协同,增强放射学报告生成的视觉基础与临床发现捕捉能力,在公共数据集上显著优于基线模型。

Comments Accepted at the 2026 International Conference on Robotics and Automation in Industry (ICRAI)

Journal ref 2026 International Conference on Robotics and Automation in Industry (ICRAI), pp. 1-6, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交 81%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13341 2026-06-12 cs.CV cs.AI physics.med-ph 新提交 81%

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis

双域等变生成对抗网络用于多模态CT-PET合成

Gabriel Steele, Alzahra Altalib, Alessandro Perelli

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出双域等变生成对抗网络(DDE-GAN),联合空间与频域学习并融入旋转等变性,实现高保真多模态CT-PET图像合成。

Comments 4 pages, 3 figures, 1 table, 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11930 2026-06-12 cs.HC cs.AI cs.CV 新提交 81%

Frozen Multimodal Embeddings for AI-Assisted Interview Assessment of Personality and Cognitive Ability

冻结多模态嵌入用于异步视频面试中的个性与认知能力评估

Kuo-En Hung, Hung-Yue Suen, Shih-Ching Yeh, Hsiang-Wen Wang

机构 * Technology Application and Human Resource Development, National Taiwan Normal University(台湾国立台中教育大学技术应用与人力资源发展系) Computer Science and Information Engineering, National Central University(台湾国立中央大学计算机科学与资讯工程系) Institute of Photonic System, National Yang Ming Chiao Tung University(台湾阳明交通大学光电系统研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对异步视频面试中标注数据有限的高维多模态学习问题,提出使用冻结多模态编码器(CLIP、Whisper、RoBERTa等)结合低容量下游模型,在个性预测任务上实现MSE降低19.1%,并发现认知能力预测中存在数据集捷径。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06696 2026-06-08 cs.CV cs.AI 新提交 81%

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力

Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Instituto Tecnológico de Monterrey(蒙特雷技术学院) Monash University(墨尔本大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18317 2026-08-20 cs.CV cs.RO 新提交 80%

Reproducible Multimodal Affordance Prediction

可复现的多模态可供性预测

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) EPFL(洛桑联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。

Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at https://apicis.github.io/aff-sheet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17452 2026-07-21 cs.CL 新提交 80%

How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks

对话状态的多模态信号有多可靠?来自远程二元协作任务的证据

Tahiya Chowdhury

机构 * Colby College(科尔比学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究探讨从多模态行为测量对话状态的特征可靠性,提出三维评估框架用于视频会议二元对话特征评估,发现语言特征预测佳但跨任务通用性差,声学可靠性受说话者身份影响,交互特征是唯一可靠信号,强调相关评估对对话系统特征选择的重要性。

Comments Accepted, to appear in Proceedings of ACM International Conference on Multimodal Interaction 2026, 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20312 2026-08-21 cs.CV 新提交 79%

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Inter-X++:用于多模态人与人交互分析的综合基准

Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv, Yichao Yan, Xin Jin, Zhibo Chen, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(宁波工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态人与人交互基准Inter-X++,构建含精细标注的大规模数据集,开发统一HHI框架OpenHHI,其在生成与感知任务上达最优性能,验证了统一表示的有效性。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19666 2026-08-21 cs.CV 新提交 79%

MUST-PET: MUltimodal Self-supervised learning across Tracers for whole-body PET/CT-based lesion segmentation

MUST-PET:用于基于全身PET/CT的病灶分割的跨示踪剂多模态自监督学习

Bashirul Azam Biswas, Amartya Bhattacharya, Biratal Raj Wagle, Matthew E. Maeder, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出MUST-PET多模态自监督学习框架,通过跨示踪剂的上下文感知掩码重建,实现全身PET-CT病灶的标注高效、可泛化分割,性能优于从头训练模型。

Comments Submitted to SPIE CAD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 79%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17884 2026-08-19 cs.CV 新提交 79%

CFB-GBM v2.0: An Augmented Longitudinal Dataset for Multi-Modal Glioblastoma Segmentation, Radiomics, and RANO Progression Tracking

CFB-GBM v2.0:用于多模态胶质母细胞瘤分割、放射组学及RANO进展追踪的增强纵向数据集

Alexandre G. Leclercq, Noémie N. Moreau, Hugo Audebert, Andros Nassar, Thomas Cochin, Thomas Leleu, Loïc Le Henaff, Alexis Desmonts, Yoann Poirier, Aurélie Dubru, Laura Guillemette, Pascal Lecoeur, Kévin Lemasson, Cyril Jaudet, Sébastien Bougleux, Romain Hérault, Carole Brunaud, Samuel Valable, Dinu Stefan, Charlotte Raboutet, Alain Batalla, Joëlle Lacroix, Roman Rouzier, Aurélien Corroyer-Dulmont

机构 * Centre François Baclesse(弗朗索瓦·巴克莱斯中心) Université de Caen Normandie(卡昂诺曼底大学) ENSICAEN(卡昂高等工程师学院) GREYC(格雷计算机科学研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文发布增强版CFB-GBM v2.0纵向数据集,含264名GBM患者数据,完成所有时间点GTV勾画(完成率达97%),提供相关标注、特征及WHO分类信息,可用于多模态GBM相关研究。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 79%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15999 2026-08-18 cs.AI 新提交 79%

MUPA$^{2}$E: Multimodal Unified Perception with Asymmetric Attention for Emotion Assessment

MUPA²E:用于情绪评估的非对称注意力多模态统一感知框架

Stefanos Gkikas, Eric Nichols, Christian Arzate Cruz, Randy Gomez

机构 * Honda Research Institute Japan(日本本田研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MUPA²E多模态统一感知框架,用共享非对称注意力骨干处理面部视频与EEG,在DMER数据集上对比多配置,发现时长线索影响分类,控制时长后准确率下降,证明统一架构处理异质信号的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 79%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏