arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2607.23542 2026-07-28 cs.CV 新提交 74%

GaitFace: A Multimodal Dataset for Long-Range Person Identification

GaitFace:一个用于远距离人员识别的多模态数据集

Alain Komaty, Luis S. Luevano, Vidit Vidit, Anjith George, Zeina Al Amine, Sébastien Marcel

机构 * Idiap Research Institute(伊迪阿普研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍用于远距离人员识别的多模态数据集GaitFace,利用预注册和“野外”捕获数据反映真实边境场景,通过基准测试揭示当前面部和步态模型在低分辨率和高视角下的关键漏洞,为无约束生物识别研究提供公共基准。

Comments Accepted in IJCB 2026 , see https://idiap.ch/paper/gaitface/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22135 2026-07-28 cs.CV 版本更新 74%

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

GLI-AL:一个具有统一解剖-病变标签的多模态胶质瘤MRI标签资源

Xingyu Xiang, Shuang Hao, Fan Wang, Jianhua Ma, Chunfeng Lian

机构 * Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi’an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi’an Jiaotong University(西安交通大学智能医疗设备与器械研究中心)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 研究针对现有BraTS-GLI数据集不足,引入BraTS-GLI Anatomy-Lesion资源,提供统一解剖-病变标签集及元数据。通过WMH感知监督,提升对共存病变敏感性,保持健康组织分割性能,支持多方面研究,数据和代码可获取。

Comments Minor revision: Figure 1 was repositioned. The scientific content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08317 2026-07-10 cs.AI 新提交 74%

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

盲点基准:评估多模态模型中的盲点

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 研究旨在评估多模态模型盲点,引入盲点基准,收集学生原始问题并标注,提出任务分类法和自动评分管道。分析发现闭源前沿模型超越开源模型,各模型在不同任务类型表现各异,凸显该基准对识别模型弱点的价值。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交 74%

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交 74%

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24770 2026-06-24 cs.CY cs.AI cs.LG 新提交 74%

Context-Aware Prediction of Student Quiz Performance with Multimodal Textbook Features

基于多模态教材特征的情境感知学生测验表现预测

Samin Khan

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本研究通过提取CourseKata教材中复习题的文字和图像特征,结合学生历史表现,将章节测验预测准确率相对提升9.1%,表明情境感知模型能利用内容特征改进预测。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 74%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17782 2026-06-23 cs.CV 版本更新 74%

Thalia: A Global, Multi-Modal Dataset for Volcanic Activity Monitoring

Thalia:用于火山活动监测的全球多模态数据集

Nikolas Papadopoulos, Nikolaos Ioannis Bountos, Maria Sdraka, Andreas Karavias, Gustau Camps-Valls, Ioannis Papoutsis

机构 * Remote Sensing Lab, National Technical University of Athens, Greece(希腊国家技术大学远程传感实验室) Department of Informatics and Telematics, Harokopio University of Athens, Greece(希腊雅典霍罗科普利奥大学信息与电信系) Image Processing Laboratory (IPL), Universitat de València, Spain(西班牙瓦伦西亚大学图像处理实验室) National Observatory of Athens, Greece(希腊国家天文台)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 针对火山监测中InSAR数据复杂且标注数据集稀缺的问题,本文构建了Thalia数据集,整合多源高分辨率时空数据,并提供专家标注和基准评估,推动深度学习在火山变形监测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19067 2026-06-18 cs.RO cs.CV 新提交 74%

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots

传感器配置至关重要:四足机器人多模态SLAM的系统评估

Roberto Corlito, Fabian Schmidt, Nils Seibert, Markus Enzweiler, Abhinav Valada, Arne Roennau

机构 * Machine Intelligence and Robotics Lab, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院智能机器人实验室) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃森堡应用科学大学智能系统研究所) Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 针对四足机器人运动中的传感器配置问题,系统评估了视觉、视觉-惯性和LiDAR-视觉-惯性SLAM方法,发现立体相机、全局快门和适当惯性集成能显著提升定位鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14251 2026-06-15 cs.CV 新提交 74%

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling

HiST:用于跨模态空间转录组建模的分层稀疏Transformer

Weiyi Wu, Xinwen Xu, Xingjian Diao, Siting Li, Zhi Wei, Alma Andersson, Jiang Gui

机构 * New Jersey Institute of Technology(新泽西理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Karolinska Institutet(卡罗林斯卡学院) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09453 2026-06-09 cs.CV 新提交 74%

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer

GD-MIL:用于前列腺癌多模态生化复发预测的等级解耦多实例学习

Dasari Naga Raju

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 针对前列腺癌生化复发预测,提出GD-MIL方法,通过梯度反转等级对抗训练实现H&E全切片图像特征与Gleason等级解耦,融合临床变量后C-index达0.704,显著优于临床基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15153 2026-06-05 cs.CV 74%

Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning

通过利用多模态链式推理解释可解释的动作形式评估

Mengshi Qi, Yeteng Wu, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出了一种新的动作形式评估任务,并引入了一个包含大量健身和武术视频的多级标注数据集CoT-AFA,通过引入新的链式思维解释方法,提出了可解释性健身评估框架,以提升动作分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02774 2026-06-03 cs.CV 74%

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

GeoDrive-Bench:自动驾驶中区域特定多模态推理的基准测试

Yingzi Ma, Chaowei Xiao, Ming Jiang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出GeoDrive-Bench基准,通过5053个跨六国人工验证的多选题,评估视觉语言模型在感知、预测、规划和区域推理四个驾驶任务中基于区域特定交通规则的推理能力,并设计蒸馏算法注入区域知识以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26328 2026-05-27 cs.CV 74%

RadarSim: Simulating Single-Chip Radar via Multimodal Neural Fields

RadarSim: 通过多模态神经场模拟单芯片雷达

Chuhan Chen, Tianshu Huang, Akarsh Prabhakara, Chaithanya Kumar Mummadi, Zhongxiao Cong, Anthony Rowe, Matthew O'Toole, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Research(博世研究) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出RadarSim,一种利用RGB相机高角分辨率从相机初始化的神经场生成多普勒雷达距离图像的统一可微渲染器,以解决雷达空间分辨率低的问题,并产生比纯雷达重建更清晰的几何和多普勒距离帧。

Comments Accepted to 3DV 2026. Project website: https://sally-chen.github.io/radar-sim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24702 2026-05-26 cs.CV 74%

Do Image-Text Metrics Respect Semantic Invariances?

图像-文本度量是否尊重语义不变性?

Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe, Michael Avendi, Yassi Abbasi, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 多模态评测 :image-text(title);分类 cs.CV

AI总结 通过空间、物体和社会语言框架三个维度的语义保持扰动,系统评估了五种流行图像-文本评估器(CLIPScore、PAC-S、UMIC、FLEUR和确定性LLM评判)的语义不变性,发现它们对非语义变化敏感,并提出了不变性校准评分作为后处理调整方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23326 2026-05-25 cs.CL 74%

ClimateChat-300K: A Multi-Modal Facebook Dataset for Understanding Diverse Perspectives in Climate Communication

ClimateChat-300K:一个用于理解气候传播中不同观点的多模态Facebook数据集

Wajdi Zaghouani, Md. Rafiul Biswas, Mabrouka Bessghaier, Shimaa Ibrahim, George Mikros

机构 * Northwestern University in Qatar(卡塔尔西北大学) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CL

AI总结 通过CrowdTangle平台收集2020年5月至2024年5月间的299,329条Facebook公开帖子,利用主题建模和情感分析识别出政策、行动主义、合作、科学和保护五大领域十个主题,揭示了情感基调、帖子格式和页面身份对受众参与度的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23068 2026-05-25 cs.CV 74%

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准

Chengyi Zhang, Zi Ye, Ziyang Wang

机构 * Swansea University, UK(威尔士大学) Maynooth University, Ireland(迈诺特大学) Aston University, UK(阿斯顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06206 2026-05-21 cs.RO cs.CV 74%

Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model

Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习

Hanqing Wang, Shaoyang Wang, Yiming Zhong, Zemin Yang, Jiamin Wang, Zhiqing Cui, Jiahao Yuan, Yifan Han, Mingyu Liu, Yuexin Ma

机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) ShanghaiTech University(上海科技大学) East China Normal University(华东师范大学) Nanjing University of Information Science & Technology(南京信息工程大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08445 2026-05-12 cs.AI 74%

Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

衡量重要性:在医疗保健中基准测试生成、多模态和代理AI

Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia, Ananya Mantravadi

机构 * Centific AI Research(Centific人工智能研究)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文探讨了在医疗保健中评估生成、多模态和代理AI的基准测试方法,强调了现有基准测试在可靠性、安全性和临床相关性方面的不足,提出需要系统性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12652 2026-05-01 cs.CV 74%

CBEN -- A Multimodal Machine Learning Dataset for Cloud Robust Remote Sensing Image Understanding

CBEN -- 一种用于云鲁棒遥感图像理解的多模态机器学习数据集

Marco Stricker, Masakazu Iwamura, Koichi Kise

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出CBEN数据集,用于研究云干扰对遥感图像理解的影响,通过结合光学与雷达数据,验证云鲁棒方法在云覆盖场景下的有效性。

Comments We are currently in the process of selecting an appropriate journal for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23781 2026-04-28 cs.CV cs.SE 74%

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

ClawMark:多轮、多日、多模态同事代理的活体世界基准

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

机构 * ClawMark Team(ClawMark团队)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 ClawMark基准通过多轮多日任务和状态化沙盒环境评估同事代理在动态环境中的表现,包含100个专业场景任务,测试七种前沿代理系统,揭示部分进展常见但完整流程完成罕见。

Comments github repo: https://github.com/evolvent-ai/ClawMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05563 2026-04-24 cs.CV cs.SI 74%

What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews

未被言说之物:检测和纠正多模态新闻预告中的误导性省略

Fanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学) School of Engineering, Yunnan University(云南大学工程学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出MM-Misleading基准,通过多阶段流程评估开源LVLMs,发现省略性误导的盲区,并提出OMGuard结合细调和引导修正,提升检测与纠正效果,揭示局部叙事变化导致的误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18908 2026-04-24 cs.AI 74%

Multimodal Bayesian Network for Robust Assessment of Casualties in Autonomous Triage

多模态贝叶斯网络用于自主分诊的稳健评估

Szymon Rusiecki, Cecilia G. Morales, Kimberly Elenberg, Leonard Weiss, Artur Dubrawski

机构 * AGH University of Krakow(AGH克拉科夫大学) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出一种融合多计算机视觉模型输出的贝叶斯网络,通过专家定义规则提升伤员评估准确性,在DARPA分诊挑战中显著优于视觉基线。

Comments Presented at NeurIPS 2025 Workshop: Structured Probabilistic Inference & Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16298 2026-04-20 cs.CV cs.RO 74%

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

FineCog-Nav:整合细粒度认知模块以实现零样本多模态无人机导航

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo

机构 * Northwestern Polytechnical University(西北工业大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出FineCog-Nav框架,通过细粒度认知模块提升无人机零样本多模态导航性能,构建了AerialVLN-Fine基准测试集,实验表明其在指令遵循、长视距规划和环境泛化方面优于基线方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13391 2026-03-17 cs.CV 74%

WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics

WebVR:通过人类对齐的视觉标准基准测试多模态大语言模型从视频中重建网页

Yuhong Dai, Yanlin Lai, Mitt Huang, Hangyu Guo, Dingming Li, Hongbo Peng, Haodong Li, Yingxiu Zhao, Haoran Lyu, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 WebVR通过人类对齐的视觉标准评估多模态大语言模型从视频中重建网页的能力,包含175个多样化网页,展示了模型在细节风格和运动质量上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21142 2026-02-25 cs.CV cs.LG 74%

LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis

LUMEN: 长期多模态放射学模型用于预后和诊断

Zhifan Jiang, Dong Yang, Vishwesh Nath, Abhijeet Parida, Nishad P. Kulkarni, Ziyue Xu, Daguang Xu, Syed Muhammad Anwar, Holger R. Roth, Marius George Linguraru

机构 * 1 Sheikh Zayed Institute for Pediatric Surgical Innovation, Children's National Hospital, Washington DC, USA 2 Nvidia Corporation, Santa Clara, CA, USA 3 ETSI Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain 4 School of Medicine Health Sciences, George Washington University, Washington DC, USA

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 LUMEN模型通过多任务指令微调提升纵向放射影像的诊断与预后能力。

Comments Accepted to IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 74%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 多模态评测 :MLLM(title);分类 cs.CV

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18083 2026-02-23 cs.CV cs.LG 74%

Comparative Assessment of Multimodal Earth Observation Data for Soil Moisture Estimation

多模态地球观测数据在土壤含水量估计中的比较评估

Ioannis Kontogiorgakis, Athanasios Askitopoulos, Iason Tsardanidis, Dimitrios Bormpoudakis, Ilias Tsoumas, Fotios Balampanis, Charalampos Kontoes

机构 * BEYOND EO Centre, IAASARS, National Observatory of Athens(BEYOND EO中心、IAASARS、雅典国家天文台) Artificial Intelligence, Wageningen University & Research(人工智能,瓦赫宁根大学与研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本研究通过多模态地球观测数据结合机器学习,提出高分辨率土壤含水量估计框架,验证了传统特征工程在稀疏数据回归任务中的有效性。

Comments This paper has been submitted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18318 2026-02-19 cs.AI 74%

Earth AI: Unlocking Geospatial Insights with Foundation Models and Cross-Modal Reasoning

Earth AI:利用基础模型和跨模态推理解锁地理空间洞察

Aaron Bell, Amit Aides, Amr Helmy, Arbaaz Muslim, Aviad Barzilai, Aviv Slobodkin, Bolous Jaber, David Schottlander, George Leifman, Joydeep Paul, Mimi Sun, Nadav Sherman, Natalie Williams, Per Bjornsson, Roy Lee, Ruth Alcantara, Thomas Turnbull, Tomer Shekel, Vered Silverman, Yotam Gigi, Adam Boulanger, Alex Ottenwess, Ali Ahmadalipour, Anna Carter, Behzad Vahedi, Charles Elliott, David Andre, Elad Aharoni, Gia Jung, Hassler Thurston, Jacob Bien, Jamie McPike, Jessica Sapick, Juliet Rothenberg, Kartik Hegde, Kel Markert, Kim Philipp Jablonski, Luc Houriez, Monica Bharel, Phing VanLee, Reuven Sayag, Sebastian Pilarski, Shelley Cazares, Shlomi Pasternak, Siduo Jiang, Thomas Colthurst, Yang Chen, Yehonathan Refael, Yochai Blau, Yuval Carny, Yael Maguire, Avinatan Hassidim, James Manyika, Tim Thelin, Genady Beryozkin, Gautam Prasad, Luke Barrington, Yossi Matias, Niv Efron, Shravya Shetty

机构 * Google Research(谷歌研究) Google X(谷歌X) Google Cloud(谷歌云)

专题命中 多模态评测 :cross-modal(title);分类 cs.AI

AI总结 Earth AI通过基础模型和跨模态推理,提升地理空间数据分析能力,实现对地球的深入洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17834 2026-02-10 cs.CV 74%

Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography

从多模态数据集构建通用基础模型用于三维计算机断层扫描

Ibrahim Ethem Hamamci, Sezgin Er, Chenyu Wang, Furkan Almas, Ayse Gulnihan Simsek, Sevval Nil Esirgun, Irem Dogan, Omer Faruk Durugol, Benjamin Hou, Suprosanna Shit, Weicheng Dai, Murong Xu, Hadrien Reynaud, Muhammed Furkan Dasdelen, Bastian Wittmann, Tamaz Amiranashvili, Enis Simsar, Mehmet Simsar, Emine Bensu Erdemir, Abdullah Alanbay, Anjany Sekuboyina, Berkan Lafci, Ahmet Kaplan, Zhiyong Lu, Malgorzata Polacin, Bernhard Kainz, Christian Bluethgen, Kayhan Batmanghelich, Mehmet Kemal Ozdemir, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Division of Intramural Research, National Institutes of Health(美国国立卫生研究院内部研究部) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射学研究所) Department Artificial Intelligence in Biomedical Engineering, FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡工业大学生物医学工程人工智能系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出CT-RATE数据集及CT-CLIP和CT-CHAT模型,用于三维医学影像的通用基础模型研究,提升了多异常检测和病例检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏