arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2601.16348 2026-01-26 cs.CV 79%

Coarse-to-Fine Non-rigid Multi-modal Image Registration for Historical Panel Paintings based on Crack Structures

基于裂缝结构的粗到细非刚性多模态图像配准用于历史面板绘画

Aline Sindel, Andreas Maier, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于裂缝结构的粗到细非刚性多模态图像配准方法,利用稀疏关键点和薄板样条实现高精度的历史面板绘画图像配准。

Comments Preprint, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 79%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15406 2026-01-23 cs.CV 79%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05577 2026-01-23 cs.LG cs.AI 79%

PyTDC: A multimodal machine learning training, evaluation, and inference platform for biomedical foundation models

PyTDC: 一种用于生物医学基础模型的多模态机器学习训练、评估和推理平台

Alejandro Velez-Arce, Jesus Caraballo, Marinka Zitnik

机构 * arcellai(ArcellAI公司) calculus(The Residency公司) mit(麻省理工学院) hms(哈佛医学院生物医学信息学系) broad(MIT与哈佛大学Broad研究所) harvard-ds(哈佛大学数据科学倡议) kempner(哈佛大学Kempner研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PyTDC是一种多模态机器学习平台,旨在提升生物医学基础模型的训练、评估和推理能力,通过统一数据源和模型权重,促进多模态、上下文感知的研究。

Comments Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 79%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 79%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13052 2026-01-21 cs.CV 79%

GridNet-HD: A High-Resolution Multi-Modal Dataset for LiDAR-Image Fusion on Power Line Infrastructure

GridNet-HD: 一种高分辨率多模态数据集,用于电力线路基础设施的LiDAR-图像融合

Antoine Carreaud, Shanci Li, Malo De Lacour, Digre Frinde, Jan Skaloud, Adrien Gressin

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 GridNet-HD是一个高分辨率多模态数据集,用于电力线路基础设施的LiDAR-图像融合,通过融合高密度LiDAR和高分辨率影像提升3D语义分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10949 2026-01-21 cs.CV 79%

MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement

MMedExpert-R1: 通过领域特定适应与临床指南强化多模态医学推理

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Haiqin Zhong, Xiaoling Luo, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MMedExpert-R1通过领域特定适应和临床指南强化,提升多模态医学推理能力,实现多专科对齐和高精度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 79%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08779 2026-01-19 cs.CV 79%

BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models

BBQ-V:评估大型多模态模型中视觉刻板印象偏见的基准

Vishal Narnaware, Ashmal Vayani, Rohit Gupta, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 BBQ-V通过真实多演员图像和多样类别评估LMMs的刻板印象偏见,揭示了主流模型在推理链中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10962 2026-01-19 cs.CV 79%

V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception

V2X-Radar: 一种包含4D雷达的多模态数据集用于协作感知

Lei Yang, Xinyu Zhang, Jun Li, Chen Wang, Jiaqi Ma, Zhiying Song, Tong Zhao, Ziying Song, Li Wang, Mo Zhou, Yang Shen, Kai Wu, Chen Lv

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动性学院,清华大学) Nanyang Technological University(南洋理工大学) CUMTB(中国交通车辆技术研究所) University of California, Los Angeles(加州大学洛杉矶分校) Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 V2X-Radar是首个包含4D雷达的多模态数据集,用于提升自动驾驶中的协作感知能力。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV 79%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07778 2026-01-13 cs.LG cs.AI 79%

DT-ICU: Towards Explainable Digital Twins for ICU Patient Monitoring via Multi-Modal and Multi-Task Iterative Inference

DT-ICU:通过多模态和多任务迭代推理实现ICU患者监测的可解释数字孪生

Wen Guo

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 DT-ICU通过多模态和多任务迭代推理实现ICU患者监测的可解释数字孪生,提升了预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07576 2026-01-13 cs.HC cs.CV 79%

A Multimodal Dataset of Student Oral Presentations with Sensors and Evaluation Data

面向学生口头陈述的多模态数据集,包含传感器和评估数据

Alvaro Becerra, Ruth Cobos, Roberto Daza

机构 * Universidad Autonoma de Madrid, School of Engineering(马德里自治大学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SOPHIAS是一个包含学生口头陈述的多模态数据集,整合了传感器和评估数据,用于研究多模态行为与表现的关系及自动化反馈工具的开发。

Comments Article under review in the journal Scientific Data. GitHub repository of the dataset at: https://github.com/dataGHIA/SOPHIAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09195 2026-01-13 cs.CV 79%

Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives

迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述

Yuhao Shen, Jiahe Qian, Shuping Zhang, Zhangtianyi Chen, Tao Lu, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18411 2026-01-13 cs.RO cs.CV 79%

SeePerSea: Multi-modal Perception Dataset of In-water Objects for Autonomous Surface Vehicles

SeePerSea:用于自主水面车辆的水下物体多模态感知数据集

Mingi Jeong, Arihant Chadda, Ziang Ren, Luyang Zhao, Haowen Liu, Monika Roznere, Aiwei Zhang, Yitao Jiang, Sabriel Achong, Samuel Lensgraf, Alberto Quattrini Li

机构 * Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) IQT Labs(IQT实验室) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Computer Science, University of Maryland College Park(马里兰大学计算机科学系) The Institute for Human and Machine Cognition and The University of West Florida(人机认知研究所与西佛罗里达大学) School of Computing, Binghamton University(宾夕法尼亚州立大学计算学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 SeePerSea数据集为自主水面车辆提供多模态水下物体感知数据,通过训练测试现有深度学习算法,推动海洋自主技术发展。

Comments Topic: Special Issue on ICRA 2024 Workshop on Field Robotics

Journal ref IEEE Transactions on Field Robotics 2 (2025) - 737-752

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19024 2026-01-13 cs.CV 79%

A Survey of Multimodal Hallucination Evaluation and Detection

多模态幻觉评估与检测综述

Zhiyuan Chen, Yuecong Min, Jie Zhang, Bei Yan, Jiahao Wang, Xiaozhen Wang, Shiguang Shan

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Trustworthy Technology and Engineering Laboratory(可信技术与工程实验室) Huawei(华为公司)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文综述了多模态幻觉评估与检测方法,分析了幻觉分类、评估基准、检测技术及未来研究方向。

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 79%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 79%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03017 2026-01-07 cs.CL 79%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16753 2026-01-07 cs.AI 79%

ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Completion

ELMM: 为多模态知识图谱补全设计的高效轻量多模态大语言模型

Wei Huang, Peining Li, Meiyu Liang, Xu Hou, Junping Du, Yingxia Shao, Guanhua Ye, Wu Liu, Kangkang Lu, Yang Yu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(计算机学院,北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ELMM通过多视图视觉标记压缩和注意力修剪策略,高效解决多模态知识图谱补全中的模态冲突和计算成本问题,实现最先进的性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07747 2026-01-07 cs.CV 79%

X-RAFT: Cross-Modal Non-Rigid Registration of Blue and White Light Neurosurgical Hyperspectral Images

X-RAFT:跨模态非刚性注册蓝光和白光神经外科高光谱图像

Charlie Budd, Silvère Ségaud, Matthew Elliot, Graeme Stasiuk, Yijing Xie, Jonathan Shapey, Tom Vercauteren

机构 * Department of Surgical \& Interventional Engineering, School of Biomedical Engineering \& Imaging Sciences, King's College London, London SE1 7EH Department of Neurosurgery, King's College London Hospital NHS Foundation Trust, London SE5 9RS, UK. Department of Imaging Chemistry \& Biology, School of Biomedical Engineering \& Imaging Sciences, King's College London, London SE1 7EH, UK.

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 X-RAFT通过跨模态输入优化,实现蓝光和白光神经外科高光谱图像的非刚性注册,提升定量荧光测量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02825 2026-01-07 cs.CV 79%

SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models

SketchThinker-R1: 向大多模态模型中高效实现草图式推理迈进

Ruiyang Zhang, Dongzhan Zhou, Zhedong Zheng

机构 * FST and ICI, University of Macau, China(澳门大学FST和ICI) Shanghai AI Laboratory, China(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SketchThinker-R1通过引入草图式推理机制,显著降低大得多模态模型的推理token成本,同时保持答案准确性。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02399 2026-01-07 cs.SE cs.AI 79%

ProSoftArena: Benchmarking Hierarchical Capabilities of Multimodal Agents in Professional Software Environments

ProSoftArena:在专业软件环境中评估多模态智能体分层能力的基准测试

Jiaxin Ai, Yukang Feng, Fanrui Zhang, Jianwen Sun, Zizhen Li, Chuanhao Li, Yifan Chang, Wenxiao Wu, Ruoxi Wang, Mingliang Zhai, Kaipeng Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ProSoftArena通过构建专业软件环境下的多模态智能体能力评估基准,揭示了智能体在复杂专业工作流任务中的性能瓶颈和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 79%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24605 2026-01-01 cs.CV 79%

MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding

MoniRefer: 一种基于道路基础设施的现实世界大规模多模态数据集用于3D视觉定位

Panquan Yang, Junfei Huang, Zongzhangbao Yin, Yingsong Hu, Anni Xu, Xinyi Luo, Xueqi Sun, Hai Wu, Sheng Ao, Zhaoxing Zhu, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MoniRefer数据集和Moni3DVG方法,用于解决户外监控场景下的3D视觉定位问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17126 2026-01-01 cs.CV cs.LG 79%

MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。

Comments Accepted at KDD 2026 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22877 2025-12-30 cs.CV 79%

M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models

M-ErasureBench:一种全面的多模态评估基准,用于扩散模型的概念擦除

Ju-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen

机构 * National Taiwan University(国立台湾大学) Research Center for Information Technology Innovation, Academia Sinica(学术院资讯技术创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 M-ErasureBench提出一种多模态评估框架,评估扩散模型的概念擦除方法,并提出IRECE模块提升擦除鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 79%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22689 2025-12-30 cs.CV cs.LG 79%

Multimodal Diffeomorphic Registration with Neural ODEs and Structural Descriptors

基于神经ODE和结构描述符的多模态可微映射注册

Salvador Rodriguez-Sanz, Monica Hernandez

机构 * Aragon Institute for Engineering Research (I3A), University of Zaragoza(阿拉贡工程研究院(I3A)、萨拉戈塔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于神经ODE和结构描述符的多模态可微映射注册方法,通过整合图像或特征描述符和局部互信息,实现了高精度且高效的多模态注册性能。

详情

展开后加载摘要…

URL PDF HTML 收藏