arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

1710.01216 2018-03-13 cs.CV 74%

Group Affect Prediction Using Multimodal Distributions

Saqib Shamsi, Bhanu Pratap Singh Rawat, Manya Wadhwa

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments This research paper has been accepted at Workshop on Computer Vision for Active and Assisted Living, WACV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.06846 2016-09-23 cs.CV cs.NE 74%

Semantic Segmentation of Earth Observation Data Using Multimodal and Multi-scale Deep Networks

Nicolas Audebert, Bertrand Le Saux, Sébastien Lefèvre

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments Asian Conference on Computer Vision (ACCV16), Nov 2016, Taipei, Taiwan

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.05347 2016-08-01 cs.CV 74%

Deep Perceptual Mapping for Cross-Modal Face Recognition

M. Saquib Sarfraz, Rainer Stiefelhagen

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

Comments This is the extended version (invited IJCV submission) with new results of our previous submission (arXiv:1507.02879)

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.06821 2015-08-19 cs.CV cs.LG cs.NE cs.RO 74%

Multimodal Deep Learning for Robust RGB-D Object Recognition

Andreas Eitel, Jost Tobias Springenberg, Luciano Spinello, Martin Riedmiller, Wolfram Burgard

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments Final version submitted to IROS'2015, results unchanged, reformulation of some text passages in abstract and introduction

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.3914 2014-12-15 cs.CV 74%

Edge Preserving Multi-Modal Registration Based On Gradient Intensity Self-Similarity

Tamar Rott, Dorin Shriki, Tamir Bendory

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1307.1739 2013-11-05 cs.CV cs.GR 74%

Anatomical Feature-guided Volumeric Registration of Multimodal Prostate MRI

Xin Zhao, Arie Kaufman

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments This paper has been withdrawn by the author due to publication

详情

展开后加载摘要…

URL PDF HTML 收藏
1304.5894 2013-04-24 cs.CV cs.LG 74%

Bayesian crack detection in ultra high resolution multimodal images of paintings

Bruno Cornelis, Yun Yang, Joshua T. Vogelstein, Ann Dooms, Ingrid Daubechies, David Dunson

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments 8 pages, double column

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.10046 2021-05-24 eess.SP 73%

Robust heartbeat detection using multimodal recordings and ECG quality assessment with signal amplitudes dispersion

Zahra Rezaei Khavas, Babak Mohammadzadeh Asl

专题命中 多模态评测 :multimodal(title,journal_ref)

Comments 14 pages Journal paper 14 figures 3 tables

Journal ref Khavas ZR, Asl BM. Robust heartbeat detection using multimodal recordings and ECG quality assessment with signal amplitudes dispersion. Computer methods and programs in biomedicine. 2018 Sep 1;163:169-82

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-28 cs.CV cs.CL 版本更新 73%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18311 2026-08-20 cs.CV cs.AI cs.LG 新提交 73%

FedCoRe: Target-Adaptive Completion for Missing Modalities in Healthcare Federated Learning

FedCoRe:医疗联邦学习中针对缺失模态的目标自适应补全方法

Holger R. Roth, Ziyue Xu, Peter Cnudde

机构 * NVIDIA(英伟达)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对医疗联邦学习中客户端存在缺失模态的问题,提出FedCoRe框架,通过学习表示或对数空间修正,在呼吸恶化任务中恢复了ECG和CXR缺失导致的部分性能损失。

Comments Accepted to the 7th Workshop on Distributed, Collaborative & Federated Learning, DeCaF 2026, MICCAI, Strasbourg, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16480 2026-08-18 cs.CV cs.AI 新提交 73%

RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning

RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解

Yanbo Jiang, Haotian Zheng, Jiahao Wang, Hanxiao Ren, Yitao Xu, Yining Xing, Zehong Ke, Hao Cheng, Yiqian Tu, Jinhao Li, Zhiyuan Xuan, Fang Zhang, Jianqiang Wang

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-18 cs.CV cs.AI 版本更新 73%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Zhenglin Wan, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 73%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02746 2026-08-06 cs.CV cs.AI 73%

Virtual Scanning for NSCLC Histology: Investigating the Discriminatory Power of Synthetic PET

非小细胞肺癌组织学的虚拟扫描:探究合成PET的判别能力

Fatih Aksu, Laura Ciuffetti, Francesco Di Feola, Filippo Ruffini, Giulia Romoli, Fabrizia Gelardi, Arturo Chiti, Valerio Guarrasi, Paolo Soda

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Università Vita-Salute San Raffaele(圣拉斐尔生命健康大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对NSCLC组织学分类问题,提出用3D Pix2Pix GAN合成PET特征并结合MINT框架的多模态方法,在714人数据集上使AUC和GMean显著提升,为无实体PET的临床场景提供特征增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 73%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 73%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 73%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 73%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 73%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 73%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 73%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09634 2026-06-09 cs.CV cs.AI 新提交 73%

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测

Debojyoti Biswas, Xianbiao Hu

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新 73%

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09883 2026-06-02 cs.CV cs.AI 73%

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

笛卡尔捷径:在极坐标空间中重新评估视觉推理

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09218 2026-05-12 cs.CV cs.AI cs.LG cs.RO 73%

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

Flame3D: 无需3D特定训练的3D场景零样本组合推理

Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh, Srinivasan Seshan, Anthony Rowe

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03331 2026-05-08 cs.CL cs.AI 73%

PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning

PulseLM:PPG-文本学习的基础数据集和基准

Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma

机构 * Singapore Management University(新加坡管理大学) Queen Mary University of London(伦敦玛丽女王大学) Eindhoven University of Technology(埃因霍温理工大学) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PulseLM通过统一的问答框架连接原始PPG波形与自然语言,包含100万标准化PPG片段及250万问题-答案对,为研究语言基础生理推断和多模态模型基准提供标准化基础。

Comments PulseLM v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20306 2026-04-23 cs.CV cs.AI 73%

Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA

双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答

Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部) Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双重因果推断框架,通过整合后门调整和工具变量学习,解决医疗视觉问答中多模态数据中的内在偏见问题,提升模型的诊断推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12315 2026-04-15 cs.CV cs.MM 73%

GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality

GTPBD-MM:一种具有多模态的全球梯田地块和边界数据集

Zhiwei Zhang, Xingyuan Zeng, Xinkai Kong, Kunquan Zhang, Haoyuan Liang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

AI总结 本文提出GTPBD-MM数据集,用于复杂梯田地块提取,结合高分辨率影像、文本描述和DEM数据,提出ETTerra模型,通过文本和地形信息提升提取精度。

Comments 15 pages, 11 figures. Submitted to ACM Multimedia 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 73%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07763 2026-04-10 cs.CV cs.AI 73%

Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities

超越表面伪影:跨模态捕捉共享的潜在伪造知识

Jingtong Dou, Chuancheng Shi, Jian Wang, Fei Shen, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种跨模态伪造检测框架MAF,通过解耦模态特定风格,提取跨模态的潜在伪造知识,并定义了两个维度评估模型泛化能力,推动多模态防伪技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏