arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

2602.10168 2026-02-16 q-bio.QM cs.AI cs.LG 70%

EVA: Towards a universal model of the immune system

EVA:朝着免疫系统通用模型迈进

Scienta Team, Ethan Bandasack, Vincent Bouget, Apolline Bruley, Yannis Cattan, Charlotte Claye, Matthew Corney, Julien Duquesne, Karim El Kanbi, Aziz Fouché, Pierre Marschall, Francesco Strozzi

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09523 2026-02-13 cs.CV 70%

Singpath-VL Technical Report

Singpath-VL 技术报告

Zhen Qiu, Kaiwen Xiao, Zhengwei Lu, Xiangyu Liu, Lei Zhao, Hao Zhang

机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16471 2026-02-12 cs.CV 70%

Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos

秩序从混沌:从 glitchy 游戏视频中理解物理世界

Meng Cao, Haoran Tang, Haoze Zhao, Mingfei Han, Ruyang Liu, Qiang Sun, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Toronto(多伦多大学) Sun Yat-sen University(孙中山大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15933 2026-02-12 cs.CV 70%

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

城市真实环境中的导航:探索从大规模知识中涌现的导航

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。

Comments Accepted at EACL 2026 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05480 2026-02-06 cs.CV 70%

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感

Peihao Wu, Yongxiang Yao, Yi Wan, Wenfei Zhang, Ruipeng Zhao, Jiayuan Li, Yongjun Zhang

机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) Hubei LuoJia Laboratory(湖北珞珈实验室) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01081 2026-02-03 cs.CV 70%

MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization

MedAD-R1: 通过一致性强化策略优化实现可解释医学异常检测中的一致推理

Haitao Zhang, Yingying Wang, Jiaxiang Wang, Haote Xu, Hongyang Zhang, Yirong Chen, Yue Huang, Xinghao Ding

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Zhejiang Expressway Co., Ltd.(浙江高速公路有限公司) School of Science and Engineering, Chinese University of Hong Kong(香港中文大学科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 MedAD-R1通过一致性强化策略优化实现医学异常检测中的可解释推理,提升模型的可信度和可解释性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 70%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 70%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 70%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 70%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 70%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 70%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 70%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09949 2026-01-21 cs.CV 70%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 70%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 70%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 70%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04715 2026-01-09 cs.CV 70%

On the Holistic Approach for Detecting Human Image Forgery

对人类图像伪造的总体方法

Xiao Guo, Jie Zhu, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。

Comments 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14749 2026-01-09 cs.CL 70%

On the robustness of modeling grounded word learning through a child's egocentric input

基于儿童自体输入的建模 grounded 词学习的鲁棒性研究

Wai Keen Vong, Brenden M. Lake

机构 * Center for Data Science, New York University(纽约大学数据科学中心) Department of Psychology, New York University(纽约大学心理学系)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL

AI总结 本文通过分析儿童自体输入数据,验证了多模态神经网络在 grounded 词学习中的鲁棒性,并揭示了不同儿童经验对学习模式的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18951 2026-01-09 cs.CV 70%

TopoBDA: Towards Bezier Deformable Attention for Road Topology Understanding

TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。

Comments Project page: https://artest08.github.io/TopoBDA.github.io/

Journal ref Neurocomputing, Vol. 670, 132360 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01868 2026-01-06 cs.CL 70%

DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs

DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型

Jinghan Ru, Siyuan Yan, Yuguo Yin, Yuexian Zou, Zongyuan Ge

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01188 2026-01-06 cs.RO cs.CV 70%

DST-Calib: A Dual-Path, Self-Supervised, Target-Free LiDAR-Camera Extrinsic Calibration Network

DST-Calib: 一种双路径、自监督、无目标的激光雷达-摄像头外参校准网络

Zhiwei Huang, Yanwei Fu, Yi Zhou, Xieyuanli Chen, Qijun Chen, Rui Fan

机构 * Department of Control Science & Engineering, the College of Electronics & Information Engineering, Tongji University(控制科学与工程系,电子与信息工程学院,同济大学) Department of Mechanical Engineering, the School of Mechanical Engineering, Tongji University(机械工程系,机械工程学院,同济大学) School of Robotics, Hunan University(机器人学院,湖南大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科学技术大学) Department of Control Science & Engineering, the College of Electronics & Information Engineering, Shanghai Research Institute for Intelligent Autonomous Systems, the State Key Laboratory of Intelligent Autonomous Systems, and Frontiers Science Center for Intelligent Autonomous Systems, Tongji University(控制科学与工程系,电子与信息工程学院,上海智能自主系统研究院,智能自主系统国家重点实验室,智能自主系统前沿科学中心,同济大学) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 DST-Calib通过双路径自监督方法,无需目标实现激光雷达与摄像头的高效外参校准,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 70%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 70%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 70%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 70%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23981 2025-12-11 cs.CV 70%

TeleEgo: Benchmarking Egocentric AI Assistants in the Wild

TeleEgo:在真实场景中评估第一人称AI助手的基准测试

Jiaqi Yan, Ruilong Ren, Jingren Liu, Shuning Xu, Ling Wang, Yiheng Wang, Xinlin Zhong, Yun Wang, Long Zhang, Xiangyu Chen, Changzhi Sun, Jixiang Luo, Dell Zhang, Hao Sun, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态评测 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 TeleEgo是一个用于评估第一人称AI助手在真实场景中多模态处理能力的基准测试,通过长持续时间流媒体数据和严格评估指标,推动未来具有更强流媒体记忆能力的助手发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09080 2025-12-05 cs.AI 70%

BioAnalyst: A Foundation Model for Biodiversity

BioAnalyst: 一种用于生物多样性的基础模型

Athanasios Trantas, Martino Mensio, Stylianos Stasinos, Sebastian Gribincea, Taimur Khan, Damian Podareanu, Aliene van der Veen

机构 * Nederlandse Organisatie voor Toegepast Natuurwetenschappelijk Onderzoek – TNO(荷兰应用自然科学研究院 – TNO) Eindhoven University of Technology(埃因霍温理工大学) Amazon(亚马逊) University of Groningen(格罗宁根大学) Helmholtz Center for Environmental Research – UFZ(环境研究赫尔姆霍茨中心 – UFZ) SURF

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 BioAnalyst是一种针对生物多样性分析和保护规划的多模态基础模型,通过预训练和微调实现物种分布建模和生态预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 70%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01300 2025-12-02 cs.AI 70%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏