arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 11 篇

2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 6 篇

2510.13515 2025-12-09 cs.CV cs.AI 88%

UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

UniME-V2:基于大规模语言模型的通用多模态嵌入学习判别器

Tiancheng Gu, Kaicheng Yang, Kaichen Zhang, Xiang An, Ziyong Feng, Yueyi Zhang, Weidong Cai, Jiankang Deng, Lidong Bing

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 UniME-V2利用大规模语言模型提升通用多模态嵌入学习的判别能力,通过引入MLLM-as-a-Judge机制和重排序模型实现更高效的负样本挖掘和语义匹配。

Comments AAAI2026 Oral, Webpage:https://garygutc.github.io/UniME-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 85%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07216 2025-12-09 cs.IR cs.LG 78%

MUSE: A Simple Yet Effective Multimodal Search-Based Framework for Lifelong User Interest Modeling

MUSE:一种简单而有效的基于多模态搜索的终身用户兴趣建模框架

Bin Wu, Feifan Yang, Zhangming Chan, Yu-Ran Gu, Jiawei Feng, Chao Yi, Xiang-Rong Sheng, Han Zhu, Jian Xu, Mang Ye, Bo Zheng

机构 * Wuhan University(武汉大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MUSE通过简单有效的多模态搜索框架,实现超长用户行为序列建模,提升推荐系统指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06449 2025-12-09 cs.IR 78%

Enhancing Medical Cross-Modal Hashing Retrieval using Dropout-Voting Mixture-of-Experts Fusion

通过Dropout投票混合专家融合增强医学跨模态哈希检索

Jaewon Ahn, Woosung Jang, Beakcheol Jang

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 本文提出MCMFH模型,通过Dropout投票和混合专家融合提升医疗跨模态哈希检索的准确性和效率。

Comments 5 pages, 1 figure, workshop paper (MMGenSR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06105 2025-12-09 cs.CV cs.AI 62%

Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation

基于对比学习和大语言模型的可解释性黑色素瘤诊断

Junwen Zheng, Xinran Xu, Li Rong Wang, Chang Cai, Lucinda Siyun Tan, Dingyuan Wang, Hong Liang Tey, Xiuyi Fan

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于对比学习和大语言模型的可解释性黑色素瘤诊断框架,通过将临床标准映射到视觉Transformer空间,实现图像与临床解释的透明连接,提升模型可解释性与临床信任度。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07807 2025-12-09 cs.CV cs.GR 57%

Lang3D-XL: Language Embedded 3D Gaussians for Large-scale Scenes

Lang3D-XL: 语言嵌入的3D高斯用于大规模场景

Shai Krakovsky, Gal Fiebelman, Sagie Benaim, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 Lang3D-XL通过引入语言嵌入的3D高斯表示,提升大规模场景的语义理解和交互效率,优于现有方法。

Comments Accepted to SIGGRAPH Asia 2025. Project webpage: https://tau-vailab.github.io/Lang3D-XL

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 14 篇

2512.06020 2025-12-09 cs.CV cs.AI 84%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07166 2025-12-09 cs.CV 83%

When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing

当隐私与恢复相遇: surrogate驱动的隐私保护在MLLM编辑中的被忽视的一半

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SPPE数据集和统一方法,通过引导生成任务实现隐私恢复,平衡隐私保护与MLLM可用性。

Comments 9 pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 83%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 83%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07184 2025-12-09 cs.LG 82%

UniDiff: A Unified Diffusion Framework for Multimodal Time Series Forecasting

UniDiff: 一种用于多模态时间序列预测的统一扩散框架

Da Zhang, Bingyu Li, Zhuyuan Zhao, Junyu Gao, Feiping Nie, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安710072,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 UniDiff提出了一种统一的扩散框架,通过融合文本和时间戳信息,提升多模态时间序列预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV 79%

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 多模态生成 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV 57%

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01302 2025-12-09 cs.CV 57%

DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy

DCText: 通过分而治之策略实现视觉文本生成的调度注意力遮罩

Jaewoo Song, Jooyoung Choi, Kanghyun Baek, Sangyub Lee, Daemin Park, Sungroh Yoon

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 DCText通过分而治之策略和注意力遮罩技术,实现高效视觉文本生成,提升长文本和多文本处理能力,同时保持图像质量和生成效率。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20415 2025-12-09 cs.CV 57%

MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

魔法城:基于语言的美学自适应城市生成与可控3D资产和布局

Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05757 2025-12-09 cs.AI 57%

Hyperbolic Large Language Models

双曲大语言模型

Sarang Patil, Zeyong Zhang, Yiran Huang, Tengfei Ma, Mengjia Xu

机构 * Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院) Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出双曲大语言模型,通过双曲几何提升语义表示学习和多尺度推理能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07341 2025-12-09 cs.CV 57%

DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation

DCoAR: 一种深度概念注入到统一自回归模型中用于个性化文本到图像生成

Fangtai Wu, Mushui Liu, Weijie He, Zhao Wang, Yunlong Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DCoAR通过深度概念注入框架实现个性化文本到图像生成,采用LMCL策略和多正则化方案提升生成质量与上下文适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01627 2025-12-09 cs.CV 57%

JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model

JambaTalk: 基于混合Transformer-Mamba模型的语音驱动3D说话人脸生成

Farzaneh Jafari, Stefano Berretti, Anup Basu

机构 * University of Alberta, Multimedia Research Center (MRC)(阿尔伯塔大学多媒体研究中心) University of Florence, Media Integration and Communication Center (MICC)(佛罗伦萨大学媒体整合与通信中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 JambaTalk基于混合Transformer-Mamba模型,通过多模态整合实现语音驱动的3D说话人脸生成,实验表明其性能可与当前最先进模型相当。

Comments 23 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17482 2025-12-09 cs.RO 50%

Variational Shape Inference for Grasp Diffusion on SE(3)

变分形状推断用于SE(3)上的抓取扩散

S. Talha Bukhari, Kaivalya Agrawal, Zachary Kingston, Aniket Bera

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种基于变分形状推断的SE(3)抓取扩散框架,通过隐式神经表示训练自编码器并引导扩散模型,实现鲁棒的多模态抓取合成,实验显示在ACRONYM数据集上性能提升6.3%并具备零样本迁移能力。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 17 篇

2512.06921 2025-12-09 cs.CV cs.AI cs.CL 85%

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18991 2025-12-09 cs.CL 84%

Surveying the MLLM Landscape: A Meta-Review of Current Surveys

测绘MLLM景观:当前调研的元综述

Ming Li, Keyu Chen, Ziqian Bi, Ming Liu, Xinyuan Song, Zekun Jiang, Tianyang Wang, Benji Peng, Qian Niu, Junyu Liu, Jinlang Wang, Sen Zhang, Xuanhe Pan, Jiawei Xu, Pohsun Feng

机构 * Georgia Institute of Technology(佐治亚理工学院) Indiana University(印第安纳大学) Purdue University(普渡大学) Emory University(埃默里大学) Sichuan University(四川大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) AppCubic Kyoto University(京都大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rutgers University(罗格斯大学) National Taiwan Normal University(台湾师范大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract,comments);分类 cs.CL

AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。

Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17397 2025-12-09 cs.CV 83%

MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality Assessment

MCMoE:基于专家混合的缺失模态补全用于不完整多模态动作质量评估

Huangbiao Xu, Huanqi Wu, Xiao Ke, Junyi Wu, Rui Xu, Jinglin Xu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MCMoE通过专家混合方法解决多模态动作质量评估中缺失模态的问题,实现单阶段训练下的多模态学习和生成。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 81%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06814 2025-12-09 cs.CL cs.AI 81%

CAuSE: Decoding Multimodal Classifiers using Faithful Natural Language Explanation

CAuSE:利用忠实的自然语言解释解码多模态分类器

Dibyanayan Bandyopadhyay, Soham Bhattacharjee, Mohammed Hasanuzzaman, Asif Ekbal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳瓦分校) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CAuSE提出了一种生成多模态分类器忠实自然语言解释的新框架,通过因果抽象和交换干预提升解释的因果忠实性,并在多模态设置中验证其有效性。

Comments Accepted at Transactions of the Association for Computational Linguistics (TACL). Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 79%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV 79%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 73%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07385 2025-12-09 cs.CV 72%

How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline

现代追踪器距离无人机-反无人机还有多远?一个百万级基准和新基线

Chunhui Zhang, Li Liu, Zhipeng Zhang, Yong Wang, Hao Wen, Xi Zhou, Shiming Ge, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) CloudWalk Technology Co., Ltd(云walk科技有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空宇航学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(abstract,comments);multi-modal(abstract);分类 cs.CV

AI总结 本文提出UAV-Anti-UAV多模态追踪任务及MambaSTS基线方法,通过百万级数据集验证了现有追踪算法在无人机反无人机领域的改进空间。

Comments https://github.com/983632847/Awesome-Multimodal-Object-Tracking

详情

展开后加载摘要…

URL PDF HTML 收藏