arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2602.03815 2026-02-04 cs.CV cs.LG 79%

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 79%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11442 2026-02-04 cs.CV 79%

MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder

MultiMAE用于脑部MRI:通过多模态掩码自编码器提高对缺失输入的鲁棒性

Ayhan Can Erdur, Christian Beischl, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(辐射肿瘤科,技术大学慕尼黑医院,慕尼黑,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(医疗与医学人工智能教研室,技术大学慕尼黑(TUM)) TUM University Hospital, Munich, Germany(技术大学慕尼黑医院,慕尼黑,德国) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(图像引导诊断与治疗人工智能教研室,技术大学慕尼黑(TUM)) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑合作伙伴站点,慕尼黑,德国) Institute of Radiation Medicine (IRM), Department of Radiation Sciences (DRS), Helmholtz Center Munich, Munich, Germany(辐射医学研究所(IRM),辐射科学部门(DRS),慕尼黑海德堡中心,慕尼黑,德国)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 MultiMAE通过多模态掩码自编码器提升脑部MRI在缺失输入下的鲁棒性,实现分割和分类任务的性能提升。

Comments Official implementation: https://github.com/chris-beischl/multimae-for-brain-mri

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01954 2026-02-03 cs.CV 79%

Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images

超越开放词汇:面向遥感图像的目标检测多模态提示

Shuai Yang, Ziyue Huang, Jiaxin Chen, Qingjie Liu, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01833 2026-02-03 cs.MM 79%

Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis

多模态情感分析中缺失模态的解耦专家混合方法

Xiang Li, Xiaoming Zhang, Dezhuang Miao, Xianfu Cheng, Dawei Li, Honggui Han, Zhoujun Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 DERL通过解耦专家和多层次重建策略,提升多模态情感分析在缺失模态下的鲁棒性和表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 79%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22729 2026-02-02 cs.CV 79%

GaussianOcc3D: A Gaussian-Based Adaptive Multi-modal 3D Occupancy Prediction

GaussianOcc3D: 一种基于高斯的自适应多模态3D占用预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥祖根大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 GaussianOcc3D通过高斯表示实现多模态3D占用预测,提升自动驾驶环境感知的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17564 2026-02-02 eess.IV cs.CV cs.LG 79%

ModalTune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-task Learning in Digital Pathology

ModalTune: 通过多模态信息细调滑片级基础模型以实现数字病理学中的多任务学习

Vishwesh Ramanathan, Tony Xu, Pushpak Pati, Faruk Ahmed, Maged Goubran, Anne L. Martel

机构 * Sunnybrook Research Institute(辛普森布鲁斯研究所在) University of Toronto(多伦多大学) Google Research(谷歌研究)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalTune通过引入多模态信息和大型语言模型,实现数字病理学中多任务学习的统一细调框架,提升癌症生存和亚型预测性能。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21673 2026-01-30 cs.CV 79%

Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification

多模态视觉代理压缩用于阿尔茨海默病分类

Dexuan Ding, Ciyuan Peng, Endrowednes Kuantama, Jingcai Guo, Jia Wu, Jian Yang, Amin Beheshti, Ming-Hsuan Yang, Yuankai Qi

机构 * Macquarie University(麦考瑞大学) Federation University Australia(联邦大学澳大利亚) The Hong Kong Polytechnic University(香港理工大学) University of California at Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MVSC通过压缩和适应大尺寸3D sMRI体积为紧凑的2D视觉代理,提升阿尔茨海默病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21453 2026-01-30 cs.AI 79%

LION: A Clifford Neural Paradigm for Multimodal-Attributed Graph Learning

LION: 一种基于克莱因代数的多模态属性图学习神经范式

Xunkai Li, Zhengyu Wu, Zekai Chen, Henan Sun, Daohan Su, Guang Zeng, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 LION基于克莱因代数和解耦图神经范式,通过几何诱导的高阶图传播实现模态交互,结合自适应全息聚合模块提升多模态属性图学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 79%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20305 2026-01-29 cs.AI 79%

Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models

内生再提示:面向统一多模态模型的自进化认知对齐

Zhenchen Tang, Songlin Yang, Zichuan Wang, Bo Peng, Yang Li, Beibei Dong, Jing Dong

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 内生再提示通过自进化框架提升统一多模态模型的认知对齐能力,有效解决生成过程引导问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 79%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 79%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05855 2026-01-26 cs.CV 79%

Decoupling Multi-Contrast Super-Resolution: Self-Supervised Implicit Re-Representation for Unpaired Cross-Modal Synthesis

解耦多对比超分辨率:自监督隐式重表示用于无配对跨模态合成

Yinzhe Wu, Hongyu Rui, Fanwen Wang, Jiahao Huang, Zhenxuan Zhang, Haosen Zhang, Zi Wang, Guang Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了解耦多对比超分辨率框架,通过自监督隐式重表示实现无配对跨模态合成,提升极端尺度下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15734 2026-01-23 cs.CV 79%

Sub-Region-Aware Modality Fusion and Adaptive Prompting for Multi-Modal Brain Tumor Segmentation

子区域感知模态融合与自适应提示的多模态脑肿瘤分割

Shadi Alijani, Fereshteh Aghaee Meibodi, Homayoun Najjaran

机构 * University of Victoria, BC, Canada(维多利亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出子区域感知模态融合与自适应提示方法,提升多模态脑肿瘤分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14448 2026-01-22 cs.CV 79%

Gaussian Based Adaptive Multi-Modal 3D Semantic Occupancy Prediction

基于高斯的自适应多模态3D语义占位预测

A. Enes Doruk

机构 * Abdullah Enes Doruk (2025)(Abdullah Enes Doruk)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于高斯的自适应多模态3D语义占位预测模型,通过高效3D高斯模型融合相机与激光雷达数据,提升自动驾驶安全性能。

Comments Master Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13331 2026-01-21 cs.CV cs.LG 79%

MultiST: A Cross-Attention-Based Multimodal Model for Spatial Transcriptomic

MultiST: 一种基于交叉注意力的多模态模型用于空间转录组

Wei Wang, Quoc-Toan Ly, Chong Yu, Jun Bai

机构 * Department of Computer Science, University of Cincinnati(计算机科学系,辛辛那提大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MultiST通过基于交叉注意力的多模态融合方法,实现了对空间转录组数据中空间拓扑、基因表达和组织形态的联合建模,提升了空间域边界解析的准确性和生物解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12994 2026-01-21 cs.CV 79%

AsyncBEV: Cross-modal Flow Alignment in Asynchronous 3D Object Detection

AsyncBEV: 无感异步3D目标检测中的跨模态流对齐

Shiming Wang, Holger Caesar, Liangliang Nan, Julian F. P. Kooij

专题命中 多模态训练与对齐 :cross-modal(title);multi-modal(abstract);分类 cs.CV

AI总结 AsyncBEV通过跨模态流对齐提升3D目标检测在传感器异步情况下的鲁棒性,尤其在动态物体识别中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11885 2026-01-21 cs.AI 79%

MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment

MyGram: 多模态实体对齐的模态感知图变换器与全局分布

Zhifei Li, Ziyue Qin, Xiangyu Luo, Xiaoju Hou, Yue Zhao, Miao Zhang, Zhifang Huang, Kui Xiao, Bing Yang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 MyGram通过模态感知图变换器与全局分布机制,提升多模态实体对齐的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10092 2026-01-16 cs.LG cs.AI 79%

LeMoF: Level-guided Multimodal Fusion for Heterogeneous Clinical Data

LeMoF:面向异构临床数据的层级引导多模态融合

Jongseok Kim, Seongae Kang, Jonghwan Shin, Yuhan Lee, Ohyun Jo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 LeMoF通过层级引导的多模态融合方法,在异构临床数据中提升预测稳定性与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08503 2026-01-14 cs.LG cs.AI 79%

Temporal Fusion Nexus: A task-agnostic multi-modal embedding model for clinical narratives and irregular time series in post-kidney transplant care

时间融合 nexus:一种任务无关的多模态嵌入模型,用于术后肾移植护理中的临床叙述和不规则时间序列

Aditya Kumar, Simon Rauch, Mario Cypko, Marcel Naik, Matthieu-P Schapranow, Aadil Rashid, Fabian Halleck, Bilgin Osmanodja, Roland Roller, Lars Pape, Klemens Budde, Mario Schiffer, Oliver Amft

机构 * Hahn-Schickard(哈恩-施克特德研究所) University of Freiburg(弗赖堡大学) Charité University Medical Center(查理医院大学医学中心) Hasso Plattner Institute for Digital Engineering, University of Potsdam(哈索·platner数字工程研究所,波茨坦大学) DFKI(德意志联邦防务研究院) University Hospital Essen(埃森大学医院) University Hospital Erlangen(埃尔兰根大学医院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 TFN是一种多模态嵌入模型,通过整合临床文本和不规则时间序列数据,在术后肾移植护理中提高了移植物丢失、排斥和死亡预测的性能。

Comments 31 pages, 9 figures, 3 tables. A supplementary file is also available

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07856 2026-01-14 quant-ph cs.AI cs.LG 79%

Feature Entanglement-based Quantum Multimodal Fusion Neural Network

基于特征纠缠的量子多模态融合神经网络

Yu Wu, Qianli Zhou, Jie Geng, Xinyang Deng, Wen Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于特征纠缠的量子多模态融合神经网络,通过量子计算框架解决多模态学习中的精度、可解释性和复杂性矛盾,实现高效且可解释的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01939 2026-01-13 cs.AI 79%

OpenSocInt: A Multi-modal Training Environment for Human-Aware Social Navigation

OpenSocInt: 一种多模态训练环境用于人感知的社会导航

Victor Sanchez, Chris Reinke, Ahamed Mohamed, Xavier Alameda-Pineda

机构 * Inria at Univ. Grenoble Alpes, LJK, CNRS(Inria与格勒诺布尔阿尔卑斯大学、LJK、CNRS)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 OpenSocInt是一个开源多模态训练环境,用于研究人感知的社会导航,支持不同感知特征的编码与融合以及多种代理的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00521 2026-01-13 cs.LG cs.CL q-bio.QM 79%

Rep3Net: An Approach Exploiting Multimodal Representation for Molecular Bioactivity Prediction

Rep3Net:一种利用多模态表示进行分子生物活性预测的方法

Sabrina Islam, Md. Atiqur Rahman, Md. Bakhtiar Hasan, Md. Hasanul Kabir

机构 * Computer Science and Engineering, Islamic University of Technology, Bangladesh(计算机科学与工程,伊斯兰技术大学,孟加拉国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 Rep3Net通过融合分子描述符、图特征和SMILES嵌入,提升了PARP1生物活性预测的准确性,并在药物发现中展示了高效能的多模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 79%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12195 2026-01-13 cs.CL 79%

Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion

浏览与聚焦:通过先验LLM上下文融合理解多模态内容

Ziyue Wang, Chi Chen, Yiqi Zhu, Fuwen Luo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出浏览与聚焦两阶段范式,通过融合先验LLM上下文提升多模态内容理解,显著提升多图像场景的性能。

Comments 17 pages, 5 figures

Journal ref ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14329 2026-01-12 cs.MM 79%

TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis

具有缺失模态的文本增强融合Mamba用于鲁棒多模态情感分析

Xiang Li, Xianfu Cheng, Dezhuang Miao, Xiaoming Zhang, Zhoujun Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 TF-Mamba通过文本增强融合框架,有效处理多模态情感分析中缺失模态的问题,提升模型鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04736 2026-01-09 cs.CL 79%

AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03296 2026-01-09 cs.CL cs.LG 79%

Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling

通过政策对齐推理和分层标注实现可信的多模态审核

Anqi Li, Wenwei Jin, Jintao Tong, Pengda Qin, Weijia Li, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 Hi-Guard通过政策对齐推理和分层标注提升多模态审核的准确性、泛化性和可解释性。

Comments Accepted by KDD 2026. Code is available at https://github.com/lianqi1008/Hi-Guard

详情

展开后加载摘要…

URL PDF HTML 收藏