arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2508.17215 2026-01-06 cs.LG cs.AI cs.CR 85%

How to make Medical AI Systems safer? Simulating Vulnerabilities, and Threats in Multimodal Medical RAG System

如何使医疗AI系统更安全?在多模态医疗RAG系统中模拟漏洞和威胁

Kaiwen Zuo, Zelin Liu, Raman Dutt, Ziyang Wang, Zhongtian Sun, Fan Mo, Pietro Liò

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出MedThreatRAG框架,通过模拟攻击环境揭示医疗RAG系统漏洞,展示跨模态冲突注入对系统性能的严重影响。

Comments Sumbitted to 2026 ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 84%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02565 2026-01-06 cs.CV 79%

SJTU:Spatial judgments in multimodal models towards unified segmentation through coordinate detection

上海交通大学:通过坐标检测实现多模态模型中的空间判断以实现统一分割

Joongwon Chae, Zhenyu Wang, Peiwu Qin

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 SJTU通过坐标检测实现多模态模型中的空间判断,提升图像分割的准确性和实用性。

Comments A flaw was discovered in the experimental setup. Therefore, we are retracting the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV 77%

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 70%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09385 2026-01-06 cs.CV 70%

Towards Vision-Language Geo-Foundation Model: A Survey

迈向视觉-语言地理基础模型:一种综述

Yue Zhou, Zhihang Zhong, Xue Yang

机构 * School of GeoAI(地理人工智能学院) Hindon STAI Institute(Hindon STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室) East China Normal University(华东师范大学) School of AI(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文综述了视觉-语言地理基础模型(VLGFMs),探讨其背景、核心技术和应用,旨在构建具备多样化地理感知能力的智能模型。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 67%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 62%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 62%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2412.05436 2026-01-06 cs.SD cs.MM eess.AS 81%

pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing

pyAMPACT:一种用于表演数据估计和多模态处理的评分-音频对齐工具包

Johanna Devaney, Daniel McKemie, Alex Morgan

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 pyAMPACT是一种用于表演数据估计和多模态处理的工具,通过符号与音频的对齐实现性能数据的估计及多模态分析

Comments Proceedings of the 2025 International Computer Music Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06372 2026-01-06 cs.SD cs.AI 79%

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21408 2026-01-06 cs.CV 57%

VALLR: Visual ASR Language Model for Lip Reading

VALLR:基于唇语的视觉ASR语言模型

Marshall Thomas, Edward Fish, Richard Bowden

机构 * University of Surrey(萨里大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 VALLR提出了一种两阶段的视觉ASR语言模型,通过音素序列预测和语言模型重构实现高效率和高精度的唇语识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09921 2026-01-06 cs.CV 57%

TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation

TalkingEyes: 多元化的语音驱动3D眼动动画

Yixiang Zhuang, Chunshan Ma, Yao Cheng, Xuan Cheng, Jing Liao, Juncong Lin

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Mobile (Hangzhou) Information Technology Co., Ltd.(中国移动(杭州)信息技术有限公司) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出TalkingEyes,通过语音驱动生成多样化且自然的3D眼动动画,结合头部和面部运动,解决语音与眼动弱相关性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2510.23506 2026-01-06 cs.AI cs.HC 83%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01322 2026-01-06 cs.CV cs.AI cs.LG cs.MM eess.IV 82%

LinMU: Multimodal Understanding Made Linear

LinMU: 使多模态理解线性化

Hongjie Wang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 79%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02206 2026-01-06 cs.CV cs.AI 62%

Seeing the Unseen: Zooming in the Dark with Event Cameras

看见不可见的:利用事件相机在黑暗中放大

Dachun Kai, Zeyu Xiao, Huyue Zhu, Jiaxiao Wang, Yueyi Zhang, Xiaoyan Sun

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RetinexEVSR通过事件驱动和Retinex先验知识提升低光视频超分辨率性能,实现高对比度细节恢复与低光伪影抑制。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17229 2026-01-06 cs.CV 57%

Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos

视频侦探:通过反复寻找关键线索来回答长视频中的问题

Henghui Du, Chunjie Zhang, Xi Chen, Chang Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) Renmin University of China(中国人民大学) AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) Tencent PCG(腾讯PCG)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01937 2026-01-06 cs.DB 50%

Vector Search for the Future: From Memory-Resident, Static Heterogeneous Storage, to Cloud-Native Architectures

向未来迈进的向量搜索:从内存驻留、静态异构存储到云原生架构

Yitong Song, Xuanhe Zhou, Christian S. Jensen, Jianliang Xu

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文从存储架构角度回顾了向量搜索技术的演变,涵盖内存驻留方法、异构存储技术及云原生系统的未来发展。

Comments Accepted as a tutorial at SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2509.25270 2026-01-06 cs.LG cs.AI cs.CV 81%

InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions

InfMasking:通过对比多模态交互释放协同信息

Liangjian Wen, Qun Dai, Jianzhuang Liu, Jiangtao Zheng, Yong Dai, Dongkai Wang, Zhao Kang, Jun Wang, Zenglin Xu, Jiang Duan

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) Engineering Research Center of Intelligent Finance Ministry of Education(教育部长智能金融工程研究中心) Shenzhen Institutes of Advanced Technology Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Electronic Science and Technology of China(电子科技大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute Fudan University(复旦大学人工智能创新与孵化院) Artificial Intelligence and Digital Finance Key Laboratory of Sichuan Province(四川省人工智能与数字金融重点实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 InfMasking通过无限遮蔽策略增强多模态协同信息提取,实现多模态表示学习中的协同信息优化与性能提升。

Comments Conference on Neural Information Processing Systems (NeurIPS) 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01718 2026-01-06 cs.AI 79%

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

YuanLab. ai, :, Shawn Wu, Sean Wang, Louie Li, Darcy Chen, Allen Wang, Jiangang Luo, Xudong Zhao, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Danied Zhao, Penn Zheng, Owen Zhu, Tong Yu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10393 2026-01-06 cs.SE cs.AI 79%

Cross-modal Retrieval Models for Stripped Binary Analysis

用于剥离二进制分析的跨模态检索模型

Guoqiang Chen, Lingyun Ying, Ziyang Song, Daguang Liu, Qiang Wang, Zhiqi Wang, Li Hu, Shaoyin Cheng, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) QI-ANXIN Technology Research Institute(QI-ANXIN技术研究所)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出BinSeek模型,通过两阶段跨模态检索框架实现对剥离二进制代码的高效检索,显著提升二进制代码与自然语言描述的相关性检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2601.02204 2026-01-06 cs.CV cs.AI 81%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01363 2026-01-06 cs.AI 79%

A unified multimodal understanding and generation model for cross-disciplinary scientific research

面向跨学科科学研究的统一多模态理解和生成模型

Xiaomeng Yang, Zhiyu Tan, Xiaohui Zhong, Mengping Yang, Qiusheng Huang, Lei Chen, Libo Wu, Hao Li

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 FuXi-Uni是一种统一多模态模型,能跨学科领域理解和生成科学数据,通过自然语言和科学数值预测提升跨学科研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG 78%

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01792 2026-01-06 cs.LG cs.AI cs.CL cs.SD 73%

HyperCLOVA X 8B Omni

HyperCLOVA X 8B Omni:首个支持文本、音频和视觉的任何到任何多模态模型

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI

AI总结 HyperCLOVA X 8B Omni是首个支持文本、音频和视觉的任何到任何多模态模型,通过统一的多模态处理实现高效且灵活的多模态交互。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 57%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17984 2026-01-06 cs.CV 57%

RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model

RS-vHeat:基于热传导的高效远程传感基础模型

Huiyang Hu, Peijin Wang, Hanbo Bi, Boyuan Tong, Zhaozhi Wang, Wenhui Diao, Hao Chang, Yingchao Feng, Ziqi Zhang, Yaowei Wang, Qixiang Ye, Kun Fu, Xian Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-vHeat通过热传导运算符和自监督策略,实现高效多模态遥感基础模型,提升效率和性能。

Comments 19 pages, 8 figures and 10 tables

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01507 2026-01-06 cs.CV 57%

DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation

DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测

Tao Li, Qing Li, Na Li, Hui Xie

机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01181 2026-01-06 cs.CV 57%

GenCAMO: Scene-Graph Contextual Decoupling for Environment-aware and Mask-free Camouflage Image-Dense Annotation Generation

GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成

Chenglizhao Chen, Shaojiang Yuan, Xiaoxue Lu, Mengke Song, Jia Song, Zhenyu Wu, Wenfeng Song, Shuai Li

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Southwest Jiaotong University(西南交通大学) Beijing Information Science and Technology University(北京信息科技大学) Beihang University(北航)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏