arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2606.01837 2026-06-02 cs.CR 82%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01047 2026-06-02 cs.RO 82%

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation

学习多模态轨迹策略以实现数据高效的机器人操作

Zijia Chen, Yuenan Hou, Xinhua Jiang, Yu Li, Weijie Li, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学学院,国防科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 针对机器人操作中数据稀缺导致的多模态干扰问题,提出基于混合专家模型的多模态轨迹预测框架MATE,通过细粒度子令牌特征解耦和跨模态余弦路由器实现稳定专家分配,在LIBERO基准和真实乒乓球实验中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10012 2026-05-26 cs.LG 82%

PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning

PID引导的多模态去中心化联邦学习部分对齐

Yanhang Shi, Xiaoyu Wang, Houwei Cao, Jian Li, Yong Liu

机构 * Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Applied Mathematics and Statistics and the Department of Computer Science, Stony Brook University(石溪大学应用数学与统计系和计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) Department of Computer Science, New York Institute of Technology(纽约理工学院计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态去中心化联邦学习中异构代理间更新不兼容的问题,提出基于部分信息分解的PARSE框架,通过特征分裂和部分对齐实现高效通信与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22868 2026-05-25 cs.LG 82%

FusionSense: Tri-Stage Near-Sensor Learning for Runtime-Adaptive Multimodal Edge Intelligence

FusionSense: 用于运行时自适应多模态边缘智能的三阶段近传感器学习

Sanggeon Yun, Ryozo Masukawa, Minhyoung Na, Hyunwoo Oh, Yoshiki Yamaguchi, Wenjun Huang, SungHeon Jeong, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(韩国国民大学) Shibaura Institute of Technology(武藏技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出FusionSense框架,通过三阶段训练(服务器端融合模型学习、过滤安全标签量化模态必要性、边缘融合模型压缩)实现近传感器分类器,在保持任务质量的同时大幅降低能耗和数据传输。

Comments Accepted to ISLPED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14650 2026-05-15 eess.SP 82%

Multimodal Learning for MIMO Beam Prediction Based on Variational Inference

基于变分推断的多模态学习用于MIMO波束预测

Zijian Zheng, Wenqiang Yi, Hyundong Shin, Arumugam Nallanathan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于变分推断的多模态框架,通过模块化特征提取和跨模态语义对齐提升MIMO波束预测精度,实验表明其在仅使用20%多模态数据的情况下表现优异。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03800 2026-05-14 q-bio.BM 82%

STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding

STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型

Hongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract)

AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 82%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06460 2026-05-08 cs.LG 82%

MINER: Mining Multimodal Internal Representation for Efficient Retrieval

MINER:挖掘多模态内部表示以实现高效检索

Weien Li, Rui Song, Zeyu Li, Haochen Liu, Gonghao Zhang, Difan Jiao, Zhenwei Tang, Bowei He, Haolun Wu, Xue Liu, Ye Yuan

机构 * McGill University(麦吉尔大学) MIT - Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩洛哥 bin Zayed 大学人工智能学院) Mila - Quebec AI Institute(Mila - 加拿大魁北克人工智能研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出MINER,通过挖掘Transformer各层内部表示,融合多模态信号生成紧凑嵌入,提升检索性能,优于现有单向量检索器并在部分设置中缩小与晚交互基线的差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06073 2026-05-08 cs.LG 82%

PRISM: Iterative Cross-Modal Posterior Refinement for Dynamic Text-Attributed Graphs

PRISM:动态文本属性图的迭代跨模态后验细化

Trimble Chang, Yihang Liu, Mingjing Han, Han Zhang

机构 * College of Artificial Intelligence(人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 PRISM通过迭代跨模态后验细化方法,提升动态文本属性图的表示学习能力,有效捕捉节点语义与交互行为的动态依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26181 2026-05-04 cs.LG 82%

SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations

SWAN:面向运行时变化的世界感知自适应多模态网络

Jason Wu, Shir-Kang Scott Jin, Yuyang Yuan, Maggie Wigness, Lance M. Kaplan, Hang Qiu, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Riverside(加州大学河滨分校) U.S. Army DEVCOM Army Research Laboratory(美国陆军 DEVCOM 军事研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 SWAN是一种新型多模态网络,通过动态资源分配和效率优化,在自动驾驶中实现复杂3D检测任务,减少49%的FLOPs并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06883 2026-04-28 cs.IR 82%

Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation

大型视觉语言模型的结构和解耦适应用于多模态推荐

Zhongtao Rao, Peilin Zhou, Dading Chong, Zhiwei Chen, Shoujin Wang, Nan Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。

Comments Accepted to SIGIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12424 2026-04-15 cs.CL cs.AI cs.CV 82%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10404 2026-04-14 cs.ET cs.LG 82%

Sense Less, Infer More: Agentic Multimodal Transformers for Edge Medical Intelligence

感知更少,推断更多:面向边缘医疗智能的代理多模态变压器

Chengwei Zhou, Zhaoyan Jia, Haotian Yu, Xuming Chen, Brandon Lee, Christopher Pulliam, Steve Majerus, Massoud Pedram, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出AMI框架,通过代理多模态变压器在边缘设备上实现高效医疗监测,在减少传感器使用的同时提升诊断准确性。

Comments 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02771 2026-04-06 cs.CR 82%

ContractShield: Bridging Semantic-Structural Gaps via Hierarchical Cross-Modal Fusion for Multi-Label Vulnerability Detection in Obfuscated Smart Contracts

ContractShield:通过层次交叉模态融合弥合语义-结构差距以实现多标签漏洞检测

Minh-Dai Tran-Duong, Nguyen Hai Phong, Nguyen Chi Thanh, Doan Minh Trung, Tram Truong-Huu, Van-Hau Pham, Phan The Duy

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 ContractShield通过三级融合机制有效关联多互补特征,提升智能合约漏洞检测鲁棒性,实现89%的Hamming得分和五种主要漏洞类型的91%F1-score。

Comments 9 figures, 8 tables, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29211 2026-04-01 cs.AI cs.CL cs.CV 82%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27852 2026-03-31 quant-ph 82%

A Resource-Aligned Hybrid Quantum-Classical Framework for Multimodal Face Anti-Spoofing

一种资源对齐的混合量子-经典框架用于多模态面部防伪

Wanqi Sun, Jungang Xu, Chenghua Duan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种混合MPS-VQC框架,通过结构化预量子压缩模块和量子分类器,有效处理多模态面部防伪问题,实现参数高效和资源优化。

Comments Under review at Quantum Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11331 2026-03-27 cs.IT math.IT 82%

AMBER: An Adaptive Multimodal Mask Transformer for Beam Prediction with Missing Modalities

AMBER: 一种自适应多模态掩码变换器用于缺失模态的波束预测

Chenyiming Wen, Binpu Shi, Min Li, Ming-Min Zhao, Min-Jian Zhao, Jiangzhou Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 AMBER通过自适应处理多模态数据中的缺失模态问题,提升波束预测的鲁棒性和准确性,实验表明其在真实世界数据集上优于现有多模态学习基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23004 2026-03-27 cs.LG 82%

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练

Kyle R. Chickering, Bangzheng Li, Muhao Chen

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。

Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21612 2026-03-24 cs.LG 82%

Towards Multimodal Time Series Anomaly Detection with Semantic Alignment and Condensed Interaction

迈向多模态时间序列异常检测的语义对齐与压缩交互

Shiyan Hu, Jianxin Jin, Yang Shu, Peng Chen, Bin Yang, Chenjuan Guo

机构 * East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MindTS模型,通过语义对齐和压缩交互解决多模态时间序列异常检测中的关键问题,实验表明其性能优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12743 2026-03-16 cs.CV cs.AI cs.CL 82%

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

MoKus: 利用跨模态知识迁移实现知识感知的概念定制

Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

机构 * Tsinghua University(清华大学) HKUST(香港科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MoKus框架,通过跨模态知识迁移实现知识感知的概念定制,解决稀有token在预训练数据中缺失导致的性能不稳定问题,并引入KnowCusBench基准测试,验证了方法在概念定制任务中的优越性。

Comments Project Page: https://chenyangzhu1.github.io/MoKus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08459 2026-03-10 cs.LG 82%

Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data

数据驱动先验用于多模态数据的不确定性感知退化风险预测

L. Julián Lechuga López, Tim G. J. Rudner, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) University of Toronto(多伦多大学) Tandon School of Engineering, New York University(纽约大学工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MedCertAIn框架,通过数据驱动的先验方法提升多模态临床数据中风险预测的准确性和不确定性量化能力。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 82%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22695 2026-03-06 cs.DC 82%

Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference

模态膨胀:MLLM推理的能量特性与优化机会

Mona Moghadampanah, Adib Rezaei Shahmirzadi, Farhana Amin, Dimitrios S. Nikolopoulos

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 本文研究了多模态大语言模型推理中的能量特性与优化机会,发现模态膨胀导致额外能耗,并提出阶段级DVFS优化方法以提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG 82%

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP 82%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 82%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04755 2026-02-13 cs.CV cs.AI cs.MM 82%

Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning

少量数据中的真实性:为高效多模态推理选择高价值数据

Shenshen Li, Xing Xu, Kaiyuan Deng, Lei Wang, Heng Tao Shen, Fumin Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Computer Science and Engineering(计算机科学与工程学院) Tongji University(同济大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出RAP方法,通过识别高价值认知样本和替换平凡实例,有效提升多模态推理效率,仅用9.3%训练数据即可实现性能超越。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02172 2026-02-12 cs.CV cs.AI cs.MM 82%

GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting

GaussianCross: 通过高斯点撒技术实现跨模态自监督3D表示学习

Lei Yao, Yi Wang, Yi Zhang, Moyun Liu, Lap-Pui Chau

机构 * Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 GaussianCross通过高斯点撒技术实现跨模态自监督3D表示学习,提升3D点云的表示质量和泛化能力。

Comments 14 pages, 8 figures, accepted by MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09445 2026-02-11 cs.IR 82%

Personalized Parameter-Efficient Fine-Tuning of Foundation Models for Multimodal Recommendation

面向多模态推荐的个性化参数高效微调

Sunwoo Kim, Hyunjin Hwang, Kijung Shin

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文提出PerPEFT,一种面向多模态推荐的个性化参数高效微调策略,通过按兴趣分组并为每个组分配独立模块,提升推荐效果。

Comments To be published at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05646 2026-02-06 cs.LG 82%

Empowering Time Series Analysis with Large-Scale Multimodal Pretraining

通过大规模多模态预训练增强时间序列分析

Peng Chen, Siyuan Wang, Shiyan Hu, Xingjian Wu, Yang Shu, Zhongwen Rao, Meng Wang, Yijie Li, Bin Yang, Chenjuan Guo

机构 * East China Normal University, Shanghai, China(华东师范大学) HuaWei, ShenZhen, China(华为,深圳,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文提出HORAI模型,通过多模态预训练提升时间序列分析的泛化能力,实现零样本预测和异常检测的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏