arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-30 至 2026-01-30 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2601.21517 2026-01-30 cs.CV 57%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 57%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04589 2026-01-30 cs.CV 57%

MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing

MiLDEdit: 基于推理的多层设计文档编辑

Zihao Lin, Wanrong Zhu, Jiuxiang Gu, Jihyung Kil, Christopher Tensmeyer, Lin Zhang, Shilong Liu, Ruiyi Zhang, Lifu Huang, Vlad I. Morariu, Tong Sun

机构 * University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司) UW-Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 57%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21524 2026-01-30 eess.SP 50%

Channel Extrapolation for MIMO Systems with the Assistance of Multi-path Information Induced from Channel State Information

利用通道状态信息诱导的多路径信息进行MIMO系统的通道外推

Yuan Gao, Xinyi Wu, Jiang Jun, Zitian Zhang, Zhaohui Yang, Shugong Xu, Cheng-Xiang Wang, Zhu Han

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于多路径信息的通道外推框架,利用CSI诱导的PDP特征提升6G网络中CSI获取的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17138 2026-01-30 q-bio.BM 50%

AI Developments for T and B Cell Receptor Modeling and Therapeutic Design

人工智能在T细胞和B细胞受体建模及治疗设计中的发展

Linhui Xie, Aurelien Pelissier, Yanjun Shao, Maria Rodriguez Martinez

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究利用人工智能技术,通过预测和生成框架改进T和B细胞受体建模,提升治疗设计的效率和临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 16 篇

2601.22155 2026-01-30 cs.CV cs.CL 84%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 84%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21342 2026-01-30 cs.AI 83%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15260 2026-01-30 cs.CV 79%

DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration

DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集

Dominik Rößle, Xujun Xie, Adithya Mohan, Venkatesh Thirugnana Sambandham, Daniel Cremers, Torsten Schön

机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。

Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV 79%

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21829 2026-01-30 cs.RO 78%

GAZELOAD A Multimodal Eye-Tracking Dataset for Mental Workload in Industrial Human-Robot Collaboration

GAZELOAD:用于工业人机协作中心理负荷的多模态眼动数据集

Bsher Karbouj, Baha Eddin Gaaloul, Jorg Kruger

机构 * Department of industrial Automation Technology TU Berlin(工业自动化技术系 柏林技术大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 GAZELOAD数据集通过多模态眼动数据支持工业人机协作中心理负荷的估计与分析,包含眼动信号、环境数据及自我报告评分,用于算法开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21479 2026-01-30 cs.CV 74%

Hypernetwork-Based Adaptive Aggregation for Multimodal Multiple-Instance Learning in Predicting Coronary Calcium Debulking

基于超网络的自适应聚合用于多模态多实例学习在预测冠状动脉钙化去除中的应用

Kaito Shiku, Ichika Seo, Tetsuya Matoba, Rissei Hino, Yasuhiro Nakano, Ryoma Bise

机构 * Department of Advanced Information Technology, Kyushu University(九州大学先进信息技术系) Department of Cardiovascular Medicine, Kyushu University(九州大学心血管医学系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出HyperAdAgFormer,通过超网络自适应聚合策略,用于多模态多实例学习预测冠状动脉钙化去除的必要性。

Comments Accepted to ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20847 2026-01-30 cs.CV cs.AI 62%

A New Dataset and Framework for Robust Road Surface Classification via Camera-IMU Fusion

基于相机-IMU融合的新型数据集与道路表面分类框架

Willams de Lima Costa, Thifany Ketuli Silva de Souza, Jonas Ferreira Silva, Carlos Gabriel Bezerra Pereira, Bruno Reis Vila Nova, Leonardo Silvino Brito, Rafael Raider Leoni, Juliano Silva Filho, Valter Ferreira, Sibele Miguel Soares Neto, Samantha Uehara, Daniel Giacometti Amaral, João Marcelo Teixeira, Veronica Teichrieb, Cristiano Coelho de Araújo

机构 * Voxar Labs(Voxar实验室) Centro de Informática(计算机中心) Universidade Federal de Pernambuco(佩纳布卢克联邦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于相机-IMU融合的新型数据集和框架,通过多模态注意力机制提升道路表面分类的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22045 2026-01-30 cs.CV 57%

Urban Neural Surface Reconstruction from Constrained Sparse Aerial Imagery with 3D SAR Fusion

从受约束的稀疏航空影像中融合3D合成孔径雷达实现城市神经表面重建

Da Li, Chen Yao, Tong Mao, Jiacheng Bao, Houjun Sun

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出融合3D SAR与航空影像的城市神经表面重建框架,通过引入雷达空间约束提升稀疏视角下的重建精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21977 2026-01-30 cs.HC cs.AI cs.CY 57%

From Particles to Agents: Hallucination as a Metric for Cognitive Friction in Spatial Simulation

从粒子到代理:幻觉作为空间模拟中认知摩擦的度量

Javier Argota Sánchez-Vaquerizo, Luis Borunda Monsivais

机构 * Computational Social Science. ETH Zürich(ETH Zurich计算社会科学) Virginia Tech School of Architecture(弗吉尼亚理工大学建筑学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出代理环境模拟,通过认知摩擦度量揭示建筑空间的象征性模糊,挑战传统HCI范式,提出人类中心的认知编排框架。

Comments Paper selected for the workshop Human Cognition, AI, and the Future of HCI: Navigating the Disruptive and Wild Landscape of Large Language Models and Agentic AI as part of the Human-Computer Interaction (HCI) conference of the Alpine region (AlpCHI 2026) hosted at the Congressi Stefano Franscini, March 1st to March 5th, 2026 on Monte Verità in Ascona, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24386 2026-01-30 cs.CV 57%

PCICF: A Pedestrian Crossing Identification and Classification Framework

PCICF:一种行人穿越识别与分类框架

Junyi Gu, Beatriz Cabrero-Daniel, Ali Nouri, Lydia Armini, Christian Berger

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(戈尔达堡大学) Volvo Cars(沃尔沃汽车公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 PCICF提出了一种基于空间填充曲线的行人穿越识别与分类框架,利用合成数据集和真实世界数据集进行系统性训练和评估,以支持运营设计领域事件分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV 57%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21022 2026-01-30 cs.CV 57%

AI-based Prediction of Biochemical Recurrence from Biopsy and Prostatectomy Samples

基于AI的生物化学复发预测:从活检和前列腺切除样本

Andrea Camilloni, Chiara Micoli, Nita Mulliqi, Erik Everett Palm, Thorgerdur Palsdottir, Kelvin Szolnoky, Xiaoyi Ji, Sol Erika Boman, Andrea Discacciati, Henrik Grönberg, Lars Egevad, Tobias Nordström, Kimmo Kartasalo, Martin Eklund

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于AI的模型,利用活检和前列腺切除样本预测生物化学复发风险,展示了AI在前列腺癌预后评估中的应用价值。

Comments 39 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18874 2026-01-30 cs.HC cs.AI cs.CR cs.CY 57%

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Queensland University of Technology(昆士兰理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。

Comments The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12588 2026-01-30 cs.LG cs.CL 57%

Plain Transformers Can be Powerful Graph Learners

原始变换器可以成为强大的图学习者

Liheng Ma, Soumyasundar Pal, Yingxue Zhang, Philip H. S. Torr, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Huawei Noah’s Ark Lab, Montreal(华为诺亚实验室,蒙特利尔) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究证明原始变换器可通过简单修改成为强大图学习者,提出PPGT架构在图学习任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21126 2026-01-30 cs.MA cs.RO 50%

AI-Augmented Density-Driven Optimal Control (D2OC) for Decentralized Environmental Mapping

AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射

Kooktae Lee, Julian Martinez

机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 3 篇

2601.21403 2026-01-30 cs.AI cs.MA 79%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22041 2026-01-30 cs.MA cs.AI cs.CV cs.LG 62%

Learning to Communicate Across Modalities: Perceptual Heterogeneity in Multi-Agent Systems

在多智能体系统中学习跨模态交流:感知异质性

Naomi Pitzer, Daniela Mihai

机构 * University of Southampton(索姆塞特大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过异质多模态交流游戏探讨智能体在感知异质性下的交流机制,发现单模态系统更高效,多模态系统需更多信息交换,位扰动实验揭示了意义的分布编码特性。

Comments To be published in EvoLang XVI proceedings. 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25889 2026-01-30 cs.LG 50%

$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models

$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调

Kang Chen, Zhihao Liu, Tonghe Zhang, Zhen Guo, Si Xu, Hao Lin, Hongzhi Zang, Xiang Li, Quanlu Zhang, Zhaofei Yu, Guoliang Fan, Tiejun Huang, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Carnegie Mellon University(卡内基梅隆大学) Infinigence AI Zhongguancun Academy(中关村学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 12 篇

2601.22020 2026-01-30 cs.LG cs.CV 83%

Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning

多模态大语言模型去敏中的视觉引导关键标记正则化

Chengyi Cai, Zesheng Ye, Peike Li, Bo Han, Jianzhong Qi, Feng Liu

机构 * The University of Melbourne(墨尔本大学) Google Research(谷歌研究) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视觉引导的关键标记正则化方法,用于多模态大语言模型的去敏,通过信息熵定义关键标记并利用梯度重新加权提升去敏效果,实验表明能有效减少遗忘并保持响应一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22009 2026-01-30 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 83%

MEIDNet: Multimodal generative AI framework for inverse materials design

MEIDNet: 多模态生成式AI框架用于反向材料设计

Anand Babu, Rogério Almeida Gouvêa, Pierre Vandergheynst, Gian-Marco Rignanese

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MEIDNet通过多模态生成式AI框架实现反向材料设计,利用对比学习提升学习效率,生成低带隙钙钛矿结构并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21547 2026-01-30 cs.LG cs.AI 83%

Multi-Modal Time Series Prediction via Mixture of Modulated Experts

多模态时间序列预测 via 专家混合

Lige Zhang, Ali Maatouk, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Duke Kunshan University, China(杜克昆山大学) Yale University, USA(耶鲁大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出专家调制方法,通过条件控制专家行为实现多模态时间序列预测的高效跨模态控制。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21673 2026-01-30 cs.CV 79%

Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification

多模态视觉代理压缩用于阿尔茨海默病分类

Dexuan Ding, Ciyuan Peng, Endrowednes Kuantama, Jingcai Guo, Jia Wu, Jian Yang, Amin Beheshti, Ming-Hsuan Yang, Yuankai Qi

机构 * Macquarie University(麦考瑞大学) Federation University Australia(联邦大学澳大利亚) The Hong Kong Polytechnic University(香港理工大学) University of California at Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MVSC通过压缩和适应大尺寸3D sMRI体积为紧凑的2D视觉代理,提升阿尔茨海默病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21453 2026-01-30 cs.AI 79%

LION: A Clifford Neural Paradigm for Multimodal-Attributed Graph Learning

LION: 一种基于克莱因代数的多模态属性图学习神经范式

Xunkai Li, Zhengyu Wu, Zekai Chen, Henan Sun, Daohan Su, Guang Zeng, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 LION基于克莱因代数和解耦图神经范式,通过几何诱导的高阶图传播实现模态交互,结合自适应全息聚合模块提升多模态属性图学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏