Multimodal Graph Representation Learning with Dynamic Information Pathways
多模态图表示学习中的动态信息路径
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出DiP框架,通过动态信息路径实现多模态图表示学习,提升跨模态消息传播的适应性和表达性。
Comments 12 pages, 6 figures, 6 tables
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态图表示学习中的动态信息路径
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出DiP框架,通过动态信息路径实现多模态图表示学习,提升跨模态消息传播的适应性和表达性。
Comments 12 pages, 6 figures, 6 tables
通过总相关性最大化实现多模态分类
机构 * Nanjing University of Science and Technology(南京理工大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出TCMax方法,通过最大化多模态特征与标签间的总相关性,缓解模态竞争并提升多模态分类性能。
Comments Accepted for publication at ICLR 2026; 19 pages; 2 figures
多模态骨骼基动作表示学习通过分解与组合
机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院,南京210096,中国) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),中华人民共和国教育部,中国) ; School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China(东南大学网络安全科学与工程学院,南京210096,中国) ; Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education, China(区块链应用、监督与管理工程研究中心(东南大学),中华人民共和国教育部,中国) ; Purple Mountain Laboratories, Nanjing 210000, China(紫金山实验室,南京210000,中国)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种自监督的多模态骨骼基动作表示学习框架,通过分解与组合策略平衡效率与效果,提升动作识别性能。
Comments Accepted by Machine Intelligence Research (Journal Impact Factor 8.7, 2024)
Journal ref Machine Intelligence Research, 2026
熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿
专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract)
AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。
通过自适应多样性缓存缓解HOI检测中的长尾偏差
机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。
逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。
Comments 28 pages, 10 figures
TriFusion-SR:联合三模态医学图像融合与超分辨率
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 TriFusion-SR通过联合三模态医学图像融合与超分辨率技术,利用小波引导的条件扩散框架实现频率感知的跨模态交互,提升图像质量和分辨率。
TopoOR: 一种用于手术室的统一拓扑场景表示
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国理工学院) ; Kyung Hee University(韩国庆熙大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。
RTFDNet:用于鲁棒RGB-T分割的融合-解耦
机构 * independent researchers(独立研究人员)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 RTFDNet通过融合与解耦机制提升RGB-T分割的鲁棒性,采用三分支编码器-解码器结构,结合协同特征融合、跨模态解耦正则化和区域解耦正则化,实现高效独立推理。
探索EEG和眼动融合用于多类目标RSVP-BCI
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 本文提出MTREE-Net,通过融合EEG和眼动数据提升多类RSVP-BCI的解码性能。
Comments 17 pages, 9 figures
Journal ref Information Fusion, 2025, 121: 103135
基于谱图滤波的模态特异性表示学习
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出DELVE方法,通过谱图滤波提取模态特异性潜在变量,以识别不同模态间的差异结构。
SPREAD: 为终身模仿学习的子空间表示蒸馏
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 SPREAD通过子空间表示蒸馏方法,在终身模仿学习中提升知识迁移和泛化能力,缓解灾难性遗忘,实现最优性能。
Comments IEEE International Conference on Robotics & Automation (ICRA) 2026
MM-Zero: 从零数据自我进化多模型视觉语言模型
机构 * University of Maryland(马里兰大学) ; Brown University(布朗大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Adobe ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Southern California(南加州大学) ; NVIDIA
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。
基于可逆性的生成采样器:用于可能具有离散参数分布的采样器
机构 * School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai, 200240, P.R.China(上海交通大学数学科学学院) ; Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University, Shanghai, 200240, P.R.China(上海交通大学自然科学研究院)
专题命中 其他多模态 :multi-modal(abstract)
AI总结 本文提出了一种基于可逆性的生成采样器,适用于具有离散参数分布的复杂系统,通过最小化MMD来实现高效的采样方法。
通过声音化探索喷流星系。视觉和听觉对多频率变化的洞察
专题命中 其他多模态 :multimodal(abstract)
AI总结 本研究通过声音化和可视化技术分析喷流星系的多频率变化,揭示其复杂行为并提升科学交流的包容性。
Comments 16 pages, 9 figures. Accepted for publication in RASTI (RAS Techniques and Instruments)
Journal ref RAS Techniques and Instruments, 2026