Generative Foundation Model for Structured and Unstructured Electronic Health Records
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会计算与信息检索研究中心,哈尔滨工业大学) ; School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) ; School of Computing, National University of Singapore(计算学院,新加坡国立大学)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). June 2025. DOI: https://doi.org/10.1109/TCSVT.2025.3578266
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 6 pages, 3 figures, accepted by IEEE ISBI 2025
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);omni-modal(abstract);分类 cs.CL、eess.AS
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.MM
Comments 10 pages, 3 figures
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
Comments 17 pages
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
超越多模态对齐:通过响应替换与有序执行验证物理语言
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出DBOSC方法,在Cluster Haptic数据集与弹塑性系统中验证了多模态物理表示的可执行含义,明确了执行器、图表等因素对动作组合的影响,区分了多项可测试的操作能力成就。
Malformer:一种基于Transformer的多模态恶意软件检测器
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)
AI总结 本研究提出四模态恶意软件检测模型Malformer,融合文本、图像、图形、音频表示,采用多模态Transformer融合,在201549个样本数据集上准确率98.3%,优于单/双模态检测器,为恶意软件防御提供稳健基础。
室内60GHz网络中多模态传感辅助非视距波束搜索的激光雷达衍生表面先验
专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)
AI总结 该研究提出用激光雷达衍生的局部表面结构作为先验,结合射频测量,可将60GHz网络的波束对探测减少72%,同时保持74.5%位置的波束在详尽搜索的3dB范围内,降低毫米波波束搜索不确定性。
临床路径对早期阿尔茨海默病检测中的多模态深度学习至关重要
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究提出基于SigLIP的零样本多模态框架,结合结构MRI与常规临床变量,在ADNI队列中实现早期阿尔茨海默病风险分层,性能优于传统模型,且可扩展至纵向数据。
Comments Published
TiMi: 通过多模态专家混合增强时间序列变换器
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。
CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习
机构 * Singapore Management University(新加坡管理大学) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract)
AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。
何时依赖视觉信息:序列推荐中的门控多模态融合
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。
Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026
推进工业4.0:面向基于3D打印的AI故障检测的多模态传感器融合
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本研究提出了一种低成本、便携的多模态传感器融合AI系统,用于实时监测FDM 3D打印过程中的故障,提升制造可靠性和可持续性。
Comments International Journal of Engineering Research and Innovation | v17, n2, Fall/Winter 2025
用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合
机构 * George Mason University(乔治梅森大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。
KILVO:面向人形机器人的具备鲁棒多模态自适应的运动学-惯性-激光雷达-视觉里程计
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出面向人形机器人的KILVO里程计,基于ESIKF整合多传感器并设计多模态自适应与接触估计模块,实验显示其精度、效率及鲁棒性优于现有方法,代码与数据集已开源。
Comments This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission
RJD-BASE:基于随机联合对角化的多模态谱聚类
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)
AI总结 本研究提出RJD-BASE方法,通过随机凸组合拉普拉斯矩阵结合BASE选择规则实现多模态谱聚类,在低计算成本下优于经典多模态聚类方法。
PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。
通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物
专题命中 多模态训练与对齐 :cross-modal(title,abstract)
AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。
反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。
RHEA:用于鲁棒多模态属性图聚类的可靠性协调重构与分配
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 针对多模态属性图聚类中属性含噪或缺失时性能下降的问题,提出RHEA框架,通过估计节点特定模态可靠性并结合邻域信息提升聚类效果,在基准测试中表现优于最强基线。
Comments Under Review
PaletteID:用于多模态点击率预测的原型组合语义标识符
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。
MMFGU:多模态联邦图遗忘
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。
隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。
CoLAS:面向金融交易的潜在资产信号多模态确证
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。
通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。
Comments 9 pages, 10 figures