CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition
CMD-HAR:基于交叉模态解耦的可穿戴人类活动识别
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 CMD-HAR通过交叉模态解耦和时空注意力机制,提升可穿戴设备中人类活动识别的准确性和部署效率。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
CMD-HAR:基于交叉模态解耦的可穿戴人类活动识别
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 CMD-HAR通过交叉模态解耦和时空注意力机制,提升可穿戴设备中人类活动识别的准确性和部署效率。
自适应全局与细粒度感知融合用于兼容硬负样本放大的人脸嵌入
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) ; Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出AGFF-Embed方法,通过自适应融合全局和细粒度语义信息,提升多模态嵌入在一般和细粒度理解上的性能。
PPE:用于多模态大语言模型中token压缩的位置保持嵌入
机构 * Huawei Technologies(华为技术有限公司)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能
Comments ICLR 2026
通过大规模多模态预训练增强时间序列分析
机构 * East China Normal University, Shanghai, China(华东师范大学) ; HuaWei, ShenZhen, China(华为,深圳,中国)
专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)
AI总结 本文提出HORAI模型,通过多模态预训练提升时间序列分析的泛化能力,实现零样本预测和异常检测的最优性能。
CyIN:循环信息潜在空间用于连接完整与不完整多模态学习
机构 * School of Electronics and Information Technology, Sun Yat-Sen University(中山大学电子与信息学院) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; School of Computer Science, South China Normal University(华南师范大学计算机科学学院) ; Desay SV Automotive Co., Ltd(德赛股份有限公司) ; Pazhou Laboratory(琶洲实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)
AI总结 CyIN通过构建循环信息潜在空间,解决多模态学习中完整与不完整数据之间的性能差距,实现统一优化。
Comments Accepted by NeurIPS 2025
线性模型合并解锁了简单且可扩展的多模态数据混合优化
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。
Comments Preprint
测试时自适应层次联合增强去噪网络用于可靠的多模态分类
机构 * The Guangdong Provincial Key Laboratory of Computational Intelligence and Cyberspace Information, the School of Computer Science and Engineering, South China University of Technology(广东省计算智能与网络信息重点实验室、计算机科学与工程学院、华南理工大学) ; The Pazhou Laboratory(琶洲实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出TAHCD网络,通过自适应稳定子空间对齐和样本自适应置信度对齐,有效去除多模态噪声,提升多模态分类的鲁棒性和泛化能力。
Comments 14 pages,9 figures, 8 tables
SwimBird: 在混合自回归大语言模型中实现可切换的推理模式
机构 * Huazhong University of Science and Technology(华中科技大学) ; Accio Team, Alibaba Group(阿里集团Accio团队)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。
Comments Project Page: https://accio-lab.github.io/SwimBird
DCER:双阶段压缩与基于能量的重建
机构 * Yiwen Wang(无) ; Jiahao Qin(无)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI、cs.MM
AI总结 DCER通过双阶段压缩和基于能量的重建解决多模态融合中的噪声和缺失模态问题,实现鲁棒性提升。
Comments 13 pages, 2 figures, 8 tables. Submitted to ICML 2026. Code will be available on GitHub
InterPrior:为基于物理的人-物体交互扩展生成控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 InterPrior通过大规模模仿预训练和强化学习微调,扩展生成控制以实现人形机器人在多样环境下泛化移动-操作技能。
Comments Webpage: https://sirui-xu.github.io/InterPrior/
RFS: 通过残差流引导的强化学习用于灵巧操作
机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) ; Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能