Fusing Face and Periocular biometrics using Canonical correlation analysis
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
Comments 11 pages, 5 figures
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
Comments Focused on extraction of feature from two different modalities (face and fingerprint) using Gabor filter
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM
Comments IAPR Joint International Workshops on Statistical Techniques in Pattern Recognition and Structural and Syntactic Pattern Recignition, Joensuu : Finland (2014)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
Comments Updated ICCV 2013 submission
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
Comments 9 pages, for ICLR-2014
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
Comments Knowledge Representation and Reasoning in Robotics Workshop at ICLP 2013
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
Comments http://ijict.org/index.php/ijoat/article/view/improving-iris-recognition
Journal ref International Journal of Advancements in Technology, Vol 1, No 1 (2010)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
SAGE-Net:用于材料属性预测的语义增强几何编码器
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(comments)
AI总结 研究针对材料属性预测,提出语义增强几何编码器网络SAGE-Net,通过语义引导消息传递将晶体学语义注入几何消息传递,在多基准测试中表现出色,能有效捕捉晶体学特征,是深度集成多模态材料学习的通用可转移框架。
Comments 29 pages, 5 figures, multi-modal network
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态训练与对齐 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments Paper to appear at the 1st Workshop in Multimodal Sign Language Recognition at ICCV 2025
利用人工智能搜索宜居带系外行星的凌星观测
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本综述探讨人工智能在宜居带系外行星凌星信号搜索各环节的进展,指出其可提升分析效率、恢复弱信号,结合物理建模等能提高发现效率与可靠性。
Comments This paper has been withdrawn by the authors for administrative reasons related to our institutional research policy
先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) ; School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。
APPROVE:结合大型语言模型的面向视觉端用户的机器人编程
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 APPROVE是一种结合LLMs的多模态端用户机器人编程框架,通过Blockly可视化程序并支持用户确认、修改或拒绝,还可存储复用已确认功能,解决了现有系统透明度不足、意图对齐差、复用有限的问题,提升了用户信任与编程灵活性。
Comments Accepted for publication in Procedia CIRP, Proceedings of the 20th CIRP Conference on Intelligent Computation in Manufacturing Engineering (ICME 2026)
用于高效视觉-语言-动作策略的角色条件子令牌路由
机构 * Futurewei Technologies(未来智能技术公司)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。
Comments 12 pages, 5 tables
专题命中 多模态训练与对齐 :multi-modal(abstract)
Journal ref Math. Stat. Learn. (2026), published online first
基于检索的双融合与相似度感知对比的分子-文本对齐方法
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 针对现有分子-文本对齐方法忽略子结构与文本细粒度语义关系的问题,提出RISEN方法,通过检索构建孪生分子并结合相似度感知对比学习,在基准数据集上取得更优性能。
让两个动作头达成一致:流匹配策略的协调机制与运行时崩溃证书
机构 * School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对流匹配策略的双动作头多模态误报问题,提出四类协调机制并推导机会校正协调边界,在LIBERO-Plus等测试中验证了残差为最强故障信号。
UniFed-VLM:面向多异质性视觉语言模型的联邦指令调优
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 UniFed-VLM是解决任务、模态、模型架构联合异质性的VLM联邦指令调优框架,含FedCSA与TCoD组件,在多基准数据集上优于现有FL方法。
FedADB:用于缓解遗忘的类别锚驱动双分支联邦学习
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对联邦学习中跨客户端数据异质性导致的全局知识遗忘问题,提出FedADB框架,通过类别锚与双分支机制平衡全局一致性与本地优化,在多数据集上提升了准确率与收敛速度。
Comments Accepted to appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)
MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。
QUARTZ:通过可访问表示与可视化实现定性理解
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对盲人和低视力研究者无法访问定性数据可视化的问题,提出基于网络的QUARTZ系统,通过用户研究揭示相关障碍并提出设计准则,以提升该群体参与定性研究的可访问性。
Comments 24 pages, accepted at ASSETS 2026
量子磁体中不确定性感知哈密顿量推断与实验设计的观测几何
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究提出AI赋能的不确定性感知哈密顿量推断与自适应实验设计框架,结合哈密顿量条件神经代理等方法,通过NiPS₃的中子散射测量验证,为量子材料表征与实验设计提供通用策略。
群体感知的物理信息神经粒子流用于贝叶斯更新
机构 * Iowa State University(爱荷华州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。
从噪声心脏血流测量中学习疾病敏感的潜在交互图
机构 * Department of Computer Science, University of Bath(巴斯大学计算机科学系) ; Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) ; Christian Doppler Laboratory for Mechanical Circulatory Support, Department of Cardiac and Thoracic Aortic Surgery, Medical University of Vienna(维也纳医学大学心脏和胸主动脉外科系基督教多普勒实验室)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 本文提出了一种物理指导的潜在关系框架,用于从噪声心脏血流测量中学习疾病敏感的潜在交互图,以捕捉心脏疾病和干预的稳健标志。
分层构型空间中接触感知不确定性校准的基于粒子的保形预测
机构 * University of Michigan(密歇根大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。
Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/
学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控
机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) ; Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。
缺失模态下的共形融合
机构 * Swinburne University of Technology(斯威本科技大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出MCCF架构,解决缺失模态下的多模态融合问题,该架构兼具模态缺失鲁棒性与校准不确定性,在多基准测试中表现出良好的覆盖率与精度性能。