Generalized Zero- and Few-Shot Learning via Aligned Variational Autoencoders
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2019
现代追踪器距离无人机-反无人机还有多远?一个百万级基准和新基线
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; CloudWalk Technology Co., Ltd(云walk科技有限公司) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空宇航学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态评测 :multimodal(abstract,comments);multi-modal(abstract);分类 cs.CV
AI总结 本文提出UAV-Anti-UAV多模态追踪任务及MambaSTS基线方法,通过百万级数据集验证了现有追踪算法在无人机反无人机领域的改进空间。
Comments https://github.com/983632847/Awesome-Multimodal-Object-Tracking
用于胎儿生长分析的不确定性感知缺失数据多模态潜在模型
专题命中 多模态评测 :multimodal(title)
AI总结 该研究提出线性高斯因子模型,对977例胎儿的四类测量数据拟合后发现测量模块几乎独立,可通过边缘化缺失值得到反映可用数据不确定性的生长谱,其重建残差还可用于数据质量筛选。
这是谁的拒绝?黑盒多模态安全护栏的未被衡量的贡献
专题命中 多模态评测 :multimodal(title)
AI总结 该研究指出黑盒多模态安全护栏的评估指标混淆了护栏与目标模型的弃权贡献,通过实验揭示了有效载荷通道和内部读取文本对护栏贡献的影响,并修正了相关评估结果。
变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取
机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) ; Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。
Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp
追踪2024年美国总统大选在TikTok上的讨论:一个公共多模态数据集
专题命中 多模态评测 :multimodal(title)
AI总结 本文公开了一个包含2024年美国总统大选相关TikTok视频的多模态数据集,通过API和第三方爬虫收集180万条视频,分析选举相关关键词和双词组合。
Comments The 2024 Election Integrity Initiative
Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025
在虚拟现实中解读眼神:社会智能的多模态建模
专题命中 多模态评测 :multimodal(title)
AI总结 研究通过在 Unity 中为桌面和 VR 实现 RMET 并进行 2x2 混合研究,探究呈现媒介和反馈对 RMET 行为的影响。结果表明即时反馈影响注视和脑电,呈现媒介无客观差异,VR 可用性高,为 RMET 在受控环境作过程感知评估任务提供证据。
为多模态数据将神经编码器集成至贝叶斯广义线性混合模型中
机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) ; Department of Ophthalmology, University of Miami(迈阿密大学眼科系)
专题命中 多模态评测 :multimodal(title)
AI总结 针对传统广义线性混合模型无法适配高维多模态数据的问题,该研究联合训练模态专属神经编码器与GLMM目标,通过方差校正随机梯度MCMC实现推断,兼顾效应可解释性与多模态纵向数据的可扩展不确定性分析。
Comments 21 pages, 5 figures
利用多模态机器学习和自驱动显微镜加速结构-性能关系发现
专题命中 多模态评测 :multimodal(title)
AI总结 提出结合自主显微镜与双新颖深度核学习及双变分自编码器的框架,用于高效采集光谱数据并构建结构-性能关系图,应用于钙钛矿薄膜揭示了纳米结构特征与迟滞行为的关联。
Comments 20 pages, 6 figures
GaSe分子束外延生长条件的多模态机器学习分析
专题命中 多模态评测 :multi-modal(title)
AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。
RoofNet: 用于地球观测屋顶材料识别的全球多模态数据集
专题命中 多模态评测 :multimodal(title)
AI总结 针对建筑屋顶材料数据缺失问题,提出RoofNet数据集,包含101个国家49,662个建筑实例的14类屋顶材料标签,结合多模态标注流程和微调方法,将零样本分类准确率从4.9%提升至47.7%,并展示了材料感知数据对灾害风险评估的影响。
Comments v3: Restructured manuscript with updated framing, added hazard case study, clarified data release/licensing, and refined main text and appendix for clarity
基于光电二极管的多模诊断用于LTX-β球形托卡马克中的低能中性束注入
专题命中 多模态评测 :multi-modal(title)
AI总结 本文提出了一种紧凑型基于光电二极管的诊断阵列,用于研究LTX-β球形托卡马克中的低能中性束注入。该诊断系统结合了滤波软X射线(SXR)、窄带Lyman-α和未滤波AXUV光电二极管行,通过部分重叠且几乎重合的切向视图来观察等离子体,包括中性束路径。这种几何结构能够同时敏感地检测到束诱导的SXR发射、与回流、快速中性粒子和燃料相关的中性氢线辐射,以及宽带发射,包括直接中性粒子从快速离子电荷交换损失。初始测量显示在12-20 keV氢束操作中,所有三种模式的探测器响应都具有束同步响应。未滤波AXUV信号表现出毫秒级的上升和下降时间,远慢于探测器响应,且在不同视线上变化,并依赖于锂条件化历史。与经典减速时间估计的比较表明,与背景中性粒子的电荷交换对测量衰减有显著贡献。该诊断可用于约束前向模型以估算小型托卡马克中束加热和燃料补充的时间分辨平衡。
Comments High temperature plasma diagnostics review of scientific instruments
TMRugPull: 一个时间感知的多模态数据集用于早期 RugPull 检测
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出一个时间绑定的多模态数据集 TMRugPull,包含1000个项目,用于早期RugPull检测,通过三种模态数据验证数据集的时间有效性,并公开数据集和代码库。
CA-DEL:一个开放的多目标、多模态基准,用于从DNA编码库筛选中学习
专题命中 多模态评测 :multi-modal(title)
AI总结 CA-DEL通过整合实验确定的结合亲和力,为学习DNA编码库筛选中的选择性挑战提供多维公共基准,解决数据稀缺问题。
EgoWalk:一种用于野外机器人导航的多模态数据集
机构 * Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) ; Sber Robotics Center(Sber机器人中心)
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出EgoWalk数据集,包含50小时人类在多样化环境中的导航数据,提供多模态数据及自动化子集生成流程,展示其在机器人导航中的应用价值。
Comments This work has been submitted to the IEEE for possible publication
知识蒸馏用于轻量级多模态感知辅助毫米波波束跟踪
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出基于知识蒸馏的轻量模型框架,利用摄像头和雷达数据实现高效波束预测与跟踪,实验显示多模态融合优于单一模态方法,模型在精度提升的同时显著降低计算复杂度和参数量。
Comments 5 pages, 4 figures, submitted to IEEE SPAWC2026
嗨!- 一个用于力导向、跨视角人工 manipulation 的多模态数据集
机构 * ETH Zurich(苏黎世联邦理工学院) ; Technical University of Munich(慕尼黑技术大学) ; University of Freiburg(弗赖堡大学) ; Microsoft(微软) ; University of Bonn(波恩大学)
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出一个结合视觉、动作和触觉的多模态数据集,包含381个人工物体在38种环境中的3048个序列,用于评估方法在人机视角间的迁移能力及探索交互力等未被研究的模态。
教育场景中的自动思维游离检测:系统综述与多模态基准评估
专题命中 多模态评测 :multimodal(title)
AI总结 本文通过系统综述和多模态基准评估,探讨教育环境中思维游离检测的方法与挑战,评估14种数据集中的EEG、面部视频、眼动追踪和生理信号等多模态数据的检测性能。
迈向实用的多模态医院暴发检测
机构 * Auton Lab, Carnegie Mellon University(自主实验室,卡内基梅隆大学) ; Microbial Genomic Epidemiology Laboratory, Center for Genomic Epidemiology, University of Pittsburgh(微生物基因组流行病学实验室,流行病学研究中心,匹兹堡大学) ; Division of Infectious Diseases, University of Pittsburgh School of Medicine(传染病科,匹兹堡大学医学院) ; Department of Epidemiology, School of Public Health, University of Pittsburgh(流行病学系,公共卫生学院,匹兹堡大学)
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出利用多模态数据提升医院暴发检测效率,通过机器学习整合质谱、抗菌谱和电子病历数据,提高检测性能并减少全基因组测序依赖。
Comments 10 pages, 3 figures, 3 tables
超越代码:一种多模态评估策略,通过入门编程项目培养专业能力
专题命中 多模态评测 :multi-modal(title)
AI总结 本文通过项目式学习框架开发2D迷宫跑游戏,提出四维评估模型提升编程基础和沟通能力,为现代软件工程教育提供可扩展的课程改革方案。
Comments Article submitted to IEEE
同时多模隐蔽通信:分析与优化
专题命中 多模态评测 :multi-modal(title)
AI总结 本文提出了一种低复杂度的多模隐蔽通信模式选择技术,旨在在满足速率约束的前提下最大化隐蔽性,通过分析不同对手知识状态下的检测错误概率,验证了其性能优势。
一种用于生态化认知评估的腕戴式多模态反应时间监测设备
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出了一种低成本腕戴式设备,用于在现实环境中实现多模态反应时间的高精度监测,支持非侵入式认知评估。
CAN-STRESS:一种用于理解大麻使用、压力和生理反应的现实世界多模态数据集
专题命中 多模态评测 :multimodal(title)
AI总结 CAN-STRESS数据集通过多模态数据研究大麻使用与压力及生理反应的关系,为相关研究提供可靠资源。
RoboMIND 2.0:一种多模态、双臂移动操作数据集,用于通用具身智能
专题命中 多模态评测 :multimodal(title)
AI总结 RoboMIND 2.0通过多模态双臂移动操作数据集和MIND-2系统,提升通用具身智能的泛化能力。
基于AERPAW自主数据中继无人机的无线多模测量收集:数字孪生与现实环境中的AADM挑战
专题命中 多模态评测 :multi-modal(title)
AI总结 本文提出基于AERPAW自主数据中继无人机的无线多模测量数据集,用于数字孪生与现实环境中的自主无线实验基准。
Comments 10 pages, 12 figures
TouchFusion: 多模态腕带传感用于无处不在的触控交互
专题命中 多模态评测 :multimodal(title)
AI总结 TouchFusion通过多模态腕带传感实现无处不在的触控交互,结合多种传感器技术,支持环境和身体表面的触控检测与上下文自适应界面控制。
Comments 23 pages, 22 figures, accompanying video available at https://youtu.be/0fdCwHu7uaA
MGKAN:通过多模态图科拉莫戈洛夫-阿诺德网络预测非对称药物-药物相互作用
机构 * School of Mathematics, Shandong University, Jinan, China(山东大学数学学院) ; Data Science Institute, Shandong University, Jinan, China(山东大学数据科学研究院)
专题命中 多模态评测 :multimodal(title)
AI总结 MGKAN通过多模态图科拉莫戈洛夫-阿诺德网络有效预测非对称药物-药物相互作用,提升建模的非线性和方向性。
Comments This paper has been accepted by ICASSP 2026
CHOMP:使用耳phones的多模态咀嚼侧检测
专题命中 多模态评测 :multimodal(title)
AI总结 CHOMP利用耳phones实现多模态咀嚼侧检测,通过融合多种传感数据提升监测精度,为日常下颌功能评估提供新方法。
ScratchEval:一种用于块式编程中LLM的多模态评估框架
专题命中 多模态评测 :multimodal(title)
AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。
Magni 人类运动数据集:准确、复杂、多模态、自然、语义丰富且上下文化的
专题命中 多模态评测 :multi-modal(title)
AI总结 本文提出一个高质量的Magni人类运动数据集,通过多模态传感器和语义丰富环境,提供自然且准确的运动数据,以支持基于上下文线索的算法开发。
Comments in SIRRW Workshop held in conjunction with 31st IEEE International Conference on Robot & Human Interactive Communication, 29/08 - 02/09 2022, Naples (Italy)
Journal ref International Journal of Robotics Research (IJRR), 2025