Understanding uncertainty in Bayesian cluster analysis
理解贝叶斯聚类分析中的不确定性
专题命中 多模态评测 :multimodal(abstract)
AI总结 WASABI通过多聚类估计近似后验分布,提升贝叶斯聚类分析中对不确定性的理解,尤其在聚类不明显或模型不恰当时表现优异。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
理解贝叶斯聚类分析中的不确定性
专题命中 多模态评测 :multimodal(abstract)
AI总结 WASABI通过多聚类估计近似后验分布,提升贝叶斯聚类分析中对不确定性的理解,尤其在聚类不明显或模型不恰当时表现优异。
具有认知启发的标记克服了多模态模型中的自我中心偏差
机构 * Department of Psychology University of Washington(心理学系华盛顿大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。
FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航
机构 * Fantasy AIGC Team(幻想AIGC团队) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。
SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器
机构 * UCSD(加州大学圣地亚哥分校) ; UVA(弗吉尼亚大学) ; UIUC(伊利诺伊大学香槟分校) ; JHU(约翰·霍普金斯大学) ; Purdue(Purdue 大学) ; PolyU ; USC(美国南加州大学) ; UMich(密歇根大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。
VTFusion: 一种面向少样本异常检测的视觉-文本多模态融合网络
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 VTFusion通过自适应特征提取和多模态融合模块,提升少样本异常检测性能,实现96.8%的AUROC。
解耦多对比超分辨率:自监督隐式重表示用于无配对跨模态合成
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出了解耦多对比超分辨率框架,通过自监督隐式重表示实现无配对跨模态合成,提升极端尺度下的超分辨率性能。
REL-SF4PASS:基于REL深度表示和球形融合的全景语义分割
机构 * School of Electronic and Information Engineering, Shanghai DianJi University(电子信息学院,上海电机大学) ; College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 REL-SF4PASS通过REL深度表示和球形动态多模态融合方法,提升全景语义分割的性能和鲁棒性。
Comments submitted to CVPR 2026
增强型多域特征选择与融合的无地图轨迹预测
机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) ; Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) ; Leapmotor Technology(Leapmotor科技) ; Department of Aeronautical and Automotive Engineering, Loughborough University(伦敦大学洛桑学院航空与汽车工程系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无地图轨迹预测方法,通过多域特征选择与融合,提升轨迹预测的准确性和效率。
AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型
机构 * Independent Researcher(独立研究者)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。
基于语言引导和运动感知的通用识别姿态表示
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 LMGait通过引入自然语言描述作为语义先验,结合运动感知模块和时间捕获模块,提升了姿态识别的通用性和准确性。
贝叶斯联合加性因子模型用于多视图学习
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文提出贝叶斯联合加性因子模型用于多视图学习,通过分解共享和视图特定成分提升多模态数据预测性能。
Comments To be published in Biometrics
基于元参数的算法身份:可靠性、可审计性与可追溯性的一条路径
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出通过DOI标识算法以提升AI应用的可靠性、可审计性和可追溯性,探讨了其在多模态LLMs中的应用及加密认证协议。
Comments 6 pages, 1 figure