arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1417 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1417 篇

2009.11154 2021-05-28 cs.CV cs.AI 61%

2D-3D Geometric Fusion Network using Multi-Neighbourhood Graph Convolution for RGB-D Indoor Scene Classification

Albert Mosella-Montoro, Javier Ruiz-Hidalgo

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV;information fusion(comments)

Comments Information Fusion 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.06104 2020-12-14 cs.LG eess.SP q-bio.QM 61%

A Review of Hidden Markov Models and Recurrent Neural Networks for Event Detection and Localization in Biomedical Signals

Yassin Khalifa, Danilo Mandic, Ervin Sejdić

专题命中 融合架构与评测 :information fusion(abstract,journal_ref);分类 eess.SP

Journal ref Yassin Khalifa, Danilo Mandic, and Ervin Sejdić. "A review of Hidden Markov models and Recurrent Neural Networks for event detection and localization in biomedical signals." Information Fusion, Volume 69, 52-72 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08568 2019-10-17 cs.CV 61%

Indic Handwritten Script Identification using Offline-Online Multimodal Deep Network

Ayan Kumar Bhunia, Subham Mukherjee, Aneeshan Sain, Ankan Kumar Bhunia, Partha Pratim Roy, Umapada Pal

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV;information fusion(comments)

Comments Accepted in Information Fusion, Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.02919 2019-02-11 cs.CV 61%

A Comprehensive Overview of Biometric Fusion

Maneet Singh, Richa Singh, Arun Ross

专题命中 融合架构与评测 :information fusion(abstract,comments);分类 cs.CV

Comments Accepted for publication in Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
0806.2008 2009-12-01 cs.CV cs.AI 61%

Generalized proportional conflict redistribution rule applied to Sonar imagery and Radar targets classification

Arnaud Martin, Christophe Osswald

专题命中 融合架构与评测 :information fusion(abstract,journal_ref);分类 cs.CV

Journal ref Advances and Applications of DSmT for Information Fusion, Florentin Smarandache & Jean Dezert (Ed.) (2006) 289-304

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11393 2025-11-24 cs.SE cs.AI cs.CR cs.MA 60%

LLM-Agent-UMF: LLM-based Agent Unified Modeling Framework for Seamless Design of Multi Active/Passive Core-Agent Architectures

LLM-Agent-UMF: 基于大语言模型的代理统一建模框架,用于无缝设计多主动/被动核心代理架构

Amine Ben Hassouna, Hana Chaari, Ines Belhaj

机构 * Mediterranean Institute of Technology(地中海技术研究所) South Mediterranean University(南地中海大学) National School of Computer Science(国家计算机科学学校) University of Manouba(曼努巴大学)

专题命中 融合架构与评测 :information fusion(abstract,comments)

AI总结 LLM-Agent-UMF提出了一种基于大语言模型的代理统一建模框架,用于设计多主动/被动核心代理架构,解决了现有架构的模块化和术语不一致问题。

Comments 39 pages, 19 figures, 3 tables. Published in Information Fusion, Volume 127, March 2026, 103865. Part of the special issue "Data Fusion Approaches in Data-Centric AI for Developing Trustworthy AI Systems"

Journal ref Information Fusion 127 (2026) 103865

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.07751 2015-06-01 cs.AI 60%

Pignistic Probability Transforms for Mixes of Low- and High-Probability Events

John J. Sudano

专题命中 融合架构与评测 :information fusion(abstract,comments)

Comments 7 pages, International Society of Information Fusion Conference Proceedings Fusion 2001 at Montreal, Quebec, Canada

Journal ref Fourth International Conference on Information Fusion, August 2001, Montreal. Pages TPUB3 23-27

详情

展开后加载摘要…

URL PDF HTML 收藏
math/0309431 2009-12-01 math.GM 60%

On the Generation of Hyper-powersets for the DSmT

Jean Dezert, Florentin Smarandache

专题命中 融合架构与评测 :information fusion(abstract,comments)

Comments 11 pages, 2 tables, one graph, one computer program. Presented to The Sixth International Conference on Information Fusion, Cairns, Queensland, Australia, 1118-1125, 8-11 July 2003

Journal ref Published in the Proceedings of the Sixth International Conference on Information Fusion, International Society for Information Fusion, Cairns, Queensland, Australia, 1118-1125, 8-11 July 2003

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21098 2026-08-24 cs.CV 新提交 57%

When does fusing hand-crafted knowledge with learned representations pay? A cost-normalized benchmark of stacking, substitution, and interference

将手工知识与学习表示融合何时有效?一种针对堆叠、替代和干扰的成本归一化基准

Ahmad AlMughrabi, Albert Clop, Benjamin Busam, Ricardo Marques, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Technical University of Munich(慕尼黑工业大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 融合架构与评测 :decision-level fusion(abstract);分类 cs.CV

AI总结 该研究以成本归一化基准分析手工知识与学习表示融合的效果,发现三种结果并提出可预测端到端增益的分解式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 57%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M. C

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-08-24 cs.CV cs.AI 57%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4580-4589

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 57%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12570 2026-08-14 cs.CV cs.IR 新提交 57%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 57%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25699 2026-08-07 cs.RO 版本更新 57%

SA-LIVO: Efficient LiDAR-Inertial-Visual Odometry with Subspace-Aware Degeneracy Handling

SA-LIVO: 基于子空间感知退化处理的轻量级LiDAR-惯性-视觉里程计

Yinong Cao, Xin He, Shouzheng Zhu, Senyuan Wang, Changhui Jiang, Chenyang Zhang, Pingfeng He, Tingwei Wang, Yuwei Chen, Shijie Liu, Chunlai Li, Genghua Huang, Jianyu Wang

机构 * Key Laboratory of Space Active Opto-Electronics Technology, Shanghai Institute of Technical Physics, Chinese Academy of Sciences(中国科学院上海技术物理研究所空间主动光电技术重点实验室) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 提出SA-LIVO系统,通过子空间感知信息融合(SAIF)框架对联合信息矩阵进行特征分解,在方向级别选择性融合LiDAR和视觉测量,解决LiDAR退化与视觉失效问题,实现高精度、低内存的实时里程计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01807 2026-08-04 cs.CV 新提交 57%

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

用于RGBT跟踪的参数动态自适应融合与校准网络

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。

Comments 9 pages,4 figures; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 57%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 57%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20897 2026-07-24 cs.CV 新提交 57%

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images

MAGE-Vein:从手指静脉图像进行多实例年龄和性别估计

Katsuki Tanaka, Koichi Ito, Takafumi Aoki, Masakazu Fujio, Yosuke Kaga, Kanade Oshima, Kenta Takahashi

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Hitachi, Ltd.(日立有限公司)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 针对手指静脉图像年龄估计难题,提出MAGE-Vein多实例多任务学习框架,通过混合特征级融合提取衰老特征并抑制噪声,结合性别分类优化消除血管差异,在平衡数据集上取得良好效果,推翻传统认知。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20790 2026-07-24 cs.CV 新提交 57%

Ocular Verification for Virtual Reality

虚拟现实中的眼部验证

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

机构 * University of Wyoming(怀俄明大学) San Diego State University(圣地亚哥州立大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究虚拟现实中眼部验证,评估虹膜质量指标局限性,用生成模型应对数据挑战,进行单模态与多模态识别及融合,发现部分指标在VR数据上失效,图像调整利于眼周识别,多模态融合降低错误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 57%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 57%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17182 2026-07-21 cs.CV 新提交 57%

BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos

BanClickThumb:用于孟加拉语YouTube视频中标题党检测的多模态数据集和Transformer融合基准测试

Md. Ariful Islam, Md Tanvirul Islam, Md. Maruf Hossain Miru, Md Khalid Syfullah

机构 * Department of Computer Science and Engineering, Bangladesh Army University of Science and Technology(孟加拉国陆军科技大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对孟加拉语YouTube视频标题党检测,公开多模态数据集BanClickThumb,用其对单模态和多模态方法进行基准测试,提出多模态模型BanClickFusionFormer,结合ViT和XLM - RoBERTa,证明多模态融合有效性,提供基准支持低资源多模态内容分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24679 2026-07-21 cs.AI eess.SP 版本更新 57%

Multi-modal cross-domain mixed fusion model with dual disentanglement for fault diagnosis under unseen working conditions

用于未知工况下故障诊断的具有双重解缠的多模态跨域混合融合模型

Pengcheng Xia, Yixiang Huang, Chengjin Qin, Chengliang Liu

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 eess.SP

AI总结 针对未知工况下故障诊断问题,提出具有双重解缠的多模态跨域混合融合模型,通过双重解缠框架、跨域混合融合策略和三模态融合机制,实现多模态表示学习与域泛化,实验验证该方法优于先进方法及各组件有效性。

Comments Accepted for publication in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114693

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13905 2026-07-16 cs.CV cs.LG 新提交 57%

The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides

第二届生物特征足迹识别国际StepUP竞赛:从单步到跨步

Robyn Larracy, Anant Gupta, Gourav Gupta, Ethan Eddy, Maxime Devanne, Cyril Meyer, Jin-Chern Chiou, Yueh-Shan Lee, Zong-Han Lu, Aaron Tabor, Erik Scheme

机构 * University of New Brunswick(新不伦瑞克大学) ArogyaPandit Private Limited(阿罗吉亚潘迪特私人有限公司) Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University(国立阳明交通大学电气与控制工程研究所)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 第二届生物特征足迹识别国际StepUP竞赛利用大规模数据集应对三项关键挑战,吸引26个注册者。ArogyaPandit研究团队用时空卷积神经网络结合集成评分策略获8.00%最佳等错误率,顶级方案展示相关策略价值,不过识别未知个人鞋类用户仍具挑战。

Comments Accepted to the 2026 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交 57%

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏