Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted to Findings of ACL 2024
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、eess.IV
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by WACV 2024; well-formatted PDF is in https://drive.google.com/file/d/1qvW52lamsvNGMCqPS7q8g8L4NaR_LlbR/view?usp=sharing. arXiv admin note: text overlap with arXiv:2401.04023
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Published in TMLR 2023
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments Camera-ready version for WACV 2024; project page is https://jinxiang-liu.github.io/anno-free-AVS/
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted In Proceedings of the 31st ACM International Conference on Multimedia (MM' 23)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、eess.IV
Comments 12 pages, 5 figures, to be published in CICAI2023
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments 14 pages, 5 figures, Accepted by ACL 2023
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments Paper Accepted by ICASSP2023
专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.IV、cs.MM
Comments Accepted by Interspeech2020
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
Comments CVPR 2020. Project page: http://music-gesture.csail.mit.edu
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by SIGIR 2019 as a full paper
Journal ref SIGIR, 2019, pages 655-664
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments Accepted for ECCV 2018
机构 * Indian Institute of Technology Indore(印度印度理工学院Indore) ; Brown University(布朗大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV;information fusion(comments)
Comments Published in Information Fusion
无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索
机构 * University of Luxembourg(卢森堡大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。
Journal ref Transactions on Machine Learning Research, 2026
特质更深:面向人格评估的特质特异性非对称融合
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) ; Jianghuai Advanced Technology Center(江淮前沿技术中心) ; Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。
基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪
机构 * Shanghai University(上海大学) ; PAII Inc.(PAII公司)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。
Comments Accepted by IEEE Transactions on Multimedia
退化视觉条件下水下机器人的鲁棒跨模态基础模型感知
机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。
通过交叉注意力和门控融合进行多模态矛盾与犹豫识别
机构 * University of Paris 8(巴黎第八大学) ; LIASD Laboratory(LIASD实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。
LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; UNSW Sydney(新南威尔士大学悉尼分校) ; School of Information and Communication Technology(信息与通信技术学院) ; Griffith University(格里菲斯大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
描述到评分:一种用于图像复杂度评估的文本引导框架
机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。
Comments Accepted by Pattern Recognition
用于通用跨模态行人重识别的双空间模态一致性学习
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV
AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。
用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。