Audio-Visual Event Localization in Unconstrained Videos
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
Comments 23 pages, 7 figures
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
Comments 23 pages, 7 figures
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.MM
Comments 15 pages, 8 figures
Journal ref IEEE Transactions on Audio, Speech, and Language Processing 23(4), 718-731, April, 2015
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);information fusion(journal_ref)
Comments Code available at https://github.com/idearibosome/embracenet
Journal ref Information Fusion 51 (2019) 259-270
专题命中 音视频/视觉语言融合 :information fusion(comments,journal_ref);分类 cs.CV、cs.MM
Comments Accepted by Information Fusion. The code is available at https://github.com/sunlicai/HiCMAE
Journal ref Information Fusion, 2024
心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。
Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations
Journal ref Journal of Industrial Integration and Management (JIIM), 2025
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
解码学生心智:利用对话代理进行心理和学习分析
机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) ; LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) ; Faculty of Sciences of Tunis(突尼斯科学学院) ; LINFI Laboratory(LINFI实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。
基于最优传输的基于大语言模型的视听语音识别语义对齐
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。
循环平稳性分析作为语音深度伪造检测中自监督表示的补充
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)
AI总结 本文提出基于循环平稳性分析的声学特征提取框架,用于提升语音深度伪造检测的性能。
Comments accepted for publication in IEEE Transactions on Audio, Speech and Language Processing
视频介导对话中不同伙伴可见性条件下的多模态信息性研究
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本研究针对视频介导对话,构建基于语音、手势或两者的模型识别指称对象,发现手势可单独预测指称,融合模型在转录模型不确定时效果最佳,还揭示了伙伴可见性对互动的语用效应。
通过部分信息分解理解多模态语言模型中的模态交互
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract)
AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。
Comments Accepted by ICML 2026
DoubleHelix:结合大语言模型的视听语音识别结构化跨模态融合方法
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 该研究针对视听语音识别跨模态融合缺乏结构化迭代优化的问题,提出DoubleHelix融合框架,通过三个组件实现迭代交互与退化感知增强,在LRS3数据集上大幅降低词错误率并提升噪声鲁棒性。
Comments ACM MM2026 ACCEPTED
用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练
机构 * University of Milan(米兰大学) ; Gran Sasso Science Institute (GSSI)(大萨索科学研究所)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。
Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)
基于多视角语音特征的LoRA微调大语言模型用于痴呆检测
机构 * NAVER Cloud(NAVER云) ; Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。
Comments Accepted at INTERSPEECH 2026
MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习
机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) ; Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) ; State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。
Comments Accepted by IEEE Transactions on Artificial Intelligence
用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限
机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。
弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测
机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) ; NAVER Cloud, South Korea(韩国NAVER Cloud)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。
Comments Accepted at INTERSPEECH 2026
ASR无关的多模态谱时建模用于早期痴呆检测
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。
ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解
机构 * Kyoto University, Japan(京都大学,日本) ; Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。
Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。
Comments Accepted to INTERSPEECH 2026
基于数据驱动的Russell情感环状模型解码
机构 * Alten ; CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) ; Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。
Comments This work has been submitted to the IEEE for possible publication
TRACE: 面向多模态时间序列基础模型的时间条件估计
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出TRACE条件估计范式,通过利用可用辅助模态推断缺失目标模态,解决多模态时间序列中的时间错位和部分模态缺失问题,在医疗和情感分析基准上优于现有融合方法。
Comments 5 figures and 5 tables in the main paper, plus appendix
DBHN-Net: 低复杂度单声道语音增强的双分支混合神经网络
机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, (School of Computer Science and Technology), Anhui University(光电信息获取与防护技术国家重点实验室(计算机科学与技术学院),安徽大学) ; China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) ; Institute of Acoustics, University of Chinese Academy of Sciences(中国科学院声学研究所) ; Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI),中国电信,中国)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
AI总结 提出一种结合ANN和SNN的双分支混合神经网络,通过BandSplit、TF-Mamba等模块降低计算复杂度,同时利用交互和融合模块保持性能,在三个公共数据集上实现平均7.5倍复杂度降低。
Comments This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI2026)
ConSensus:面向多模态感知的多智能体协作
机构 * KAIST(韩国科学技术院) ; Nokia Bell Labs(诺基亚贝尔实验室) ; University of Glasgow(格拉斯哥大学)
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)
AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。
Comments Accepted to ACL 2026 Findings
专家混合模型用于从访谈和阅读任务中识别抑郁症
机构 * DSS Laboratory, School of ECE, National Technical University of Athens, Greece(国家技术大学雅典分校电子工程系DSS实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出利用多模态融合和专家混合模型,从访谈和阅读任务的语音中识别抑郁症,实现87%的准确率和86.66%的F1分数。
Comments Accepted at ICASSP 2026
EviDep:通过解耦证据学习实现可信的多模态抑郁估计
机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; Department of Psychiatry, The First Affiliated Hospital of University of Science and Technology of China, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院精神科,生命科学与医学学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出EviDep框架,通过解耦证据学习量化抑郁严重程度及不确定性,提升多模态抑郁估计的可信度和不确定性校准能力。
通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的
机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。
Comments 8 pages, 1 figure, under review at XAI 2026 LBW
CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。
基于频谱和时间序列表示的商品价格多模态预测
机构 * Impactive AI
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出SEMF方法,结合频谱和时间序列表示,提升多变量时间序列预测的准确性与鲁棒性,通过多模态融合和频谱编码在多个商品价格预测任务中优于七种基线模型。
Comments AAAI 2026 Summer Symposium Series; 9 pages
关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别
机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) ; Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。
Comments 19 pages
Journal ref neurocomputing2026