(Re)framing Built Heritage through the Machinic Gaze
专题命中 图文多模态 :image-text(abstract)
Comments 18 pages, 5 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(abstract)
Comments 18 pages, 5 figures
专题命中 图文多模态 :image-text(abstract)
专题命中 图文多模态 :multi-modal(abstract)
Journal ref SIGGRAPH 2023
专题命中 图文多模态 :image-text(abstract)
Comments 5 pages, 5 tables, 3 figures. Accepted by ICASSP 2023
专题命中 图文多模态 :image-text(abstract)
专题命中 图文多模态 :image-text(abstract)
专题命中 图文多模态 :image-text(abstract)
ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型
机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。
mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台
机构 * Warsaw University of Technology(华沙理工大学)
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。
Comments Submitted to ACL2026
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL
Comments NAACL 2025
跨语音与面部的情感:多模态基础模型中的共享情感机制
机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) ; Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)
专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。
Comments 9 pages, 4 figures
OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构
机构 * Shanghai Qizhi Institute(上海期智研究院) ; College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。
Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026
WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入
机构 * Tsinghua University(清华大学) ; WeChat Vision, Tencent Inc.(腾讯公司)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。
FutureOmni:从全模态上下文中评估多模态大语言模型的未来预测能力
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract)
AI总结 提出FutureOmni基准,评估多模态大模型从音视频线索预测未来的能力,发现现有模型在语音密集场景下表现差,并设计OFF训练策略提升性能。
Comments Accepted by ICML 2026
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://av-odyssey.github.io/
当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract)
AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。
Comments Accepted to ACM HCOMP 2026
AVSCap:为全模态视频字幕编排视听协同
机构 * Nanjing University(南京大学) ; Kuaishou Technology(快手科技) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)
AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。
InteractiveOmni: 一种用于音频-视觉多轮对话的统一多模态模型
机构 * SenseTime Research(商汤科技研究院)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 InteractiveOmni是一种统一的多模态模型,通过多阶段训练策略提升多轮对话能力,提供高效的音频-视觉交互体验。
多模态模型中的跨模态后门
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted to NeurIPS 2023
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 12 pages, 5 figures, Accepted by IJCAI 2023
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments CVPR 2022
CoLA: 跨模态低秩适配用于多模态下游任务
机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) ; University of Surrey(塞维利亚大学) ; Surrey Institute for People-Centred AI(以人为本的人工智能研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。
Comments Accepted by ICML 2026, 17 pages, 6 Figures
SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索
机构 * Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系) ; School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) ; Nanjing University(南京大学) ; Xiamen University(厦门大学) ; Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 提出SMART框架,融合音频与视觉特征,利用镜头感知令牌压缩技术,在多模态大模型基础上实现视频时刻检索,在Charades-STA和QVHighlights上取得显著提升。
多模态还是非多模态:通过主动模态检测的查询自适应音视频人物检索
机构 * University of Cambridge(剑桥大学) ; Queen's University Belfast(贝尔法斯特女王大学) ; University of Surrey(萨里大学) ; Cisco(思科) ; Southwest Jiaotong University(西南交通大学) ; Teesside University(泰赛德大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出一种查询自适应框架,通过跨模态分数一致性检测主动模态,在BBC Rewind语料库上达到94.2%的P@1,优于单模态和固定融合方法。
Comments INTERSPEECH 2026
LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Peking University(北京大学) ; HKUST(香港科技大学) ; CASIA(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);multimodal(abstract);cross-modal(abstract)
AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。
Comments 21 pages, 15 figures
音频视频质量评估中的多模态置信度建模
机构 * Texas State University Department of Computer Science(德克萨斯州立大学计算机科学系)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出MCM-AVQA框架,通过多模态置信度感知方法提升音频视频质量评估的准确性与可解释性,特别在处理不对称退化时表现更优。
Comments Accepted at ICIP 2026, 6 pages, 4 figures, no supplementary material
跨模态二进制注意力:面向音频视觉学习的高效融合框架
机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) ; Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学方法中心)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 提出CMQKA和SNNergy,通过高效二进制操作实现线性复杂度的跨模态融合,显著提升音频视觉任务的能耗效率和性能