Topic Modeling Based Multi-modal Depression Detection
专题命中 视频多模态 :multi-modal(title);分类 cs.CL、eess.AS
Comments Proceedings of the 7th Audio/Visual Emotion Challenge and Workshop (AVEC). (Official Depression Challenge Winner)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(title);分类 cs.CL、eess.AS
Comments Proceedings of the 7th Audio/Visual Emotion Challenge and Workshop (AVEC). (Official Depression Challenge Winner)
专题命中 视频多模态 :multimodal(title);分类 cs.AI、cs.MM
Comments 11 pages, 5 figures, ICDM 2017
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.MM
保持简洁:用于超长视频理解的多键情景记忆检索
机构 * Yonsei University(延世大学) ; Adobe Research(奥多比研究院)
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。
Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/
主动视频感知:用于代理长视频理解的迭代证据寻求
机构 * Salesforce AI Research(Salesforce AI研究院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。
Comments Website: https://activevideoperception.github.io/
通过儿童自我中心输入进行持续的视觉与语言学习
机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学) ; Department of Psychology, Princeton University(心理学系,普林斯顿大学)
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出BabyCL持续多模态学习框架,在单一时间顺序处理SAYCam数据集,通过流式视觉表示学习和图像-文本对比目标,在SAYCam Labeled-S 4AFC基准上优于流式学习基线,缩小了与离线训练上限的差距。
Comments 15 pages, 4 figures
PaSBench-Video: 面向主动安全预警的流式视频基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。
层次化局部-全局Transformer用于时间语句定位
机构 * Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,华中科技大学网络安全科学与工程学院) ; Wangxuan Institute of Computer fTechnology, Peking University(王宣计算机技术研究院,北京大学) ; School of software, Dalian University of Technology(软件学院,大连理工大学) ; School of Computer Science, and Technology, Huazhong University of Science, and Technology(计算机科学与技术学院,华中科技大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 提出层次化局部-全局Transformer(HLGT),通过建模视频和查询的不同粒度层次及跨模态交互,实现更细粒度的多模态表示,并在三个数据集上取得最先进性能。
Comments Publish in IEEE Transactions on Multimedia
DisImpact:通过社交媒体量化自然灾害的生理-社会影响
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)
AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。
Comments Accepted by ICWSM 2026
LPM 1.0:基于视频的角色表现模型
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出LPM 1.0模型,通过构建多模态数据集和训练扩散变换器,实现高可控性和身份一致性的角色表现生成,支持实时交互和无限长度生成。
Comments 43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io
小视觉-语言模型是长视频理解的智能压缩器
机构 * Meta AI ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。
Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/
EVA: 为端到端视频代理的高效强化学习
机构 * SenseTime Research(商汤科技研究院)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。
Comments CVPR2026
重新思考视频中的链式推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。
Comments Technical report
机构 * ITI, CERTH(ITI、CERTH)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments In ACM Multimedia 2025, DOI:10.1145/3746027.3755821
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2025, project page at https://github.com/google-deepmind/video_comp
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to CVPR 2025, Project webpage: http://yuanze-lin.me/Olympus_page/
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ICLR2025
专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ICCV 2023, code is at https://github.com/bo-miao/SgMg
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Work under review for ICASSP 2023
专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NeurIPS 2021 (19 pages)
机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)
专题命中 视频多模态 :multi-modal(abstract,comments);cross-modal(abstract);分类 cs.CV、cs.AI
Comments The First Work that Exploits Multi-modal Knowledge Graph for Pedestrian Attribute Recognition
机构 * USTC(中国科学技术大学) ; NJU(南京大学) ; THU(清华大学) ; XMU(厦门大学)
专题命中 视频多模态 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、cs.CL
Comments Project page: https://github.com/VITA-MLLM/Sparrow
不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知
机构 * University of South Florida(南佛罗里达大学)
专题命中 视频多模态 :cross-modal(title);分类 cs.CV
AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。
Comments 7 pages, 3 figures. Working draft prepared for journal submission
带多模态收益的极小极大最优半参数情境动态定价
专题命中 视频多模态 :multimodal(title);分类 cs.AI
AI总结 该研究针对带多模态收益的情境动态定价问题,提出经试点校正的分层决策划分策略,达到依赖极小极大平滑性的时域速率,填补了半参数情境动态定价的相关理论空白。
Comments 53 pages