arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-02 至 2026-02-02 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2601.21815 2026-02-02 cs.CY cs.AI cs.CL cs.SI 82%

Moral Outrage Shapes Commitments Beyond Attention: Multimodal Moral Emotions on YouTube in Korea and the US

道德愤怒影响承诺:韩国和美国YouTube上的多模态道德情感

Seongchan Park, Jaehong Kim, Hyeonseung Kim, Heejin Bin, Sue Moon, Wonjae Lee

机构 * KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多模态道德情感分类器分析YouTube上道德愤怒对用户参与度的影响,发现其在不同文化中均能提升观看和评论等互动行为。

Comments Accepted at The Web Conference 2026. We release Korean and English multimodal moral emotion classifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22675 2026-02-02 cs.CV cs.AI 62%

Fire on Motion: Optimizing Video Pass-bands for Efficient Spiking Action Recognition

运动中的火焰:为高效脉冲动作识别优化视频通过带

Shuhan Ye, Yuanbin Qian, Yi Yu, Chong Wang, Yuqi Xie, Jiazhen Xu, Kun Wang, Xudong Jiang

机构 * Ningbo University(宁波大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PBO模块,通过优化时间通过带以提升动态视频中脉冲神经网络的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 62%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02295 2026-02-02 cs.CV cs.AI cs.LG 62%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22938 2026-02-02 cs.CR cs.AI eess.IV eess.SP 57%

A Real-Time Privacy-Preserving Behavior Recognition System via Edge-Cloud Collaboration

通过边缘-云协作实现实时隐私保护行为识别系统

Huan Song, Shuyu Tian, Junyi Hao, Cheng Yuan, Zhenyu Jia, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于AI流理论和边缘-云协作架构的隐私保护行为识别系统,通过边缘设备的特征抽象与云平台的联合推断,实现高隐私环境下的行为检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 57%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22547 2026-02-02 cs.IR 50%

PersonaAct: Simulating Short-Video Users with Personalized Agents for Counterfactual Filter Bubble Auditing

PersonaAct: 通过个性化代理模拟短视频用户以进行反事实过滤气泡审计

Shilong Zhao, Qinggang Yang, Zhiyi Yin, Xiaoshi Wang, Zhenxing Chen, Du Su, Xueqi Cheng

专题命中 视频多模态 :multimodal(abstract)

AI总结 PersonaAct通过个性化代理模拟短视频用户,提升过滤气泡审计的保真度和深度,揭示内容压缩现象并释放首个开源数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏