Recognizing and Presenting the Storytelling Video Structure with Deep Multimodal Networks
专题命中 视频理解 :long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :long video(abstract);分类 cs.CV
专题命中 视频理解 :long video(abstract);分类 cs.CV
Comments Accepted to ECCV 2016
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
专题命中 视频理解 :long video(abstract);分类 cs.CV
Comments Video summarization, deep convolutional neural networks, co-regularized restricted Boltzmann machines
专题命中 视频理解 :long video(abstract);分类 cs.CV
Comments 13 pages
BasketEvent:理解篮球视频中谁在何时做了什么
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 视频理解 :video understanding(abstract)
AI总结 该研究旨在解决篮球视频理解问题,提出以球员为中心的BasketEvent数据集,引入PlayNet推理框架,通过建模多种互动并聚合时间证据进行事件预测,实验证明其在体育视频理解上优于基线。
EPIC:面向具身AR眼镜的高效自我中心感知系统框架
专题命中 视频理解 :video understanding(abstract)
AI总结 提出EPIC系统,通过算法-硬件协同优化,利用注视、姿态和惯性信号推断用户意图,仅保留高分辨率感知输入中最具信息量的部分,平均减少27.5倍内存占用和24.3倍能耗,同时保持自我中心视频理解任务的智能辅助精度。
OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架
专题命中 视频理解 :video understanding(abstract)
AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。
Comments Any questions feel free to contact: benchen4395@gmail.com
GridPE: 一种基于网格细胞的统一位置嵌入方法用于任意维度空间
机构 * New York University(纽约大学) ; Peking University(北京大学) ; Imperial College London(伦敦帝国学院) ; Tongji University(同济大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 本文提出GridPE,一种受哺乳动物空间认知中六边形周期编码启发的新型位置嵌入框架,旨在解决高维时空任务中位置嵌入的理论保障问题,通过结合计算神经科学原理和调和分析,为任意维度空间提供统一的位置嵌入解决方案。
多视频摘要中位置偏差的系统评估:基于多模态大语言模型
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) ; International Center of Future Science, Jilin University(未来科学国际中心)
专题命中 视频理解 :video understanding(abstract)
AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。
OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) ; Nanjing University(南京大学) ; The Hong Kong University of Science(香港科学大学) ; Sichuan University(四川大学) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。
Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT
见林木而非树木:通过视觉-语义引导实现松散推测解码以提高视频大语言模型的推理效率
机构 * ZJU(浙江大学) ; BUPT(北京邮电大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 本文提出LVSpec,一种无需训练的松散推测解码框架,通过视觉相关锚点识别和位置移位容忍机制,提升视频大语言模型的推理速度和精度。
Comments ACL'2026 Main Conference
Fanar 2.0:阿拉伯生成AI堆栈
机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) ; Hamad Bin Khalifa University(哈马德·本·卡西姆大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。
人机交互:从视频演示中学习机器人模仿
专题命中 视频理解 :video understanding(abstract)
AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。
TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理
机构 * cornell(康奈尔大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。
Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution
RoboSubtaskNet: 人类-机器人技能转移中的时间子任务分割用于现实环境
专题命中 视频理解 :video understanding(abstract)
AI总结 RoboSubtaskNet通过结合增强注意力的I3D特征和改进的MS-TCN,实现了人类-机器人技能转移中的时间子任务分割,提升了现实环境中的机器人操作性能。
SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究
机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)
专题命中 视频理解 :video-language(abstract)
AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。
语义视觉引导的音频突出与大型视觉-语言模型
机构 * University of Rochester(罗切斯特大学)
专题命中 视频理解 :video understanding(abstract)
AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。
本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用
机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) ; Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
专题命中 视频理解 :video understanding(abstract)
AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。
通过时空分离释放脉冲神经网络的时间能力
专题命中 视频理解 :video understanding(abstract)
AI总结 本文提出STSep网络,通过解耦空间与时间分支,提升脉冲神经网络在视频理解中的时空建模能力。
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Basic Algorithm Center, Tencent(腾讯基础算法中心)
专题命中 视频理解 :video understanding(abstract)
Comments EMNLP 2025 Main Camera Ready
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; XPeng(小鹏)
专题命中 视频理解 :video understanding(abstract)
Comments 14 pages, 11 figures and 3 tables. Project page is available at \url{https://irvlutd.github.io/HRT1/}
专题命中 视频理解 :video understanding(abstract)
Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 视频理解 :video understanding(abstract)
Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident
机构 * University of Minnesota(明尼苏达大学)
专题命中 视频理解 :video generation(abstract)
Comments Project page: https://minnesotanlp.github.io/scitalk-project-page/
机构 * Duke University(杜克大学) ; Duke Kunshan University(杜克昆山大学)
专题命中 视频理解 :video understanding(abstract)
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视频理解 :video understanding(abstract)