arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2610.00069cs.CVcs.AI

基于时间分割与语义抽象的第一人称与第三人称程序性理解框架

A Framework for Egocentric and Exocentric Procedural Understanding via Temporal Segmentation and Semantic Abstraction

Vivek Chavan, Jörg Krüger

首次发表
浏览论文内容

中文总结 AI 辅助

提出一种将长时程第一/第三人称视频转化为结构化程序性状态记忆的紧凑框架,通过事件分割与语义抽象实现高效、可审计的文档记录与检索。

中文摘要 AI 辅助

长时程的第一人称/第三人称数据包含丰富的程序性证据,但存在冗余、噪声大且处理或保留成本高昂的问题。我们提出一个紧凑框架,将连续的多模态工作场所视频转换为结构化的程序性状态记忆,实现为工作环境模型(WEM)。受事件分割理论启发,我们利用视觉上下文、位置、运动、叙述、注视/物体交互以及可选的第三人称工作区证据的变化来检测边界,而非依赖固定窗口或仅凭视觉新颖性。每个片段被抽象为一张带有证据关联的事件卡,包含执行者、时间间隔、位置、动作、物体/工具、前/后状态、置信度和来源信息。这些事件卡增量更新WEM,支持在本地隐私约束下的紧凑、可审计的文档记录与检索。我们使用冻结的DINOv2和VJEPA-2编码器以及本地语言模型实例化该设计,并概述了针对分割质量、记忆压缩、检索保真度和长时程问答的评估标准。

英文摘要

Long-horizon ego/exo data contains rich procedural evidence, but are redundant, noisy, and costly to process or retain. We propose a compact framework that converts continuous multimodal workplace video into a structured Procedural State Memory, implemented as a Work Environment Model (WEM). Inspired by event segmentation theory, we detect boundaries using changes in visual context, location, motion, narration, gaze/object interaction, and optional exocentric workspace evidence, rather than fixed windows or visual novelty alone. Each segment is abstracted into an evidence-linked event card containing actor, interval, location, action, objects/tools, pre/post state, confidence, and provenance. These event cards incrementally update the WEM, enabling compact, auditable documentation and retrieval under on-premise privacy constraints. We instantiate the design with frozen DINOv2 and VJEPA-2 encoders and a local language model, and outline evaluation criteria for segmentation quality, memory compression, retrieval fidelity, and long-horizon QA.

发表机构

  • Fraunhofer IPK(弗劳恩霍夫生产设备和设计技术研究所)
  • Technische Universität Berlin(柏林工业大学)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑