Visual prompt engineering for video models
视频模型的视觉提示工程
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV
AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
视频模型的视觉提示工程
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV
AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。
TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。
LPM:工业规模的生成式视频修复
机构 * Kuaishou Technology(快手科技)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 研究提出工业规模的LPM用于视频修复,通过统一系统解决UGC退化问题,含数据工程、模型训练和推理。其架构等机制实现高保真修复,已在快手生产应用,节省带宽成本,还能集成产品,证明该方法实用、可扩展且具成本效益。
Comments 21 pages, 7 figures
WanToFight:用于多人战斗交互的实时生成游戏引擎
机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)
专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV
AI总结 WanToFight是用于多人战斗交互的实时生成游戏引擎,基于Wan-1.3B视频扩散变换器构建三个组件,解决了先前引擎未共同处理的问题,能结合多种玩法,在特定配置下维持30FPS,是首个此类集成系统。
Comments Project Page: https://humanaigc.github.io/wantofight/
StoryTeller:用于长格式音频描述的免训练叙事接地
机构 * Dartmouth College(达特茅斯学院)
专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV
AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026
视频语言模型真的在观看吗?诊断长视频中的角色跟踪失败
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 研究视频语言模型在长视频中跟踪角色的能力,通过九条件诊断协议测试三个开源模型及Gemini,发现模型准确性非来自角色跟踪,存在性别线索利用问题,还发布诊断工具包揭示基准分数衡量的实际情况。
LIST3R: 长序列实例感知三维重建
机构 * Beijing Jiaotong University(北京交通大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 提出LIST3R框架,通过实例锚点组织长序列三维重建,将子序列局部观测整合为全局一致场景,在长序列基准上实现更优轨迹与重建质量。
开放世界视频分割
机构 * University of Connecticut(康涅狄格大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 提出Savvy系统,结合分层掩码发现、延迟接纳和轨迹整合,实现零样本开放世界长时视频分割;并设计粒度感知评估套件OGA,采用n:1匹配协议,解决传统1:1匹配对开放世界方法的不公平惩罚问题。
MaineCoon: 追求实时音视频社交世界模型
机构 * Catnip AI Team(Catnip AI团队)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。
Comments 32 pages, 13 figures, 3 tables
TivTok:广播时间不变令牌以实现可扩展视频分词
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Kuaishou Technology(快手科技)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 提出TivTok,一种可重用感知的视频分词器,通过时间不变(TIV)和时间变化(TV)令牌分解视频,实现高效压缩和长视频建模,在标准基准上rFVD达12.65,压缩效率提升2.91倍。
通过候选感知因果推理增强教学视频中的时间答案定位
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 提出候选感知因果推理框架,通过视觉-语言预训练候选选择和基于GRPO的时序逻辑推理,解决教学视频中复杂问题理解和长视频片段定位挑战,在六个基准上取得最优mIoU。
AVIS: 视觉语言模型的自适应测试时缩放
机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; York University(约克大学)
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV
AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。
Comments Project page: https://avis-vlm.github.io/
Echo-Memory:动作世界模型中记忆的受控研究
机构 * Joy Future Academy(京东探索研究院)
专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV
AI总结 提出Echo-Memory框架,通过控制变量法研究动作条件世界模型中的记忆机制,发现原始上下文容量和块状状态空间递归对开放域返回任务至关重要。
Comments 9 figures and 28 pages, Code at \href{https://github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Memory}{this URL}
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 长视频与时序推理 :long video(abstract)
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
阿莱雅世界:交互式长视野世界建模——完整技术报告
机构 * Alaya Lab(阿莱亚实验室)
专题命中 长视频与时序推理 :video diffusion(abstract)
AI总结 研究旨在创建交互式视频世界模型,核心方法是基于15B视频扩散变压器构建阿莱雅世界,通过自回归生成短潜在块等实现多种能力,在iWorld - Bench上长视野生成性能最佳,为相关研究提供开源可扩展基础。
Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details