arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-12 至 2026-02-12 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.10986 2026-02-12 cs.LG 50%

TVCACHE: A Stateful Tool-Value Cache for Post-Training LLM Agents

TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理

Abhishek Vijaya Kumar, Bhaskar Kataria, Byungsoo Oh, Emaad Manzoor, Rachee Singh

机构 * cornell(康奈尔大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。

Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10015 2026-02-12 cs.RO cs.AI 50%

RoboSubtaskNet: Temporal Sub-task Segmentation for Human-to-Robot Skill Transfer in Real-World Environments

RoboSubtaskNet: 人类-机器人技能转移中的时间子任务分割用于现实环境

Dharmendra Sharma, Archit Sharma, John Rebeiro, Vaibhav Kesharwani, Peeyush Thakur, Narendra Kumar Dhar, Laxmidhar Behera

专题命中 视频理解 :video understanding(abstract)

AI总结 RoboSubtaskNet通过结合增强注意力的I3D特征和改进的MS-TCN,实现了人类-机器人技能转移中的时间子任务分割,提升了现实环境中的机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2602.10825 2026-02-12 cs.CV cs.AI 85%

Flow caching for autoregressive video generation

流缓存用于自回归视频生成

Yuexiao Ma, Xuzhe Zheng, Jing Xu, Xiwei Xu, Feng Ling, Xiawu Zheng, Huafeng Kuang, Huixia Li, Xing Wang, Xuefeng Xiao, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 FlowCache通过分块缓存策略和优化的KV缓存压缩机制,显著提升了自回归视频生成的速度,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 50%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2510.17247 2026-02-12 cs.CL cs.CV 85%

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11154 2026-02-12 cs.CV 57%

SurfPhase: 3D Interfacial Dynamics in Two-Phase Flows from Sparse Videos

SurfPhase:从稀疏视频中重建两相流三维界面动力学

Yue Gao, Hong-Xing Yu, Sanghyeon Chang, Qianxi Fu, Bo Zhu, Yoonjin Won, Juan Carlos Niebles, Jiajun Wu

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Aerospace Engineering, University of California, Irvine(加州大学伊藤分校航空航天工程系) School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SurfPhase通过动态高斯surfels和视频扩散模型,从稀疏视频中重建两相流的三维界面动力学,实现高质量视角合成和速度估计。

Comments The first two authors contributed equally. Project website: https://yuegao.me/SurfPhase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11105 2026-02-12 cs.CV 57%

FastFlow: Accelerating The Generative Flow Matching Models with Bandit Inference

FastFlow: 通过多臂老虎机推断加速生成流匹配模型

Divya Jyoti Bajpai, Dhruv Bhardwaj, Soumya Roy, Tejas Duseja, Harsh Agarwal, Aashay Sandansing, Manjesh Kumar Hanawal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Amazon(亚马逊)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FastFlow通过多臂老虎机推断方法,实现流匹配模型生成过程的加速,同时保持生成质量。

Comments Accepted at International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10173 2026-02-12 cs.CV 57%

ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop

ArtisanGS: 带有AI和人机协作的高斯点选择交互工具

Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina

机构 * NVIDIA NVIDIA Canada(NVIDIA 加拿大) University of Toronto Canada(多伦多大学 加拿大) NVIDIA France(NVIDIA 法国) University of Toronto(多伦多大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。

Comments 12 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2602.07449 2026-02-12 cs.CV 57%

SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads

SoulX-FlashHead: 基于Oracle的无限实时流式谈话头生成

Tan Yu, Qian Qiao, Le Shen, Ke Zhou, Jincheng Hu, Dian Sheng, Bo Hu, Haoming Qin, Jun Gao, Changhai Zhou, Shunshun Yin, Siyuan Liu

机构 * AIGC Team, Soul AI Lab(AIGC团队,Soul AI实验室)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 SoulX-FlashHead通过引入流式感知预训练和Oracle引导蒸馏,实现了高保真实时流式谈话头生成,达到最先进的性能并支持超快交互。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00891 2026-02-12 cs.CV 57%

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

通过分层令牌压缩加速流式视频大型语言模型

Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 STC通过分层令牌压缩技术,显著降低流式视频大语言模型的处理延迟,同时保持高精度。

Comments Code is avaliable at \url{https://github.com/lern-to-write/STC}

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 3 篇

2602.10639 2026-02-12 cs.CV cs.CR cs.MM 73%

VideoSTF: Stress-Testing Output Repetition in Video Large Language Models

VideoSTF: 视频大语言模型中输出重复性压力测试

Yuxin Cao, Wei Song, Shangzhi Xu, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM

AI总结 VideoSTF通过系统测量和压力测试揭示视频大语言模型中普遍存在的输出重复问题,发现其对时间扰动高度敏感,并暴露了其作为安全漏洞的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10675 2026-02-12 cs.CV cs.AI 57%

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集

Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08971 2026-02-12 cs.CV cs.RO 57%

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准

Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) Princeton University, Princeton, NJ, USA(普林斯顿大学) Chinese Academy of Sciences, Beijing, China(中国科学院) University of Science(科学技术大学) Peking University, Beijing, China(北京大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏