arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-12 至 2026-02-12 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 3 篇

2602.10639 2026-02-12 cs.CV cs.CR cs.MM 73%

VideoSTF: Stress-Testing Output Repetition in Video Large Language Models

VideoSTF: 视频大语言模型中输出重复性压力测试

Yuxin Cao, Wei Song, Shangzhi Xu, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM

AI总结 VideoSTF通过系统测量和压力测试揭示视频大语言模型中普遍存在的输出重复问题,发现其对时间扰动高度敏感,并暴露了其作为安全漏洞的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10675 2026-02-12 cs.CV cs.AI 57%

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集

Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08971 2026-02-12 cs.CV cs.RO 57%

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准

Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) Princeton University, Princeton, NJ, USA(普林斯顿大学) Chinese Academy of Sciences, Beijing, China(中国科学院) University of Science(科学技术大学) Peking University, Beijing, China(北京大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏