arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-09-01 至 2026-09-01 共收录 30 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 8 篇

2608.29958 2026-09-01 cs.CV 新提交 86%

RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

RIDGE:用于长视频理解的区域感知导数引导证据选择

Shanqing Xu, Meng Luo, Mengchen Qian, Yuhui Gao, Siyue Peng, Xiaohan Zhong, Xiaojin Zhang, Zhongyu Wei, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 视频理解 :long video(title,abstract);video understanding(title);分类 cs.CV

AI总结 针对长视频理解中视觉内容超出LVLM固定token预算的问题,提出RIDGE框架,通过将帧-查询相似性曲线作为时间信号划分区域并选择证据,在多基准和主干上取得最优性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交 83%

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28666 2026-09-01 cs.CV 新提交 83%

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

通过结构化视频提示提升视频-语言模型的时空推理能力

Sadegh Mohammadian

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 该研究提出无需训练的结构化视频提示方法,在推理时通过为视频添加时空结构锚点,提升视频-语言模型在时空推理任务上的性能,为改进视频理解提供了实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18586 2026-09-01 cs.CV cs.AI 版本更新 79%

APT: Atomic Physical Transitions for Causal Video-Language Understanding

APT: 用于因果视频语言理解的原子物理转变

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。

Comments v2:Expanded the experiment section with more baselines. Expand supplementary materials and LLM usage--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30279 2026-09-01 cs.CV 新提交 74%

Motion-Saliency Complementary Masked Modeling for Point Cloud Video Understanding

面向点云视频理解的运动显著性互补掩码建模

Wei Wang, Yiding Sun, Yuyan Wang, Zhuoyue Zhang, Zhengqiao Li, Dongfu Yin, Chen Li

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) State Key Laboratory of Intelligent Geotechnics and Tunnelling (FSDI)(智能岩土与隧道工程国家重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 该研究提出MoSaiC框架,结合CMSM、NFM、CTCP组件实现自监督点云视频表示学习,在多个下游任务上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-09-01 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 50%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 10 篇

2608.30194 2026-09-01 cs.CV 新提交 88%

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

NoisEasier:用于文本到视频生成的测试时噪声优化

Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交 79%

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29621 2026-09-01 cs.CV cs.AI 新提交 79%

CineForge: Self-Improving Agents for Long-Horizon Video Generation

CineForge:用于长时序视频生成的自改进智能体

Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li

机构 * Tongji University(同济大学) Kuaishou Technology(快手科技) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出CineForge框架,结合CineForge-Produce与CineForge-Evolve,通过CPPE策略演进机制提升长时序故事驱动视频生成效果,在CineScope指标及基准测试中表现优于现有方法,减少了审查LLM调用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28694 2026-09-01 cs.CV 新提交 79%

SNF-Bench: Separating Static Drift from Natural Flow in Long-Horizon Fixed-Camera Video Generation

SNF-Bench:分离长视野固定相机视频生成中的静态漂移与自然流动

Matiur Rahman Minar, Seunghun Oh, Ganghyeon Jeong, Unsang Park

机构 * Sogang University(西江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SNF-Bench 是针对长视野固定相机视频生成的评估框架,可分离静态漂移与自然流动,实验发现全帧运动与静态区域漂移对输出排序几乎相反,其指标能针对性评估对应因素。

Comments Project page: https://minar09.github.io/snfbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-09-01 cs.CV 版本更新 79%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Yujia Zeng, Tianlin Pan, Haofan Wang, Yueming Lyu, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29123 2026-09-01 cs.CV 新提交 74%

Dancing Stick Figures: An Introductory Dataset for Training Video Generation Models

跳舞的简笔画人物:用于训练视频生成模型的入门级数据集

Jin Hyuk Cho

机构 * Sprited(斯普里特公司) Dataset(数据集机构)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文针对视频生成模型训练的反馈循环长、数据难获取、评分粗糙三大痛点,构建了跳舞的简笔画人物数据集,该数据集规模适配单GPU训练,提供低预算训练流程,且含丰富标注以支持精准评估。

Comments 9 pages, 4 figures. Dataset, code, reference models, and Colab notebook are linked from the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新 74%

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新 70%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29469 2026-09-01 physics.optics 新提交 50%

Artificial Intelligence in a Photonic Temporal Processor

光子时间处理器中的人工智能

Youlve Chen, Jinlong Xiang, Yimin Hu, Yuchen Yin, Chaojun Xu, Zhengshun Lei, Xin Wang, Yufeng Zhang, Yixiao Zhu, Qunbi Zhuge, Junwen Zhang, Wei Chu, Tao Lin, Yikai Su, Zhipei Sun, Xuhan Guo

专题命中 视频生成 :video generation(abstract)

AI总结 该研究提出光子时间处理器,通过时空对偶性实现可扩展的光学神经网络,完成分类、图像视频生成等任务,性能优于现有系统,为下一代机器智能提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21385 2026-09-01 cs.HC 版本更新 50%

Beyond Reconstruction: What EEG-to-Video Decoding Actually Recovers

超越重建:脑电信号到视频解码究竟能恢复什么

Prajwal Singh, Anupam Sharma, Pankaj Pandey, Krishna Miyapuram, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract)

AI总结 本研究提出EEGVid框架用于脑电到动态视频的解码,发现脑电含视觉与情绪结构,当前重建仅反映粗粒度刺激级信息,三元组学习可优化脑电特征,生成器会主动利用脑电作为内容信号。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2608.29598 2026-09-01 cs.LG 新提交 88%

On the Resilience of Text-to-Video Diffusion Models to Hardware Faults

文本到视频扩散模型对硬件故障的鲁棒性研究

Zachary Coalson, A M Aahad, Stella Doehring, Zane Ma, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract)

AI总结 本研究首次系统性探究文本到视频(T2V)扩散模型对硬件故障的鲁棒性,发现单个故障可降低性能、改变语义,内存故障危害更大,揭示了已部署T2V系统的可靠性风险。

Comments Accepted to ICML 2026 Workshop on From Frames to Stories (F2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交 79%

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-09-01 cs.CV 版本更新 79%

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: https://ggxxii.github.io/ace-ego-hand

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-09-01 cs.CV cs.AI cs.RO 版本更新 79%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

Comments v2:Expanded the experiment section with more baselines and add more experiments in supplementary--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28670 2026-09-01 cs.CV 新提交 57%

Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache

基于BaryCache的内存高效无训练扩散Transformer加速方法

Chengjie Lu, Tianchi Deng, Zhengqi He, Zhijian Gao, Huisi Wu, Xueliang Li

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究提出无训练加速方法BaryCache,采用重心外推器缓解扩散Transformer采样的振荡伪影,在图像与视频生成中实现最高3.30倍采样加速,兼顾内存与感知质量。

Comments Accepted by ICITES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2608.28675 2026-09-01 cs.CV cs.CL 新提交 79%

Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning

用于视频推理的多智能体自增强强化学习

Mingwen Zhang, Jisheng Dang, Minqiang Yang, Bimei Wang, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学)

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

AI总结 该研究提出结合可训练Grounder与冻结Verifier的多智能体强化学习框架,在20亿参数规模下实现视频推理任务零样本迁移,相关指标优于同等规模基线,验证了冻结验证作为证据选择训练信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 57%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 2 篇

2608.22067 2026-09-01 cs.RO cs.AI cs.CV cs.LG 版本更新 57%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

Comments DeepLeap Technology Co., Ltd., Shenzhen, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30897 2026-09-01 cs.AI 新提交 50%

CAER: Causal Action Effect Reweighting for World Model Training

CAER:面向世界模型训练的因果动作效应重加权

Jianjie Fang, Xvyuan Liu, Ziyou Wang, Rongze Tang, Zhaolu Wang, Zhuohang Li, Xin Zhang, Haisheng Su, Chen Gao, Wei Wu, Xinlei Chen, Yong Li

专题命中 动作与事件理解 :video generation(abstract)

AI总结 针对现有动作条件世界模型训练中交互动态未充分优化的问题,提出CAER范式,通过在线定位动作因果影响的令牌并重加权,提升了生成视频的物理一致性、可控性与视觉质量。

Comments 14 pages, 8 figures. Project page: https://manifoldai-research.github.io/CAER/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 1 篇

2608.29910 2026-09-01 cs.CV 新提交 57%

Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory

Matrix-Game 3.5:利用补丁内存增强实时流式交互式世界模型

Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 Matrix-Game 3.5通过三项关键改进优化交互式世界模型,实现稳定长时序实时交互式生成,在多类任务上表现出色。

Comments https://matrix-game-v3-5.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 2 篇

2608.28784 2026-09-01 cs.CV 新提交 70%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-09-01 cs.CV 版本更新 57%

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏