arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交 57%

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19356 2026-07-20 cs.CV 版本更新 57%

Rethinking Reward Signals in Video GRPO: When Scores Become Targets

重新思考视频GRPO中的奖励信号:当分数成为目标

Rui Li, Yuanzhi Liang, Ziqi Ni, Haibin Huang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出TaRoS框架,通过组件级评估和组内稀疏性解决GRPO中奖励信号失真问题,提升视频生成的视觉质量和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交 57%

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交 57%

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 57%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新 57%

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26740 2026-07-14 cs.CV 版本更新 57%

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

LiveEdit:迈向基于扩散的实时流式视频编辑

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

机构 * THU(清华大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出一种因果逐帧编辑的流式视频框架,通过三阶段蒸馏将双向模型能力迁移至单向流式编辑器,结合AR掩码缓存实现12.66 FPS的实时编辑,并保持背景稳定。

Comments Accepted by ECCV 2026, Project page: https://live-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23191 2026-07-14 cs.CV 版本更新 57%

GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation

GeoWorld:提供全帧几何特征以促进3D场景生成

Yuhao Wan, Lijuan Liu, Jingzhi Zhou, Zihan Zhou, Xuying Zhang, Dongbo Zhang, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP & AAIS, Nankai University(VCIP与AAIS,南开大学) ByteDance Inc.(字节跳动公司) Renmin University of China(中国人民大学) NKIARI, Shenzhen Futian(NKIARI,深圳福田)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对视频模型用于图像到3D场景生成时的几何失真等问题,提出两阶段GeoWorld方法,先由视频模型和多视图几何模型生成全帧几何特征辅助第二阶段,还提几何损失和适配模块,能生成更高保真3D场景且更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19348 2026-07-09 cs.CV 版本更新 57%

When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators

当蒸馏破坏运动控制时:恢复快速视频生成器的生成轨迹

Jintao Rong, Xin Xie, Xinyi Yu, Linlin Ou, Xinyu Zhang, Chunhua Shen, Dong Gong

机构 * Zhejiang University of Technology(浙江工业大学) University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼)) University of Auckland(奥克兰大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究免训练运动定制应用于蒸馏视频生成器的问题,提出MotionEcho框架,通过推理时用高质量扩散教师模型校正学生模型采样轨迹,实现准确运动控制,提升运动保真度和视觉质量,且保留蒸馏生成效率优势。

Comments Project page: https://euminds.github.io/motionecho/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交 57%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03043 2026-07-07 cs.CV 新提交 57%

Natural Language Camera Movement Understanding

自然语言相机运动理解

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

机构 * Boston University(波士顿大学) Pixocial Technology(皮克索西尔科技公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 57%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 57%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 57%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交 57%

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01663 2026-07-03 cs.CV 新提交 57%

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis

统一全景-高斯表示用于单目4D场景合成

Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出PanoGaussian,结合全景轨迹引导与显式动态高斯表示,解决单目视频4D场景合成中视角外区域推断不一致和动态内容建模问题。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 57%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交 57%

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13793 2026-07-02 cs.CV 版本更新 57%

From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation

从同步到序列:通过插值实现外视角到视角的视频生成

Mohammad Mahdi, Nedko Savov, Danda Pani Paudel, Luc Van Gool

机构 * 1 INSAIT, Sofia University “St. Kliment Ohridski”

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Syn2Seq-Forcing方法,通过插值生成连续信号解决外视角到视角视频生成中的时空和几何断点问题,提升扩散模型在跨视角视频合成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24336 2026-07-01 cs.CV 新提交 57%

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

TIGER:驯服身份、几何和生成先验以实现高质量人脸视频恢复

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIGER框架,融合身份、几何和生成先验,通过解耦3D参数空间和一步整流流,解决人脸视频恢复中的身份偏移、视角纠缠和感知真实性问题,实现高保真、时间一致且高效的恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30045 2026-06-30 cs.CV 57%

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

行走于隐空间:通过神经场景表示进行交互式世界探索

Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Afari Intelligent Drive(Afari智能驾驶)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出以场景为中心的交互式视频生成范式,将生成变量从帧隐变量改为可渲染的固定长度隐状态(神经隐式场景),通过紧凑场景状态随机转移和确定性姿态条件渲染实现长程一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28531 2026-06-30 cs.MM cs.CL 57%

A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks

好的演讲不像摘要,它教你!衡量论文到视频演讲的收获

Ishani Mondal, Aparna Garimella, Ananya Sai, Pannaga Shivaswamy, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 提出EffectivePresentationScorer框架,通过评估解释清晰度、背景概念引入和细节与贡献的关联,衡量论文讲解视频的教学质量,发现现有视频生成系统缺乏解释性。

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI 57%

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02918 2026-06-30 cs.CV 57%

Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems

在视频生成模型中评估牛顿力学

Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark Bodracska, Nicu Sebe, Andrii Zadaianchuk, Efstratios Gavves

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Morpheus框架,通过真实物理系统评估视频生成模型对牛顿力学的理解能力,揭示当前模型在物理原理编码上的不足。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交 57%

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 57%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19193 2026-06-26 cs.CV 57%

How Far Are Video Models from True Multimodal Reasoning?

视频模型距离真正的多模态推理还有多远?

Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li, Yan Zhang, Ziyi Chen, Daoan Zhang, Dezhi YU, Wei Xu, Songtao Jiang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出CLVG-Bench评估框架,通过上下文学习测试视频模型的零样本推理能力,揭示当前SOTA模型在逻辑推理和交互生成任务中表现不足,指出多模态推理和物理基础是关键瓶颈。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24799 2026-06-24 cs.CV cs.AI 新提交 57%

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

OrbitForge: 通过重建锚定的视频合成实现文本到3D场景生成

Chenrui Fan, Paolo Favaro

机构 * Computer Vision Group, Institute of Computer Science University of Bern(计算机视觉组,计算机科学研究所,伯恩大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出OrbitForge,利用冻结的视频先验和每提示高斯泼溅重建优化,将单个文本生成视频转换为规范闭轨3D场景,无需任务特定微调或分数蒸馏。

Comments 40 pages, 33 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05896 2026-06-24 cs.CV 版本更新 57%

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

共鸣心智:具备心智理论的闭环社交虚拟人

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Jenq-Neng Hwang, Wentao Zhu

机构 * University of Washington(华盛顿大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Eastern Institute of Technology, Ningbo(宁波工程技术学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出一个闭环双智能体框架,通过整合感知、社会推理(基于心智理论)和多模态生成,实现具备社交智能的虚拟人,并在信息不对称数据集上取得优于全信息脚本模式的对话质量。

Comments Project page: https://resonantminds.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22835 2026-06-23 cs.CV cs.AI 新提交 57%

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention

OrthoMotion:通过几何语义正交注意力解耦相机与主体运动

Zijie Meng

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OrthoMotion方法,通过将相机运动编码为几何通道(旋转位置嵌入相位旋转)和主体运动编码为语义通道(门控值注入交叉注意力),并利用正交正则化保证解耦,实现可控视频生成中相机与主体运动的独立控制,将串扰降低2.4倍以上。

Comments Accepted by SCA2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏