arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 221 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 221 篇

2607.06516 2026-07-08 cs.CV 新提交 57%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03043 2026-07-07 cs.CV 新提交 57%

Natural Language Camera Movement Understanding

自然语言相机运动理解

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

机构 * Boston University(波士顿大学) Pixocial Technology(皮克索西尔科技公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 57%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 57%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交 57%

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01663 2026-07-03 cs.CV 新提交 57%

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis

统一全景-高斯表示用于单目4D场景合成

Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出PanoGaussian,结合全景轨迹引导与显式动态高斯表示,解决单目视频4D场景合成中视角外区域推断不一致和动态内容建模问题。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交 57%

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24336 2026-07-01 cs.CV 新提交 57%

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

TIGER:驯服身份、几何和生成先验以实现高质量人脸视频恢复

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIGER框架,融合身份、几何和生成先验,通过解耦3D参数空间和一步整流流,解决人脸视频恢复中的身份偏移、视角纠缠和感知真实性问题,实现高保真、时间一致且高效的恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交 57%

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 57%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24799 2026-06-24 cs.CV cs.AI 新提交 57%

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

OrbitForge: 通过重建锚定的视频合成实现文本到3D场景生成

Chenrui Fan, Paolo Favaro

机构 * Computer Vision Group, Institute of Computer Science University of Bern(计算机视觉组,计算机科学研究所,伯恩大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出OrbitForge,利用冻结的视频先验和每提示高斯泼溅重建优化,将单个文本生成视频转换为规范闭轨3D场景,无需任务特定微调或分数蒸馏。

Comments 40 pages, 33 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22835 2026-06-23 cs.CV cs.AI 新提交 57%

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention

OrthoMotion:通过几何语义正交注意力解耦相机与主体运动

Zijie Meng

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OrthoMotion方法,通过将相机运动编码为几何通道(旋转位置嵌入相位旋转)和主体运动编码为语义通道(门控值注入交叉注意力),并利用正交正则化保证解耦,实现可控视频生成中相机与主体运动的独立控制,将串扰降低2.4倍以上。

Comments Accepted by SCA2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22416 2026-06-23 cs.CV 新提交 57%

Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition

Gen2Balance:面向长尾视频动作识别的生成式平衡方法

Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron, Dima Damen

机构 * University of Bristol(布里斯托大学) Adobe Research(Adobe 研究院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出Gen2Balance方法,利用文本到视频生成模型将长尾训练集平衡为真实与生成视频的混合,结合两阶段训练策略缓解域偏移,在长尾基准上显著提升动作识别准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15015 2026-06-19 cs.CV cs.AI 新提交 57%

NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics

NEXUS: 用于物理一致的高接触3D物体动力学的神经能量场

Qizhen Ying, Guangming Wang, Yangchen Pan, Victor Adrian Prisacariu, Brian Sheil, Yixiong Jing

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出神经能量场框架NEXUS,通过标量能量和耗散项建模保守与非保守动力学,提升高接触3D场景下的长时程轨迹精度并指导视频生成。

Comments 18 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18943 2026-06-18 cs.CV 新提交 57%

Physics-IQ Verified

物理智力验证

Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth

机构 * Anates Labs(Anates实验室) Technical University of Munich(慕尼黑技术大学) University of Technology Nuremberg(纽伦堡技术大学) Tuebingen AI Center, University of Tuebingen(图宾根大学人工智能中心) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) Google DeepMind research(谷歌DeepMind研究)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Physics-IQ Verified基准,通过改进提示和地面真实质量及引入样本级评分系统,提升视频生成模型对物理现实的理解评估,验证结果表明基准提升了57.6%的样本和34.8%的提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16401 2026-06-16 cs.CV 新提交 57%

RGFVR: Reference-Guided Face Video Restoration with Flow Matching

RGFVR: 基于参考引导的流匹配人脸视频修复

Cem Eteke, Batuhan Tosun, Eckehard Steinbach

机构 * Chair of Media Technology, Munich Institute of Robotics and Machine Intelligence, School of Computation, Information, and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院慕尼黑机器人与机器智能研究所媒体技术教席)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出一种主体无关的参考引导框架,通过双模态感知-描述身份条件注入预训练流匹配文本到视频生成器,结合两阶段训练策略,在降采样、模糊、噪声和压缩伪影等退化下提升人脸视频修复的保真度、时间一致性和身份保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16317 2026-06-16 cs.CV 新提交 57%

Training-free sparse attention based on cumulative energy filtering

基于累积能量过滤的无训练稀疏注意力

Chunlu Li, Yixuan Pan, Bai Du, Zhenyuan Chen, Yanzhao Li, Hui Dong, Hui Wang, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出动态阈值策略,在保持固定召回率的同时提高稀疏性,并与Flash Attention深度集成,无需额外掩码计算,在Wan 2.2上稀疏度从61.42%提升至82%,VBench指标下降小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交 57%

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13432 2026-06-12 cs.CV cs.AI 新提交 57%

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

OmniDirector: 无需配对数据的通用多镜头相机克隆

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11838 2026-06-11 cs.CV 新提交 57%

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

基于时空场景图基础的计划与验证视频奖励推理

Hyomin Kim, Junghye Kim, Joanie Hayoun Chung, Yoonjin Oh, Kyungjae Lee, Sungbin Lim, Sungwoong Kim

机构 * Korea University(高丽大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出SG-PVR视频奖励模型,通过计划-验证推理和时空场景图,系统验证提示中的每个条件,实现细粒度语义对齐,提升文本到视频生成的组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 57%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10988 2026-06-10 cs.CV cs.GR 新提交 57%

AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects

AnimaSpark: 一种用于任意3D对象动画的前馈方法

Yiming Zhao, Haoyu Sun, Aoyu Wang

机构 * Bytedance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-06-09 cs.CV 新提交 57%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: https://aka.ms/latent-spatial-memory, Code: https://github.com/microsoft/LatentSpatialMemory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08780 2026-06-09 cs.CV 新提交 57%

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

超越一致性:在零样本视频编辑中保留时间结构

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

机构 * Anhui University(安徽大学) University of Surrey(萨里大学) University of Warwick(华威大学)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 提出一种零样本视频编辑方法,通过自适应分割视频片段、选取锚帧和令牌合并策略,首次显式保留源视频的时间结构,平衡编辑保真度与计算效率。

Journal ref Pattern Recognition, Vol. 180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07967 2026-06-09 cs.CV 新提交 57%

DisCo: World Models with Discrete Camera Motion Control

DisCo: 具有离散相机运动控制的世界模型

Hongrui Huang, Junke Wang, Quanhao Li, Yu-Gang Jiang, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出DisCo,通过离散动作原语替代连续相机轨迹作为条件,解决可控视频生成中动作表示纠缠问题,提升动作跟随可靠性,并引入DisCoBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 56%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 视频生成 :video generation(abstract,comments)

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28203 2026-07-31 cs.HC 新提交 50%

Student Perceptions and Preferences Regarding AI-Generated Instructional Videos in Computing Education

计算教育中学生对AI生成教学视频的感知与偏好

Esse Ciego, Shubbhi Taneja, Wilson Wong, Amanpreet Kapoor

专题命中 视频生成 :video generation(abstract)

AI总结 本研究通过对170名计算专业学生的调查,探究其对Knowlify生成的Markdown教学AI视频的感知与偏好,发现学生认可视频质量但对其课堂广泛采用存顾虑,明确了AI视频的适用场景与潜在问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 50%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 视频生成 :video generation(abstract)

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏