arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 35 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 5 篇

2608.22403 2026-08-25 cs.RO 新提交 50%

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM:从人类视频学习世界动作模型的潜在动力学

Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

专题命中 动作与事件理解 :video generation(abstract)

AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01027 2026-08-25 cs.RO 版本更新 50%

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。

Comments Our project homepge: this https URL (https://tau0-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长视频与时序推理 2 篇

2607.15772 2026-08-25 cs.CV 版本更新 88%

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23383 2026-08-25 cs.CV 新提交 57%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 1 篇

2608.02035 2026-08-25 cs.MM cs.SD 版本更新 57%

AcoustiTrace: When Plausible Sound Violates Physics

AcoustiTrace:看似合理的声音为何违背物理规律

Shiyang Li, Yuewen Cao, Yihao Liu, Yuandong Pu, Baochang Zhang, Xiaofei Li, Changqing Zou

专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM

AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。

详情

展开后加载摘要…

URL PDF HTML 收藏