arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-09 至 2026-02-09 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 2 篇

2511.08585 2026-02-09 cs.AI cs.CV 62%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06129 2026-02-09 cs.LG cs.AI 57%

Urban Spatio-Temporal Foundation Models for Climate-Resilient Housing: Scaling Diffusion Transformers for Disaster Risk Prediction

城市时空基础模型用于气候韧性住房:扩散变换器的扩展用于灾害风险预测

Olaf Yunus Laitinen Imanov, Derya Umut Kulali, Taner Yilmaz

机构 * Technical University of Denmark(技术大学) Eskisehir Technical University(埃斯基谢普大学) Afyon Kocatepe University(阿夫yon卡奥塔佩大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Skjold-DiT模型,通过整合时空城市数据预测建筑气候风险,并结合交通网络结构提升灾害响应能力。

Comments 10 pages, 5 figures. Submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏