arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-05 至 2026-01-05 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 3 篇

2512.24513 2026-01-05 cs.CY 82%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00051 2026-01-05 cs.CV 79%

TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model

TeleWorld:面向动态多模态合成的4D世界模型

Yabo Chen, Yuanzhi Liang, Jiepeng Wang, Tingxi Chen, Junfei Cheng, Zixiao Gu, Yuyang Huang, Zicheng Jiang, Wei Li, Tian Li, Weichen Li, Zuoxin Li, Guangce Liu, Jialun Liu, Junqi Liu, Haoyuan Wang, Qizhen Weng, Xuan'er Wu, Xunzhi Xiang, Xiaoyan Yang, Xin Zhang, Shiwen Zhang, Junyu Zhou, Chengcheng Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleWorld Team(TeleWorld团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 TeleWorld提出了一种实时多模态4D世界建模框架,通过生成-重建-引导范式实现动态场景重建与长期记忆,提升世界模型的交互性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17168 2026-01-05 cs.GR cs.CV 57%

StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics

StyGazeTalk: 学习风格化的 gaze 和 head 动态生成

Chengwei Shi, Chong Cao

机构 * Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StyGazeTalk 通过多模态框架生成风格化的 gaze 和 head 动态,提升 3D 面部生成的现实感。

Comments arXiv submission

详情

展开后加载摘要…

URL PDF HTML 收藏