arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-24 至 2025-12-24 共收录 3 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA
2512.20615 2025-12-24 cs.CV 88%

Active Intelligence in Video Avatars via Closed-loop World Modeling

通过闭环世界建模实现视频虚拟角色的主动智能

Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出ORCA框架,通过闭环世界建模和双系统架构,实现视频虚拟角色的主动智能与目标导向行为。

Comments Project Page: https://xuanhuahe.github.io/ORCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 81%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18741 2025-12-24 cs.CV 81%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏