arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-08 至 2026-01-08 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 2 篇

2601.03955 2026-01-08 cs.CV 79%

ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation

ResTok: 在1D视觉分词器中学习层次化残差以实现自回归图像生成

Xu Zhang, Cheng Da, Huan Yang, Kun Gai, Ming Lu, Zhan Ma

机构 * Vision Lab, Nanjing University(南京大学视觉实验室) Kolors Team, Kuaishou Technology(快手技术Kolors团队)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ResTok通过引入层次化残差机制提升自回归图像生成效果,实现更高效的潜在分布建模与生成过程。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03517 2026-01-08 cs.CV 57%

Semantic Belief-State World Model for 3D Human Motion Prediction

语义信念状态世界模型用于3D人体运动预测

Sarim Chaudhry

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出语义信念状态世界模型,通过将人体视为世界模型状态空间的一部分,实现更稳定的长期运动预测与模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏