arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-02 至 2026-03-02 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 2 篇

2503.21449 2026-03-02 cs.CV 57%

Towards Generating Realistic 3D Semantic Training Data for Autonomous Driving

朝向生成逼真3D语义训练数据以实现自动驾驶

Lucas Nunes, Rodrigo Marcuzzi, Jens Behley, Cyrill Stachniss

机构 * Center for Robotics, University of Bonn, Germany(bonn大学机器人中心) RWTH Aachen, Germany(亚琛工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(lamarr机器学习与人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需投影或分离开的多分辨率模型的3D语义生成方法,生成更逼真的场景数据,提升自动驾驶训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏