arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-06 至 2026-01-06 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2601.01535 2026-01-06 cs.CV 79%

Improving Flexible Image Tokenizers for Autoregressive Image Generation

改进灵活的图像标记器以用于自回归图像生成

Zixuan Fu, Lanqing Guo, Chong Wang, Binbin Song, Ding Liu, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Harbin Institute of Technology(哈尔滨工业大学) Meta AI

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ReToK通过冗余标记填充和层次语义正则化改进灵活图像标记器,提升自回归图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 57%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23650 2026-01-06 cs.RO 50%

Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

你有即兴能力吗?通过音频控制实现 expressive 人形 locomotion

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang

机构 * BAAI(北京人工智能研究院) University of Sydney(悉尼大学) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 RoboPerform 是首个通过音频直接生成音乐舞蹈和语音手势的人形运动框架,实现了低延迟、高保真的即兴运动表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10182 2026-01-06 cs.CR eess.SP 50%

Secure Semantic Communication With Homomorphic Encryption

安全语义通信与同态加密

Rui Meng, Dayu Fan, Haixiao Gao, Yifan Yuan, Bizhu Wang, Xiaodong Xu, Mengying Sun, Chen Dong, Xiaofeng Tao, Ping Zhang, Dusit Niyato

专题命中 可控生成 :image generation(abstract)

AI总结 本文提出HE-JSCC方案,利用同态加密保护语义通信中的信息,通过SIFT验证加密后语义信息的保留,并展示了图像分类和生成任务的仿真结果。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏