arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-09 至 2025-12-09 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 4 篇

2512.07584 2025-12-09 cs.CV 81%

LongCat-Image Technical Report

LongCat-Image 技术报告

Meituan LongCat Team, Hanghang Ma, Haoxian Tan, Jiale Huang, Junqiang Wu, Jun-Yan He, Lishuai Gao, Songlin Xiao, Xiaoming Wei, Xiaoqi Ma, Xunliang Cai, Yayong Guan, Jie Hu

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 LongCat-Image通过双语开源模型提升多语言图像生成与编辑能力,实现高效部署与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07328 2025-12-09 cs.CV cs.AI 79%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07618 2025-12-09 cs.CV cs.AI 79%

Moyun: A Diffusion-Based Model for Style-Specific Chinese Calligraphy Generation

莫云:一种基于扩散模型的风格特定中文书法生成模型

Kaiyuan Liu, Jiahao Mei, Hengyu Zhang, Yihuai Zhang, Daoguo Dong, Liang He

机构 * School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(华东师范大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 莫云模型通过引入Vision Mamba和TripleLabel机制,实现了基于书法家、字体和字符风格的可控书法生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10826 2025-12-09 cs.SD cs.MM eess.AS 57%

SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing

SteerMusic: 增强零射文本引导和个性化音乐编辑的音乐一致性

Xinlei Niu, Kin Wai Cheuk, Jing Zhang, Naoki Murata, Chieh-Hsin Lai, Michele Mancusi, Woosung Choi, Giorgio Fabbro, Wei-Hsiang Liao, Charles Patrick Martin, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 SteerMusic通过delta去噪分数和概念令牌实现零射文本引导和个性化音乐编辑,提升音乐一致性与编辑保真度。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏