arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-09 至 2026-01-09 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2601.04706 2026-01-09 cs.CV 79%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 文生图 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01839 2026-01-09 cs.CR cs.AI cs.CL cs.CV 79%

Jailbreaking Safeguarded Text-to-Image Models via Large Language Models

通过大型语言模型对受保护的文本到图像模型进行劫持

Zhengyuan Jiang, Yuepeng Hu, Yuchen Yang, Yinzhi Cao, Neil Zhenqiang Gong

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出了一种利用微调大型语言模型来劫持受安全防护的文本到图像模型的方法,有效绕过安全防护并优于现有攻击技术。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21015 2026-01-09 cs.CV 77%

FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing

FluencyVE:将时间感知Mamba与旁路注意力相结合用于视频编辑

Mingshu Cai, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(早稻田大学,日本) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FluencyVE通过结合时间感知Mamba与旁路注意力,实现高效的视频编辑,减少计算成本并提升生成能力。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI 57%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 文生图 :image generation(abstract);分类 cs.CV

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏