Text-guided Controllable Diffusion for Realistic Camouflage Images Generation
基于文本引导的可控扩散生成逼真伪装图像
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出CT-CIG方法,通过文本引导和可控扩散生成逼真且逻辑合理的伪装图像,利用VLM和FIRM模块提升伪装图像质量。
Comments Accepted by AAAI 2026
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
基于文本引导的可控扩散生成逼真伪装图像
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出CT-CIG方法,通过文本引导和可控扩散生成逼真且逻辑合理的伪装图像,利用VLM和FIRM模块提升伪装图像质量。
Comments Accepted by AAAI 2026
可控制的分层分解用于可逆的多层图像生成
专题命中 可控生成 :image generation(title);inpainting(abstract);分类 cs.GR
AI总结 本文提出CLD方法,通过可控分层分解实现多层图像的细粒度控制与精确生成,提升图像编辑的可控性和实用性。
Comments 19 pages, 14 figures
动物跳舞(当你不在看的时候)
机构 * University of Washington(华盛顿大学) ; Columbia University(哥伦比亚大学)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 该研究提出了一种生成音乐同步且具有舞蹈意识的动物跳舞视频的框架,通过引入舞蹈模式和图优化问题实现高效舞蹈合成。
Comments Project page: https://how-animals-dance.github.io/
无需训练生成多样化且高保真的图像 via 提示语义空间优化
机构 * Queen Mary University of London(伦敦女王学院) ; Centre for AI, AstraZeneca(AstraZeneca人工智能中心) ; University of Bedfordshire(贝德福德大学) ; Samsung AI Center(三星人工智能中心)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。
Comments under review
用于可控视频生成的指令解释器
机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; National University of Singapore(新加坡国立大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。
Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/
HybriDLA:文档布局分析的混合生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 HybriDLA通过结合扩散和自回归解码,实现文档布局分析的高精度区域预测,达到83.5%的mAP性能。
Comments Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA
时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。
Spatial-SSRL: 通过自监督强化学习增强空间理解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。
Comments preprint
双电位控制解锁离子泵的闪烁马达特性
专题命中 可控生成 :diffusion(abstract)
AI总结 双电位控制解锁离子泵的闪烁马达特性,实现频率依赖的电流反转和设备不对称性调节,提升离子分离性能。
伴随施罗德inger桥采样器
机构 * FAIR at Meta(Meta 的 FAIR) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 可控生成 :diffusion(abstract)
AI总结 ASBS是一种基于施罗德inger桥的新型扩散采样器,通过伴随匹配方法实现高效采样,无需估计目标样本,适用于多种能量函数和分子分布。
Comments NeurIPS 2025 (Oral presentation)
多域集成分布下的领域融合可控泛化用于跨领域时间序列预测
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 本文提出TimeControl模型,通过领域融合范式整合多领域时间序列信息,利用扩散模型实现跨领域时间序列预测的可控泛化。
Comments We have updated the abstract, introduction and related work. Additionally, we have incorporated the latest competitive baseline models