simpleposter: A simple baseline for product poster generation
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
大厂专区
simpleposter: 产品海报生成的一个简单基线
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。
Comments Accepted to CVPR 2026
机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; AMAP, Alibaba(阿里妈妈实验室) ; Guangdong University of Technology(广东工业大学)
AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。
Comments Accepted at ACM Multimedia 2026
扩散探针:利用CNN探针进行生成图像结果预测
机构 * Alibaba Group(阿里巴巴集团) ; Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) ; Southeast University(东南大学) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; ByteDance Inc.(字节跳动有限公司)
AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。
Comments CVPR 2026
TC-Padé:轨迹一致的Padé近似用于扩散加速
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang Gongshang University(浙江工商大学) ; ByteDance Intelligent Creation(字节跳动智能创作)
AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。
Comments CVPR 2026
Marco-Voice技术报告
机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)
AI总结 本研究提出集成语音克隆与情感控制的Marco-Voice语音合成系统,通过说话人-情感解耦等机制构建CSEMOTIONS数据集,实现了表现力与可控性的显著提升。
Comments Technical Report. Our code and dataset are publicly available at https://github.com/AIDC-AI/Marco-Voice and https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS respectively for non-commercial use only