TextSculptor: Training and Benchmarking Scene Text Editing
TextSculptor: 训练和评估场景文本编辑
机构 * Beijing Jiaotong University(北京交通大学) ; Bytedance(字节跳动)
AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。
大厂专区
TextSculptor: 训练和评估场景文本编辑
机构 * Beijing Jiaotong University(北京交通大学) ; Bytedance(字节跳动)
AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。
通过语言先验解决无监督3D点云分割中的长尾歧义
机构 * South China University of Technology(华南理工大学) ; Bytedance(字节跳动) ; Tsinghua University(清华大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; Guangming Laboratory(光明实验室)
AI总结 本文提出LangTail框架,利用语言模型中的平衡世界知识来缓解无监督3D分割中的长尾歧义问题,通过建立语言衍生语义先验与视觉上不常见的小类之间的多级关联,提升小类的表示能力,实验表明在ScanNet-v2、S3DIS和nuScenes数据集上均取得显著提升。
Comments In submission. The code will be released at: https://github.com/Whisky0129/langtail_official
Lance:通过多任务协同实现统一多模态建模
机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)
AI总结 本文提出Lance,一种轻量级的原生统一模型,支持图像和视频的多模态理解、生成和编辑。该模型通过协同多任务训练的实用范式实现统一多模态建模,基于统一上下文建模和解耦能力路径两个核心原则,通过双流混合专家架构实现联合上下文学习并解耦理解和生成路径。
Comments 34 pages, 14 figures, 10 tables, homepage url: https://lance-project.github.io , code url: https://github.com/bytedance/Lance
只计算一次:用于高效大规模推荐模型的UG分离
机构 * ByteDance AML(字节跳动人工智能实验室)
AI总结 本文提出UG分离方法,通过在TokenMixer密集交互模型中显式分离用户侧和物品侧的信息流,实现用户侧计算的重用,从而减少冗余推理成本,并通过信息补偿策略和权重量化技术提升效率。
Comments Large Recommender Model, Industrial Recommenders, Scaling Law