AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects
AnimaSpark: 一种用于任意3D对象动画的前馈方法
机构 * Bytedance(字节跳动)
AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。
大厂专区
AnimaSpark: 一种用于任意3D对象动画的前馈方法
机构 * Bytedance(字节跳动)
AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。
动态线性注意力
机构 * The Ohio State University(俄亥俄州立大学) ; University of Michigan(密歇根大学) ; ByteDance Seed(字节跳动Seed)
AI总结 提出DLA框架,通过信息感知动态状态合并和容量受限内存建模,解决多状态线性注意力中固定合并策略导致的错误累积问题,在16个数据集上超越现有方法。
Comments Accepted by ICML 2026
SRT: 基于解缠校正流的时间序列超分辨率
机构 * Bytedance(字节跳动)
AI总结 提出SRT框架,通过解缠校正流将低分辨率时间序列重建为高分辨率,分解趋势与季节成分,利用隐式神经表示对齐分辨率,并引入跨分辨率注意力机制生成细节。
Comments Accepted to the International Conference on Learning Representations (ICLR) 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
自适应教师暴露用于大语言模型推理中的自蒸馏
机构 * ByteDance Douyin(字节跳动抖音)
AI总结 针对自蒸馏中教师暴露完整推理导致学生难以吸收的问题,提出自适应教师暴露方法ATESD,通过轻量Beta策略控制器动态调整暴露比例,并用折扣学习进步奖励优化,在多个模型和数据集上提升推理性能。
Comments 11 pages, 4 figures; code not released yet
让ViT说话:生成式语言-图像预训练
机构 * Beijing Jiaotong University(北京交通大学) ; ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学)
AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。
Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP