arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

ByteDance(字节跳动)

2026-06-10 至 2026-06-10 共收录 5
2606.10988 2026-06-10 cs.CV cs.GR 新提交

AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects

AnimaSpark: 一种用于任意3D对象动画的前馈方法

Yiming Zhao, Haoyu Sun, Aoyu Wang

机构 * Bytedance(字节跳动)

AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10650 2026-06-10 cs.CL cs.AI 新提交

Dynamic Linear Attention

动态线性注意力

Xin Wang, Hui Shen, Boyuan Zheng, Xueshen Liu, Minkyoung Cho, Zhongwei Wan, Zesen Zhao, Zhuoqing Mao, Shen Yan, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Michigan(密歇根大学) ByteDance Seed(字节跳动Seed)

AI总结 提出DLA框架,通过信息感知动态状态合并和容量受限内存建模,解决多状态线性注意力中固定合并策略导致的错误累积问题,在16个数据集上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07605 2026-06-10 cs.LG cs.AI 版本更新

SRT: Super-Resolution for Time Series via Disentangled Rectified Flow

SRT: 基于解缠校正流的时间序列超分辨率

Jufang Duan, Shenglong Xiao, Yuren Zhang

机构 * Bytedance(字节跳动)

AI总结 提出SRT框架,通过解缠校正流将低分辨率时间序列重建为高分辨率,分解趋势与季节成分,利用隐式神经表示对齐分辨率,并引入跨分辨率注意力机制生成细节。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11458 2026-06-10 cs.AI cs.CL cs.LO 版本更新

Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning

自适应教师暴露用于大语言模型推理中的自蒸馏

Zihao Han, Tiangang Zhang, Huaibin Wang, Yilun Sun

机构 * ByteDance Douyin(字节跳动抖音)

AI总结 针对自蒸馏中教师暴露完整推理导致学生难以吸收的问题,提出自适应教师暴露方法ATESD,通过轻量Beta策略控制器动态调整暴露比例,并用折扣学习进步奖励优化,在多个模型和数据集上提升推理性能。

Comments 11 pages, 4 figures; code not released yet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏