arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-08-03 至 2026-08-03 共收录 5
2607.23125 2026-08-03 cs.LG 版本更新

Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

基于有噪学生策略性自蒸馏的自增强视觉语言模型

Shuai Wang, Daoan Zhang, Zhe Tang, Hao Cheng, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Inc.(字节跳动公司) Zhejiang University of Technology(浙江工业大学) Hong Kong Baptist University(香港浸会大学)

AI总结 研究针对视觉语言模型无外部监督难以改进的问题,提出NOPD自蒸馏方法,利用干净与损坏输入预测差异产生自监督信号,在多视觉推理任务中有效,能提升多个模型在多个基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22614 2026-08-03 cs.AI 版本更新

DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training

DynaResize:用于分布式语言模型训练后运行时的GPU重新分配

Hanlin Du, Zhiyuan Yan, Yungang Bao, Sa wang

机构 * SKLP, Institute of Computing Technology, CAS(中国科学院计算技术研究所智能处理器研究中心) Bytedance(字节跳动)

AI总结 研究基于强化学习的语言模型训练后GPU资源分配问题,提出DynaResize运行时GPU重新分配系统,通过动态切换GPU平衡阶段执行时间,分解操作并去除关键路径非关键工作,实验显示可提高吞吐量、减少执行时间并隐藏部分开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19338 2026-08-03 cs.AI 版本更新

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue:用于编码智能体的预算校准恢复路由

Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang

机构 * University of Washington(华盛顿大学) New York University(纽约大学) ByteDance(字节跳动) Amazon(亚马逊)

AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。

Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00177 2026-08-03 cs.GR cs.CV 版本更新

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13677 2026-08-03 cs.CV 版本更新

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

JoVA:联合视频音频生成的统一多模态学习

Xiaohu Huang, Haoyang He, Hao Zhou, Qiangpeng Yang, Shilei Wen, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance(字节跳动)

AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏