arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

ByteDance(字节跳动)

2026-06-03 至 2026-06-03 共收录 7
2606.03455 2026-06-03 eess.AS cs.SD

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

WavTTS:通过直接原始波形建模实现高质量零样本TTS

Wenxi Chen, Dongya Jia, Yushen Chen, Zhikang Niu, Yuzhe Liang, Xiquan Li, Ruiqi Yan, Ziyang Ma, Guanrou Yang, Sanyuan Chen, Yue Wang, Zhuo Chen, Kai Yu, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ByteDance Seed(字节跳动种子)

AI总结 提出WavTTS,首个基于流匹配与扩散Transformer的原始波形生成TTS模型,通过简单分块策略直接建模波形并集成多尺度梅尔频谱监督,在零样本TTS中接近潜在空间生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03868 2026-06-03 cs.CV

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

统一视频-动作联合去噪用于灵巧动作与数据生成

Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang, Mattia Piccinini, Yu Sun, Johannes Betz

机构 * Technical University of Munich(慕尼黑技术大学) ByteDance(字节跳动) Tsinghua University(清华大学)

AI总结 提出Donk模型,通过联合建模交互视频与手部轨迹的分布,实现灵巧手的动作生成与数据增强。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03127 2026-06-03 cs.RO

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

TTT-VLA:面向视觉-语言-动作模型的测试时潜在提示优化

Wenbo Zhang, Jianxiong Li, Shuai Yang, Sijin Chen, Jiajun Liu, Lingqiao Liu, Xiao Ma

机构 * ByteDance Seed(字节跳动种子) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) CSIRO Data61

AI总结 提出TTT-VLA框架,通过测试时优化潜在提示来适应分布偏移,无需修改策略本身,在SimperEnv上提升单/多实体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02946 2026-06-03 cs.LG cs.CR

Outsmarting the Chameleon: Counterfactual Decoupling for Tactical OOD Shifts in Live Streaming Risk Assessment

智取变色龙:针对直播风险评估中战术性OOD偏移的反事实解耦

Yiran Qiao, Jing Chen, Jiaqi Xu, Yang Liu, Qiwei Zhong, Xiang Ao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ByteDance China(字节跳动中国)

AI总结 针对直播中恶意行为者通过战术性分布偏移(Tactical OOD Shift)规避检测的问题,提出基于潜在因果的反事实解耦框架LPCD,通过潜在层建模意图与叙事变化并强制潜在反事实一致性,实现鲁棒的风险评估。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02132 2026-06-03 cs.AI

Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

学习何时不行动:缓解智能体强化学习中的工具滥用

Liuji Chen, Dianxing Tang, Xing Shi, Dingshuo Chen, Qiang Liu, Shu Wu, Liang Wang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(NLPR,自动化研究所,中国科学院) ByteDance(字节跳动) Zhejiang University(浙江大学)

AI总结 提出EAPO框架,通过引入无工具轨迹、难度感知奖励塑造和置信度感知令牌重加权,在数学和知识密集型推理任务中减少工具滥用,同时提升准确率-效率权衡。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26006 2026-06-03 cs.CV cs.GR cs.RO

MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control

MIND: 多尺度意图扩散用于文本驱动的基于物理的人形控制

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Bytedance Seed(字节跳动种子) Stanford University(斯坦福大学) InstAdapt

AI总结 提出MIND框架,通过多尺度意图扩散机制将文本命令与低级动作语义对齐,实现基于物理的人形机器人行为生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09233 2026-06-03 cs.CV cs.AI

Towards Robust Sequential Decomposition for Complex Image Editing

面向复杂图像编辑的鲁棒顺序分解

Zilai Zeng, Mingdeng Cao, Zijie Li, Xiaochen Lian, Yichun Shi, Peihao Zhu, Chen Sun, Peng Wang

机构 * Brown University(布朗大学) ByteDance Seed(字节跳动种子) The University of Tokyo(东京大学)

AI总结 提出通过顺序分解将复杂编辑任务拆解为简单步骤,并利用合成数据训练模型,在统一上下文编辑框架下平衡分解优势与误差累积,实现鲁棒改进和从模拟到真实的泛化。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏