arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Apple(苹果)

2026-04-21 至 2026-04-21 共收录 4
2411.17690 2026-04-21 cs.MM cs.CV cs.SD eess.AS

Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis

多模态同步机制:来自基于解码器的视频-文本到语音合成的洞察

Akshita Gupta, Tatiana Likhomanenko, Karren Dai Yang, Richard He Bai, Zakaria Aldeneh, Navdeep Jaitly

机构 * Apple(苹果公司)

AI总结 本文通过视频-文本到语音合成研究多模态同步机制,探讨了解码器如何整合不同模态信息,以及模态顺序对性能和迁移的影响,提出了TimeSync指标用于细粒度分析。

Comments 30 pages, Decoder-only model, Speech Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16957 2026-04-21 cs.LG

Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon

Open-TQ-Metal:融合压缩域注意力的长上下文LLM推理

Sai Vegasena

机构 * Apple Silicon

AI总结 Open-TQ-Metal在Apple Silicon上实现了首个融合压缩域注意力的实现,使Llama 3.1 70B在单台64GB Mac上实现128K上下文推理,通过量化KV缓存和自定义Metal计算着色器提升了推理效率和内存利用率。

Comments 8 pages, 8 figures, 8 tables. Code: https://github.com/svv232/gemma4metal and https://github.com/svv232/turboquant-llama3.170B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16498 2026-04-21 cs.AR cs.AI cs.DC

Forge-UGC: FX optimization and register-graph engine for universal graph compiler

Forge-UGC:面向通用图编译器的FX优化与寄存器图引擎

Satyam Kumar, Saurabh Jha

机构 * Intel(英特尔) Qualcomm(高通) AMD Apple(苹果)

AI总结 Forge-UGC通过四阶段编译器提升Transformer在异构加速器上的部署效率,采用硬件无关设计,优化图捕获、优化、中间表示降低及后端调度,显著降低编译时间和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18272 2026-04-21 cs.SD cs.MM eess.AS

StereoFoley: Object-Aware Stereo Audio Generation from Video

StereoFoley:从视频生成对象感知的立体音频

Tornike Karchkhadze, Kuan-Lin Chen, Mojtaba Heydari, Robert Henzel, Alessandro Toso, Mehrez Souden, Joshua Atkins

机构 * UC San Diego(UC圣地亚哥大学) Apple(苹果公司)

AI总结 本文提出StereoFoley框架,通过视频生成与音频同步的立体声,解决视频到音频生成中对象感知的难题,引入合成数据生成流程提升空间准确性。

Comments Accepted to ICASSP 2026

Journal ref Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏