Self-Speculation for Faster Reasoning Models
用于更快推理模型的自推测技术
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。
高校专区
用于更快推理模型的自推测技术
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。
隐形斗篷:实时隐私保护的体视频流
机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Nokia Bell Labs(诺基亚贝尔实验室)
AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。
AgRefactor:面向HLS兼容性与性能的自进化智能体工作流
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。