ChunkWise LoRA: Adaptive Sequence Partitioning for Memory-Efficient Low-Rank Adaptation and Accelerated LLM Inference
ChunkWise LoRA: 适应性序列分块用于内存高效低秩适应和加速大语言模型推理
机构 * Bentley University USA(伯克利大学) ; Cornell University USA(康奈尔大学) ; University of California Berkeley USA(加州大学伯克利分校) ; George Mason University USA(乔治·马歇尔大学) ; Georgia Institute of Technology USA(佐治亚理工学院)
AI总结 ChunkWise LoRA通过动态分块和适应性配置提升LLM推理效率,实现更低延迟和内存消耗的同时保持性能。
Comments Presented at 13th IEEE International Conference on Intelligent Systems and Embedded Design