Turbo-LLM
Fast Memory-Efficient Inference Engine for Large MoE Models
Turbo-LLM is an experimental inference engine designed to run very large Mixture-of-Experts language models under strict VRAM constraints using dynamic expert execution and adaptive memory management.