QwenForge
Handwritten Qwen2.5-0.5B inference engine — no vLLM, no model.generate(); CUDA Graph + hand-written Triton flash kernels, 3.34x vLLM decode…
cuda-graphflash-attentionkv-cachellm-inferencepytorchqwen
More Everything else
Handwritten Qwen2.5-0.5B inference engine — no vLLM, no model.generate(); CUDA Graph + hand-written Triton flash kernels, 3.34x vLLM decode…