STILLWORKS

QwenForge

Handwritten Qwen2.5-0.5B inference engine — no vLLM, no model.generate(); CUDA Graph + hand-written Triton flash kernels, 3.34x vLLM decode…

Visit product ↗
Everything else GitHub Launched Jul 19, 2026 by ziyiguanmomo View original post ↗
cuda-graphflash-attentionkv-cachellm-inferencepytorchqwen
More Everything else