cuda.fast

CUDA · LLM systemsLive
22
solvers
2.803707
current best

Make Qwen 3.8 125B-A6B inference faster on CUDA with verified speculative decoding.