A catalogue of local model performance

Sloptimized.

Fastest measured local inference result per language model. Speed, not model quality. Complete catalogue ↗Optimizations ↗

Best result per model

Prefill and decode are tokens/second. Context is depth / window; n/m means not measured in the winning run.

ModelQuantBackendHardwareContextPrefill (tok/s)Status
GLM-5.2744B / 40BINT4 g64 + INT8 MTPColibriCPU + V100 (2×)0 / 4Kn/m1.2Provisional
DeepSeek V4 Flash 0731284B / 13BUD-Q8_K_XLllama.cppCPU + V100 (2×)0 / 4K15.94.1Valid
MiniMax M2.5229B / 10BQ3_K_Mllama.cppV100 (4×)23827 / 32K352.121.3Valid
Step 3.5 Flash197B / 11BQ4_K_Mllama.cppV100 (4×)24699 / 32Kn/m27.2Valid
Qwen3.5 122B-A10B125B / 10BQ3_K_Mllama.cppV100 (2×)0 / 1K240.144.3Provisional
Mistral Small 4 119B 2603119BUD-IQ3_XXSllama.cppV100 (2×)0 / 1K422.675.1Valid
Laguna S 2.1118B / 8BQ4_K_Mllama.cppV100 (3×)0n/m38.9Valid
gpt-oss-120B117B / 5BMXFP4llama.cppV100 (2×)0 / 1K627.499.9Provisional
Qwen3-Coder-Next 80B-A3B80B / 3BQ4_K_Mllama.cppV100 (2×)0 / 1K270.579.6Provisional
Qwen2.5 72B Instruct72BQ4_K_Mllama.cppV100 (2×)8K / 32K118.08.6Valid
Dolphin 2.2 70B70BQ3_K_Mllama.cppV100 (2×)8K / 32K127.911.5Provisional
Qwen3.6 35B-A3B35B / 3BQ4_K_Mllama.cppV1000 / 4K76.8101.5Provisional
Laguna XS 2.133B / 3BQ4_K_Mllama.cppV1000 / 4K275.6104.6Provisional
Gemma 4 31B IT31BUD-Q4_K_XLllama.cppV100258.935.6Valid
Muse Glimmer 30B30BK-Quant-17GBllama.cppV1000 / 4K79.345.4Valid
Qwen3.6 27B28BUD-Q4_K_XLllama.cppV100— / 4K84.339.4Valid
Qwen3.8 27B27BQ4_K_Mllama.cppV10020 / 4K36.955.0Valid
Gemma 4 26B-A4B IT25B / 4BUD-Q4_K_XLllama.cppV100776.581.0Valid
Bonsai 8B8BQ1_0llama.cppV1001338.8123.3Valid
TinyLlama OpenOrca 1.1B1BQ4_K_Mllama.cppV1000 / 4K4150.9384.1Valid

Valid means no known correctness or sample-count issue. Provisional means a known correctness problem or too few samples. Both compete here. Hardware, context, cache state, and quantization can make rows unlike; use the complete catalogue for rigorous comparisons.