Fleet Model Eval — 11-Test Skill Matrix

Every agent/model across the full 11-test battery, compared by task — real per-test results
2026-08-25 · 33 runs · 9 models · source: Fleet-Eval-2026-08 (authoritative)
Model · Box1a
HTML pricing
1b
is_prime
2a
kbd copy
2b
rewrite
3a
SVG logo
3b
CSS vars
4a
disk du
4b
crash/OOM
5b
transcript
7a
AZ sales-tax
7b
web-cost
CapableQualityLatencyVerdict
mistral-small:24b
midgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.318.9sSTRONG
odin
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.315.6sSTRONG
gemma4:12b
midgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.356.2sSTRONG
overgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.541.2sSTRONG
qwen3.6:latest
heimdall
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.556.2sSTRONG
midgaard
FAILFAILFAILFAILFAILFAILFAILFAILFAILFAILFAIL0/11180.9sWEAK
overgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/115.038.3sSTRONG
qwen3.5:4b
asgard
PASSPASSFAILPASSFAILPASSPASSPASSPASSFAILPASS8/114.5131.1sMIXED
heimdall
PASSPASSFAILFAILFAILPASSFAILPASSPASSFAILPASS6/115.029.4sMIXED
m1pro
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.8186.3sSTRONG
midgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.689.3sSTRONG
odin
PASSPASSFAILFAILPASSFAILPASSPASSPASSFAILPASS7/115.057.7sMIXED
gemma4:12b-it-qat
asgard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.648.0sSTRONG
heimdall
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.622.4sSTRONG
midgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.550.9sSTRONG
odin
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.339.2sSTRONG
overgaard
PASSPASSFAILPASSPASSPASSPASSPASSPASSPASSPASS10/114.646.4sSTRONG
gemma3:4b
asgard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.310.6sSTRONG
heimdall
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.14.2sSTRONG
m1pro
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.115.0sSTRONG
midgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.37.7sSTRONG
odin
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.36.3sSTRONG
overgaard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.14.9sSTRONG
llama3.1:8b
asgard
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.18.8sSTRONG
odin
PASSPASSPASSPASSPASSPASSPASSPASSPASSPASSPASS11/114.36.1sSTRONG
qwen3.5:9b
asgard
PASSPASSFAILPASSPASSPASSPASSPASSPASSPASSPASS10/114.8171.5sSTRONG
heimdall
PASSPASSFAILPASSFAILPASSFAILFAILPASSPASSPASS7/114.742.3sMIXED
midgaard
PASSPASSFAILPASSFAILPASSFAILFAILPASSPASSPASS7/114.7139.1sMIXED
odin
PASSPASSFAILPASSFAILPASSPASSFAILPASSPASSPASS8/114.878.1sMIXED
overgaard
PASSPASSFAILPASSPASSPASSPASSPASSPASSPASSPASS10/114.868.4sSTRONG
qwen3.8:27b
heimdall
PASSPASSFAILPASSPASSPASSPASSPASSPASSPASSPASS10/114.6173.7sSTRONG
midgaard
FAILPASSFAILPASSPASSPASSPASSPASSPASSPASSPASS9/114.3243.8sMIXED
overgaard
PASSPASSFAILPASSPASSPASSPASSPASSPASSPASSFAIL9/114.6106.7sMIXED
PASS rate by task94%97%61%91%82%94%88%88%97%88%94%of 33 runs
PASS FAIL (honest N/A where capable=false) no record Capable = tests passed of 11. Quality = avg score 1–5. Latency = avg seconds/test.

Local vs Cloud — 12B Model Head-to-Head

Identical 13-test battery · local Ollama vs cloud Sonnet-5 (Nous) · 2026-08-26
gemma4:12b-it-qat vs claude-sonnet-5
LOCAL
gemma4:12b-it-qat
Asgard (m2pro, 16GB)
  • 12/13capable
  • 607.23swall-clock
  • 12,625tokens
  • $0.00cost
  • 44.5savg/test
CLOUD
anthropic/claude-sonnet-5
Nous Portal (cloud)
  • 12/13capable
  • 437.4swall-clock
  • 17,240tokens
  • $0.34cost (est)
  • 33.6savg/test
MetricLocal (gemma4:12b)Cloud (Sonnet-5)
Modelgemma4:12b-it-qatanthropic/claude-sonnet-5
ExecutionOllama local (Asgard m2pro, 16GB)Hermes → Nous Portal API
Capable12/1312/13
Wall-clock607.2 s437.4 s
Tokens12,62517,240
Est. cost$0.00~$0.34 (state.db)
Avg latency44.5 s33.6 s
Max latency105.1 s206.2 s
Verdict: Cloud (Sonnet) is faster per-test avg and higher capability; local is $0 but slower wall-clock and lower capability on this 12B model. Cloud costs real $ per run. — Both failed test 8b, 8c (prime print-strict scoring — model wrote a correct prime FUNCTION, not a print statement).
Source: benchmark_gemma4_vs_sonnet_20260826.json (Fleet-Eval-2026-08, authoritative). Cloud $ is an estimate from state.db; authoritative billing on the Nous $110 Portal cap ($61.80 used before this run).