b70-optimization-lab

20260623T0936 N7 Backend-Sampling Sweep

Goal: test the current n=7, n-min=2, p-min=0.10 frontier against p-split variants and llama.cpp’s draft backend sampling toggle.

Common identity:

Results

GPU Label Change Canary tok/s after TTFT tok/s wall Decision
0 gemma4-q8-gpu0-mtp-n7-aot-nmin2-pmin010-repeat-filled-long-deep-20260623T093619Z repeat n=7, p-min=0.10 384/384 88.076 80.437 Valid repeat, below prior 88.345 record.
1 gemma4-q8-gpu1-mtp-n7-aot-nmin2-pmin010-psplit015-filled-long-deep-20260623T093619Z p-split=0.15 384/384 87.738 80.174 Valid but lower; p-split remains low value.
2 gemma4-q8-gpu2-mtp-n7-aot-nmin2-pmin010-psplit005-filled-long-deep-20260623T093619Z p-split=0.05 384/384 88.335 80.369 Valid and near-tie, but below 88.345.
3 gemma4-q8-gpu3-mtp-n7-aot-nmin2-pmin010-nobs-filled-long-deep-20260623T093619Z --no-spec-draft-backend-sampling 384/384 90.243 82.243 New valid record; submitted to LocalMaxxing.

Submitted record:

Takeaways

Follow-Up

Keep backend sampling disabled and test:

Treat n=8 as exhausted unless paired with a much stricter confidence gate; the prior n=8 run had high acceptance but too much draft overhead.