{
  "bench_run_identity": {
    "api_mode": "chat",
    "base_url": "http://127.0.0.1:18262",
    "created_at_utc": "2026-06-26T19:26:44.661388+00:00",
    "max_tokens": 512,
    "model": "gemma4-26b-a4b-q8",
    "prompt_chars": 3460,
    "prompt_mode": "filled-long",
    "prompt_preview": "You are running a deterministic Gemma B70 decode benchmark. Read the reference context, then produce a long numbered response until the token limit is reached. Do not summarize early.\n\nReference context:\nbenchmark latency memory throughput ",
    "prompt_sha256": "04f687a68d60254567d3252624e01a696b0c9843dbb02f5a789d75aada5e4da5",
    "prompt_tokens_requested": 512,
    "repeats": 8,
    "seed": 1,
    "usage_required": true
  },
  "bench_summary": {
    "completion_tokens": {
      "cv": 0.0,
      "max": 512,
      "mean": 512.0,
      "median": 512.0,
      "min": 512,
      "stdev": 0.0
    },
    "completion_tokens_total": 4096,
    "elapsed_s": {
      "cv": 0.021165081568500527,
      "max": 5.675013536005281,
      "mean": 5.403568527755851,
      "median": 5.351254032022553,
      "min": 5.349647582974285,
      "stdev": 0.11436696865093489
    },
    "prompt_tokens": {
      "cv": 0.0,
      "max": 588,
      "mean": 588.0,
      "median": 588.0,
      "min": 588,
      "stdev": 0.0
    },
    "requests": 8,
    "tok_s_after_ttft": {
      "cv": 0.00652305761553187,
      "max": 103.51547512013657,
      "mean": 103.19340167720759,
      "median": 103.40955604010917,
      "min": 101.53177845012858,
      "stdev": 0.6731365046831482
    },
    "tok_s_wall": {
      "cv": 0.020377935193904878,
      "max": 95.70723903934984,
      "mean": 94.78796818050768,
      "median": 95.67850857385872,
      "min": 90.22004912439446,
      "stdev": 1.931583072744303
    },
    "ttft_s": {
      "cv": 0.2625473628142881,
      "max": 0.7288931669900194,
      "mean": 0.44182369100599317,
      "median": 0.40115232349489816,
      "min": 0.3991685209912248,
      "stdev": 0.1159996449024984
    }
  },
  "canary_pass_all": true,
  "canary_rows_completed": 1536,
  "fresh_response_validity": {
    "all_cached_tokens": [
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0
    ],
    "cached_tokens_all_zero": true,
    "cached_tokens_reported": true,
    "headline_cached_tokens": 0,
    "headline_policy": "Use row0 only as fresh-response headline. Later repeated-prompt rows are support-only unless each request uses an independently fresh prompt with no reusable continuation/history.",
    "headline_row": 0,
    "headline_tok_s_after_ttft": 103.51547512013657,
    "headline_tok_s_wall": 90.22004912439446,
    "repeated_prompt_rows_support_only": true
  },
  "headline_eligible_for_gemma_q8": true,
  "label": "gemma4-q8-gpu2-routecache-ctx8192-full-20260626T191746Z",
  "launcher_identity": {
    "batch_size": "1024",
    "cache_type_k": "f16",
    "cache_type_v": "f16",
    "ctx_size": "8192",
    "extra_llama_args": "--parallel 1 --cache-ram 0 --spec-type draft-mtp --spec-draft-model /mnt/fast-ai/llm-models/gemma4-26b-a4b-it-q8-gguf/MTP/gemma-4-26B-A4B-it-Q4_0-MTP.gguf --spec-draft-n-max 7 --spec-draft-device SYCL0 --spec-draft-ngl all --spec-draft-type-k f16 --spec-draft-type-v f16 --spec-draft-n-min 2 --spec-draft-p-min 0.136 --no-spec-draft-backend-sampling --spec-draft-threads 32 --spec-draft-threads-batch 32 --ctx-checkpoints 0",
    "flash_attn": "off",
    "ggml_sycl_disable_dnn": "<unset>",
    "ggml_sycl_disable_graph": "0",
    "ggml_sycl_disable_opt": "0",
    "ggml_sycl_enable_vmm": "0",
    "gpu_index": "2",
    "llama_cpp_commit": "c926ad098",
    "llama_devices": "SYCL0",
    "llama_gemma4_moe_fused_down_weighted_sum": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_debug": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_direct_f32_parallel_slots": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_matmul_epilogue": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_parallel_slots": "<unset>",
    "llama_gemma4_moe_fused_geglu_down_weighted_sum": "<unset>",
    "llama_gemma4_moe_geglu_down_matmul_epilogue": "<unset>",
    "llama_gemma4_moe_selected_softmax": "1",
    "llama_gemma4_moe_selected_softmax_fused": null,
    "llama_gemma4_moe_selected_softmax_weighted_sum": "<unset>",
    "llama_gemma4_moe_skip_early_weights_expand": "<unset>",
    "llama_gemma4_moe_sorted_top_k": "<unset>",
    "llama_gemma4_moe_top_k": "<unset>",
    "llama_gemma4_moe_weighted_sum": "1",
    "llama_gemma4_moe_weighted_sum_selected_softmax": "<unset>",
    "llama_gemma4_mtp_fused_output_argmax": "<unset>",
    "llama_gemma4_mtp_qonly_attn_inputs": "1",
    "llama_main_gpu": "<unset>",
    "llama_mtp_defer_target_h_nextn": "1",
    "llama_mtp_draft_backend_argmax": "<unset>",
    "llama_mtp_draft_backend_topk": "<unset>",
    "llama_mtp_draft_device_h_handoff": "<unset>",
    "llama_mtp_draft_direct_argmax_ids": "1",
    "llama_mtp_draft_direct_argmax_unroll": "7",
    "llama_mtp_draft_fast_argmax": "1",
    "llama_mtp_draft_fast_topk": "<unset>",
    "llama_mtp_draft_logit_gap_min": "<unset>",
    "llama_mtp_draft_profile": "<unset>",
    "llama_mtp_draft_terminal_logits_only": "<unset>",
    "llama_mtp_draft_top_k": "<unset>",
    "llama_server": "/home/steve/src/llama.cpp-gemma-record-stack/build-sycl-b70-aot-bmg-g31/bin/llama-server",
    "llama_server_spec_profile": "<unset>",
    "llama_spec_verify_backend_argmax_ids": "1",
    "llama_spec_verify_fused_output_argmax": "<unset>",
    "llama_spec_verify_greedy_argmax": "<unset>",
    "llama_spec_verify_softcap_argmax": null,
    "llama_split_mode": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_fast": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_filter": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_grouped_q8_0": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_name_substr": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_no_reorder": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_per_slot_q8_0": "<unset>",
    "llama_sycl_mul_mat_id_route_cache": "1",
    "llama_tensor_split": "<unset>",
    "oneapi_device_selector": "level_zero:2",
    "poll": "100",
    "port": "18262",
    "reasoning": "off",
    "threads": "8",
    "ubatch_size": "1024"
  },
  "model_file_bytes": 27636230944,
  "model_path": "/mnt/fast-ai/llm-models/gemma4-26b-a4b-it-q8-gguf/gemma-4-26B-A4B-it-UD-Q8_K_XL.gguf",
  "quality_lane": "q8_target",
  "run_dir": "/home/steve/qwen36-results-main/data/gemma4-q8-gpu2-routecache-ctx8192-full-20260626T191746Z",
  "server_log": "/mnt/fast-ai/bench-results/gemma4-26b-a4b-q8/servers/gemma4-q8-gpu2-routecache-ctx8192-full-20260626T191746Z.server.log"
}
