{
  "bench_kind": "realistic_final_gate",
  "bench_path": "/home/steve/qwen36-results-main/data/gemma4-q8-gpu3-q8lmhead-noreorder-control-full512-20260629T224927Z/realistic-suite.json",
  "bench_rc": 0,
  "bench_run_identity": {
    "api_mode": "chat",
    "base_url": "http://127.0.0.1:18677",
    "created_at_utc": "2026-06-29T22:51:41.632371+00:00",
    "max_tokens": 512,
    "model": "gemma4-26b-a4b-q8",
    "prompt_count": 12,
    "seed": 1,
    "suite": {
      "description": "Fixed cold-response prompt suite for Gemma 4 26B A4B Q8 B70 promotion and LocalMaxxing submissions. Each prompt is sent exactly once. Synthetic/repeated prompts remain diagnostic only.",
      "metric": "median generated-token throughput for tokens 1-100 after TTFT across prompts",
      "suite_id": "gemma4-26b-a4b-q8-b70-realistic-v1",
      "version": 1
    },
    "suite_path": "/home/steve/qwen36-results-main/repro/gemma4-26b-a4b-q8-b70/realistic-suite-v1.json"
  },
  "bench_summary": {
    "tok_s_1_100_after_ttft": {
      "count": 12,
      "max": 134.65322307535814,
      "mean": 120.13610933675466,
      "median": 121.41411987308553,
      "min": 102.2069018052588,
      "p10": 107.03214367227781,
      "stdev": 11.300158861489246
    },
    "tok_s_after_ttft_full": {
      "count": 12,
      "max": 114.90612724773871,
      "mean": 109.5400299404971,
      "median": 110.39053979324245,
      "min": 100.20591005162392,
      "p10": 103.01563126202706,
      "stdev": 4.509418663692123
    },
    "tok_s_wall_full": {
      "count": 12,
      "max": 110.58224380238646,
      "mean": 105.04615266461911,
      "median": 105.88057667302085,
      "min": 96.90763707891227,
      "p10": 99.08859989589817,
      "stdev": 4.147603464584323
    },
    "ttft_ms": {
      "count": 12,
      "max": 275.2424420323223,
      "mean": 189.58695317269303,
      "median": 179.117635008879,
      "min": 167.37421602010727,
      "p10": 172.79268738348037,
      "stdev": 29.077026356120502
    }
  },
  "canary_pass_all": true,
  "canary_rows_completed": 256,
  "fresh_response_validity": {
    "cached_tokens": [
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0
    ],
    "cached_tokens_all_zero": true,
    "classification": "fresh-response",
    "context_checkpoints_or_prefix_reuse": false,
    "each_prompt_run_once": true,
    "history_acceleration": false,
    "ngram_history_acceleration": false,
    "note": "Fixed realistic suite; each prompt is sent once as a cold response. Do not average synthetic repeated prompts, warmed continuations, or n-gram/history-accelerated rows into this metric.",
    "primary_metric_name": "median_tok_s_1_100_after_ttft",
    "primary_metric_tokens": 100,
    "prompt_count": 12,
    "prompts_are_unique": true,
    "response_reuse": false,
    "suite_id": "gemma4-26b-a4b-q8-b70-realistic-v1",
    "suite_version": 1,
    "token_timing_source": "openai_stream_text_delta",
    "valid": true
  },
  "headline_eligible_for_gemma_q8": true,
  "label": "gemma4-q8-gpu3-q8lmhead-noreorder-control-full512-20260629T224927Z",
  "launcher_identity": {
    "batch_size": "1024",
    "cache_type_k": "f16",
    "cache_type_v": "f16",
    "cpu_affinity": null,
    "ctx_size": "32768",
    "extra_llama_args": "--parallel 1 --cache-ram 0 --spec-type draft-mtp --spec-draft-model /mnt/fast-ai/llm-models/gemma4-26b-a4b-it-q8-gguf/MTP/gemma-4-26B-A4B-it-Q4_0-MTP.gguf --spec-draft-n-max 3 --spec-draft-device SYCL0 --spec-draft-ngl all --spec-draft-type-k f16 --spec-draft-type-v f16 --spec-draft-n-min 2 --spec-draft-p-min 0.0475 --no-spec-draft-backend-sampling --spec-draft-threads 32 --spec-draft-threads-batch 32 --ctx-checkpoints 0",
    "flash_attn": "on",
    "ggml_sycl_disable_dnn": "<unset>",
    "ggml_sycl_disable_graph": "0",
    "ggml_sycl_disable_opt": "0",
    "ggml_sycl_enable_vmm": "1",
    "gpu_index": "3",
    "llama_cpp_commit": "c926ad098",
    "llama_devices": "SYCL0",
    "llama_gemma4_fused_final_post_norm_residual": "<unset>",
    "llama_gemma4_moe_fused_branch_post_norm_add": "<unset>",
    "llama_gemma4_moe_fused_down_selected_softmax": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_debug": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_direct_f32_parallel_slots": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_matmul_epilogue": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_parallel_slots": "<unset>",
    "llama_gemma4_moe_fused_down_weighted_sum_reorder_vdr2": "1",
    "llama_gemma4_moe_fused_geglu_down_weighted_sum": "<unset>",
    "llama_gemma4_moe_fused_router_selected_weights": "<unset>",
    "llama_gemma4_moe_gateup_geglu": "<unset>",
    "llama_gemma4_moe_gateup_geglu_bf16": "<unset>",
    "llama_gemma4_moe_gateup_geglu_epilogue": "<unset>",
    "llama_gemma4_moe_geglu_down_matmul_epilogue": "<unset>",
    "llama_gemma4_moe_reuse_attn_rms": "1",
    "llama_gemma4_moe_router_post_scale": "<unset>",
    "llama_gemma4_moe_selected_softmax": "1",
    "llama_gemma4_moe_selected_softmax_fused": "1",
    "llama_gemma4_moe_selected_softmax_weighted_sum": "<unset>",
    "llama_gemma4_moe_skip_early_weights_expand": "<unset>",
    "llama_gemma4_moe_sorted_top_k": "<unset>",
    "llama_gemma4_moe_top_k": "<unset>",
    "llama_gemma4_moe_weighted_sum": "1",
    "llama_gemma4_moe_weighted_sum_2d": "<unset>",
    "llama_gemma4_moe_weighted_sum_selected_softmax": "<unset>",
    "llama_gemma4_mtp_fused_output_argmax": "1",
    "llama_gemma4_mtp_qonly_attn_inputs": "1",
    "llama_gemma4_skip_identity_out_ids": "<unset>",
    "llama_main_gpu": "<unset>",
    "llama_mtp_defer_target_h_accept_only": null,
    "llama_mtp_defer_target_h_nextn": "1",
    "llama_mtp_defer_verifier_pending_h_copy": "<unset>",
    "llama_mtp_draft_backend_argmax": "<unset>",
    "llama_mtp_draft_backend_topk": "<unset>",
    "llama_mtp_draft_device_h_handoff": "<unset>",
    "llama_mtp_draft_direct_argmax_ids": "1",
    "llama_mtp_draft_direct_argmax_scores": "<unset>",
    "llama_mtp_draft_direct_argmax_unroll": "7",
    "llama_mtp_draft_fast_argmax": "1",
    "llama_mtp_draft_fast_topk": "<unset>",
    "llama_mtp_draft_logit_gap_min": "<unset>",
    "llama_mtp_draft_profile": "<unset>",
    "llama_mtp_draft_terminal_logits_only": "<unset>",
    "llama_mtp_draft_top_k": "<unset>",
    "llama_server": "/home/steve/src/llama.cpp-gemma-record-repro-c926/build-sycl-b70-aot-bmg-g31-q8reorder-vdr2/bin/llama-server",
    "llama_server_spec_profile": "<unset>",
    "llama_spec_adaptive_mtp": "<unset>",
    "llama_spec_adaptive_mtp_alpha": "<unset>",
    "llama_spec_adaptive_mtp_high": "<unset>",
    "llama_spec_adaptive_mtp_low": "<unset>",
    "llama_spec_adaptive_mtp_low_n_max": "<unset>",
    "llama_spec_adaptive_mtp_warmup": "<unset>",
    "llama_spec_head_fused_output_argmax": "<unset>",
    "llama_spec_verify_adaptive_bonus_min_full_accept": "<unset>",
    "llama_spec_verify_adaptive_bonus_row": "<unset>",
    "llama_spec_verify_adaptive_bonus_warmup": "<unset>",
    "llama_spec_verify_backend_argmax_ids": "1",
    "llama_spec_verify_bulk_sampled_ids": "1",
    "llama_spec_verify_clip_draft_at_eog": "<unset>",
    "llama_spec_verify_fused_output_argmax": "<unset>",
    "llama_spec_verify_greedy_argmax": "<unset>",
    "llama_spec_verify_late_head_bonus": "<unset>",
    "llama_spec_verify_no_bonus_row": "<unset>",
    "llama_spec_verify_prefix2_tail_head": "<unset>",
    "llama_spec_verify_raw_argmax": "<unset>",
    "llama_spec_verify_regular_mmvq_top1_epilogue": "<unset>",
    "llama_spec_verify_skip_stateless_accept": "<unset>",
    "llama_spec_verify_softcap_argmax": "<unset>",
    "llama_spec_verify_stage_mtp3": "<unset>",
    "llama_spec_verify_stage_mtp3_split_bonus": "<unset>",
    "llama_split_mode": "<unset>",
    "llama_sycl_f16_p021_small_ncols": "1",
    "llama_sycl_mul_mat_argmax_multi_reuse": "<unset>",
    "llama_sycl_mul_mat_argmax_reorder_ncols": "<unset>",
    "llama_sycl_mul_mat_argmax_tile_subgroups": "<unset>",
    "llama_sycl_mul_mat_id_gate_up_fast_seed_route_cache": "<unset>",
    "llama_sycl_mul_mat_id_gate_up_q8_singleton_direct": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_bf16_direct": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_fast": "1",
    "llama_sycl_mul_mat_id_multi_token_filter": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_grouped_q8_0": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_grouped_q8_0_reorder": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_name_substr": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_no_reorder": "<unset>",
    "llama_sycl_mul_mat_id_multi_token_per_slot_q8_0": "<unset>",
    "llama_sycl_mul_mat_id_q8_0_reorder": "1",
    "llama_sycl_mul_mat_id_q8_0_reorder_direct_vdr2": "1",
    "llama_sycl_mul_mat_id_q8_0_reorder_pair_slots": "<unset>",
    "llama_sycl_mul_mat_id_q8_0_reorder_rowpack": "<unset>",
    "llama_sycl_mul_mat_id_q8_0_reorder_top8_slots": "<unset>",
    "llama_sycl_mul_mat_id_route_cache": "1",
    "llama_sycl_mul_mat_id_route_cache_device_map": "<unset>",
    "llama_sycl_mul_mat_id_route_cache_inplace": "<unset>",
    "llama_sycl_mul_mat_id_route_timing": "<unset>",
    "llama_sycl_mul_mat_id_route_timing_every": "<unset>",
    "llama_sycl_mul_mat_top1_epilogue": "<unset>",
    "llama_sycl_mul_mat_top1_epilogue_partial": "<unset>",
    "llama_sycl_q8_0_lm_head_1col_dmmv": "<unset>",
    "llama_sycl_q8_0_lm_head_1col_no_reorder": "<unset>",
    "llama_sycl_q8_mmvq_small_ncols": "<unset>",
    "llama_tensor_split": "<unset>",
    "oneapi_device_selector": "level_zero:3",
    "poll": "100",
    "port": "18677",
    "realistic_gate": "1",
    "realistic_metric_tokens": "100",
    "realistic_suite": null,
    "reasoning": "off",
    "sycl_pi_level_zero_use_copy_engine": "<unset>",
    "threads": "8",
    "ubatch_size": "1024",
    "ur_l0_enable_relaxed_allocation_limits": "1",
    "ur_l0_use_copy_engine": "<unset>",
    "ur_l0_use_immediate_commandlists": "1"
  },
  "model_file_bytes": 27636230944,
  "model_path": "/mnt/fast-ai/llm-models/gemma4-26b-a4b-it-q8-gguf/gemma-4-26B-A4B-it-UD-Q8_K_XL.gguf",
  "quality_lane": "q8_target",
  "realistic_final_gate": {
    "cached_tokens": [
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0,
      0
    ],
    "cached_tokens_all_zero": true,
    "chunk_count_matches_completion_tokens_all": false,
    "chunk_count_matches_completion_tokens_note": "Informational only: llama.cpp usage may count an EOS/final token that is not emitted as a text delta. Promotion requires enough streamed text deltas to measure the first metric window.",
    "chunk_counts": [
      512,
      512,
      311,
      512,
      512,
      512,
      512,
      512,
      512,
      512,
      512,
      512
    ],
    "completion_tokens_at_least_metric_window": true,
    "metric_chunk_events_at_least_window": true,
    "metric_name": "median_tok_s_1_100_after_ttft",
    "metric_tokens": 100,
    "passed": true,
    "prompts_unique": true,
    "required_policy": "fixed realistic prompt suite; each prompt once; cached_tokens=0 every row; no repeated/warmed prompt averaging; metric is median tokens 1-100 after TTFT",
    "token_timing_source": "openai_stream_text_delta"
  },
  "run_dir": "/home/steve/qwen36-results-main/data/gemma4-q8-gpu3-q8lmhead-noreorder-control-full512-20260629T224927Z",
  "server_log": "/mnt/fast-ai/bench-results/gemma4-26b-a4b-q8/servers/gemma4-q8-gpu3-q8lmhead-noreorder-control-full512-20260629T224927Z.server.log"
}
