{ "chart": "quantization", "metric": "top-1 agreement with the full-precision reference (%), plus file size (GB = bytes/1e9)", "rows": [ { "tier": "16-bit", "model": "v3", "label": "Jev-Style 0.8B v3 \u00b7 GGUF F16", "agree": 100.0, "n": 240, "agree_count": 240, "size_gb": 1.516744128, "size_note": "local export file (bytes / 1e9)", "reference": "torch FP32", "source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes" }, { "tier": "16-bit", "model": "v3", "label": "Jev-Style 0.8B v3 \u00b7 MLX bf16", "agree": 100.0, "n": 240, "agree_count": 240, "size_gb": 1.504827355, "size_note": "local export file (bytes / 1e9)", "reference": "torch FP32", "source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes" }, { "tier": "16-bit", "model": "v2", "label": "Jev-Style 2B v2 \u00b7 GGUF BF16", "agree": 99.6, "n": 500, "size_gb": 3.78, "size_note": "as reported on card", "reference": "CUDA merged BF16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md" }, { "tier": "16-bit", "model": "v2", "label": "Jev-Style 2B v2 \u00b7 MLX BF16", "agree": 99.6, "n": 500, "size_gb": 3.76, "size_note": "as reported on card", "reference": "CUDA merged BF16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md (table: 'Native MLX BF16 | 3.76 GB | 99.6% choice agreement')" }, { "tier": "16-bit", "model": "v1", "label": "Jev-Style 2B v1 \u00b7 GGUF BF16", "agree": 99.8, "n": 500, "size_gb": 3.9, "size_note": "as reported on card", "reference": "bf16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md" }, { "tier": "8-bit", "model": "v3", "label": "Jev-Style 0.8B v3 \u00b7 GGUF Q8_0", "agree": 100.0, "n": 240, "agree_count": 240, "size_gb": 0.811843008, "size_note": "local export file (bytes / 1e9)", "reference": "torch FP32", "source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes" }, { "tier": "8-bit", "model": "v3", "label": "Jev-Style 0.8B v3 \u00b7 MLX 8-bit", "agree": 100.0, "n": 240, "agree_count": 240, "size_gb": 0.799973748, "size_note": "local export file (bytes / 1e9)", "reference": "torch FP32", "source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes" }, { "tier": "8-bit", "model": "v2", "label": "Jev-Style 2B v2 \u00b7 GGUF Q8_0", "agree": 99.2, "n": 500, "size_gb": 2.01, "size_note": "as reported on card", "reference": "CUDA merged BF16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md" }, { "tier": "8-bit", "model": "v1", "label": "Jev-Style 2B v1 \u00b7 GGUF Q8_0", "agree": 99.4, "n": 500, "size_gb": 2.1, "size_note": "as reported on card", "reference": "bf16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md" }, { "tier": "4-bit", "model": "v3", "label": "Jev-Style 0.8B v3 \u00b7 GGUF Q4_K_M", "agree": 100.0, "n": 240, "agree_count": 240, "size_gb": 0.529296832, "size_note": "local export file (bytes / 1e9)", "reference": "torch FP32", "source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes" }, { "tier": "4-bit", "model": "v2", "label": "Jev-Style 2B v2 \u00b7 GGUF Q4_K_M", "agree": 91.4, "n": 500, "size_gb": 1.27, "size_note": "as reported on card", "reference": "CUDA merged BF16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md" }, { "tier": "4-bit", "model": "v1", "label": "Jev-Style 2B v1 \u00b7 GGUF Q4_K_M", "agree": 94.39999999999999, "n": 500, "size_gb": 1.3, "size_note": "as reported on card", "reference": "bf16", "source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md" } ], "deltas": { "v2 Q4_K_M size / v3 Q4_K_M size": 2.4 }, "no_agreement_delta_claimed": "v3 parity rows are training-pool rows; v1/v2 used 500 held-out decisions, so no agreement gap is claimed", "long_points": "v3 formats also 100% top-1 at 16,384 and 25,600 tokens (3 rows each), parity report long_points", "not_plotted": "mlx-4bit (98.75%, 237/240) is not a published format and is omitted", "footnote": "v3: top-1 agreement with the PyTorch FP32 reference on a 240-row parity fixture drawn from the training pool (22 categories, en+zh), plus 6 extra rows at about 16K and 25.6K tokens (6/6 agree). v3 sizes = exported weight files (GB = 10^9 bytes). 2B v1/v2: as reported on their public HF GGUF cards (500 held-out decisions each; vs bf16 for v1, vs CUDA merged BF16 for v2; card sizes). Different fixtures (training-pool rows for v3, held-out rows for v1/v2) and references: rows are not a paired comparison. x-axis starts at 88%.", "protocol_label": "v3 G5 parity: 240-row mixed fixture (drawn from training-pool rows, 22 categories, en+zh) vs torch FP32; plus 16K and 25.6K long points (3 rows each). 2B numbers are from their cards on different fixtures (500 decisions vs bf16)" }