Jev-Style-0.8B-Decision-v3 / figures /quantization.data.json
chaoliangUNSW's picture
Release Jev-Style-0.8B-Decision-v3
656ca59 verified
Raw History Blame Contribute Delete
5.47 kB
{
"chart": "quantization",
"metric": "top-1 agreement with the full-precision reference (%), plus file size (GB = bytes/1e9)",
"rows": [
{
"tier": "16-bit",
"model": "v3",
"label": "Jev-Style 0.8B v3 \u00b7 GGUF F16",
"agree": 100.0,
"n": 240,
"agree_count": 240,
"size_gb": 1.516744128,
"size_note": "local export file (bytes / 1e9)",
"reference": "torch FP32",
"source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes"
},
{
"tier": "16-bit",
"model": "v3",
"label": "Jev-Style 0.8B v3 \u00b7 MLX bf16",
"agree": 100.0,
"n": 240,
"agree_count": 240,
"size_gb": 1.504827355,
"size_note": "local export file (bytes / 1e9)",
"reference": "torch FP32",
"source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes"
},
{
"tier": "16-bit",
"model": "v2",
"label": "Jev-Style 2B v2 \u00b7 GGUF BF16",
"agree": 99.6,
"n": 500,
"size_gb": 3.78,
"size_note": "as reported on card",
"reference": "CUDA merged BF16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md"
},
{
"tier": "16-bit",
"model": "v2",
"label": "Jev-Style 2B v2 \u00b7 MLX BF16",
"agree": 99.6,
"n": 500,
"size_gb": 3.76,
"size_note": "as reported on card",
"reference": "CUDA merged BF16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md (table: 'Native MLX BF16 | 3.76 GB | 99.6% choice agreement')"
},
{
"tier": "16-bit",
"model": "v1",
"label": "Jev-Style 2B v1 \u00b7 GGUF BF16",
"agree": 99.8,
"n": 500,
"size_gb": 3.9,
"size_note": "as reported on card",
"reference": "bf16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md"
},
{
"tier": "8-bit",
"model": "v3",
"label": "Jev-Style 0.8B v3 \u00b7 GGUF Q8_0",
"agree": 100.0,
"n": 240,
"agree_count": 240,
"size_gb": 0.811843008,
"size_note": "local export file (bytes / 1e9)",
"reference": "torch FP32",
"source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes"
},
{
"tier": "8-bit",
"model": "v3",
"label": "Jev-Style 0.8B v3 \u00b7 MLX 8-bit",
"agree": 100.0,
"n": 240,
"agree_count": 240,
"size_gb": 0.799973748,
"size_note": "local export file (bytes / 1e9)",
"reference": "torch FP32",
"source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes"
},
{
"tier": "8-bit",
"model": "v2",
"label": "Jev-Style 2B v2 \u00b7 GGUF Q8_0",
"agree": 99.2,
"n": 500,
"size_gb": 2.01,
"size_note": "as reported on card",
"reference": "CUDA merged BF16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md"
},
{
"tier": "8-bit",
"model": "v1",
"label": "Jev-Style 2B v1 \u00b7 GGUF Q8_0",
"agree": 99.4,
"n": 500,
"size_gb": 2.1,
"size_note": "as reported on card",
"reference": "bf16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md"
},
{
"tier": "4-bit",
"model": "v3",
"label": "Jev-Style 0.8B v3 \u00b7 GGUF Q4_K_M",
"agree": 100.0,
"n": 240,
"agree_count": 240,
"size_gb": 0.529296832,
"size_note": "local export file (bytes / 1e9)",
"reference": "torch FP32",
"source": "runs/macjev/export_r2/main/parity/report.json; sizes: chart_data.json export.sizes"
},
{
"tier": "4-bit",
"model": "v2",
"label": "Jev-Style 2B v2 \u00b7 GGUF Q4_K_M",
"agree": 91.4,
"n": 500,
"size_gb": 1.27,
"size_note": "as reported on card",
"reference": "CUDA merged BF16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-v2-GGUF/raw/main/README.md"
},
{
"tier": "4-bit",
"model": "v1",
"label": "Jev-Style 2B v1 \u00b7 GGUF Q4_K_M",
"agree": 94.39999999999999,
"n": 500,
"size_gb": 1.3,
"size_note": "as reported on card",
"reference": "bf16",
"source": "https://huggingface.co/chaoliangUNSW/Jev-Style-Qwen3.5-2B-Decision-GGUF/raw/main/README.md"
}
],
"deltas": {
"v2 Q4_K_M size / v3 Q4_K_M size": 2.4
},
"no_agreement_delta_claimed": "v3 parity rows are training-pool rows; v1/v2 used 500 held-out decisions, so no agreement gap is claimed",
"long_points": "v3 formats also 100% top-1 at 16,384 and 25,600 tokens (3 rows each), parity report long_points",
"not_plotted": "mlx-4bit (98.75%, 237/240) is not a published format and is omitted",
"footnote": "v3: top-1 agreement with the PyTorch FP32 reference on a 240-row parity fixture drawn from the training pool (22 categories, en+zh), plus 6 extra rows at about 16K and 25.6K tokens (6/6 agree). v3 sizes = exported weight files (GB = 10^9 bytes). 2B v1/v2: as reported on their public HF GGUF cards (500 held-out decisions each; vs bf16 for v1, vs CUDA merged BF16 for v2; card sizes). Different fixtures (training-pool rows for v3, held-out rows for v1/v2) and references: rows are not a paired comparison. x-axis starts at 88%.",
"protocol_label": "v3 G5 parity: 240-row mixed fixture (drawn from training-pool rows, 22 categories, en+zh) vs torch FP32; plus 16K and 25.6K long points (3 rows each). 2B numbers are from their cards on different fixtures (500 decisions vs bf16)"
}