DeepSeek-V4-Flash-NE50-42-OP

This is an offline seed-pruned version of deepseek-ai/DeepSeek-V4-Flash, produced with Akicou/ream.

It is not an official DeepSeek release.

Name decoding

DeepSeek-V4-Flash-NE50-42-OP means:

  • NE50: created with --n-experts 50
  • 42: seed 42
  • OP: offline pruning

Important: in this pruning script, --n-experts 50 means 50 routed experts were removed from each MoE layer, not retained. The resulting model keeps 206 / 256 routed experts per MoE layer.

What was changed

The base DeepSeek-V4-Flash checkpoint was pruned directly at the safetensors level without loading the full Transformers model into memory and without GPU calibration.

Pruning details:

Item Value
Base model deepseek-ai/DeepSeek-V4-Flash
Method Offline random seed expert pruning
Command flag --n-experts 50
Seed 42
Original routed experts per MoE layer 256
Experts removed per MoE layer 50
Routed experts retained per MoE layer 206
MoE layers processed 43
Config value n_routed_experts: 206
Experts per token 6
Shared experts 1
Output model safetensors payload ~`130.85 GB`

Only routed MoE experts and their router tensors were pruned/remapped. Shared experts, non-MoE weights, tokenizer files, inference files, and model metadata were copied from the base model.

How it was created

python examples/compress_model.py \
  --model deepseek-ai/DeepSeek-V4-Flash \
  --output ./DeepSeek-V4-Flash-NE50-42-OP \
  --offline-seed-prune \
  --n-experts 50 \
  --seed 42

Important notes

  • This is random seed pruning, not calibrated saliency pruning.
  • No benchmark evaluation is claimed here.
  • Quality may be worse than the original model.
  • The model may require a recent torch/transformers stack with DeepSeek-V4 support.

Basic text usage

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Akicou/DeepSeek-V4-Flash-NE50-42-OP"

tokenizer = AutoTokenizer.from_pretrained(model_id)

model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
    low_cpu_mem_usage=True,
)

prompt = "What is a reaper?"
inputs = tokenizer(prompt, return_tensors="pt").to(next(model.parameters()).device)

with torch.no_grad():
    output = model.generate(**inputs, max_new_tokens=128, do_sample=False)

print(tokenizer.decode(output[0], skip_special_tokens=True))

Attribution

All architecture, tokenizer, inference files, and original weights are from deepseek-ai/DeepSeek-V4-Flash. This repository only contains an offline-pruned derivative checkpoint.

Downloads last month
31
Safetensors
Model size
129B params
Tensor type
BF16
·
F32
·
I64
·
F8_E8M0
·
F8_E4M3
·
I8
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Akicou/DeepSeek-V4-Flash-NE50-42-OP

Quantized
(128)
this model

Collection including Akicou/DeepSeek-V4-Flash-NE50-42-OP