New NVIDIA B300 · 288 GB HBM3e servers — from $4,019/mo per GPU

See the B300

6 workloads

The right server
for what you run.

Training, fine-tuning, serving, generation, rendering or research: each workload needs something different from a GPU. Start from yours.

Model size → cheapest server.

The cheapest configuration that holds a model of each size, by our rule of thumb. Mixture-of-experts models count by total parameters.

Cheapest server by model size and workload
Model sizeFP8 inference4-bit inferenceQLoRA fine-tuneFull training (mixed precision, Adam)
8Bparameters 1× RTX 5080$199/mo 1× RTX 5080$199/mo 1× RTX 5080$199/mo 1× MI355X$1,409/mo
32Bparameters 2× RTX 4090$538/mo 1× RTX 4090$269/mo 1× RTX 5090$329/mo 4× MI355X$5,636/mo
70Bparameters 1× RTX PRO 6000$959/mo 2× RTX 5090$658/mo 2× RTX 5090$658/mo 8× MI355X$11,272/mo
120Bparameters 1× MI355X$1,409/mo 1× RTX PRO 6000$959/mo 4× RTX 5090$1,316/mo Beyond one server
405Bparameters 2× MI355X$2,818/mo 1× MI355X$1,409/mo 2× MI355X$2,818/mo Beyond one server
671Bparameters 4× MI355X$5,636/mo 2× MI355X$2,818/mo 2× MI355X$2,818/mo Beyond one server

FP8 ≈ 1.2, 4-bit ≈ 0.65, QLoRA ≈ 0.75 and full training ≈ 18 bytes per parameter, 92% of GPU memory usable. For other sizes and precisions, use the sizing helper.

Know your model? Size it.

Enter a parameter count and a precision: we list every server that fits, cheapest first.