Skip to content

Training Guides

Guides for running model training workloads on Spheron GPU instances, from single-GPU fine-tuning to large-scale distributed training on bare-metal H100 clusters.

Choosing the right instance for training

WorkloadRecommended TypeWhy
Experiments, prototypingSpot30–60% cheaper; interrupt-safe with checkpointing
Single-GPU fine-tuningDedicated (RTX 4090 / A100)No interruption risk for multi-hour runs
Multi-GPU distributed trainingDedicated Bare Metal (multi-GPU SXM)NVLink interconnect, full physical server access
Production training runs (days)DedicatedGuaranteed availability

Use Spot instances for experiments; they save significant cost. Enable checkpoint saving to a persistent volume so work survives if the instance is reclaimed.

Available guides

Distributed Training (PyTorch DDP)

Multi-GPU PyTorch DDP and DeepSpeed ZeRO-3 training on a bare-metal SXM instance (up to 8 GPUs with NVLink). Covers torchrun invocation, gradient checkpointing, BF16 mixed precision, checkpoint persistence, and GPU monitoring.

Best for: Large language model pre-training and fine-tuning; multi-day training runs on multi-GPU NVLink hosts.

What's next