VRAM pools across identical cards; KV splits per card. Tensor-parallel pays a communication tax (0.85–1.10× per card); pipeline keeps single-card speed but splits the model. Mixed stacks + network clusters (exo) come next.
most models train at 128k or less · higher context shows memory required, not support
advanced · enter specs manually
for rigs we don't list — filled numbers override the hardware search