Skip to content
Lab notes

Firmus H200 cluster

Slurm, CUDA and environment notes for the Firmus four-node H200 cluster.

Info about nodes

[apacsc03@login ~]$ sinfo -p hpcai -N -o "%N %c %m %G"
NODELIST CPUS MEMORY GRES
g1 128 2063746 gpu:nvidia_h200:8(S:0-1)
g2 128 2063746 gpu:nvidia_h200:8(S:0-1)
g3 128 2063746 gpu:nvidia_h200:8(S:0-1)
g4 128 2063746 gpu:nvidia_h200:8(S:0-1)

Launch an interactive instance

srun -N 1 --ntasks=1 --cpus-per-task=1 --gpus=1 --mem=200G -p hpcai --time=00:30:00 --pty bash

Set cuda home to use local version

export CUDA_HOME=$HOME/cuda-12.9
export PATH=$CUDA_HOME/bin:$PATH

Default settings

export VENV="$HOME/py312"
export CPATH=$HOME/cutlass
export CUDA_HOME="$HOME/cuda-12.9"
export PATH="$VENV/bin:$CUDA_HOME/bin:$PATH"
export LD_LIBRARY_PATH="$CUDA_HOME/lib64:${LD_LIBRARY_PATH:-}"
export TORCH_CUDA_ARCH_LIST="9.0"

Snoop

squeue -a -o "%i %j"

Pretty Print

cat * | grep "Offline Throughput Benchmark Result" -A 11

ENTER THE SINGULARITY

IMG="$HOME/sglang_v0.5.3rc1-cu126.sif"
REPO="/home/apacsc03/src/sglang"
singularity shell --nv   --bind "$REPO":/work/sglang:rw   --bind "$HOME/.cache":/root/.cache   "$IMG"