Info about nodes
[apacsc03@login ~]$ sinfo -p hpcai -N -o "%N %c %m %G"
NODELIST CPUS MEMORY GRES
g1 128 2063746 gpu:nvidia_h200:8(S:0-1)
g2 128 2063746 gpu:nvidia_h200:8(S:0-1)
g3 128 2063746 gpu:nvidia_h200:8(S:0-1)
g4 128 2063746 gpu:nvidia_h200:8(S:0-1)
Launch an interactive instance
srun -N 1 --ntasks=1 --cpus-per-task=1 --gpus=1 --mem=200G -p hpcai --time=00:30:00 --pty bash
Set cuda home to use local version
export CUDA_HOME=$HOME/cuda-12.9
export PATH=$CUDA_HOME/bin:$PATH
Default settings
export VENV="$HOME/py312"
export CPATH=$HOME/cutlass
export CUDA_HOME="$HOME/cuda-12.9"
export PATH="$VENV/bin:$CUDA_HOME/bin:$PATH"
export LD_LIBRARY_PATH="$CUDA_HOME/lib64:${LD_LIBRARY_PATH:-}"
export TORCH_CUDA_ARCH_LIST="9.0"
Snoop
squeue -a -o "%i %j"
Pretty Print
cat * | grep "Offline Throughput Benchmark Result" -A 11
ENTER THE SINGULARITY
IMG="$HOME/sglang_v0.5.3rc1-cu126.sif"
REPO="/home/apacsc03/src/sglang"
singularity shell --nv --bind "$REPO":/work/sglang:rw --bind "$HOME/.cache":/root/.cache "$IMG"