最近在研究AI Compiler,需要用到GPU,我自己倒是一张GTX1650的老古董,但是最新的nvcc已经把sm_70sm_75的机器移除,这下只能自己去vast.ai和autodl租卡,但这两个平台各有各的问题

autodl:容器形式使用,不支持Nsight Compute获取硬件计数器

vast.ai:以VM形式创建倒是可以使用Nsight Compute,但美元记价,也不敢开太长时间

我知道学校是有GPU的,但CSE的大家都说缺卡——实际也确实是这样,UNSW Katana HPC倒是有百来张卡,而且对HDR Student开放,早些时间申请工单也很顺利的批复了,今天就上手试试

image-20260914231500604

先看看官网列了什么卡

  • 35 GPU nodes
    • 80 x Nvidia H200 141GB (13 nodes)
    • 1 x Nvidia H100 94GB (1 nodes)
    • 1 x Nvidia GH200 480GB + 96GB (1 node)
    • 32 x Nvidia L40S 48GB (7 nodes)
    • 24 x Nvidia A100 40GB (3 nodes)
    • 32 x Nvidia V100 32GB (8 nodes)
    • 16 x Nvidia RTX Pro 6000 96GB (2 nodes)
  • 20 GPU nodes have priority access for the school/group that purchased them
  • 15 GPU nodes are for use by all researchers

好吧,100张卡确实不算多,全UNSW分下来也就比没有强点🧐

配套的样例很详细,应该是用PBS调度的:Running Jobs on Katana

另外想用容器应该也是OK的,虽然手册没说,但确实是有权限访问apptainer的,具体使用可以看apptainer的手册:Introduction to Apptainer

(本来想跑个Nsight Compute测试和OpenAI Triton测试,但排显卡的速度确实太慢了,有空再更新,不指定显卡的情况下,应该跑的是V100)

Triton现在得跑在sm_80以上,需要手动指定显卡:

pbsnodes -av | grep gpu_model
qsub -I -l select=1:ncpus=2:mem=8gb:ngpus=1:gpu_model=A100

原本计划还要去试试CSE的HPC的,但CSE存储每人共享上课用的3GB存储容量,随便上个Conda环境就没了——只能期待他们后续给更多Storage了