Skip to content

Commit 323e370

Browse files
authored
Update Dockerfile and README.md instructions for a3mega nemo framework (GoogleCloudPlatform#5164)
1 parent a1c320f commit 323e370

2 files changed

Lines changed: 11 additions & 9 deletions

File tree

examples/machine-learning/a3-megagpu-8g/nemo-framework/Dockerfile

Lines changed: 4 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -20,10 +20,8 @@ ENV NCCL_FASTRAK_IFNAME=enp6s0,enp7s0,enp13s0,enp14s0,enp134s0,enp135s0,enp141s0
2020
ENV NCCL_SOCKET_IFNAME=enp0s12
2121
ENV GLOO_SOCKET_IFNAME=enp0s12
2222
ENV NCCL_CROSS_NIC=0
23-
ENV NCCL_ALGO=Ring,Tree
24-
ENV NCCL_PROTO=Simple
23+
ENV NCCL_PROTO=Simple,LL128
2524
ENV NCCL_MIN_NCHANNELS=4
26-
ENV NCCL_DYNAMIC_CHUNK_SIZE=524288
2725
ENV NCCL_P2P_NET_CHUNKSIZE=524288
2826
ENV NCCL_P2P_PCI_CHUNKSIZE=524288
2927
ENV NCCL_P2P_NVL_CHUNKSIZE=1048576
@@ -36,11 +34,12 @@ ENV NCCL_NET_GDR_LEVEL=PIX
3634
ENV NCCL_FASTRAK_ENABLE_HOTPATH_LOGGING=0
3735
ENV NCCL_FASTRAK_USE_LLCM=1
3836
ENV NCCL_FASTRAK_LLCM_DEVICE_DIRECTORY=/dev/aperture_devices
39-
ENV NCCL_TUNER_PLUGIN=libnccl-tuner.io
37+
ENV NCCL_TUNER_PLUGIN=libnccl-tuner.so
4038
ENV NCCL_TUNER_CONFIG_PATH=/var/lib/tcpxo/lib64/a3plus_tuner_config.textproto
4139
ENV NCCL_SHIMNET_GUEST_CONFIG_CHECKER_CONFIG_FILE=/var/lib/tcpxo/lib64/a3plus_guest_config.textproto
4240
ENV NCCL_FASTRAK_PLUGIN_ACCEPT_TIMEOUT_MS=600000
43-
ENV NCCL_NVLS_ENABLE=0
41+
ENV TORCH_NCCL_AVOID_RECORD_STREAMS=0
42+
ENV NCCL_NVLSTREE_MAX_CHUNKSIZE=131072
4443

4544
RUN echo "/var/lib/tcpxo/lib64" >> /etc/ld.so.conf.d/tcpxo.conf && ldconfig
4645
ENV LD_LIBRARY_PATH=/var/lib/tcpxo/lib64:$LD_LIBRARY_PATH

examples/machine-learning/a3-megagpu-8g/nemo-framework/README.md

Lines changed: 7 additions & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -39,11 +39,15 @@ README
3939
```
4040

4141
This will run an example of training a 5B parameter GPT3 model for 10 steps
42-
using mock data as the input.
42+
using mock data as the input. Note: Please update `NUM_NODES` to
43+
actual number of nodes in the deployment.
4344

4445
```shell
4546
cd launcher_scripts
46-
mkdir data
47+
mkdir -p data/bpe
48+
49+
wget https://huggingface.co/gpt2/resolve/main/vocab.json -O ./data/bpe/vocab.json
50+
wget https://huggingface.co/gpt2/resolve/main/merges.txt -O ./data/bpe/merges.txt
4751

4852
MAX_STEPS=10
4953
NUM_NODES=8
@@ -52,9 +56,8 @@ README
5256
launcher_scripts_path=${PWD} \
5357
stages=[training] \
5458
training=gpt3/5b \
55-
env_vars.TRANSFORMERS_OFFLINE=0 \
5659
container=../nemofw+tcpxo-24.12.sqsh \
57-
container_mounts=[${HOME}/.cache,/var/lib/tcpxo/lib64] \
60+
container_mounts=[${HOME}/.cache,/var/lib/tcpxo/lib64,/sys/bus/pci] \
5861
cluster.srun_args=["--container-writable"] \
5962
training.model.data.data_impl=mock \
6063
training.model.data.data_prefix=[] \

0 commit comments

Comments
 (0)