[ GUIDE 03 ]

Training guide

Your exported model is ready to train. This guide covers running the included training script on various platforms.

[ 01 ]

Prerequisites

  • › Python 3.9+ with pip
  • › PyTorch 2.0+ with CUDA support
  • › 16 GB GPU minimum, 40 GB+ for larger models
  • › Training data in text format (one document per line recommended)
[ 02 ]

Quick start (local GPU)

# Unzip your export
unzip Otter_export.zip
cd Otter_model

# Install dependencies
pip install -r requirements.txt

# Prepare your data
curl -O https://raw.githubusercontent.com/karpathy/char-rnn/master/data/tinyshakespeare/input.txt
mv input.txt data/train.txt

# Start training
python train.py --data_dir data --epochs 10
[ 03 ]

Google Colab

Free GPU access with limitations. Good for short experiments.

!unzip Otter_export.zip
%cd Otter_model
!pip install -r requirements.txt

!curl -O https://raw.githubusercontent.com/karpathy/char-rnn/master/data/tinyshakespeare/input.txt
!mkdir -p data && mv input.txt data/train.txt

!python train.py --data_dir data --epochs 5 --batch_size 4

→ Colab free tier has 90-min session timeouts and T4 (16 GB) memory. Use Colab Pro for longer runs.

[ 04 ]

Lambda Labs / cloud GPU

For serious runs, rent an A100 or H100. Lambda Labs, RunPod, and Vast.ai are reliable.

ssh ubuntu@<instance-ip>
scp -r ./data ubuntu@<instance-ip>:~/data
scp Otter_export.zip ubuntu@<instance-ip>:~/
unzip Otter_export.zip && cd Otter_model

pip install -r requirements.txt
python train.py \
  --data_dir ~/data \
  --epochs 100 \
  --batch_size 32 \
  --learning_rate 3e-4 \
  --gradient_accumulation_steps 4
[ 05 ]

Training arguments

--data_dirdata/Directory containing train.txt
--epochs10Number of training epochs
--batch_size8Batch size per GPU
--learning_rate1e-4Peak learning rate
--warmup_steps100LR warmup steps
--gradient_accumulation_steps1Gradient accumulation
--max_seq_len512Maximum sequence length
--output_dircheckpoints/Save checkpoints here
[ 06 ]

Monitoring

For richer telemetry, integrate Weights & Biases:

pip install wandb
wandb login
python train.py --data_dir data --use_wandb --wandb_project my-llm
[ AFTER TRAINING ]

Your checkpoint can be:

  • › Loaded with torch.load() for inference
  • › Converted to HuggingFace format with the included script
  • › Quantized with llama.cpp for local deployment
  • › Fine-tuned further on domain-specific data