[ GUIDE 03 ]
Training guide
Your exported model is ready to train. This guide covers running the included training script on various platforms.
[ 01 ]
Prerequisites
- › Python 3.9+ with pip
- › PyTorch 2.0+ with CUDA support
- › 16 GB GPU minimum, 40 GB+ for larger models
- › Training data in text format (one document per line recommended)
[ 02 ]
Quick start (local GPU)
# Unzip your export unzip Otter_export.zip cd Otter_model # Install dependencies pip install -r requirements.txt # Prepare your data curl -O https://raw.githubusercontent.com/karpathy/char-rnn/master/data/tinyshakespeare/input.txt mv input.txt data/train.txt # Start training python train.py --data_dir data --epochs 10
[ 03 ]
Google Colab
Free GPU access with limitations. Good for short experiments.
!unzip Otter_export.zip %cd Otter_model !pip install -r requirements.txt !curl -O https://raw.githubusercontent.com/karpathy/char-rnn/master/data/tinyshakespeare/input.txt !mkdir -p data && mv input.txt data/train.txt !python train.py --data_dir data --epochs 5 --batch_size 4
→ Colab free tier has 90-min session timeouts and T4 (16 GB) memory. Use Colab Pro for longer runs.
[ 04 ]
Lambda Labs / cloud GPU
For serious runs, rent an A100 or H100. Lambda Labs, RunPod, and Vast.ai are reliable.
ssh ubuntu@<instance-ip> scp -r ./data ubuntu@<instance-ip>:~/data scp Otter_export.zip ubuntu@<instance-ip>:~/ unzip Otter_export.zip && cd Otter_model pip install -r requirements.txt python train.py \ --data_dir ~/data \ --epochs 100 \ --batch_size 32 \ --learning_rate 3e-4 \ --gradient_accumulation_steps 4
[ 05 ]
Training arguments
--data_dirdata/Directory containing train.txt
--epochs10Number of training epochs
--batch_size8Batch size per GPU
--learning_rate1e-4Peak learning rate
--warmup_steps100LR warmup steps
--gradient_accumulation_steps1Gradient accumulation
--max_seq_len512Maximum sequence length
--output_dircheckpoints/Save checkpoints here
[ 06 ]
Monitoring
For richer telemetry, integrate Weights & Biases:
pip install wandb wandb login python train.py --data_dir data --use_wandb --wandb_project my-llm
[ AFTER TRAINING ]
Your checkpoint can be:
- › Loaded with torch.load() for inference
- › Converted to HuggingFace format with the included script
- › Quantized with llama.cpp for local deployment
- › Fine-tuned further on domain-specific data