ivo@setyadi:~$ ivo.blogspot.com

# catatan teknis, sejak 2001

Konfigurasi MaxText untuk reproduksi OLMo 3 7B di TPU

Konfigurasi MaxText ini mereproduksi pre-training OLMo 3 7B di Google Cloud TPUs. Setup mencakup stage 1 dan stage 2 dengan total 5.93 triliun token, selaras dengan run referensi AI2. Sistem menggunakan JAX/XLA dan data pipeline khusus untuk meniru kurva training PyTorch. Config ini berguna untuk memvalidasi apakah recipe PyTorch terjemahkan dengan benar ke hardware TPU. Kekurangannya adalah kebutuhan akses ke Google Cloud TPUs dan data mix OLMo 3 spesifik. Fokusnya adalah verifikasi numerik MaxText terhadap baseline, bukan tutorial GPU generik. sumber: developers.googleblog.com my other side: setyadi.com