ivo@setyadi:~$ ivo.blogspot.com

# catatan teknis, sejak 2001

Olmo-core 3 untuk pelatihan model MoE

2026-10-02 · #AI #TechReview

Olmo-core 3 untuk pelatihan model MoE

Allen Institute for AI merilis Olmo-core 3, sebuah framework open-source untuk melatih model Mixture-of-Experts hingga skala satu triliun parameter. Framework ini meninggalkan fully sharded data parallelism demi distributed data parallelism yang menjaga expert tetap berada di dalam GPU dan merutekan data secara langsung guna menghindari pengumpulan bobot berulang. Pada pengujian di hardware NVIDIA B300, model MoE berukuran 47 miliar parameter mampu mencapai 52.000 token per detik per GPU, atau 2,7 kali lebih cepat dibanding stack lama mereka.

Framework ini layak dilirik jika sedang membangun model sparse berskala besar dan membutuhkan alternatif selain Megatron-Core, terlebih dengan adanya dukungan MXFP8 yang memberikan peningkatan throughput sebesar 21 persen dibanding BF16. Kendati demikian, tingkat kompleksitasnya sangat tinggi sehingga tidak relevan sama sekali jika masih menggunakan arsitektur dense atau skala akademis yang lebih kecil.

sumber: huggingface.co/olmocore3

my other side: setyadi.com

$ cd ~/

$ cat comments/ (0)