ivo@setyadi:~$ ivo.blogspot.com

# catatan teknis, sejak 2001

TurboFieldfare jalankan Gemma 4 di Mac RAM rendah

TurboFieldfare adalah runtime Swift dan Metal yang menjalankan Gemma 4 26B-A4B dengan menggunakan sekitar dua gigabyte RAM. Sistem ini memotong expert weights dari SSD untuk menjaga model tetap di memori, sehingga dapat berjalan di MacBook Air M2 8GB. Proyek ini mencakup aplikasi Mac native, CLI, dan server yang kompatibel dengan OpenAI, semuanya dibangun khusus untuk Apple Silicon. Alat ini layak dicoba untuk local inference pada hardware berkapasitas memori rendah yang ingin menghindari overhead dari wrapper umum. Kekurangannya adalah kecepatan decode pada hardware M2 dasar yang lambat, hanya menghasilkan lima hingga enam token per detik. Turbine ini tidak cocok untuk tugas high-throughput atau Mac berbasis Intel. sumber: https://github.com/drumih/turbo-fieldfare versi bahasa Inggris: https://home.wordpress.com/2026/09/21/turbofieldfare-runs-gemma-4-on-low-ram-macs/

Mesin C99 menjalankan model 2,78T parameter di CPU

2026-09-21 · #AI

Ini mesin inference C99 yang portabel untuk model Kimi K3 berparameter 2,78 triliun. Ia berjalan di CPU biasa dengan RAM 8 GB, tanpa BLAS, tanpa framework, tanpa GPU. Seluruh mesinnya hanya 176 KB, dan ia mengalirkan checkpoint 1,56 TB langsung dari disk supaya pemakaian memori puncak tetap rendah.

Layak dilihat kalau Anda ingin memahami cara menjalankan model raksasa tanpa dependensi berat, tapi jangan berharap kecepatan interaktif. Di laptop 8 GB, pembangkitan butuh 26,5 detik per token karena modelnya dialirkan dari disk di tiap langkah. Ini bukti konsep untuk lingkungan dengan sumber daya terbatas, bukan pengganti inference berakselerasi GPU.

sumber: https://github.com/FareedKhan-dev/kimi-k3-in-c

versi bahasa Inggris: https://home.wordpress.com/2026/09/21/c99-engine-runs-2-78t-parameter-model-on-cpu/

$ cd ~/

ivo@setyadi:~$