ivo@setyadi:~$ ivo.blogspot.com

# catatan teknis, sejak 2001

TurboFieldfare jalankan Gemma 4 di Mac RAM rendah

TurboFieldfare adalah runtime Swift dan Metal yang menjalankan Gemma 4 26B-A4B dengan menggunakan sekitar dua gigabyte RAM. Sistem ini memotong expert weights dari SSD untuk menjaga model tetap di memori, sehingga dapat berjalan di MacBook Air M2 8GB. Proyek ini mencakup aplikasi Mac native, CLI, dan server yang kompatibel dengan OpenAI, semuanya dibangun khusus untuk Apple Silicon. Alat ini layak dicoba untuk local inference pada hardware berkapasitas memori rendah yang ingin menghindari overhead dari wrapper umum. Kekurangannya adalah kecepatan decode pada hardware M2 dasar yang lambat, hanya menghasilkan lima hingga enam token per detik. Turbine ini tidak cocok untuk tugas high-throughput atau Mac berbasis Intel. sumber: https://github.com/drumih/turbo-fieldfare versi bahasa Inggris: https://home.wordpress.com/2026/09/21/turbofieldfare-runs-gemma-4-on-low-ram-macs/

FreeToken menjalankan model MoE 290B di PC konsumen

2026-09-21 · #AI

FreeToken adalah mesin inference edge-native yang dirancang menyajikan model Mixture-of-Experts berskala frontier di perangkat keras pribadi. Ia menyatukan GPU, CPU, dan memori host menjadi satu platform elastis untuk mencapai kecepatan interaktif pada model 290 miliar parameter ke atas. Tersedia aplikasi desktop untuk Windows dan Linux yang menangani setup dan penyetelan awal.

Layak dilirik kalau Anda punya perangkat keras konsumen kelas atas dan butuh akses lokal ke model MoE besar tanpa klaster datacenter. Proyeknya masih muda dan bersandar pada abstraksi perangkat keras yang rumit, jadi siapkan diri untuk gesekan konfigurasi. Ini bukan pengganti langsung untuk tumpukan serving kelas produksi seperti vLLM di lingkungan cloud.

sumber: https://github.com/FlashML-org/FreeToken

versi bahasa Inggris: https://home.wordpress.com/2026/09/21/freetoken-runs-290b-moe-models-on-consumer-pcs/

$ cd ~/

ivo@setyadi:~$