TurboFieldfare jalankan Gemma 4 di Mac RAM rendah
2026-09-21 · #AI
TurboFieldfare adalah runtime Swift dan Metal yang menjalankan Gemma 4 26B-A4B dengan menggunakan sekitar dua gigabyte RAM. Sistem ini memotong expert weights dari SSD untuk menjaga model tetap di memori, sehingga dapat berjalan di MacBook Air M2 8GB. Proyek ini mencakup aplikasi Mac native, CLI, dan server yang kompatibel dengan OpenAI, semuanya dibangun khusus untuk Apple Silicon.
Alat ini layak dicoba untuk local inference pada hardware berkapasitas memori rendah yang ingin menghindari overhead dari wrapper umum. Kekurangannya adalah kecepatan decode pada hardware M2 dasar yang lambat, hanya menghasilkan lima hingga enam token per detik. Turbine ini tidak cocok untuk tugas high-throughput atau Mac berbasis Intel.
sumber: https://github.com/drumih/turbo-fieldfare
versi bahasa Inggris: https://home.wordpress.com/2026/09/21/turbofieldfare-runs-gemma-4-on-low-ram-macs/
Mesin C99 menjalankan model 2,78T parameter di CPU
2026-09-21 · #AI
Ini mesin inference C99 yang portabel untuk model Kimi K3 berparameter 2,78 triliun. Ia berjalan di CPU biasa dengan RAM 8 GB, tanpa BLAS, tanpa framework, tanpa GPU. Seluruh mesinnya hanya 176 KB, dan ia mengalirkan checkpoint 1,56 TB langsung dari disk supaya pemakaian memori puncak tetap rendah.
Layak dilihat kalau Anda ingin memahami cara menjalankan model raksasa tanpa dependensi berat, tapi jangan berharap kecepatan interaktif. Di laptop 8 GB, pembangkitan butuh 26,5 detik per token karena modelnya dialirkan dari disk di tiap langkah. Ini bukti konsep untuk lingkungan dengan sumber daya terbatas, bukan pengganti inference berakselerasi GPU.
sumber: https://github.com/FareedKhan-dev/kimi-k3-in-c
versi bahasa Inggris: https://home.wordpress.com/2026/09/21/c99-engine-runs-2-78t-parameter-model-on-cpu/
Graft membangun graf kode lokal untuk coding agent
2026-09-21 · #AI
Graft adalah CLI yang menghasilkan satu folder berisi berkas markdown saling tertaut untuk menjembatani coding agent dengan basis kode Anda. Ia mengklaim memangkas panggilan tool 46 persen dan pemakaian token 42 persen dibanding start dingin. Graf itu berlaku sebagai cache lokal yang bisa dibangun ulang dan menyesuaikan diri dengan working tree dalam hitungan milidetik.
Layak dicoba kalau Anda memakai Claude Code dan ingin menekan latensi tanpa menambah dependensi database. Tangkapannya: ia bersandar pada LLM untuk meringkas, jadi Anda perlu API key yang kompatibel. Bukan untuk tim yang menolak menjalankan perkakas eksternal di lingkungan pengembangannya.
sumber: https://github.com/trailhq/Graft
versi bahasa Inggris: https://home.wordpress.com/2026/09/21/graft-builds-local-code-graphs-for-coding-agents/
Hypit membuat coding agent menghasilkan alur kerja video
2026-09-21 · #AI
Hypit adalah perkakas Node.js yang memperluas agen CLI seperti Claude Code dan Codex agar bisa membuat video. Ia memakai bahasa berbasis skrip di mana elemen visual ditambatkan pada kata yang diucapkan, bukan pada timestamp. Sebuah video yang dijatuhkan ke dalamnya bisa dikloning menjadi alur kerja yang bisa dipakai ulang, atau agen bisa menyusun yang baru dari template dan deskripsi.
Perkakasnya sendiri gratis, tapi Anda tetap membayar model AI yang dipakai untuk footage dan gambar. Ia menuntut coding agent yang cakap dan sedikit konfigurasi untuk koneksi API, sehingga kurang cocok bagi yang menginginkan GUI sederhana tanpa menyentuh kode.
sumber: https://github.com/hypit-ai/hypit
versi bahasa Inggris: https://home.wordpress.com/2026/09/21/hypit-lets-coding-agents-generate-video-workflows/
FreeToken menjalankan model MoE 290B di PC konsumen
2026-09-21 · #AI
FreeToken adalah mesin inference edge-native yang dirancang menyajikan model Mixture-of-Experts berskala frontier di perangkat keras pribadi. Ia menyatukan GPU, CPU, dan memori host menjadi satu platform elastis untuk mencapai kecepatan interaktif pada model 290 miliar parameter ke atas. Tersedia aplikasi desktop untuk Windows dan Linux yang menangani setup dan penyetelan awal.
Layak dilirik kalau Anda punya perangkat keras konsumen kelas atas dan butuh akses lokal ke model MoE besar tanpa klaster datacenter. Proyeknya masih muda dan bersandar pada abstraksi perangkat keras yang rumit, jadi siapkan diri untuk gesekan konfigurasi. Ini bukan pengganti langsung untuk tumpukan serving kelas produksi seperti vLLM di lingkungan cloud.
sumber: https://github.com/FlashML-org/FreeToken
versi bahasa Inggris: https://home.wordpress.com/2026/09/21/freetoken-runs-290b-moe-models-on-consumer-pcs/