JustFit 2026: Arsitektur 200K-Token LLM Serving pada Laptop 24 GiB, Just-in-Time State Management (KVExec, PhaseSwap, StateTrans), dan Apple Silicon MLX Acceleration
Bedah arsitektur makalah riset frontier arXiv:2609.17475 (September 2026, Yuhua Chen): Bagaimana runtime JustFit berbasis Apple MLX mendobrak limit memori 24 GiB unified memory pada laptop M4 Pro untuk melayani 212.992 context window (lonjakan 6.93x dari baseline mlx-vlm) pada model Qwen3.8-27B MXFP4. Analisis mendalam tiga subsistem utama: KVExec (fused page-native TurboQuant TQ4 dequantization & inverse Randomized Hadamard Transform), PhaseSwap (lifecycle component leasing untuk vision tower & Multi-Token Prediction drafter), dan StateTrans (transisi seamless antara singleton MTP speculation dan continuous autoregressive batching tanpa reallocating KV cache). Dilengkapi formulasi matematika kompresi memori, evaluasi empiris AIME 2026 (29/30 benar), dan implementasi pipeline Python Metal.

Di era modern model penalaran dan coding berparameter besar (seperti Qwen3.8-27B), mengeksekusi inferensi lokal pada workstation laptop telah menjadi impian utama setiap engineer software. Namun, tantangan terberat yang membendung adopsi inferensi edge lokal bukan sekadar kompresi bobot model (weights quantization), melainkan ledakan konsumsi Key-Value (KV) Cache dan execution state yang melumat habis kapasitas unified memory hingga memicu system OOM killer.
Executive Architectural Brief — arXiv:2609.17475
Dipublikasikan pada pertengahan September 2026 oleh peneliti independen Yuhua Chen, riset bertajuk "JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management" mendobrak batasan inferensi komputasi personal. Menggunakan framework Apple MLX pada laptop MacBook M4 Pro berkapasitas 24 GiB Unified Memory, JustFit membuktikan kemampuan melayani 212.992 posisi konteks aktif (196.608 token input + 16.384 token output) secara penuh tanpa degradasi penalaran—meningkatkan kapasitas inferensi sebesar 6.93x dibanding baseline mlx-vlm resmi.
1. Anatomi Kegagalan Inferensi Lokal: Mengapa Quantization Bobot Saja Gagal
Pada arsitektur komputasi terpadu seperti Apple Silicon Unified Memory Architecture (UMA), CPU, GPU, dan Neural Engine berbagi satu ruang memori fisik yang sama tanpa adanya isolasi DRAM terpisah. Formula total footprint memori dinamis sistem pada saat inferensi berjalan dirumuskan sebagai:
Di mana W(t) adalah bobot model yang dapat diakses, K(t) adalah persistent packed KV cache, S(t) adalah recurrent state (Gated DeltaNet) dan speculative state, X(t) adalah workspace eksekusi sementara (intermediate activation workspaces), dan H(t) adalah overhead alokator runtime.
Mayoritas optimasi konvensional hanya fokus mengecilkan W(t) menggunakan format low-bit seperti MXFP4 atau INT4. Namun, ketika prompt bertambah panjang (misalnya memuat seluruh repositori kode atau berkas log raksasa), K(t) dan ruang dekuantisasi X(t) membengkak secara eksponensial. Pada geometri Qwen3.8-27B (interleaving 16 full-attention layers dan 48 Gated DeltaNet layers dengan 4 KV heads bertranslasi pada 256 dimensi), representasi FP16 standar menuntut 65.536 byte per posisi konteks. Pada 229.376 posisi, KV cache FP16 menuntut lebih dari 14,33 GiB VRAM—seketika menabrak batas guard 21.000 MiB macOS.
2. Tiga Pilar Arsitektur JustFit: KVExec, PhaseSwap, dan StateTrans
JustFit memecahkan dilema tersebut melalui paradigma Just-in-Time (JIT) State Management, memecah tanggung jawab runtime ke dalam tiga subsistem yang saling terkoordinasi secara ketat:
KVExec
Page-Native Compressed KV Execution. Menyimpan persistent KV dalam representasi TurboQuant 4-bit (TQ4) dengan normalized randomized Hadamard rotation. Dekuantisasi dan inverse transform difusikan langsung ke dalam layer-scoped evaluation kernel, mengeliminasi alokasi ganda floating tensor antar-layer.
PhaseSwap
Lifecycle Component Leasing. Komponen model besar (seperti Vision Tower seberat multi-gigabyte dan predictor Multi-Token Prediction/MTP seberat 215.21 MiB) tidak dimuat secara permanen. Modul di-attach melalui lease temporer dan di-release seketika fasenya selesai.
StateTrans
State-Preserving Serving Transitions. Mengelola admisi antrean, transisi dinamis antara singleton speculative decoding (MTP) dan continuous autoregressive (AR) multi-request batching tanpa membuang target KV prompt cache yang sudah terbentuk.
3. Deep Dive KVExec: Fused Direct-Inverse Reconstruct & Page-Native TQ4
Pendekatan kompresi KV konvensional kerap gagal karena workspace rekonstruksinya (intermediate dequantized buffers) melampaui memori yang berhasil dihemat. KVExec mengadopsi formulasi matematis TurboQuant (Zandieh et al., 2025). Untuk setiap vektor atensi \(x\) dengan norm \(\rho = \|x\|_2\), unnormalized Hadamard matrix \(H_d\), dan random-sign diagonal matrix \(S\):
Setiap vektor Key atau Value dikompresi menjadi 128 byte packed indices (8 index 4-bit per U32 word) dan 2-byte norm FP16 (dihitung dari FP32). Total payload KV per token posisi konteks terpangkas drastis:
Dibandingkan dengan 65.536 Byte pada FP16, JustFit menghasilkan efisiensi kompresi 3.94x. Yang paling revolusioner: inverse Hadamard transform dieksekusi secara fused in-kernel menggunakan kernel Apple Metal Shader khusus (dua tahap radix-16 dalam 16-thread group buffer). Hasil tensor floating K/V langsung dikonsumsi oleh Apple MLX Scaled Dot-Product Attention (SDPA) pada layer tersebut dan langsung di-release sebelum layer berikutnya dieksekusi, memastikan working set memory tidak pernah bocor ke layer selanjutnya.
4. Koordinasi PhaseSwap & StateTrans: Speculation vs Continuous Batching
Tantangan besar dalam sistem multi-tasking edge adalah fluktuasi kebutuhan beban kerja. Ketika request berjalan sendirian (singleton request), JustFit memanfaatkan Multi-Token Prediction (MTP) dengan auxiliary drafter predictor untuk melipatgandakan kecepatan decoding. Namun saat request kedua masuk ke antrean, memori laptop tidak cukup untuk menjalankan multi-drafter secara simultan.
StateTrans menerapkan Algorithm 1 Serving Iteration:
- Zero-Overhead Transition: Saat request peer diizinkan masuk, StateTrans menunggu satu putaran spekulatif selesai, melepaskan (detach) bobot MTP predictor seberat 215.21 MiB, lalu mengonversi eksekusi ke Autoregressive (AR) Batching tanpa membuang KV Cache target yang telah dibangun.
- Phase-Aware Vision Lease: Permintaan yang membawa media gambar tidak disisipkan sembarangan ke dalam active decode cohort. Vision tower dimuat secara eksklusif selama tahap pemrosesan feature image, di-evaluate, lalu segera di-release sebelum token prefill teks dilanjutkan.
- Bounded Chunk Interleaving: Selama batch decode aktif, alokator membatasi kesempatan prefill sebesar maksimal 64 token per 4 langkah decode forward (skema N4/PF64), mencegah lonjakan latensi interaktif bagi request yang sedang melakukan stream teks.
5. Evaluasi Empiris: 212K Context Capacity & Benchmark AIME 2026
Riset ini diuji secara ketat pada perangkat Apple MacBook M4 Pro (24 GiB Unified Memory) menjalankan model Qwen3.8-27B MXFP4. Berikut adalah komparasi metrik empiris terhadap baseline:
| Konfigurasi Serving | Context Window Max | Prefill (PP) Speed | Decode (TG) Speed | Peak Process Memory |
|---|---|---|---|---|
| mlx-vlm Baseline | 30.720 tokens | 110.8 tok/s | OOM Guard Kill (>21 GiB) | >21.000 MiB (Failed) |
| JustFit (32K+6K Fixed Probe) | 38.912 tokens | 115.0 tok/s | 11.54 tok/s | 16.374 MiB |
| JustFit Limit Run (Single-Req) | 212.992 tokens (6.93x) | 68.31 tok/s | 4.985 tok/s | 20.975 MiB (Stable) |
| JustFit Two-Request Aggregate | 229.376 tokens (7.47x) | 72.4 tok/s | 8.12 tok/s (AR) | 20.988 MiB |
Tiga pengujian independen pada batas 196.608 token input + 16.384 token output berhasil diselesaikan 100% tanpa ada crash atau silent truncation, dengan variasi memori puncak yang luar biasa stabil (20.960 hingga 20.977 MiB).
Lebih penting lagi, kompresi 4-bit TQ4 tidak merusak daya pikir model: pada benchmark penalaran matematika bergengsi AIME 2026, runtime JustFit terintegrasi berhasil memecahkan 29 dari 30 soal secara akurat (akurasi 96.67%) pada kecepatan tertimbang 15.04 token/detik, membuktikan bahwa kompresi state berbasis orthogonal transform mempertahankan integritas reasoning jangka panjang.
6. Implementasi Arsitektur: StateTrans & PhaseSwap Coordinator
Di bawah ini adalah implementasi referensi state coordinator yang menerapkan prinsip Algorithm 1 JustFit untuk mengelola memori terpadu dan transisi status request secara deterministik:
"""
JustFit Production State Management Engine: Apple Silicon Unified Memory Coordinator
Berdasarkan Arsitektur Resmi Makalah Riset arXiv:2609.17475 (Yuhua Chen, September 2026).
Mengimplementasikan koordinasi KVExec (TQ4 Fused Kernel), PhaseSwap (Lease Manager),
dan StateTrans (MTP <-> AR serving transition boundary).
"""
import time
import math
from typing import Dict, List, Optional, Tuple, Set
from dataclasses import dataclass, field
from enum import Enum
class ServingMode(str, Enum):
SINGLETON_MTP = "SINGLETON_MTP" # Multi-Token Prediction Speculative Mode
AUTOREGRESSIVE_BATCH = "AR_BATCH" # Multi-Row Continuous Batching
class ComponentType(str, Enum):
LM_HEAD = "LM_HEAD"
VISION_TOWER = "VISION_TOWER"
MTP_DRAFTER = "MTP_DRAFTER"
@dataclass
class PageTableEntry:
page_id: int
logical_slot: int
ref_count: int = 1
is_evicted: bool = False
@dataclass
class ServingRequest:
req_id: str
prompt_tokens: int
output_budget: int
allocated_pages: List[int] = field(default_factory=list)
has_vision_payload: bool = False
tokens_generated: int = 0
is_completed: bool = False
class JustFitStateCoordinator:
"""
Sub-sistem StateTrans & PhaseSwap:
Mengelola unified memory 24 GiB pada Apple Silicon M-Series, mencegah OOM guard kill,
dan memanipulasi kepemilikan memori fisik secara zero-overhead.
"""
PAGE_SIZE = 256 # 256 tokens per physical page
TQ4_BYTES_PER_TOKEN = 16640 # 16 layers * 2(K/V) * 4 heads * (128 bytes indices + 2 bytes norm)
def __init__(self, total_unified_memory_mib: int = 24576, memory_guard_limit_mib: int = 21000):
self.total_memory = total_unified_memory_mib
self.guard_limit = memory_guard_limit_mib
self.serving_mode = ServingMode.SINGLETON_MTP
# Component Leases (PhaseSwap)
self.active_leases: Dict[ComponentType, Set[str]] = {
ComponentType.LM_HEAD: set(),
ComponentType.VISION_TOWER: set(),
ComponentType.MTP_DRAFTER: set(),
}
# Physical Page Management (KVExec & StateTrans)
self.free_page_ids: List[int] = list(range(1024)) # 1024 * 256 tokens = 262,144 token slots
self.page_directory: Dict[int, PageTableEntry] = {}
self.active_requests: Dict[str, ServingRequest] = {}
def calculate_reservation_pages(self, prompt_len: int, output_budget: int) -> int:
"""
Persamaan (7) Makalah JustFit:
Ri = ceil( (prompt_len + min(output_budget, 8192)) / 256 )
"""
guaranteed_tokens = prompt_len + min(output_budget, 8192)
return math.ceil(guaranteed_tokens / self.PAGE_SIZE)
def acquire_component_lease(self, comp: ComponentType, requester_id: str) -> bool:
"""PhaseSwap: Materialisasi komponen hanya saat dibutuhkan, retain selama ada lease."""
self.active_leases[comp].add(requester_id)
return True
def release_component_lease(self, comp: ComponentType, requester_id: str) -> None:
"""PhaseSwap: Lepas komponen segera setelah fase komputasi selesai."""
self.active_leases[comp].discard(requester_id)
def admit_request(self, req: ServingRequest) -> bool:
"""
StateTrans: Evaluasi budget kuota memori sebelum admisi.
Jika transisi dari Singleton MTP ke AR Batching, preserve target prompt cache & detach MTP drafter.
"""
needed_pages = self.calculate_reservation_pages(req.prompt_tokens, req.output_budget)
if len(self.free_page_ids) < needed_pages:
return False # Blocked in queue without polluting cache
# Alokasi halaman fisik
allocated = [self.free_page_ids.pop(0) for _ in range(needed_pages)]
req.allocated_pages = allocated
for pid in allocated:
self.page_directory[pid] = PageTableEntry(page_id=pid, logical_slot=len(self.page_directory))
self.active_requests[req.req_id] = req
# Transisi mode jika terdapat >1 concurrent requests
if len(self.active_requests) > 1 and self.serving_mode == ServingMode.SINGLETON_MTP:
self.transition_to_autoregressive_batch()
return True
def transition_to_autoregressive_batch(self) -> None:
"""Konversi mode ke AR Batching tanpa mereset target prompt cache."""
self.serving_mode = ServingMode.AUTOREGRESSIVE_BATCH
# Detach singleton MTP drafter (menghemat 215.21 MiB VRAM seketika)
self.active_leases[ComponentType.MTP_DRAFTER].clear()
def complete_request(self, req_id: str) -> None:
"""
Algorithm 1 StateTrans:
1. Selesaikan step aktif.
2. Evaluasi pending write ke backing buffer.
3. Filter row yang selesai, decref page table.
4. Jika ref_count == 0, kembalikan page ID ke free list.
"""
req = self.active_requests.pop(req_id, None)
if not req:
return
for pid in req.allocated_pages:
entry = self.page_directory.get(pid)
if entry:
entry.ref_count -= 1
if entry.ref_count <= 0:
del self.page_directory[pid]
self.free_page_ids.append(pid)
# Cek re-promosi kembali ke Singleton MTP jika tersisa 1 request aktif
if len(self.active_requests) == 1 and self.serving_mode == ServingMode.AUTOREGRESSIVE_BATCH:
survivor_id = next(iter(self.active_requests.keys()))
self.serving_mode = ServingMode.SINGLETON_MTP
self.acquire_component_lease(ComponentType.MTP_DRAFTER, survivor_id)
7. Implikasi Strategis bagi Local AI Coding & Edge Inference 2026
Keberhasilan JustFit membuktikan pergeseran fundamental dalam lanskap komputasi kecerdasan buatan:
- Demokratisasi Full-Repository Reasoning: Pengembang software independen tidak lagi bergantung mutlak pada GPU cluster cloud (A100/H100) hanya untuk melakukan analisis codebase skala besar (200K context). Laptop kelas konsumen kini mampu menampung seluruh pohon dependensi kode secara lokal dengan privasi total.
- Pergeseran Paradigma dari Model Weights ke State Management: Persaingan efisiensi AI bukan lagi semata-mata mencari arsitektur model baru, melainkan bagaimana sistem operasi dan runtime inferensi mengelola siklus hidup memori (memory lifecycle management) secara hardware-aware.
- Sinergi dengan Algoritma Kompresi Eviksi: Mengombinasikan pendekatan JIT resident state JustFit dengan seleksi token cerdas seperti BeaconKV (arXiv:2609.04971) membuka potensi melayani konteks hingga 1 Juta token pada perangkat laptop standar di masa mendatang.
Kesimpulan Redaksi NEWSAINT
JustFit adalah cetak biru teknis bagaimana rekayasa sistem tingkat rendah (low-level systems engineering) mampu melipatgandakan kapabilitas hardware komputasi yang ada tanpa perlu menambah silikon fisik. Dengan memadukan KVExec, PhaseSwap, dan StateTrans, batas 24 GiB unified memory bukan lagi vonis mati untuk eksekusi model penalaran 27B berkonteks masif. Inovasi ini menetapkan tolok ukur baru bagi masa depan komputasi agen AI otonom di tahun 2026.
Referensi & Sumber Terverifikasi
- [1]JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management(arXiv:2609.17475 [cs.AI, cs.PF] — Yuhua Chen (www.yuhuachen.com))
- [2]TurboQuant: Low-Bit Key-Value Cache Compression via Randomized Orthogonal Transformations(arXiv:2505.02107 [cs.LG, cs.AI] — Zandieh et al.)
- [3]Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve(USENIX OSDI 2024 — Agrawal et al. (Microsoft Research))
- [4]MLX: An Array Framework for Apple Silicon Machine Learning(Apple Machine Learning Research & GitHub: ml-explore/mlx)
- [5]BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference(arXiv:2609.04971 [cs.CL, cs.AI] — NEWSAINT Technical Research Review)
- [6]JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management(arXiv:2609.17475 [cs.AI, cs.PF] — Yuhua Chen (www.yuhuachen.com))
- [7]TurboQuant: Low-Bit Key-Value Cache Compression via Randomized Orthogonal Transformations(arXiv:2505.02107 [cs.LG, cs.AI] — Zandieh et al.)
- [8]Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve(USENIX OSDI 2024 — Agrawal et al. (Microsoft Research))
- [9]MLX: An Array Framework for Apple Silicon Machine Learning(Apple Machine Learning Research & GitHub: ml-explore/mlx)
- [10]BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference(arXiv:2609.04971 [cs.CL, cs.AI] — NEWSAINT Technical Research Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.