NS
NEWSAINT
ai-eng• 8 MIN READ•1 Oktober 2026

Loop Scaling Laws 2026: Arsitektur Looped Mixture-of-Experts (LoopMoE), Sparsity-Conditional Recurrence Mapping, dan Penskalaan Efisiensi Parameter Skala Triliun Token

Analisis arsitektur sistemik riset frontier penskalaan model (arXiv:2609.40316, Meta AI, Oktober 2026): Mengapa penskalaan konvensional yang hanya berfokus pada penambahan parameter mentah dan data mulai menemui dinding efisiensi komputasi dan memori. Mixture-of-Experts (MoE) menawarkan sparsity dengan memperluas kapasitas total pada fixed active compute, sementara Looped Transformers menawarkan recurrence dengan menggunakan kembali bobot layer untuk memperdalam komputasi pada fixed stored parameters. Paper terobosan Meta AI memperkenalkan Loop Scaling Laws—hukum penskalaan terpadu pertama yang memodelkan interaksi simultan antara recurrence (R) dan sparsity (m). Dengan memformulasikan Sparsity-Conditional Recurrence Mapping N_eff(R, m), riset ini membuktikan bahwa diversitas rute routing token antar-pass mencegah saturasi recurrence dini. Pada skala triliun token, arsitektur Looped MoE A0.3B-1.3B dengan compute-optimal recurrence R=4 mampu menyaingi model non-looped MoE 2x lebih besar (A0.6B-2.9B) pada anggaran komputasi setara, sekaligus membuka kapabilitas test-time reasoning scaling yang fleksibel.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 Loop Scaling Laws 2026: Arsitektur Looped Mixture-of-Experts (LoopMoE), Sparsity-Conditional Recurrence Mapping, dan Penskalaan Efisiensi Parameter Skala Triliun Token

Dalam kurun waktu lima tahun terakhir, penskalaan model bahasa besar (LLM) bertumpu pada formula klasik Chinchilla scaling laws: perbesar jumlah parameter model ($N$) dan perbanyak jumlah token pelatihan ($D$). Namun, di era model frontier 2026, strategi penambahan brute-force parameter fisik telah menabrak dua dinding batas yang sangat nyata: memory footprint wall pada memori HBM GPU dan compute saturation pada cluster komputasi terdistribusi.

Intisari Riset Frontier: Meta AI Research (arXiv:2609.40316)

Dua paradigma efisiensi parameter telah berkembang pesat: Mixture-of-Experts (MoE) yang memperluas kapasitas total tanpa menambah komputasi aktif (sparsity axis), dan Looped Transformers yang menggunakan kembali bobot layer secara berulang untuk memperdalam komputasi tanpa menambah memori bobot (recurrence axis). Dipimpin oleh Yanbei Chen, Anirudh Goyal, dan Raghuraman Krishnamoorthi dari Meta AI, riset Loop Scaling Laws memperkenalkan formulasi hukum penskalaan gabungan pertama yang memodelkan interaksi matematis antara recurrence dan sparsity, membuktikan bahwa sinergi keduanya menghasilkan efisiensi parameter hingga 3x lipat pada komputasi aktif dan 2x lipat pada kapabilitas reasoning.

1. Mengapa Hukum Penskalaan Klasik Gagal pada Arsitektur Looped MoE?

Hukum penskalaan standar mengasumsikan model feed-forward statis di mana setiap token melewati setiap parameter tepat satu kali. Ketika peneliti mencoba memodelkan Looped Transformers sebelumnya (seperti Parcae), mereka menggunakan pemetaan linear sederhana:

N_eff^{linear}(R) = N + (R - 1) N_{loop}

Model linear ini mengasumsikan bahwa setiap kali model mengulang blok tengah (middle-block loop), keuntungan kapasitas parameter bertambah secara linier tanpa batas. Pada kenyataannya, pengujian empiris membuktikan terjadinya diminishing returns yang tajam: memutar bobot yang sama berulang-ulang akan mengalami saturasi karena representasi fitur token konvergen ke ruang representasi yang sempit.

Di sisi lain, hukum penskalaan MoE konvensional hanya memodelkan pembagian expert pada arsitektur non-looped. Ketika Looped Transformer dikombinasikan dengan MoE, terjadi dinamika yang sepenuhnya baru: Expert-Path Diversity ($Psi$). Karena mekanisme sparse routing memilih top-$k$ expert yang berbeda pada setiap pass rekursif $r$, token dapat melintasi kombinasi jalur parameter yang eksponensial meskipun bobot fisik model tetap identik!

Model Pemetaan Formulasi Matematika Held-Out RMSE (R=16) Karakteristik Teoretis
Linear Mapping (Parcae) N + (R - 1) N_loop 0.2847 Overestimasi parah; mengabaikan saturasi rekursi
Power-Law Mapping N + (R^φ - 1) N_loop 0.0480 Sub-linear namun tetap tidak berbatas (unbounded)
Dense Bounded Mapping N + κ_1 N_loop (1 - e^{-(R-1)/κ_2}) 0.0190 Asimptotik berbatas, namun abai terhadap diversitas routing
MoE Loop Law (Meta AI 2026) N_act + κ_1(m) N_loop (1 - e^{-(R-1)/κ_2(m)}) 0.0100 (Held-out R) / 0.0037 (Overall) Sparsity-conditional: mengangkat kurva saturasi secara vertikal

2. Anatomi Matematika: Sparsity-Conditional Recurrence Mapping

Kunci keberhasilan Loop Scaling Laws terletak pada pengikatan rasio sparsity $m = N_{act} / N_{total}$ ke dalam koefisien saturasi rekursif:

// Persamaan (7) arXiv:2609.40316: Sparsity-Conditional Recurrence Mapping
N_{eff}(R, m) = N_{act} + kappa_1(m) N_{loop} left(1 - e^{- rac{R-1}{kappa_2(m)}} ight)
di mana: kappa_j(m) = kappa_j cdot m^{- heta} quad (j in {1, 2})

Dalam formulasi ini, eksponen penskalaan sparsity $ heta = 0.3286$ bertindak sebagai tuas pengungkit. Ketika sparsity meningkat (nilai $m$ mengecil, yang berarti jumlah expert $E$ bertambah), nilai $m^{- heta}$ membesar. Efek geometrisnya sangat elegan:

  • Pengangkatan Asimtotik ($kappa_1(m)$): Menaikkan batas atas kapasitas parameter efektif maksimum yang dapat dicapai oleh model saat $R o infty$. Token tidak lagi 'terkunci' dalam siklus representasi yang monoton karena pada setiap loop ia diproses oleh expert yang berbeda.
  • Perlambatan Saturasi ($kappa_2(m)$): Memperpanjang rentang recurrensi yang efektif sebelum model menyentuh plateau hukum hasil yang berkurang (diminishing returns).
  • Pemulihan Hukum Klasik (Boundary Properties): Saat $R = 1$, rumus secara tepat kembali ke parameter aktif non-looped ($N_{eff}(1, m) = N_{act}$). Saat $m = 1$ (model dense tanpa MoE), rumus secara otomatis memulihkan Dense Bounded Loop Scaling Law.

3. Koefisien Parametrik dan Optimasi Sumber Daya (Compute & Memory Optimal)

Melalui sweep empiris berskala masif melibatkan lebih dari 1.000 observasi training loss melintasi parameter aktif $N_{act} in {0.3B, 0.6B, 1.0B}$, token $D in [100B, 500B]$, expert $E in [1, 16]$, dan recurrensi $R in [1, 8]$, Meta AI berhasil mengestimasi parameter global dengan tingkat presisi tinggi (RMSE = 0.0037):

Base Model Exponent (α)
-0.1951
A = 0.8085
Data Exponent (β)
-0.7548
B = 3.4291
MoE Scaling Exponent (δ)
-0.1935
E_max = 57.12
Sparsity Modulation (θ)
0.3286
κ_1 = 0.368, κ_2 = 1.404

Dengan persamaan ini, arsitek sistem AI dapat memecahkan dua masalah optimasi krusial di bawah kendala komputasi dan memori:

  1. Compute-Optimal Recurrence ($R^star$): Pada anggaran FLOPs tetap ($ar{F}_{train}$), apakah lebih baik melatih model dengan sedikit pass pada token yang banyak, atau dengan $R > 1$ pada token yang lebih sedikit? Analisis membuktikan bahwa untuk model dengan active parameter kecil, nilai $R^star = 2$ hingga $4$ memberikan loss yang jauh lebih rendah daripada model non-looped pada FLOPs yang sama.
  2. Memory-Optimal Sparsity ($E^star$): Pada batas memori VRAM GPU tetap ($mathcal{M}_{weight} le M_{budget}$), meningkatkan sparsity via expert count meningkatkan kapasitas tanpa menambah komputasi aktif.

4. Evaluasi Triliun Token: Looped MoE Menaklukkan Model 2x Lebih Besar

Uji pembuktian paling spektakuler dari riset ini dilakukan pada skala triliun token. Peneliti membandingkan model baseline A0.6B-2.9B MoE (0.6B active / 2.9B total, 8 expert, dilatih pada ~6T token) melawan model yang dirancang berdasarkan hukum penskalaan: A0.3B-1.3B LoopMoE (0.3B active / 1.3B total, recurrensi $R=4$).

Kedua model dilatih dengan total compute FLOPs yang persis sama ($approx 1.5 imes 10^{22}$ FLOPs). Berikut adalah hasil evaluasi pada 14 tolok ukur standar downstream:

Model & Konfigurasi Inference FLOPs GSM8K (8-shot) BBH (3-shot) ARC-C (25-shot) MMLU (5-shot) Overall Average
A0.6B-2.9B MoE (Baseline Non-Looped) 1.0× (Ref) 42.9% 29.8% 50.0% 46.9% 50.2%
A0.3B-1.3B LoopMoE (R = 1, Test-Time) 0.8× 30.0% 26.7% 42.2% 37.6% 43.0%
A0.3B-1.3B LoopMoE (R = 2, Test-Time) 1.1× 41.0% 30.1% 44.9% 41.6% 46.0%
A0.3B-1.3B LoopMoE (R = 4, Matched Recurrence) 1.8× 41.2% 31.8% 47.5% 42.2% 46.9%

Hasil ini mengungkapkan fakta fundamental: meskipun ukuran parameter aktif dan totalnya 2x lebih kecil, model A0.3B-1.3B LoopMoE mampu mengejar performa penalaran matematis (GSM8K: 41.2% vs 42.9%) dan bahkan melampaui baseline non-looped pada Big-Bench Hard (BBH: 31.8% vs 29.8%). Selain itu, arsitektur looped memberikan keunggulan fleksibilitas inferensi: pengguna dapat menjalankan inferensi cepat pada $R=1$ (hanya 0.8x komputasi) untuk tugas ringan, atau menaikkan $R$ saat menghadapi masalah penalaran sulit tanpa mengubah satu pun bobot checkpoint.

5. Implementasi Referensi TypeScript: LoopMoE Scaling Law Engine

Untuk membantu tim riset dan machine learning engineering menghitung konfigurasi arsitektur optimal, berikut adalah implementasi TypeScript yang memetakan seluruh formulasi matematis Loop Scaling Laws:

src/scaling/loop-moe-scaling-engine.ts Meta AI Formula Implementation
// Production Implementation: LoopMoE Scaling Law Evaluator & Resource Optimizer
// Berdasarkan Arsitektur Meta AI (arXiv:2609.40316 - September/Oktober 2026)
//
// Karakteristik Desain:
// 1. Sparsity-Conditional Recurrence Mapping: N_eff(R, m) = N_act + κ_1(m) * N_loop * (1 - exp(-(R-1)/κ_2(m)))
// 2. Dual-Axis Parametric Loss: L(N_act, D, R, E, m) menggabungkan expert expansion E_hat dan N_eff
// 3. Compute- & Memory-Optimal Solver: Menghitung R* dan E* optimal di bawah batas FLOPs dan VRAM

export interface MoELoopLawCoefficients {
  A: number;        // Base parameter scaling constant (0.8085)
  alpha: number;    // Model scaling exponent (-0.1951)
  B: number;        // Base data scaling constant (3.4291)
  beta: number;     // Data scaling exponent (-0.7548)
  c: number;        // Irreducible loss entropy (1.3555)
  delta: number;    // MoE expert scaling coefficient (-0.1935)
  gamma: number;    // MoE parameter interaction exponent (-0.0137)
  omega: number;    // MoE data scaling coefficient (-0.2056)
  zeta: number;     // MoE data interaction exponent (0.0881)
  E_start: number;  // Expert start saturation point (1.3174)
  E_max: number;    // Maximum effective expert capacity (57.1201)
  kappa1: number;   // Recurrence scale multiplier (0.3682)
  kappa2: number;   // Recurrence decay base (1.4037)
  theta: number;    // Sparsity modulation exponent (0.3286)
}

export const META_FITTED_COEFFS: MoELoopLawCoefficients = {
  A: 0.8085,
  alpha: -0.1951,
  B: 3.4291,
  beta: -0.7548,
  c: 1.3555,
  delta: -0.1935,
  gamma: -0.0137,
  omega: -0.2056,
  zeta: 0.0881,
  E_start: 1.3174,
  E_max: 57.1201,
  kappa1: 0.3682,
  kappa2: 1.4037,
  theta: 0.3286,
};

export interface ArchitectureConfig {
  activeParamsB: number;   // N_act dalam Miliar (misal: 0.3B)
  totalParamsB: number;    // N_total dalam Miliar (misal: 1.3B)
  loopParamsB: number;     // N_loop dalam Miliar (middle block parameter)
  expertCount: number;     // E (jumlah routed expert)
  recurrence: number;      // R (jumlah pass middle block)
  trainingTokensB: number; // D dalam Miliar token
}

export class LoopMoEScalingEngine {
  constructor(private coeffs: MoELoopLawCoefficients = META_FITTED_COEFFS) {}

  /**
   * Menghitung Sparsity Ratio m = N_act / N_total
   */
  public computeSparsityRatio(N_act: number, N_total: number): number {
    return Math.min(1.0, Math.max(0.001, N_act / N_total));
  }

  /**
   * Menghitung Effective Expert Expansion E_hat (Clark et al., 2022)
   */
  public computeEffectiveExpertExpansion(E: number): number {
    const { E_start, E_max } = this.coeffs;
    if (E <= 1) return 1.0;
    const invTerm = Math.pow(E - 1 + Math.pow(1 / E_start - 1 / E_max, -1), -1);
    return Math.pow(invTerm + 1 / E_max, -1);
  }

  /**
   * Menghitung Effective Parameters N_eff(R, m) dengan Sparsity-Conditional Bounded Mapping
   * Persamaan (7) Meta AI arXiv:2609.40316
   */
  public computeEffectiveParameters(
    N_act: number,
    N_loop: number,
    R: number,
    m: number
  ): number {
    if (R <= 1) return N_act;
    const kappa1_m = this.coeffs.kappa1 * Math.pow(m, -this.coeffs.theta);
    const kappa2_m = this.coeffs.kappa2 * Math.pow(m, -this.coeffs.theta);
    const gainFactor = 1.0 - Math.exp(-(R - 1) / kappa2_m);
    return N_act + kappa1_m * N_loop * gainFactor;
  }

  /**
   * Prediksi Cross-Entropy Loss L(N_act, D, R, E, m)
   * Persamaan (9) Meta AI arXiv:2609.40316
   */
  public predictLoss(config: ArchitectureConfig): number {
    const { activeParamsB: N_act, totalParamsB: N_total, loopParamsB: N_loop, expertCount: E, recurrence: R, trainingTokensB: D } = config;
    const m = this.computeSparsityRatio(N_act, N_total);
    const E_hat = this.computeEffectiveExpertExpansion(E);
    const N_eff = this.computeEffectiveParameters(N_act, N_loop, R, m);

    const logE = Math.log(Math.max(1.0, E_hat));
    const paramExponent = this.coeffs.alpha + this.coeffs.gamma * logE;
    const dataExponent = this.coeffs.beta + this.coeffs.zeta * logE;

    const paramTerm = this.coeffs.A * Math.pow(E_hat, this.coeffs.delta) * Math.pow(N_eff, paramExponent);
    const dataTerm = this.coeffs.B * Math.pow(E_hat, this.coeffs.omega) * Math.pow(D, dataExponent);

    return paramTerm + dataTerm + this.coeffs.c;
  }

  /**
   * Menghitung Total Training FLOPs: F_train = 6 * N_unroll(R) * D
   */
  public computeTrainingFlops(config: ArchitectureConfig): number {
    const N_unroll = config.activeParamsB + (config.recurrence - 1) * config.loopParamsB;
    return 6.0 * N_unroll * 1e9 * (config.trainingTokensB * 1e9);
  }

  /**
   * Optimasi Compute-Optimal Recurrence (R*) pada Anggaran FLOPs Tetap (Persamaan 11)
   */
  public findComputeOptimalRecurrence(
    N_act: number,
    N_total: number,
    N_loop: number,
    E: number,
    targetFlops: number,
    candidateRecurrences: number[] = [1, 2, 3, 4, 6, 8]
  ): { optimalR: number; minLoss: number; tokenBudgetB: number } {
    let bestR = 1;
    let minLoss = Infinity;
    let optimalTokensB = 0;

    for (const R of candidateRecurrences) {
      const N_unroll = N_act + (R - 1) * N_loop;
      // 6 * N_unroll * 1e9 * D_tokens = targetFlops
      const tokens = targetFlops / (6.0 * N_unroll * 1e9);
      const tokensB = tokens / 1e9;

      const loss = this.predictLoss({
        activeParamsB: N_act,
        totalParamsB: N_total,
        loopParamsB: N_loop,
        expertCount: E,
        recurrence: R,
        trainingTokensB: tokensB,
      });

      if (loss < minLoss) {
        minLoss = loss;
        bestR = R;
        optimalTokensB = tokensB;
      }
    }

    return { optimalR: bestR, minLoss, tokenBudgetB: optimalTokensB };
  }
}

6. Implikasi Arsitektural bagi Generasi Foundation Models Mendatang

Penemuan Loop Scaling Laws mendefinisikan ulang peta jalan desain arsitektur foundation model di industri. Ke depan, pengembang model tidak lagi harus memilih antara model raksasa yang boros VRAM atau model kecil yang dangkal penalarannya.

Dengan memadukan Mixture-of-Experts dan Looped Depth:

  • Efisiensi VRAM Edge & Consumer Hardware: Model dengan parameter fisik kecil (misal 1B hingga 3B) dapat ditampung sepenuhnya dalam cache on-chip atau VRAM kartu grafis kelas konsumen, namun memiliki kedalaman komputasi penalaran setara model 7B atau 14B.
  • Native Test-Time Compute Scaling: Berbeda dengan model feed-forward biasa yang membutuhkan prompting Chain-of-Thought (CoT) panjang untuk memperpanjang waktu pikir, arsitektur Looped MoE dapat meningkatkan komputasi internal per token secara langsung di level arsitektur jaringan (latent reasoning recurrence).
  • Optimalisasi Alokasi Biaya Pelatihan: Formulasi parametrik Meta AI memungkinkan tim ML untuk memprediksi secara akurat apakah budget tambahan $100.000 lebih efektif dialokasikan untuk menambah expert MoE, menambah token pre-training, atau menambah siklus perulangan rekursif.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.