NS
NEWSAINT
ai-eng• 8 MIN READ•11 September 2026

T1 2026: Arsitektur Terminal Agent Reinforcement Learning, Token-In-Token-Out (TITO), Rollout Routing Replay (R3), dan Dense Verification Reward untuk Long-Horizon Tasks

Bedah arsitektur mendalam atas terobosan riset frontier arXiv:2609.11042 (September 2026, Yang et al.): Bagaimana melatih model Mixture-of-Experts 122B mengeksekusi shell terminal hingga 300+ turn secara otonom? Makalah ini membongkar kegagalan fatal RL sparse MoE klasik akibat token drift dan expert routing mismatch, lalu merumuskan solusi deterministik: Token-In-Token-Out (TITO) yang memangkas token drift hingga tepat nol di loss region, Rollout Routing Replay (R3) yang mengunci rute expert layer-by-layer dari inference ke training, serta Dense Process Reward berbasis held-out verifier assertions. Hasilnya, T1 melonjak ke 64.0% di Terminal-Bench 2.1, mengungguli GPT-5.4 dan DeepSeek-V4-Flash, serta meraih 100% sempurna pada pengujian debugging.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 T1 2026: Arsitektur Terminal Agent Reinforcement Learning, Token-In-Token-Out (TITO), Rollout Routing Replay (R3), dan Dense Verification Reward untuk Long-Horizon Tasks

Dalam evolusi kecerdasan buatan terapan, pergeseran dari sekadar single-turn conversational assistant menuju Autonomous Long-Horizon Agent menandai garis demarkasi paling radikal dekade ini. Model tidak lagi cukup hanya menghasilkan kode yang lolos uji mata manusia; mereka dituntut untuk mengoperasikan shell sistem operasi secara persisten, mengeksekusi puluhan hingga ratusan perintah terminal berturut-turut, menavigasi kegagalan runtime, dan membuktikan keabsahan solusinya melalui verifikasi deterministik lingkungan nyata.

Executive Architectural Summary

Dipublikasikan pada arXiv:2609.11042 (10 September 2026) oleh konsorsium Tencent Hy Foundation Model Frontier, National University of Singapore, University of Georgia, Indiana University, dan University of Maryland, T1 adalah model Mixture-of-Experts (MoE) 122 miliar parameter pertama yang dilatih secara murni menggunakan Reinforcement Learning (RL) pada eksekusi terminal shell interaktif berdurasi panjang (hingga 300+ turn per task). Dengan memadukan Token-In-Token-Out (TITO), Rollout Routing Replay (R3), dan Dense Verification Reward, T1 mencatat skor rekor 64.0% pada Terminal-Bench 2.1—mengungguli GPT-5.4 (54.8%) dan DeepSeek-V4-Flash (56.9%), serta membukukan akurasi sempurna 100.0% pada domain software debugging.

1. Krisis Sinkronisasi Sparse MoE: Runtuhnya Asumsi Klasik On-Policy RL

Reinforcement Learning pada model arsitektur Mixture-of-Experts skala raksasa menghadapi tantangan numerik yang jauh lebih kejam dibanding model padat (dense models). Pada model T1 (berbasis Qwen3.5-122B-A10B), bobot expert menyumbang 116.0 miliar dari total 121.4 miliar parameter. Pada setiap layer, 8 expert dipilih dari total 256 candidate experts via router diskret:

$$\text{TopK}(\mathcal{W}_{router} \cdot x, k=8) \quad \text{dari} \quad N=256 \; \text{Experts}$$

Ketika agent mengeksekusi tugas panjang dalam sandbox terminal (misalnya melakukan bisection pada ratusan commit git, merekonstruksi bug C++, memodifikasi Makefile, dan mengompilasi ulang), terjadi akumulasi diskrepansi yang merusak stabilitas training. Riset Yang et al. membongkar dua anomali sistemik yang selama ini membuat RL pada coding agent gagal konvergen:

1. Token Drift Antar-Turn (Harness Desync)

Koleksi data rollout terjadi secara dinamis di inference engine (SGLang), di mana token digenerasi satu per satu. Namun pada saat trainer (Megatron-Core) memproses trajektori utuh, re-tokenization dari teks mentah menghasilkan token IDs yang berbeda akibat representasi whitespace, pemangkasan template, atau pergeseran byte boundary. Satu token yang bergeser menyebabkan seluruh token berikutnya membawa gradien ke posisi yang salah.

2. Routing Mismatch (Expert Flipping)

Karena perbedaan implementasi kernel komputasi, urutan reduksi floating point (FP8/BF16), dan optimasi KV-cache antara engine rollout dan trainer, nilai logit router bergeser tipis ($Delta < 10^{-4}$). Pergeseran mikro ini cukup untuk menukar expert ke-8 dengan expert ke-9. Akibatnya, gradien PPO dialirkan ke bobot expert yang tidak pernah menghasilkan tindakan tersebut saat rollout, memicu degradasi kebijakan (policy collapse).

2. Solusi Dual-Axis T1: Token-In-Token-Out (TITO) & Rollout Routing Replay (R3)

Tim peneliti T1 menyelesaikan kedua masalah tersebut melalui pemisahan ortogonal: TITO mengunci sumbu representasi token, sedangkan R3 mengunci sumbu pemilihan expert.

A. Token-In-Token-Out (TITO): Bit-Exact Stream Preservation

Alih-alih mentransfer string teks mentah antar giliran (turns), harness Terminus-2 dan trainer T1 secara ketat berkomunikasi menggunakan token identifiers biner murni. Template percakapan dikonfigurasi append-only sehingga tidak ada token penalaran historis yang di-prune atau diubah formatnya.

Sebuah trajektori disusun menjadi satu rangkaian token terpadu dengan loss mask biner $mathcal{M}$:

$$mathcal{M}_t = egin{cases} 1, & ext{jika token } t ext{ digenerasi oleh agent policy (loss-bearing)} \ 0, & ext{jika token } t ext{ adalah instruksi sistem, prompt, atau output terminal} end{cases}$$

Dengan auditor boundary case yang ketat, pengukuran produksi pada 1.402 sampel multi-turn membuktikan bahwa drift rate di dalam zona loss bernilai tepat 0.000%:

$$ ext{Token Drift}_{ ext{loss region}} = 0.000000$$

B. Rollout Routing Replay (R3): Replaying Expert Selections

Pada arsitektur MoE standar, layer training menghitung pemilihan Top-K dari logit live-nya sendiri. Di bawah R3, pemilihan Top-K digantikan oleh lookup topologi biner dari riwayat rollout ($M^{rec}$), sementara normalisasi probabilitas tetap dilakukan di atas logit live:

$$p_i(x) = rac{exp(h_i(x))}{sum_{j in M^{rec}} exp(h_j(x))} quad ext{untuk setiap } i in M^{rec}$$

Mekanisme ini menghadirkan dua keuntungan arsitektur yang fundamental:

  • Eliminasi Disparitas Routing: Expert yang menerima gradien backpropagation identik 100% dengan expert yang mengeksekusi token pada sandbox Daytona.
  • Preservasi Gradien Router: Karena fungsi softmax tetap beroperasi pada logit live $h(x)$, parameter router $mathcal{W}_{router}$ tetap dapat dioptimalkan tanpa memutus graph komputasi autograd.
Konfigurasi Sinkronisasi Log-Prob Variance Gap Drift Token Loss Region Stabilitas Gradient Step
Tanpa TITO & R3 (Konvensional) 0.0210 Accumulating (> 4.2%) High Variance / Frequent Divergence
T1 Stack (TITO + R3 Active) 0.0130 (-38.1%) 0.0000 (Bit-Exact) Deterministic Monotonic Convergence

3. Dense Process Verification Reward: Melampaui Sparse Binary Feedback

Dalam reinforcement learning untuk coding agent, pendekatan naif memberikan reward biner: +1 jika seluruh tugas selesai sempurna, dan 0 jika gagal. Namun, satu batch rollout pada 512 sandbox Linux menghabiskan ratusan jam CPU/GPU sandbox. Membayar komputasi sebesar itu hanya untuk memperoleh 1-bit informasi per trajektori terbukti menjadi penyebab utama kegagalan eksperimen awal T1 (di mana model tidak pernah melampaui performa SFT dasarnya).

T1 merevolusi formula reward dengan memanfaatkan Dense Process Reward yang diekstrak langsung dari unit assertion verifier yang held-out. Setiap tugas memiliki suite pengujian internal yang memverifikasi sub-kondisi (misal: apakah file konfigurasi dibuat, apakah dependensi terkompilasi, apakah port listening, apakah test suite lolos):

$$R_{ ext{dense}}( au) = rac{sum_{k=1}^K mathbb{I}( ext{Assertion}_k = ext{Passed})}{M}$$

Di mana $M$ adalah konstanta skala global tetap (bukan dinormalisasi per-batch). Keputusan arsitektur ini krusial: normalisasi per-batch akan membuat satu trajektori ekstrem mengubah pembagi bagi seluruh batch, mendistorsi ekspektasi value function. Dengan skala global $M$, setiap tugas yang lebih sulit secara inheren memberikan sinyal reward absolut yang lebih kaya kepada jaringan Critic.

Arsitektur Critic Terjadwal & Critic Warm-Up

Jaringan Critic pada T1 adalah duplikat penuh 122B MoE (di mana language modeling head diganti dengan scalar value head). Untuk menghemat alokasi hardware, Actor dan Critic berbagi GPU yang sama secara bergantian (time-multiplexed) dengan memory footprint masing-masing dibatasi ketat di 95 GiB.

  • Critic Warm-Up Satu Epoch: Critic dilatih terlebih dahulu selama 1 epoch penuh pada dataset TMax-15k sebelum Actor mengambil langkah pembaruan pertama. Ini melesatkan Explained Variance ($R^2_{EV}$) dari defisit negatif ($-0.40$) langsung ke kisaran +0.80 s.d. +0.85, mengeliminasi bias estimasi Generalized Advantage Estimation (GAE).
  • Pembaruan Asimetris (Critic First): Pada setiap step PPO, Critic diperbarui terlebih dahulu dan menyerahkan nilai estimasi pre-update kepada Actor. Learning rate Critic dipatok pada $5 imes 10^{-6}$ (5x lebih agresif dibanding Actor pada $1 imes 10^{-6}$) karena tugas Critic adalah regresi nilai terawasi, bukan pembaruan kebijakan probabilistik.

4. Analisis Hasil Empiris: Terminal-Bench 2.1, LHTB & Keunggulan Domain

Evaluasi komparatif dilakukan secara strictly held-out: seluruh tugas evaluasi terisolasi dan tidak memiliki irisan dengan korpus pelatihan sintesis RST-38k maupun T1-15k. Pengujian dijalankan di dalam container Daytona cloud berkapasitas disk 10 GiB dengan limit 60 tool-call turns dan timeout eksekusi 3.600 detik.

Model & Parameter Scale Terminal-Bench 2.1 (Resolved %) LHTB (Avg Continuous Reward) Terminal-Bench Hard (Resolved %) Debugging Domain (%)
Qwen3.5-122B-A10B Base 43.8% 14.2% 20.0% 40.0%
SFT Baseline (RST Checkpoint) 49.4% 18.6% 28.3% 60.0%
GPT-5.4 (Frontier Commercial) 54.8% 24.1% 31.0% 75.0%
DeepSeek-V4-Flash 56.9% 25.3% 33.5% 80.0%
GLM-5.1 Frontier 58.2% 26.0% 34.2% 80.0%
DeepSeek-V4-Pro (Dense/MoE Large) 61.5% 26.8% 36.0% 80.0%
T1 (122B MoE + TITO + R3 + Dense RL) 64.0% (+28.5% over SFT) 27.9% (Surpasses GPT-5.4) 38.0% (Top of Category) 100.0% (Flawless)
Claude Opus 4.7 (Proprietary Ceiling) 66.1% 29.4% 41.2% 100.0%

Dekomposisi Sumber Peningkatan Kinerja

Dari total lompatan +20.2 poin persentase dari base model (43.8% $ o$ 64.0%), tahap Supervised Fine-Tuning (SFT) hanya menyumbang 5.6 poin persentase. Selebihnya, 14.6 poin persentase (72.3% dari total keuntungan) disumbangkan murni oleh Reinforcement Learning.

Pada pengujian domain spesifik:

  • Software Debugging: T1 mencapai 100.0% sukses (mengungguli GPT-5.6 Sol di 80.0%). Kemampuan memeriksa stack trace, mengisolasi file penyebab, dan memverifikasi patch secara berulang menjadi sifat alami berkat dense assertion feedback.
  • System Administration: T1 mencatat 88.9% dibanding 55.6% untuk baseline komersial—membuktikan keandalan navigasi filesystem, konfigurasi systemd, dan manajemen izin Unix.

5. Implementasi Arsitektur: Assembler TITO & R3 Router Cache

Berikut adalah spesifikasi referensi TypeScript tingkat produksi yang mendemonstrasikan bagaimana harness agentik modern menyelaraskan aliran token, mengunci routing mask MoE, dan mengalkulasi dense process rewards:

typescript / t1-reinforcement-sync.ts TITO & R3 PROTOCOL SPEC
// T1 Reinforcement Learning Synchronization Engine (TypeScript Reference Architecture)
// Mengimplementasikan Token-In-Token-Out (TITO), Rollout Routing Replay (R3), dan Dense Verifier Assertions
// Sesuai Spesifikasi Arsitektur arXiv:2609.11042 (Yang et al., September 2026)

export interface MoERoutingChoice {
  layerIndex: number;
  tokenPosition: number;
  selectedExperts: number[]; // e.g. 8 experts out of 256
  routerWeights: number[];
}

export interface RolloutTurn {
  turnIndex: number;
  promptTokenIds: number[];
  generatedTokenIds: number[];
  toolObservationTokenIds: number[];
  routingRecord: MoERoutingChoice[];
}

export interface TaskVerificationAssertion {
  id: string;
  command: string;
  passed: boolean;
  exitCode: number;
  executionMs: number;
}

export interface TrajectoryVerificationReport {
  taskId: string;
  totalAssertions: number;
  passedAssertions: number;
  assertions: TaskVerificationAssertion[];
  denseReward: number; // passedAssertions / globalScale M
}

/**
 * 1. Token-In-Token-Out (TITO) Alignment Assembler
 * Memperbaiki turn boundary drift secara bit-exact dan menerapkan loss masking.
 */
export class TitoAssembler {
  /**
   * Menggabungkan multi-turn token trajectory tanpa memicu de-tokenization / re-encoding drift.
   * Tool output diberi mask 0 (no gradient), sedangkan generated tokens diberi mask 1 (loss-bearing).
   */
  public static assembleTrajectory(turns: RolloutTurn[]): {
    flatTokenIds: number[];
    lossMask: number[];
    routingLookup: Map;
  } {
    const flatTokenIds: number[] = [];
    const lossMask: number[] = [];
    const routingLookup = new Map();

    for (let t = 0; t < turns.length; t++) {
      const turn = turns[t];

      // 1. Injeksi Prompt / Initial Context (Mask = 0)
      if (t === 0) {
        for (const tid of turn.promptTokenIds) {
          flatTokenIds.push(tid);
          lossMask.push(0);
        }
      }

      // 2. Injeksi Generated Action Tokens (Mask = 1, Loss Bearing)
      const actionStartPos = flatTokenIds.length;
      for (let i = 0; i < turn.generatedTokenIds.length; i++) {
        const tid = turn.generatedTokenIds[i];
        const currentPos = flatTokenIds.length;
        flatTokenIds.push(tid);
        lossMask.push(1);

        // Petakan routing MoE persis pada posisi token ini
        const tokenRoutings = turn.routingRecord.filter((r) => r.tokenPosition === i);
        routingLookup.set(currentPos, tokenRoutings);
      }

      // 3. Injeksi Tool Observation / Terminal Output (Mask = 0)
      // Turn boundary repair: pastikan stream token observasi tidak merusak prefix token berikutnya
      for (const tid of turn.toolObservationTokenIds) {
        flatTokenIds.push(tid);
        lossMask.push(0);
      }
    }

    return { flatTokenIds, lossMask, routingLookup };
  }
}

/**
 * 2. Rollout Routing Replay (R3) Validator
 * Mengisolasi router gradient path sembari mencegah training-inference mismatch.
 */
export class RolloutRoutingReplayManager {
  private routingBuffer = new Map();

  public recordStepRouting(trajectoryId: string, choices: MoERoutingChoice[]): void {
    const existing = this.routingBuffer.get(trajectoryId) || [];
    this.routingBuffer.set(trajectoryId, [...existing, ...choices]);
  }

  /**
   * Menghitung normalized expert probabilities dengan replaying recorded routing mask
   * Softmax dihitung ulang di atas live logits tetapi hanya pada himpunan selectedExperts yang tercatat.
   */
  public computeReplayedRouterWeights(
    liveLogits: Float32Array,
    recordedExperts: number[]
  ): { activeIndices: number[]; normalizedWeights: number[] } {
    let maxLogit = -Infinity;
    for (const expIdx of recordedExperts) {
      if (liveLogits[expIdx] > maxLogit) maxLogit = liveLogits[expIdx];
    }

    let sumExp = 0.0;
    const expVals: number[] = [];
    for (const expIdx of recordedExperts) {
      const v = Math.exp(liveLogits[expIdx] - maxLogit);
      expVals.push(v);
      sumExp += v;
    }

    const normalizedWeights = expVals.map((v) => v / (sumExp || 1.0));
    return { activeIndices: recordedExperts, normalizedWeights };
  }
}

/**
 * 3. Dense Process Verifier Reward Calculator
 * Mengonversi assertion individual menjadi continuous scalar reward pada skala global konstan.
 */
export class DenseProcessRewardEvaluator {
  constructor(private globalScaleM: number = 10.0) {}

  public evaluateTrajectoryReward(report: TrajectoryVerificationReport): number {
    if (report.totalAssertions === 0) return 0.0;

    // Reward dihitung dari jumlah absolut assertion yang lulus, bukan persentase
    // Ini memastikan task yang lebih kompleks memberikan sinyal gradien yang proporsional
    const rawReward = report.passedAssertions / this.globalScaleM;

    // Bounded reward range [0.0, 1.5] untuk stabilitas Actor-Critic
    return Math.min(Math.max(rawReward, 0.0), 1.5);
  }
}

6. Implikasi Industri & Rekomendasi NEWSAINT

Keberhasilan T1 membuktikan bahwa model open-weight dengan arsitektur sparse MoE dapat melampaui raksasa komersial tertutup pada eksekusi terminal otonom jika dan hanya jika harness pelatihan menghormati hukum integritas sistem. Tiga panduan esensial bagi para arsitek AI agent:

  1. Tinggalkan Token Re-encoding pada Multi-Turn RL: Jangan pernah mengubah token array menjadi teks string lalu meng-encode ulang saat transisi turn. Selalu operasikan representasi ID biner asli (TITO) agar posisi token pembawa loss tidak tergeser akibat variasi whitespace atau template delimiter.
  2. Rekam dan Putar Ulang Router Mask (R3) untuk Model MoE: Pada arsitektur dengan sparse routing (seperti Qwen3.5, Mixtral, atau DeepSeek), pastikan inference sampler merekam indeks expert yang terpilih pada setiap token. Gunakan rekaman tersebut sebagai constraint mask pada pass latihan untuk mencegah hilangnya sinyal gradien pada expert yang salah.
  3. Ubah Tes Unit Menjadi Sinyal Dense Reward: Evaluasi biner (pass/fail) membuang 99% sinyal komputasi lingkungan. Rancang verifier yang mengekspos jumlah assertion yang berhasil secara granular pada skala pembagi global yang konstan ($M$), dan latih jaringan Critic terlebih dahulu (Warm-Up) sebelum memperbarui bobot kebijakan agent.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.