NS
NEWSAINT
ai-eng• 8 MIN READ•29 September 2026

The Decomposition Tax 2026: Mengapa Multi-Stage LLM Pipelines Kehilangan Hingga 40 Poin Akurasi pada Interface Antar-Tahap, Empirical Diagnosis pada 21 Model, dan Dua Resep Preskriptif Perbaikan

Analisis arsitektur sistemik riset frontier AI engineering & pipeline reasoning (arXiv:2609.32825, Rutgers University, NYU, NJTech & NUPT, 26 September 2026): Mengapa memecah problem kompleks ke dalam pipeline multi-tahap (seperti Least-to-Most atau Decomposed Prompting) kerap menyebabkan degradasi akurasi katastropik hingga 40.5 poin persentase pada antarmuka pesan (interface) antar-tahap. Melalui diagnosis terkontrol pada 21 open-weight LLMs (termasuk Gemma-3, Gemma-4-12B, Qwen2.5, Llama-3.1, hingga GPT-OSS-20B) di benchmark MATH-500 dan GSM-Hard, riset ini membongkar fenomena "The Decomposition Tax": kegagalan bukan berasal dari kapasitas inferensi model, melainkan kompresi informasi destruktif saat satu tahap merangkum konteks untuk tahap berikutnya. Artikel ini mengupas anatomi matematis pembengkakan pajak dekomposisi (Content vs Form dan Edge vs Receiver), membuktikan ketidakberdayaan kontrol plasebo token, serta merumuskan dua resep perbaikan preskriptif terverifikasi: penempatan Re-Grounding tepat setelah lossy interface (bukan sebelumnya yang justru merusak akurasi pada 7/7 model), dan penegakan klausa Relational Preservation pada instruksi ekstraksi data.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 The Decomposition Tax 2026: Mengapa Multi-Stage LLM Pipelines Kehilangan Hingga 40 Poin Akurasi pada Interface Antar-Tahap, Empirical Diagnosis pada 21 Model, dan Dua Resep Preskriptif Perbaikan

Dalam rekayasa sistem kecerdasan buatan terapan, salah satu prinsip arsitektur paling populer adalah Modular Prompt Decomposition. Saat dihadapkan pada penalaran multi-langkah (multi-step reasoning) yang rumit, arsitek sistem hampir selalu tergoda untuk memecah alur pemikiran monolitik menjadi sekuens tahap mikro: ekstraksi variabel (Extract), perencanaan strategi (Plan), eksekusi komputasi (Solve), dan verifikasi keluaran (Verify). Pola ini diadopsi luas dalam literatur melalui paradigma Least-to-Most prompting, Decomposed Prompting, hingga multi-agent sequential workflows.

Asumsi intuitif di balik pemisahan ini sangat meyakinkan: dengan mengecilkan cakupan masalah di setiap tahap, model akan lebih fokus, hallucination rate menurun, dan batas jendela konteks dapat dihemat. Namun, sebuah riset empiris berskala masif yang baru saja dipublikasikan pada 26 September 2026 oleh kolaborasi peneliti dari Rutgers University, New York University, Nanjing Tech University, dan NUPT (arXiv:2609.32825, Bu et al.) membuktikan bahwa asumsi tersebut membawa ilusi berbahaya.

EMPIRICAL SHOCKWAVE

Definisi "The Decomposition Tax": Kebocoran Akurasi Ekstrem di Antarmuka Pesan Sendiri

Riset Bu et al. mengisolasi apa yang terjadi ketika satu-satunya variabel yang diubah pada pipeline multi-tahap adalah apakah setiap tahap lanjutan diizinkan membaca kembali deskripsi masalah asli (problem statement) atau dipaksa bernalar hanya dari pesan ringkas tahap sebelumnya (one-message regime). Hasilnya mengejutkan komunitas AI engineering:

  • Degradasi Akurasi Mencapai 40.5 Poin Persentase: Pada model Gemma-3-12B di benchmark penalaran matematika ketat MATH-500, pipeline 4-tahap tanpa akses masalah asli (strict arm) hanya mencatat akurasi 15.0%. Begitu setiap tahap diizinkan melihat kembali masalah aslinya (full arm), akurasi meroket menjadi 55.5%—menciptakan kesenjangan "pajak dekomposisi" sebesar +40.5 poin ($p = 1.66 \times 10^{-19}$).
  • Model Frontier 2026 Tidak Kebal: Model penalaran tercanggih seperti Gemma-4-12B—yang mampu menyelesaikan 86.5% soal MATH-500 dalam satu panggilan monolitik—tetap menyerahkan 37.0 poin akurasi di antarmuka pipeline-nya sendiri. GPT-OSS-20B kehilangan 22.5 poin, dan Granite-4.1-8B kehilangan 10.0 poin.
  • Plasebo Token Terbukti Tidak Berdaya: Pengujian kontrol menggunakan token pengisi (placebo tokens) yang mempertahankan panjang token dan tata letak teks tanpa memuat substansi masalah asli menghasilkan pemulihan akurasi 0.00% (bahkan -0.010). Ini membuktikan bahwa pembengkakan pajak murni disebabkan oleh hilangnya informasi semantik asli, bukan karena komputasi uji (test-time compute) tambahan.

1. Anatomi Antarmuka Komunikasi: Dua Dimensi Pembentuk Tax

Mengapa dekomposisi menghancurkan kinerja model penalaran? Untuk membongkar mekanismenya, para peneliti merancang matriks eksperimental ortogonal $2 \times 2$ yang membedah antarmuka pengirim-penerima (sender-receiver interface):

Depth-3 Square (Sender Factors)

Content vs Form: Bahaya Ekstraksi Berbentuk Daftar

Eksperimen menyilangkan apa yang diinstruksikan kepada tahap pertama untuk disimpan (Content) dan bagaimana cara menuliskannya (Form):

  • Condensing List: Hanya mengekstrak kuantitas numerik dalam daftar terstruktur. Memicu pajak terbesar: rata-rata +36.50 poin pada Gemma-3-12B.
  • Preserving Prose: Menuliskan kembali persoalan dalam prosa naratif utuh beserta relasi antar-variabel. Pajak langsung anjlok ke +4.50 poin.
  • Temuan Kunci: Menginstruksikan model untuk "membuat daftar bersih" (clean list) memotong dependensi relasional implisit antar-angka yang sangat dibutuhkan oleh tahap solver berikutnya.
Depth-4 Square (Receiver Factors)

Edge vs Receiver: Hak Penurunan Ulang (Re-deriving)

Eksperimen menyilangkan instruksi tepi (Edge) dengan derajat kebebasan yang diberikan kepada tahap penerima (Receiver):

  • Committed Receiver: Tahap penerima hanya diperintahkan langsung mengeluarkan ekspresi aritmatika final. Jika input pengirim tidak lengkap, kegagalan bersifat permanen.
  • Re-deriving Receiver: Tahap penerima diinstruksikan untuk bernalar langkah demi langkah sebelum menulis ekspresi.
  • Pergeseran Generasi Model: Pada kohort model 2024 (Llama-3, Qwen2.5), faktor Edge mendominasi pembentukan pajak. Namun pada kohort frontier 2026 (Gemma-4-12B), pajak didominasi oleh apakah tahap penerima diizinkan menurunkan ulang (re-derive) premis atau tidak.

2. Data Empiris & Tolok Ukur Evaluasi: 21 Model Open-Weight

Tabel berikut merangkum hasil pengukuran empiris pada benchmark MATH-500 ($n=200$ butir soal terpasang per sel evaluasi) di seluruh arsitektur model utama yang diuji dalam penelitian Bu et al.:

Arsitektur & Model LLM Monolith (Single Call) Strict Pipeline (Lossy) Full Pipeline (Re-Grounded) Decomposition Tax Signifikansi Statistik
Gemma-3-12B (Google DeepMind) 79.5% 15.0% 55.5% +40.50% p = 1.66e-19 (Holm)
Gemma-4-12B (2026 Frontier Cohort) 86.5% 45.0% 82.0% +37.00% p = 8.68e-17 (Holm)
Qwen2.5-7B-Instruct (Alibaba Cloud) 74.0% 22.5% 60.5% +38.00% p = 2.14e-18 (Holm)
GPT-OSS-20B (Open-Source Frontier) 81.5% 55.5% 78.0% +22.50% p = 7.09e-11 (Holm)
Llama-3.1-8B-Instruct (Meta AI) 68.0% 26.0% 54.5% +28.50% p = 4.12e-14 (Holm)
Granite-4.1-8B (IBM Research) 71.0% 55.5% 65.5% +10.00% p = 0.0526 (BH-survived)

Secara agregat di 322 sel evaluasi di mana panggilan tunggal (monolith) mengungguli strict pipeline lebih dari 5%, penerapan teknik re-grounding berhasil memulihkan median 63% dari kesenjangan akurasi yang hilang.

3. Dua Resep Preskriptif: Solusi Arsitektur yang Terbukti Secara Matematis

Para pengembang tidak perlu membuang arsitektur multi-tahap. Riset ini memberikan panduan preskriptif konkret yang telah terbukti secara formal memitigasi Decomposition Tax:

1

Resep 1: Post-Loss Targeted Re-Grounding (Bukan Pre-Loss)

Jika anggaran konteks atau batasan latensi hanya mengizinkan Anda menyuntikkan kembali (re-ground) deskripsi masalah asli pada satu tahap dalam pipeline, tempatkan re-grounding tepat pada tahap setelah interface yang mengalami degradasi informasi (lossy interface).

Jebakan Fatal Intuisi: Intuisi rekayasa umum menyarankan untuk menyuntikkan konteks pada tahap seawal mungkin agar tahap lanjutan mewarisi hasil yang lebih baik. Namun bukti empiris membantahnya secara telak: pada konfigurasi pipeline MIX_RL (kehilangan informasi terjadi di antarmuka tahap 1 ke tahap 2), melakukan re-grounding pada Tahap 1 (sebelum loss) menghasilkan akurasi yang lebih buruk dibanding tanpa perbaikan sama sekali pada 7 dari 7 model di MATH-500 ($p = 0.016$). Sebaliknya, melakukan re-grounding pada Tahap 2 (setelah loss) menang mutlak pada 7 dari 7 model dan memulihkan hingga +23.5 poin akurasi.
2

Resep 2: Relational Preservation Clause pada Ekstraksi Data

Jika sebuah tahap mikro diwajibkan menyarikan atau mengekstrak parameter (misalnya JSON parsing atau variable extraction), jangan pernah membiarkan instruksi hanya meminta daftar variabel terisolasi.

Tambahkan klausa mutlak: "Extract the numerical quantities, what is asked, AND EVERY RELATIONSHIP STATED BETWEEN THEM". Penambahan klausul relasi semantik ini terbukti menurunkan nilai Decomposition Tax secara konsisten pada 9 dari 9 model yang diuji di benchmark MATH-500.

4. Implementasi Referensi: TypeScript Decomposition Tax Mitigation Engine

Berikut adalah modul TypeScript enterprise berstandar produksi yang mengimplementasikan RelationalInstructionCompiler, PostLossReGrounder, dan PipelineTaxAuditor untuk gateway inferensi agentik modern:

lib/agent-pipelines/decomposition-tax-remedy.ts ENTERPRISE SPEC / TYPESCRIPT
// Production Implementation: Re-Grounding & Relational Preservation Engine
// Berdasarkan Prinsip Arsitektur Riset arXiv:2609.32825 (Bu et al. - September 2026)
//
// Mengatasi "The Decomposition Tax" pada multi-stage LLM pipelines:
// 1. RelationalPreservingExtractor: Menjamin relasi logis dipertahankan saat ekstraksi
// 2. PostLossReGrounder: Menginjeksikan problem asli tepat setelah antarmuka lossy (Stage > Loss)
// 3. DecompositionTaxAuditor: Mengukur degradasi delta akurasi: acc(Full) - acc(Strict)

export interface PipelineStageConfig {
  stageId: string;
  stageName: 'EXTRACT' | 'PLAN' | 'SOLVE' | 'VERIFY';
  isLossyInterfacePreceding: boolean;
  enforceReGrounding: boolean;
  preserveRelationalSemantics: boolean;
}

export interface PipelineExecutionContext {
  originalProblem: string;
  stageOutputs: Map;
  tokenBudget: number;
}

export interface StagePayload {
  role: 'system' | 'user';
  content: string;
}

/**
 * 1. Relational-Preserving Stage Instruction Compiler
 * Mengeliminasi pereduksian agresif (condensing list) yang menghilangkan koneksi antar-variabel
 */
export class RelationalInstructionCompiler {
  public static compileExtractionPrompt(baseInstruction: string, preserveRelations: boolean): string {
    if (!preserveRelations) {
      // Condensing list (baseline rentan: memicu tax rata-rata +15.16 poin)
      return `${baseInstruction}\nExtract the numerical quantities given and exactly what is asked as a clean structured list.`;
    }

    // Preserving specification (menurunkan tax pada 9 dari 9 model di MATH-500)
    return `${baseInstruction}\nExtract the numerical quantities given, exactly what is asked, and EVERY RELATIONSHIP STATED BETWEEN THEM as a cohesive plain-prose restatement in your own words.`;
  }

  public static compileReceiverPrompt(baseInstruction: string, allowReDerivation: boolean): string {
    if (!allowReDerivation) {
      // Committed receiver (terkunci pada input sebelumnya tanpa ruang koreksi)
      return `${baseInstruction}\nOutput only the final expression(s) to compute.`;
    }

    // Re-deriving receiver (memberikan ruang eksplorasi langkah demi langkah)
    return `${baseInstruction}\nReason step by step, re-evaluate constraints, and then write the arithmetic expression(s). End with the expression(s) to compute.`;
  }
}

/**
 * 2. Post-Loss Targeted Re-Grounder
 * Menempatkan re-grounding masalah asli TEPAT SETELAH interface yang lossy.
 * Berdasarkan Teorema Empiris Bu et al.: Re-grounding sebelum loss merugikan (negative recovery pada 7/7 model),
 * sementara re-grounding setelah loss memulihkan hingga 65% akurasi yang hilang.
 */
export class PostLossReGrounder {
  public static assembleStageInput(
    context: PipelineExecutionContext,
    stageConfig: PipelineStageConfig,
    previousStageOutput: string
  ): StagePayload[] {
    const messages: StagePayload[] = [];

    // System prompt dasar
    messages.push({
      role: 'system',
      content: `You are executing stage [${stageConfig.stageName}]. Reason strictly over the provided context.`
    });

    let contextPayload = '';

    // Targeted Re-Grounding Gate:
    // Hanya disisipkan jika stageConfig menandai kebutuhan re-grounding pasca antarmuka lossy
    if (stageConfig.enforceReGrounding && stageConfig.isLossyInterfacePreceding) {
      contextPayload += `=== Original problem (for reference) ===\n${context.originalProblem}\n\n`;
    }

    contextPayload += `=== Output from previous stage ===\n${previousStageOutput}`;

    messages.push({
      role: 'user',
      content: contextPayload
    });

    return messages;
  }
}

/**
 * 3. Decomposition Tax Auditor & Pipeline Harness
 * Menguji apakah pipeline Anda membayar 'pajak dekomposisi' dan mengukur efikasi re-grounding
 */
export class PipelineTaxAuditor {
  private runsStrict: number = 0;
  private correctStrict: number = 0;
  private runsFull: number = 0;
  private correctFull: number = 0;

  public recordStrictResult(isCorrect: boolean): void {
    this.runsStrict++;
    if (isCorrect) this.correctStrict++;
  }

  public recordFullResult(isCorrect: boolean): void {
    this.runsFull++;
    if (isCorrect) this.correctFull++;
  }

  public computeTaxMetrics(): {
    strictAccuracy: number;
    fullAccuracy: number;
    decompositionTax: number;
    recoveryFractionVsMonolith: number;
  } {
    const accStrict = this.runsStrict > 0 ? this.correctStrict / this.runsStrict : 0;
    const accFull = this.runsFull > 0 ? this.correctFull / this.runsFull : 0;
    const tax = accFull - accStrict;

    return {
      strictAccuracy: Number((accStrict * 100).toFixed(2)),
      fullAccuracy: Number((accFull * 100).toFixed(2)),
      decompositionTax: Number((tax * 100).toFixed(2)),
      recoveryFractionVsMonolith: tax > 0 ? Number(((tax / accFull) * 100).toFixed(1)) : 0
    };
  }
}

5. Panduan Arsitektur bagi AI Systems & Autonomous Agent Engineers

Bagi organisasi enterprise yang membangun sistem multi-agent, workflow chains (LangChain / LlamaIndex / Vercel AI SDK), atau harness koding otonom:

  1. Jangan Mendekomposisi Tanpa Mengukur Baseline Monolitik: Sebelum memecah tugas kompleks ke dalam 3 atau 4 agen spesialis, selalu jalankan evaluasi perbandingan terhadap satu panggilan langsung (single monolithic prompt with extended reasoning tokens). Pada banyak kasus tugas bernalar tinggi, satu panggilan model penalaran modern bekerja jauh lebih akurat dibanding rantai agen berantarmuka sempit.
  2. Audit Titik Pertukaran Pesan (Interface Boundaries): Selalu anggap setiap ringkasan (summary), format terkompresi, atau filter data yang dikirim antar-agen sebagai antarmuka yang berpotensi menghilangkan informasi (lossy interface). Lakukan injeksi kembali konteks mentah (raw task context) tepat pada saat agen eksekutor utama mulai memproses data.
  3. Hindari JSON Schema yang Terlalu Ramping pada Fase Awal: Memaksa agen ekstraksi menghasilkan payload JSON minimalis tanpa kolom penjelasan relasi kontekstual adalah penyebab utama robohnya pipeline hilir. Selalu sertakan field seperti contextual_relationships atau verbatim_constraints dalam skema data perantara.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.