NS
NEWSAINT
ai-eng• 8 MIN READ•16 September 2026

The Router Within 2026: Eliciting Native Skill Routing dari Frozen LLMs Tanpa In-Context Metadata Pollution

Bedah arsitektur makalah frontier arXiv:2609.15982 (September 2026, Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li): Bagaimana native skill routing dapat dibangkitkan langsung dari representasi internal (forward-pass hidden states) frozen LLM tanpa meracuni context window dengan ratusan deskripsi tools atau mengandalkan semantic search RAG eksternal yang lambat. Menggunakan dua proyeksi linear sederhana (two linear maps), paradigma ini memangkas overhead token sistem hingga 92%, mengeliminasi context dispersion, dan menaikkan akurasi pemilihan perkakas otonom pada library perkakas skala besar.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 The Router Within 2026: Eliciting Native Skill Routing dari Frozen LLMs Tanpa In-Context Metadata Pollution

Ringkasan Eksekutif & Temuan Inti

Makalah frontier dari Ruishuo Chen, Xun Wang, Yu Chen, dan Zhuoran Li arXiv:2609.15982 (September 2026) mengungkap paradoks mendasar dalam arsitektur AI agent modern: bagaimana memperluas katalog perkakas (tools & skills) tanpa membuat model mengalami amnesia konteks atau degradasi penalaran?

Melalui The Router Within, para peneliti membuktikan secara matematis dan empiris bahwa model bahasa besar beku (frozen LLMs) secara alami telah mengkodekan preferensi pemilihan skill dalam forward-pass activation states mereka. Cukup dengan menempelkan dua pemetaan linear (two linear maps) tanpa melatih ulang model dasar, sistem mampu memilih skill yang presisi dari ratusan perkakas dengan menghemat hingga 92% token context window dan menaikkan akurasi retrieval perkakas hingga 24.6% dibanding dense prompt preloading.

1. Krisis In-Context Tool Overload & RAG Latency Tax

Dalam implementasi AI Agent enterprise standar (seperti Model Context Protocol/MCP atau OpenAI Functions), paradigma dominan untuk memberi tahu agen mengenai kapabilitas perkakas adalah melalui in-context definition injection: seluruh skema JSON, deskripsi parameter, dan petunjuk penggunaan disuntikkan ke dalam system prompt.

Pendekatan ini memicu tiga kegagalan struktural fatal ketika perpustakaan perkakas berkembang melebihi 20 alat:

  • Attention Dispersion (Kepadatan Perhatian Terpecah): Semakin panjang deskripsi perkakas di prompt awal, semakin lemah bobot atensi model pada instruksi inti pengguna (fenomena needle-in-a-haystack decay).
  • Token Cost Explosion: Menyuntikkan 80 skema tools menghabiskan 8.000 hingga 15.000 token pada setiap turn percakapan, melipatgandakan biaya inferensi dan menaikkan Time-to-First-Token (TTFT) secara drastis.
  • RAG Decoupling Failure: Solusi alternatif menggunakan dense retrieval (embedding search eksternal seperti bge-large atau text-embedding-3) kerap gagal menangkap maksud implisit pengguna karena terputus dari konteks percakapan multi-turn yang sedang dipegang oleh LLM.

2. Mekanisme Representasi Intrinsik pada Hidden State Frozen LLM

Penelitian Chen et al. menemukan bahwa model LLM modern (seperti Llama-3-70B, Qwen-2.5, dan GLM-4) tidak memerlukan deskripsi tekstual tools untuk mengetahui apa yang harus dilakukan berikutnya. Selama proses membaca prompt pengguna, lapisan transformer bagian atas (layers 24-32) telah membentuk intent trajectory yang sangat terpolarisasi.

[User Prompt Tokens] ──> [Frozen Transformer Blocks L1..LN] ──> [Hidden State h_T] │ ▼ [Two Linear Maps W_q & W_k] │ ▼ [Direct Cosine Sim with Skill Bank] │ ▼ [Target Tool ID: 0x4F (ripgrep)]

Ketika pengguna mengetik "Cari tahu kenapa test suite auth gagal di commit terakhir", hidden state dari token terakhir mengandung representasi semantik tingkat tinggi yang secara geometri lebih dekat dengan konsep git_diff dan terminal_execution dibanding konsep pencarian web umum, bahkan tanpa model pernah melihat nama fungsi tersebut dalam prompt.

3. Perumusan Matematis: Two Linear Maps & Latent Skill Projection

Daripada melatih ulang transformer (fine-tuning) yang berisiko merusak reasoning general, The Router Within memformulasikan routing sebagai mekanisme ekstraksi linear ringan:

z_q = LayerNorm(W_2 · GELU(W_1 · h_last))
P(Skill = s_i | h_last) = exp(cos(z_q, e_i) / τ) / Σ_j exp(cos(z_q, e_j) / τ)

Di mana:

  • h_last ∈ ℝ^D adalah vektor representasi tersembunyi dari token terakhir urutan input.
  • W_1 ∈ ℝ^{d × D} dan W_2 ∈ ℝ^{d × d} adalah parameter pemetaan linear yang dilatih dengan contrastive routing objective.
  • e_i ∈ ℝ^d adalah embedding kanonikal dari skill/tool ke-i dalam ruang laten berdimensi rendah (d=512).
  • τ adalah parameter temperatur terkalibrasi (default: 0.07).

4. Data Empiris & Benchmark Akurasi vs Retrieval Pipelines

Metode Routing Top-1 Accuracy (%) Token Overhead / Turn Routing Latency Max Skill Capacity
Full In-Context Schema (Default MCP) 71.4% 12,450 tokens Baseline (+620ms TTFT) < 40 tools
External RAG (Dense Embeddings) 64.8% 1,200 tokens +145ms (extra network call) 1,000+ tools
The Router Within (arXiv:2609.15982) 89.2% 0 tokens (Internal) < 4ms (single forward head) 2,048+ tools

5. Implementasi Referensi Produksi: NativeSkillRouter Engine

Berikut implementasi arsitektur PyTorch murni untuk mengintegrasikan router ini pada layer inferensi serverless atau AI runtime gateway:

"""
The Router Within: Native Hidden-State Skill Routing Architecture
Berdasarkan Inovasi arXiv:2609.15982 (Chen et al., September 2026).
Dua linear projection map untuk mengekstrak sinyal pemilihan skill langsung dari representasi forward-pass frozen LLM.
"""

import torch
import torch.nn as nn
import torch.nn.functional as F
from typing import List, Dict, Tuple, Optional

class NativeSkillRouter(nn.Module):
    """
    Ekstraktor sinyal routing skill berbasis representasi internal model.
    Menghindari injeksi ratusan deskripsi tools ke context window dengan memetakan
    hidden state layer perantara model ke embedding ruang kemampuan (skill space).
    """
    def __init__(
        self,
        hidden_dim: int = 4096,
        skill_latent_dim: int = 512,
        num_skills: int = 128,
        temperature: float = 0.07,
    ):
        super().__init__()
        self.hidden_dim = hidden_dim
        self.skill_latent_dim = skill_latent_dim
        self.num_skills = num_skills
        self.temperature = temperature

        # Map 1: Proyeksi forward pass hidden state token terakhir ke ruang routing
        self.state_projector = nn.Sequential(
            nn.Linear(hidden_dim, skill_latent_dim, bias=False),
            nn.LayerNorm(skill_latent_dim),
            nn.GELU(),
            nn.Linear(skill_latent_dim, skill_latent_dim, bias=False),
        )

        # Map 2: Representasi kanonikal skill matriks (Bank Embeddings)
        self.skill_embeddings = nn.Parameter(
            torch.randn(num_skills, skill_latent_dim) * 0.02
        )

        # Gating threshold untuk menentukan apakah tool invocation diperlukan
        self.activation_gate = nn.Linear(skill_latent_dim, 1)

    def forward(
        self,
        frozen_hidden_states: torch.Tensor,
        candidate_mask: Optional[torch.Tensor] = None
    ) -> Tuple[torch.Tensor, torch.Tensor]:
        """
        Input:
            frozen_hidden_states: [batch_size, hidden_dim] - hidden state token penutup dari frozen LLM
            candidate_mask: [batch_size, num_skills] - optional mask untuk permission scoping
        Output:
            routing_probs: [batch_size, num_skills] - distribusi probabilitas pemilihan skill
            need_tool: [batch_size, 1] - probabilitas sigmoid bahwa intervensi alat dibutuhkan
        """
        # Proyeksikan representasi internal ke skill latent space
        query_latent = self.state_projector(frozen_hidden_states)
        query_norm = F.normalize(query_latent, p=2, dim=-1)
        skill_norm = F.normalize(self.skill_embeddings, p=2, dim=-1)

        # Hitung dot-product similarity terkalibrasi temperatur
        logits = torch.matmul(query_norm, skill_norm.t()) / self.temperature

        if candidate_mask is not None:
            logits = logits.masked_fill(~candidate_mask, -1e9)

        routing_probs = F.softmax(logits, dim=-1)
        need_tool = torch.sigmoid(self.activation_gate(query_latent))

        return routing_probs, need_tool

class FrozenLLMSkillDispatcher:
    """Harness runtime untuk mengeksekusi routing deterministik pada agent production."""
    def __init__(self, router: NativeSkillRouter, skill_registry: List[Dict[str, str]]):
        self.router = router
        self.skill_registry = skill_registry

    def select_skill(self, last_hidden_state: torch.Tensor, top_k: int = 3) -> List[Dict]:
        with torch.no_grad():
            probs, need_tool = self.router(last_hidden_state)
            if need_tool.item() < 0.5:
                return []  # Model memutuskan tidak membutuhkan tool eksternal

            top_scores, top_indices = torch.topk(probs, k=top_k, dim=-1)
            selected = []
            for score, idx in zip(top_scores[0].tolist(), top_indices[0].tolist()):
                skill_meta = self.skill_registry[idx].copy()
                skill_meta["confidence"] = round(score, 4)
                selected.append(skill_meta)
            return selected

6. Panduan Arsitektur & Mitigasi di Lini Rekayasa Agentic 2026

Eliminasi Context Waste

Jangan lagi menyuntikkan puluhan file definisi skema JSON secara serentak ke model. Pisahkan tahapan: gunakan router laten untuk memilih 1-3 tool kandidat, lalu injeksikan skema penuh hanya ketika tool tersebut terpilih.

Multi-Turn Awareness

Karena hidden state merangkum seluruh percakapan yang telah diproses oleh mekanisme atensi transformer, router ini secara inheren kebal terhadap ambiguitas kata ganti atau referensi silang masa lalu (anaphora resolution) yang kerap menggagalkan vector search konvensional.

Kesimpulan Redaksi NEWSAINT

Evolusi AI coding agent dan sistem multi-agent di akhir 2026 menuntut perpindahan dari brute-force context stuffing menuju arsitektur yang sadar geometri laten. The Router Within membuktikan bahwa kecerdasan untuk mengorkestrasi perkakas telah ada di dalam representasi model itu sendiri—kita hanya membutuhkan lensa linear yang tepat untuk mengekspresikannya.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.