The Router Within 2026: Eliciting Native Skill Routing dari Frozen LLMs Tanpa In-Context Metadata Pollution
Bedah arsitektur makalah frontier arXiv:2609.15982 (September 2026, Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li): Bagaimana native skill routing dapat dibangkitkan langsung dari representasi internal (forward-pass hidden states) frozen LLM tanpa meracuni context window dengan ratusan deskripsi tools atau mengandalkan semantic search RAG eksternal yang lambat. Menggunakan dua proyeksi linear sederhana (two linear maps), paradigma ini memangkas overhead token sistem hingga 92%, mengeliminasi context dispersion, dan menaikkan akurasi pemilihan perkakas otonom pada library perkakas skala besar.

Ringkasan Eksekutif & Temuan Inti
Makalah frontier dari Ruishuo Chen, Xun Wang, Yu Chen, dan Zhuoran Li arXiv:2609.15982 (September 2026) mengungkap paradoks mendasar dalam arsitektur AI agent modern: bagaimana memperluas katalog perkakas (tools & skills) tanpa membuat model mengalami amnesia konteks atau degradasi penalaran?
Melalui The Router Within, para peneliti membuktikan secara matematis dan empiris bahwa model bahasa besar beku (frozen LLMs) secara alami telah mengkodekan preferensi pemilihan skill dalam forward-pass activation states mereka. Cukup dengan menempelkan dua pemetaan linear (two linear maps) tanpa melatih ulang model dasar, sistem mampu memilih skill yang presisi dari ratusan perkakas dengan menghemat hingga 92% token context window dan menaikkan akurasi retrieval perkakas hingga 24.6% dibanding dense prompt preloading.
Daftar Isi Pembahasan
- 1. Krisis In-Context Tool Overload & RAG Latency Tax
- 2. Mekanisme Representasi Intrinsik pada Hidden State Frozen LLM
- 3. Perumusan Matematis: Two Linear Maps & Latent Skill Projection
- 4. Data Empiris & Benchmark Akurasi vs Retrieval Pipelines
- 5. Implementasi Referensi Produksi: NativeSkillRouter Engine
- 6. Panduan Arsitektur & Mitigasi di Lini Rekayasa Agentic 2026
1. Krisis In-Context Tool Overload & RAG Latency Tax
Dalam implementasi AI Agent enterprise standar (seperti Model Context Protocol/MCP atau OpenAI Functions), paradigma dominan untuk memberi tahu agen mengenai kapabilitas perkakas adalah melalui in-context definition injection: seluruh skema JSON, deskripsi parameter, dan petunjuk penggunaan disuntikkan ke dalam system prompt.
Pendekatan ini memicu tiga kegagalan struktural fatal ketika perpustakaan perkakas berkembang melebihi 20 alat:
- Attention Dispersion (Kepadatan Perhatian Terpecah): Semakin panjang deskripsi perkakas di prompt awal, semakin lemah bobot atensi model pada instruksi inti pengguna (fenomena needle-in-a-haystack decay).
- Token Cost Explosion: Menyuntikkan 80 skema tools menghabiskan 8.000 hingga 15.000 token pada setiap turn percakapan, melipatgandakan biaya inferensi dan menaikkan Time-to-First-Token (TTFT) secara drastis.
- RAG Decoupling Failure: Solusi alternatif menggunakan dense retrieval (embedding search eksternal seperti bge-large atau text-embedding-3) kerap gagal menangkap maksud implisit pengguna karena terputus dari konteks percakapan multi-turn yang sedang dipegang oleh LLM.
2. Mekanisme Representasi Intrinsik pada Hidden State Frozen LLM
Penelitian Chen et al. menemukan bahwa model LLM modern (seperti Llama-3-70B, Qwen-2.5, dan GLM-4) tidak memerlukan deskripsi tekstual tools untuk mengetahui apa yang harus dilakukan berikutnya. Selama proses membaca prompt pengguna, lapisan transformer bagian atas (layers 24-32) telah membentuk intent trajectory yang sangat terpolarisasi.
Ketika pengguna mengetik "Cari tahu kenapa test suite auth gagal di commit terakhir", hidden state dari token terakhir mengandung representasi semantik tingkat tinggi yang secara geometri lebih dekat dengan konsep git_diff dan terminal_execution dibanding konsep pencarian web umum, bahkan tanpa model pernah melihat nama fungsi tersebut dalam prompt.
3. Perumusan Matematis: Two Linear Maps & Latent Skill Projection
Daripada melatih ulang transformer (fine-tuning) yang berisiko merusak reasoning general, The Router Within memformulasikan routing sebagai mekanisme ekstraksi linear ringan:
P(Skill = s_i | h_last) = exp(cos(z_q, e_i) / τ) / Σ_j exp(cos(z_q, e_j) / τ)
Di mana:
h_last ∈ ℝ^Dadalah vektor representasi tersembunyi dari token terakhir urutan input.W_1 ∈ ℝ^{d × D}danW_2 ∈ ℝ^{d × d}adalah parameter pemetaan linear yang dilatih dengan contrastive routing objective.e_i ∈ ℝ^dadalah embedding kanonikal dari skill/tool ke-i dalam ruang laten berdimensi rendah (d=512).τadalah parameter temperatur terkalibrasi (default: 0.07).
4. Data Empiris & Benchmark Akurasi vs Retrieval Pipelines
| Metode Routing | Top-1 Accuracy (%) | Token Overhead / Turn | Routing Latency | Max Skill Capacity |
|---|---|---|---|---|
| Full In-Context Schema (Default MCP) | 71.4% | 12,450 tokens | Baseline (+620ms TTFT) | < 40 tools |
| External RAG (Dense Embeddings) | 64.8% | 1,200 tokens | +145ms (extra network call) | 1,000+ tools |
| The Router Within (arXiv:2609.15982) | 89.2% | 0 tokens (Internal) | < 4ms (single forward head) | 2,048+ tools |
5. Implementasi Referensi Produksi: NativeSkillRouter Engine
Berikut implementasi arsitektur PyTorch murni untuk mengintegrasikan router ini pada layer inferensi serverless atau AI runtime gateway:
"""
The Router Within: Native Hidden-State Skill Routing Architecture
Berdasarkan Inovasi arXiv:2609.15982 (Chen et al., September 2026).
Dua linear projection map untuk mengekstrak sinyal pemilihan skill langsung dari representasi forward-pass frozen LLM.
"""
import torch
import torch.nn as nn
import torch.nn.functional as F
from typing import List, Dict, Tuple, Optional
class NativeSkillRouter(nn.Module):
"""
Ekstraktor sinyal routing skill berbasis representasi internal model.
Menghindari injeksi ratusan deskripsi tools ke context window dengan memetakan
hidden state layer perantara model ke embedding ruang kemampuan (skill space).
"""
def __init__(
self,
hidden_dim: int = 4096,
skill_latent_dim: int = 512,
num_skills: int = 128,
temperature: float = 0.07,
):
super().__init__()
self.hidden_dim = hidden_dim
self.skill_latent_dim = skill_latent_dim
self.num_skills = num_skills
self.temperature = temperature
# Map 1: Proyeksi forward pass hidden state token terakhir ke ruang routing
self.state_projector = nn.Sequential(
nn.Linear(hidden_dim, skill_latent_dim, bias=False),
nn.LayerNorm(skill_latent_dim),
nn.GELU(),
nn.Linear(skill_latent_dim, skill_latent_dim, bias=False),
)
# Map 2: Representasi kanonikal skill matriks (Bank Embeddings)
self.skill_embeddings = nn.Parameter(
torch.randn(num_skills, skill_latent_dim) * 0.02
)
# Gating threshold untuk menentukan apakah tool invocation diperlukan
self.activation_gate = nn.Linear(skill_latent_dim, 1)
def forward(
self,
frozen_hidden_states: torch.Tensor,
candidate_mask: Optional[torch.Tensor] = None
) -> Tuple[torch.Tensor, torch.Tensor]:
"""
Input:
frozen_hidden_states: [batch_size, hidden_dim] - hidden state token penutup dari frozen LLM
candidate_mask: [batch_size, num_skills] - optional mask untuk permission scoping
Output:
routing_probs: [batch_size, num_skills] - distribusi probabilitas pemilihan skill
need_tool: [batch_size, 1] - probabilitas sigmoid bahwa intervensi alat dibutuhkan
"""
# Proyeksikan representasi internal ke skill latent space
query_latent = self.state_projector(frozen_hidden_states)
query_norm = F.normalize(query_latent, p=2, dim=-1)
skill_norm = F.normalize(self.skill_embeddings, p=2, dim=-1)
# Hitung dot-product similarity terkalibrasi temperatur
logits = torch.matmul(query_norm, skill_norm.t()) / self.temperature
if candidate_mask is not None:
logits = logits.masked_fill(~candidate_mask, -1e9)
routing_probs = F.softmax(logits, dim=-1)
need_tool = torch.sigmoid(self.activation_gate(query_latent))
return routing_probs, need_tool
class FrozenLLMSkillDispatcher:
"""Harness runtime untuk mengeksekusi routing deterministik pada agent production."""
def __init__(self, router: NativeSkillRouter, skill_registry: List[Dict[str, str]]):
self.router = router
self.skill_registry = skill_registry
def select_skill(self, last_hidden_state: torch.Tensor, top_k: int = 3) -> List[Dict]:
with torch.no_grad():
probs, need_tool = self.router(last_hidden_state)
if need_tool.item() < 0.5:
return [] # Model memutuskan tidak membutuhkan tool eksternal
top_scores, top_indices = torch.topk(probs, k=top_k, dim=-1)
selected = []
for score, idx in zip(top_scores[0].tolist(), top_indices[0].tolist()):
skill_meta = self.skill_registry[idx].copy()
skill_meta["confidence"] = round(score, 4)
selected.append(skill_meta)
return selected
6. Panduan Arsitektur & Mitigasi di Lini Rekayasa Agentic 2026
Eliminasi Context Waste
Jangan lagi menyuntikkan puluhan file definisi skema JSON secara serentak ke model. Pisahkan tahapan: gunakan router laten untuk memilih 1-3 tool kandidat, lalu injeksikan skema penuh hanya ketika tool tersebut terpilih.
Multi-Turn Awareness
Karena hidden state merangkum seluruh percakapan yang telah diproses oleh mekanisme atensi transformer, router ini secara inheren kebal terhadap ambiguitas kata ganti atau referensi silang masa lalu (anaphora resolution) yang kerap menggagalkan vector search konvensional.
Kesimpulan Redaksi NEWSAINT
Evolusi AI coding agent dan sistem multi-agent di akhir 2026 menuntut perpindahan dari brute-force context stuffing menuju arsitektur yang sadar geometri laten. The Router Within membuktikan bahwa kecerdasan untuk mengorkestrasi perkakas telah ada di dalam representasi model itu sendiri—kita hanya membutuhkan lensa linear yang tepat untuk mengekspresikannya.
Referensi & Sumber Terverifikasi
- [1]The Router Within: Eliciting Native Skill Routing from a Frozen LLM(arXiv:2609.15982 [cs.AI, cs.CL, cs.LG] — Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li)
- [2]Model Context Protocol (MCP) Specification 2026(Anthropic & Model Context Protocol Open Standards)
- [3]Toolformer: Language Models Can Teach Themselves to Use Tools(Meta AI Research / arXiv:2302.04761)
- [4]Scanning the Harness: Empirical Study of Agent Configuration Defects & Unpinned Tools(arXiv:2609.07360 [cs.SE, cs.CR] — NEWSAINT Technical Research Review)
- [5]The Router Within: Eliciting Native Skill Routing from a Frozen LLM(arXiv:2609.15982 [cs.AI, cs.CL, cs.LG] — Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li)
- [6]Model Context Protocol (MCP) Specification 2026(Anthropic & Model Context Protocol Open Standards)
- [7]Toolformer: Language Models Can Teach Themselves to Use Tools(Meta AI Research / arXiv:2302.04761)
- [8]Scanning the Harness: Empirical Study of Agent Configuration Defects & Unpinned Tools(arXiv:2609.07360 [cs.SE, cs.CR] — NEWSAINT Technical Research Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.