NS
NEWSAINT
ai-eng• 8 MIN READ•18 September 2026

AgentKV 2026: Arsitektur Phase-Aware KV Eviction, Principal-Angle Subspace Discrepancy, dan Online Page Compaction pada High-Throughput Agentic LLM Serving

Analisis arsitektur mendalam atas riset frontier arXiv:2609.14872 (September 2026, Taowen Liu et al.): Mengapa metode kompresi KV cache konvensional (R-KV, SnapKV, H2O) runtuh pada autonomous LLM agents akibat asumsi keseragaman temporal. Eksplorasi Principal-Angle Subspace Analysis membuktikan bahwa query space antar fase (think, act, tool, others) menempati dimensi geometris ortogonal yang berbeda. AgentKV memperkenalkan token-level streaming phase parser, union representative query scoring, serta online physical page compaction pada SGLang 0.5.12 + FlashInfer yang melipatgandakan throughput inferensi hingga 1.80x dan mengungguli baseline sebesar +5.5 poin pada BFCL dan Tau-bench.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 AgentKV 2026: Arsitektur Phase-Aware KV Eviction, Principal-Angle Subspace Discrepancy, dan Online Page Compaction pada High-Throughput Agentic LLM Serving

Dalam lanskap infrastruktur kecerdasan buatan terdistribusi tahun 2026, pergeseran beban kerja dari single-turn chat menuju Autonomous Multi-Turn AI Agents (seperti sistem coding mandiri, browser automation, dan enterprise workflow runners) telah menciptakan krisis komputasi baru. Agen otonom mengonsumsi token beberapa orde magnitudo lebih masif dibandingkan chatbot konvensional. Setiap siklus observasi lingkungan, pemanggilan tool MCP, dan sintesis langkah penalaran (Chain-of-Thought) mengakibatkan akumulasi Key-Value (KV) cache yang mencekik kapasitas High-Bandwidth Memory (HBM) GPU serta mendegradasi decoding memory bandwidth.

Ringkasan Arsitektur Eksekutif

Riset frontier terbaru dari Taowen Liu et al. (arXiv:2609.14872, September 2026) memperkenalkan AgentKV: Kerangka kerja kompresi KV cache pertama yang dirancang khusus untuk pola lintasan agen otonom. Melalui analisis Principal Angles, riset ini membuktikan secara matematis bahwa vektor query dari empat fase eksekusi agen (think, act, tool, dan others) menempati subruang geometri yang ortogonal dan berbeda. Algoritma eviksi berbasis kebaruan (recency-based) konvensional menderita bias estimasi parah yang membuang informasi lingkungan krusial. AgentKV memadukan Token-Level Streaming Phase Parser, Union Representative Scoring, dan Online Physical Page Compaction pada serving engine SGLang 0.5.12, menghasilkan lonjakan throughput decoding hingga 1.80x serta peningkatan akurasi rata-rata +5.5 poin pada benchmark BFCL dan Tau-bench.

1. Keruntuhan Asumsi Keseragaman Temporal pada Lintasan Agen Otonom

Metode kompresi KV cache terdahulu—termasuk algoritma terkemuka seperti StreamingLLM, H2O (Heavy Hitter Oracle), SnapKV, dan R-KV—dibangun di atas premis bahwa atensi masa depan dapat diproyeksikan secara akurat oleh pola atensi dari jendela token terbaru (recency window). Pada percakapan teks biasa, hipotesis ini bekerja cukup memadai karena distribusi semantik bergeser secara halus dan bertahap.

Namun, pada agen otonom, asumsi ini runtuh secara mendasar. Trajektori agen tidak bergerak secara linier seragam, melainkan berosilasi di antara empat fase diskrit yang berulang:

1. Fase Think (Penalaran Internal)

Blok penalaran Chain-of-Thought (CoT) di dalam tag <think>...</think> tempat model membedah masalah, merumuskan hipotesis, dan memvalidasi batasan sebelum mengambil tindakan fisik.

2. Fase Act (Pemanggilan Alat)

Emisi sintaksis aksi dalam tag <tool_call>...</tool_call> yang menyusun parameter fungsi, payload JSON, nama API endpoint, dan format argumen target.

3. Fase Tool (Observasi Lingkungan)

Respons mentah yang dikembalikan oleh lingkungan eksternal dalam tag <tool_response>...</tool_response>, mencakup stack trace terminal, hasil query SQL, atau DOM scraping.

4. Fase Others (Instruksi & Dialog)

Definisi skema tool sistem, batasan etika pada system prompt, dan pertanyaan atau koreksi interaktif yang dimasukkan oleh pengguna di awal maupun tengah giliran.

Ketika sistem kompresi KV konvensional melakukan eviksi saat model sedang berada di akhir fase think atau act, query representatif yang digunakan untuk menilai kepentingan seluruh memori masa lalu hanya berasal dari jendela token think/act tersebut. Akibatnya timbul recency estimator bias: model menilai token observasi dari tool sebelumnya serta parameter skema pada others memiliki skor atensi rendah, lalu menghapusnya dari HBM. Ketika langkah berikutnya tiba dan agen perlu merujuk kembali hasil eksekusi tool untuk memformulasikan jawaban akhir, token esensial tersebut telah hilang, memicu halusinasi fatal dan kegagalan eksekusi skrip.

2. Pembuktian Matematis: Analisis Principal Angles pada Subruang Query

Untuk membuktikan bahwa query dari setiap fase memang memiliki karakteristik representasi yang tidak kompatibel, para peneliti AgentKV menerapkan teknik Principal Angles Subspace Analysis.

Setiap trajektori dibagi menjadi rentang fase kontigu $s$. Untuk rentang $s$ yang memiliki $n_s$ token, vektor-vektor query $d$-dimensinya disusun ke dalam matriks $X_s in mathbb{R}^{n_s imes d}$. Kemudian dilakukan dekomposisi nilai singular tipis (thin SVD):

$$X_s = U_s Sigma_s V_s^ op$$

Di mana $k$ vektor singular kanan pertama, $V_{s,k} in mathbb{R}^{d imes k}$, membentuk basis ortonormal yang merangkum arah dominan dari subruang query pada rentang fase tersebut. Untuk membandingkan dua rentang fase $s_1$ dan $s_2$, sudut-sudut prinsipal $ heta_1, heta_2, dots, heta_k$ dihitung melalui SVD dari perkalian silang basis ortonormalnya:

$$V_{s_1,k}^ op V_{s_2,k} = Y cos(Theta) Z^ op, quad cos(Theta) = ext{diag}(cos heta_1, dots, cos heta_k)$$

Temuan Empiris Kunci (Key Empirical Finding)

Hasil komputasi sudut prinsipal pada setiap attention head dan layer model frontier (Qwen3-8B dan Qwen3-32B) menunjukkan bahwa sudut antar-fase ($ heta_{ ext{cross-phase}}$) secara konsisten mendekati $pi/2$ (90 derajat ortogonal), jauh lebih besar daripada sudut intra-fase ($ heta_{ ext{intra-phase}}$). Artinya, ruang query saat berpikir sama sekali tidak selaras dengan ruang query saat mengamati output tool. Menggunakan query fase terbaru untuk memprediksi kebutuhan fase lain adalah kekeliruan matematis fatal.

3. Arsitektur Inti AgentKV: Dari Streaming Parsing ke Union Scoring

Menyadari bahwa bias estimasi kebaruan adalah akar masalah, AgentKV merancang alur kompresi yang menjamin setiap fase representatif memiliki hak suara yang setara dalam menentukan token mana yang harus dipertahankan.

Pipeline Eksekusi Modular AgentKV

Langkah 1 Token-Level Streaming Parser mendeteksi transisi fase secara deterministik tanpa overhead model tambahan.
Langkah 2 Setiap query yang dipancarkan dialirkan ke buffer FIFO terisolasi sesuai fasenya: $Q_{ ext{think}}, Q_{ ext{act}}, Q_{ ext{tool}}, Q_{ ext{others}}$.
Langkah 3 Saat trigger eviksi aktif, himpunan representatif digabungkan: $mathcal{Q}^{(e)} = igcup_{phi} Q_{phi}$.
Langkah 4 Seluruh kandidat historical key diskor terhadap gabungan $mathcal{Q}^{(e)}$ dan Top-B token tertinggi dipilih secara global.
Langkah 5 Online Page Compaction merelokasi slot KV fisik dan mengembalikan halaman kosong ke memory allocator SGLang.

3.1 Formulasi Skoring Utilitas Global Tanpa Kuota Buatan

Salah satu keunggulan desain AgentKV adalah ketiadaan kuota buatan per fase. Alih-alih menetapkan aturan kaku seperti "pertahankan 25% token think dan 25% token tool", AgentKV membiarkan seluruh key berkompetisi secara bebas terhadap himpunan query representatif gabungan $mathcal{Q}^{(e)}$:

$$s_j = rac{1}{|mathcal{Q}^{(e)}|} sum_{q in mathcal{Q}^{(e)}} ext{Softmax}left( rac{q cdot k_j^ op}{sqrt{d_k}} ight)$$

Skor $s_j$ merefleksikan utilitas intrinsik sebuah token terhadap seluruh fase operasi agen di masa depan. Token observasi tool yang bernilai tinggi akan tetap bertahan secara alami meskipun sistem baru saja menyelesaikan fase reasoning panjang.

4. Implementasi Serving-Aware: Online Physical Page Compaction pada SGLang

Banyak riset kompresi KV akademis hanya melakukan logical masking pada atensi tanpa pernah membebaskan memori GPU secara fisik. Pada arsitektur serving produksi, jika halaman memori yang dievokasi tidak dikembalikan ke memory allocator, kapasitas batching tidak akan bertambah dan latensi transfer bandwidth tetap tinggi.

AgentKV diintegrasikan langsung ke dalam runtime SGLang 0.5.12 yang didukung oleh kernel FlashInfer:

  • Persistent Trajectory State Preservation: KV cache dipertahankan sebagai state persisten melintasi giliran tool call dan dialog user. Compaction dijalankan secara online tanpa merusak snapshot chunked prefill.
  • Physical Page Compaction: Entri KV yang dipertahankan dikumpulkan (gathered) ke dalam slot fisik baru yang padat. Seluruh blok paged-attention yang kosong segera ditandai bebas dan dikembalikan ke pool alokasi GPU.
  • CUDA Graph Capture Compatibility: Struktur decoding pointer dijaga tetap stabil sehingga eksekusi decoding token berikutnya tetap dapat memanfaatkan akselerasi CUDA Graph tanpa fallback ke runtime kernel lambat.

5. Hasil Evaluasi Benchmark: BFCL, Tau-Bench, dan Throughput 1.80x

Efektivitas AgentKV diuji secara komprehensif menggunakan dua model frontier (Qwen3-8B dan Qwen3-32B) pada enam domain tugas agen otonom: Berkeley Function-Calling Leaderboard (BFCL) pada kategori web_search, multi_turn, memory, serta Tau-Bench ($ au^2$-bench) pada domain airline, retail, dan telecom.

Model & Metode Budget (Tokens) BFCL Web Search BFCL Multi-Turn BFCL Memory Tau Airline Tau Retail Tau Telecom
Qwen3-32B Full KV (Uncompressed) Full (~32k) 28.0% 52.0% 24.8% 44.0% 53.5% 25.4%
Qwen3-32B AgentKV (Phase-Aware) 2048 / 4096 22.0% 48.0% 22.8% 40.0% 50.9% 21.9%
Qwen3-32B R-KV (Recency Baseline) 2048 / 4096 13.0% 37.0% 23.9% 26.0% 44.7% 7.9%
Qwen3-32B Tri-attention 2048 / 4096 21.0% 44.0% 24.3% 40.0% 39.5% 10.5%
Qwen3-8B AgentKV 1024 / 2048 16.0% 38.0% 18.7% 34.0% 30.7% 18.4%
Qwen3-8B R-KV 1024 / 2048 6.0% 20.0% 15.9% 32.0% 28.9% 18.4%

Dari data empiris di atas terlihat bahwa pada tugas interaktif multi-turn dan pemanggilan tool yang ketat (seperti BFCL Multi-Turn dan Tau Telecom), baseline R-KV mengalami degradasi performa hingga lebih dari 50% akibat terhapusnya token observasi lingkungan. Sebaliknya, AgentKV mempertahankan hingga 90–95% kemampuan model Full KV asli hanya dengan sebagian kecil alokasi cache.

Throughput Serving Nyata pada NVIDIA H100 NVL & RTX A6000

Pada pengujian throughput token output di kluster komputasi NVIDIA H100 NVL dengan konfigurasi prompt 16k hingga 32k token:

1. Regime Bandwidth-Bound (16k prompt / 1k gen): AgentKV memangkas traffic pembacaan memori KV saat decoding, meningkatkan output throughput sebesar 1.45x.
2. Regime Capacity-Bound (32k prompt / 1k gen): Melalui pengembalian halaman memori ke allocator secara fisik, kapasitas konkuren meningkat drastis, mencapai peningkatan throughput sebesar 1.80x dibandingkan implementasi bawaan SGLang 0.5.12 tanpa kompresi.

6. Panduan Implementasi untuk Arsitektur Produksi 2026

Keberhasilan AgentKV menggarisbawahi prinsip desain fundamental bagi para arsitek sistem AI dan engineer infrastruktur serving:

  1. Hentikan Penggunaan Algoritma Recency Tunggal pada Agen: Sistem seperti SnapKV atau StreamingLLM hanya cocok untuk chatbot linier. Menggunakannya pada agen autonomous yang berinteraksi dengan API eksternal hanya akan menimbulkan bug silent failure dan loop halusinasi.
  2. Manfaatkan Chat-Template Semantic Parsing: Membedakan fase eksekusi tidak memerlukan model klasifikasi BERT atau neural classifier tambahan. Cukup parsing tag template chat standar (<think>, <tool_call>, <tool_response>) pada level tokenizer streaming.
  3. Wajibkan Physical Compaction: Kompresi KV tanpa pembebasan halaman memori fisik adalah pemborosan sumber daya. Pastikan serving engine Anda (baik SGLang, vLLM, maupun TensorRT-LLM) mengadopsi mekanisme realokasi blok fisik untuk membuka ruang konkurensi request yang lebih besar.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.