CliffCompaction 2026: Arsitektur Autocompaction Long-Horizon Coding Agents Tanpa Konteks Drift, Zero Summarization-of-Summary, dan Efisiensi Test-Time Scaling
Bedah arsitektur riset frontier Carnegie Mellon University (CMU) dan Bosch Center for AI arXiv:2609.26779 (Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers, September 2026): Mengapa sliding-window dan summarization berulang menghancurkan KV-cache serta memicu halusinasi context drift pada autonomous coding agents? CliffCompaction memperkenalkan paradigma autocompaction berkala berbasis "Never Compact a Compaction". Mengawinkan pembuangan total riwayat terkompresi lama (C_{t-1}), preservasi verbatim fragmen presisi tinggi tanpa parafrasa, perlindungan KV-cache prefix reuse hingga titik tebing (cliff), serta selektor Soft Group Verification (SGV). Berhasil memangkas biaya hingga 50%, melipatgandakan efisiensi test-time scaling hingga Kimi K2.6 menyamai Claude Opus 4.7 pada Terminal-Bench 2.0, dan mencetak rekor akselerasi CUDA kernel 3.58x pada sesi KernelBench melampaui 1 juta token.

Ketika autonomous coding agents didelegasikan untuk menyelesaikan perbaikan repositori berskala besar, mengoptimasi kernel komputasi performa tinggi, atau menelusuri bug multi-file yang rumit, trajektori eksekusi mereka dengan cepat membengkak melampaui ratusan ribu hingga jutaan token. Menghadapi batas context window dan lonjakan biaya inferensi, ekosistem AI selama ini terpecah ke dalam dua pendekatan klasik: sliding window yang membuang observasi masa lalu atau modul LLM summarization yang meringkas percakapan secara periodik. Namun, kedua metode ini menyimpan cacat arsitektural yang melumpuhkan: sliding window menghancurkan KV-cache prefix sehingga memicu biaya re-prefill berulang hingga 5-6 kali lipat, sedangkan summarization rekursif memicu erosi fakta sistemik (summary-of-summary compounding context drift).
Dipublikasikan pada 22 September 2026 oleh peneliti Carnegie Mellon University (CMU) dan Bosch Center for AI—termasuk Tim Dettmers (pencipta bitsandbytes & QLoRA), Trang Nguyen, Eulrang Cho, dan Bingqing Chen—makalah CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents (arXiv:2609.26779) membuktikan sebuah prinsip arsitektural radikal: Never compact a compaction. Melalui preservasi kutipan verbatim, pembuangan total riwayat terkompresi lama ($C_{t-1}$), eliminasi parafrasa LLM, dan pemeliharaan KV-cache alami antar-tebing (cliff), CliffCompaction memangkas biaya hingga 50%, melipatgandakan ROI test-time scaling, dan mencetak rekor akselerasi kernel CUDA 3.58x pada KernelBench Level 3.
1. Anatomi Krisis Konteks pada Long-Horizon Autonomous Coding
Untuk memahami signifikansi CliffCompaction, kita harus membedah ke mana sebenarnya token dan dolar dihabiskan dalam trajektori coding agent. Berdasarkan audit telemetri empiris pada Terminal-Bench 2.0 menggunakan model GLM-5.1 tanpa kompresi:
Tool Results (Outputs)
Didominasi oleh output pembacaan berkas kode berukuran besar, log build compiler yang panjang, dan trace stack eksekusi. Mayoritas informasi ini statis dan tersimpan di filesystem lokal.
Tool Invocations (Calls)
Didominasi oleh payload kode yang di-inline saat perintah file_write atau patch. Menghabiskan token secara mubazir karena isi file sudah terefleksi di repositori.
Reasoning & Dialogue
Analisis rantai berpikir (chain-of-thought), formulasi rencana, instruksi sistem, dan deskripsi tugas awal hanya menyumbang fraksi kecil dari pembengkakan memori.
Dengan kata lain, 84% pemborosan token dan biaya inferensi disumbangkan oleh interaksi tool. Namun, penanganan konvensional terhadap lonjakan ini memicu paradoks ekonomi yang berbahaya:
-
Sliding Window Menghancurkan Efisiensi KV-Cache
Dalam model inferensi modern (vLLM, SGLang, Claude API, OpenAI API), token input yang tersimpan di prefix cache berharga 5 hingga 6 kali lipat lebih murah dibanding token input baru (uncached re-prefill). Ketika harness menggeser jendela konteks pada setiap turn, prefix cache batal (cache miss), memaksa komputasi re-prefill penuh pada seluruh konteks aktif. Penghematan memori di frontend justru meledakkan tagihan GPU di backend.
-
LLM Summarization Memicu Context Drift Akumulatif
Ketika ringkasan dibuat oleh LLM pembantu, fakta presisi (seperti nama variabel, path absolut, kode baris kesalahan, status exit code) mengalami kompresi lossy. Saat sesi berlangsung panjang dan ringkasan generasi kedua dibuat dari ringkasan generasi pertama (summary of summaries), terjadi degradasi eksponensial. Agen mulai berhalusinasi mengenai struktur kode yang telah diubahnya sendiri.
2. Tiga Prinsip Desain Fundamental CliffCompaction
CliffCompaction memecahkan dikotomi ini melalui pertukaran desain yang sangat diperhitungkan: mengorbankan recall riwayat masa lalu demi mempertahankan presisi (fidelity) 100% dan efisiensi KV-cache maksimal.
| Dimensi Arsitektur | Sliding Window | LLM Summarization | CliffCompaction (CMU) |
|---|---|---|---|
| Integritas Riwayat | Terpotong kaku per turn | Lossy parafrasa rekursif | Verbatim selektif (No rewrite) |
| Akumulasi Drift | Rendah (namun lupa total) | Tinggi (Summary of summary) | Zero ($C_{t-1}$ dibuang total) |
| Status KV Prefix Cache | Invalid pada SETIAP turn | Invalid saat ringkasan berubah | 100% Cache Reuse antar Cliff |
| Overhead Model Pembantu | Nol (Rule-based) | Tinggi (Panggilan LLM ekstra) | Nol (Algoritma deterministik) |
| Portabilitas Harness | Tergantung scaffold | Tergantung scaffold | Scaffold-Agnostic API Proxy |
A. Never Compact a Compaction: Discarding-Compaction Rekursif
Setelah pemadatan ke-$(t-1)$, konteks agen $S_t$ terdiri dari riwayat terkompresi $C_{t-1}$ diikuti sesi aktif $L_t$ yang tumbuh di atasnya (dengan $C_0 = emptyset$). Ketika $S_t$ menyentuh batas ambang token $B$, proses kompresi ke-$t$ dipicu:
Perhatikan bahwa $C_{t-1}$ dibuang secara keseluruhan dari memori dan tidak pernah digabungkan ke dalam $C_t$. Setiap iterasi pemadatan hanya beroperasi pada sesi aktif orisinal yang baru ($L_t$). Karena tidak ada kompresi bersarang, context drift tidak dapat berakumulasi seiring waktu.
B. Pemfilteran Deterministik Berbasis Panjang & Preservasi Verbatim
CliffCompaction menolak parafrasa generatif dan memberlakukan 4 aturan reduksi deterministik:
- Tool Results: Hasil eksekusi di bawah 500 karakter dipertahankan secara utuh (verbatim). Output ringkas seperti pesan error compiler, status exit code, dan hasil
grepsangat murah dan krusial. Hasil yang melampaui 500 karakter dibuang sepenuhnya; jika agen membutuhkan kembali isi file atau log tersebut, agen dapat membaca ulang melalui filesystem. - Tool Calls: Mereduksi panggilan tool menjadi signature ringkas (nama tool, path file target, dan argumen esensial). Konten panjang yang di-inline pada
file_writedibuang karena file sudah tersimpan di disk. - Chain-of-Thought (Thoughts): Blok pemikiran asisten dipotong secara presisi pada batas 300 karakter pertama.
- K-Turn Retention & Root Invariants: System prompt dan prompt tugas pertama dipertahankan 100%. Selain itu, $K$ pasang interaksi turn terakhir ($2K$ pesan) dipertahankan utuh tanpa kompresi untuk menjamin kontinuitas penalaran jangka pendek.
C. Amortized Cache Reuse & Cliff Invalidation Profile
Alih-alih memodifikasi konteks pada setiap langkah, CliffCompaction membiarkan konteks tumbuh secara organik. Selama fase pertumbuhan, prefix cache pada server inferensi tetap 100% valid. Invalidasi cache hanya terjadi satu kali tepat di tebing pemadatan (cliff), di mana konteks menyusut tajam ke lantai dasar sebelum mulai tumbuh kembali. Karena frekuensi tebing sangat jarang, biaya komputasi re-prefill teramortisasi secara sempurna di sepanjang trajektori.
3. Evaluasi Benchmark Empiris: Terminal-Bench 2.0 & SWE-bench Verified
Peneliti CMU menguji CliffCompaction pada beragam model frontier open-weight dan proprietary—termasuk Kimi K2.6, Kimi K2.5, GLM-5.1, GLM-5.3 Flash, serta integrasi Claude Code.
| Benchmark / Model | Metode Kompresi | Batas Konteks | Task Resolved (%) | Rata-rata Biaya (USD) | Dampak Biaya |
|---|---|---|---|---|---|
| Terminal-Bench 2.0 / Kimi K2.6 | Full Context (No Compaction) | 256K | 59.16 ± 3.41% | $0.40 | Baseline |
| Terminal-Bench 2.0 / Kimi K2.6 | LLM Summarization | 16K | 55.45 ± 0.64% | $0.26 | -35% |
| Terminal-Bench 2.0 / Kimi K2.6 | CLIFFCOMPACTION | 16K | 61.42 ± 1.30% | $0.19 | -52.5% (Biaya Terpangkas) |
| Terminal-Bench 2.0 / GLM-5.1 | Full Context | 200K | 49.83 ± 3.42% | $0.54 | Baseline |
| Terminal-Bench 2.0 / GLM-5.1 | CLIFFCOMPACTION | 16K | 54.33 ± 2.35% | $0.27 | -50.0% (Akurasi Naik +4.5) |
| Terminal-Bench 2.1 / Claude Code | Native Auto-Compaction | ~45K Peak | 70.97 ± 3.72% | $0.14 | Scaffold Native |
| Terminal-Bench 2.1 / Claude Code | CLIFFCOMPACTION (Proxy) | ~45K Peak | 76.69 ± 1.41% | $0.16 | +5.72 poin vs Native |
Wawasan Krusial: Pada Terminal-Bench 2.0, mengeliminasi observasi basi justru meningkatkan tingkat keberhasilan dari 59.16% menjadi 61.42% pada Kimi K2.6, sekaligus memotong biaya per tugas lebih dari separuhnya ($0.40 menjadi $0.19). Pada integrasi dengan Claude Code (harness komersial tertutup), CliffCompaction yang dipasang sebagai API Proxy eksternal mengalahkan sistem auto-compaction internal Claude Code sendiri (76.69% vs 70.97%), membuktikan bahwa arsitektur ini benar-benar independen dari struktur scaffold internal.
4. Demokratisasi Test-Time Scaling: Kimi K2.6 Menyaingi Claude Opus 4.7
Secara teori, Test-Time Scaling (menjalankan $k$ trajektori independen secara paralel lalu memilih kandidat terbaik via verifier) adalah cara paling efektif melompatkan penalaran model. Namun di dunia nyata, test-time scaling hampir tidak pernah dipakai di lingkungan produksi karena biayanya eksorbitan: melakukan 3 rollout penuh pada Terminal-Bench menelan biaya $91.65—jauh lebih mahal dibanding mengeksekusi model proprietary tunggal berbiaya $65.
CliffCompaction membalikkan kalkulus ekonomi ini secara total:
| Konfigurasi Model & Harness | Budget / Context | Rollout (k) | Total Biaya (USD) | Oracle pass@k (%) | Practical (SGV Verifier) |
|---|---|---|---|---|---|
| Anthropic Claude Opus 4.7 | 1M (Full) | k = 1 | Proprietary ($$) | — | 69.4% |
| Kimi K2.6 + CLIFF + SGV | 16K Bounded | k = 3 | $58.01 | 74.2% | 69.7% (+10.5 poin @ 1.9x cost) |
| OpenAI GPT-5.3 Codex | 272K (Full) | k = 1 | $64.63 | — | 64.7% |
| Anthropic Claude Opus 4.6 | 1M (Full) | k = 1 | $44.53 | — | 62.9% |
| Kimi K2.6 + SGV (Naive Scaling) | 256K (Full) | k = 3 | $91.65 | 70.8% | 64.0% (+4.8 poin @ 3.0x cost) |
Dengan CliffCompaction pada ambang 16K, tiga eksekusi paralel Kimi K2.6 dipadukan dengan selektor Soft Group Verification (SGV) mencapai akurasi praktis 69.7% dengan total biaya hanya $58.01. Ini melampaui performa model proprietary termahal seperti GPT-5.3 Codex ($64.63, 64.7%) dan Claude Opus 4.6 (62.9%), serta menyamai Claude Opus 4.7 (69.4%) dengan biaya operasional yang jauh lebih terjangkau.
5. Rekor Pembelajaran Kontinu pada KernelBench: Sesi 1 Juta+ Token
Tantangan paling ekstrem bagi arsitektur kompresi konteks adalah continual learning (optimasi berulang pada problem tunggal) di mana agen menulis, mengompilasi, melakukan profiling, dan merevisi kode kernel GPU secara iteratif hingga melampaui 400 langkah (mencapai jutaan token akumulatif).
Meskipun CliffCompaction adalah teknik pemadatan konteks umum tanpa pengetahuan domain spesifik GPU, ia mengungguli algoritma pencarian kernel spesialis seperti AdaExplore (1.78x pada 200 langkah) dan CUDA-Agent (1.80x pada 200 langkah). Pada 200 langkah, CliffCompaction mencapai akselerasi 2.09x dan melesat ke 3.58x pada 400 langkah, membuktikan daya tahan penalaran jangka panjang tanpa pernah mengalami kejenuhan akibat context rot.
6. Implementasi Referensi Python: API-Proxy Interceptor
Berikut adalah implementasi referensi modul interceptor CliffCompaction yang kompatibel dengan protokol API OpenAI / Anthropic untuk dipasang di depan coding agent komersial apa pun:
"""
CliffCompaction: Cost-Efficient Compaction Proxy for Long-Horizon Coding Agents.
Berdasarkan formulasi riset CMU & Bosch Center for AI (arXiv:2609.26779, Tim Dettmers et al., 2026).
Komponen Arsitektur Utama:
1. Non-Recursive Cliff Compactor: S_{t+1} = C_t (+) L_{t+1}, dengan C_{t-1} dibuang total (Zero Summary-of-Summary).
2. Verbatim Truncation Filter: Preservasi verbatim tanpa parafrasa; Tool output > 500 chars di-drop; tool call direduksi ke signature.
3. KV-Cache Prefix Preservation: Pertumbuhan alami tanpa perubahan konteks hingga menyentuh ambang batas B (amortized re-prefill).
4. Scaffold-Agnostic Proxy Handler: Interseptor API OpenAI/Anthropic kompatibel Claude Code, Codex, & OpenHands.
"""
from dataclasses import dataclass, field
from typing import List, Dict, Any, Optional, Tuple
import re
@dataclass
class AgentMessage:
role: str # 'system', 'user', 'assistant', 'tool'
content: Optional[str] = None
tool_calls: Optional[List[Dict[str, Any]]] = None
tool_call_id: Optional[str] = None
thinking: Optional[str] = None
is_prior_compaction: bool = False
class CliffCompactor:
def __init__(
self,
token_threshold_b: int = 32000,
recent_turn_pairs_k: int = 4,
max_tool_result_chars: int = 500,
max_thinking_chars: int = 300,
max_tool_signature_chars: int = 150
):
self.b_threshold = token_threshold_b
self.k_recent = recent_turn_pairs_k
self.max_tool_result = max_tool_result_chars
self.max_thinking = max_thinking_chars
self.max_tool_sig = max_tool_signature_chars
def extract_tool_signature(self, tool_call: Dict[str, Any]) -> str:
"""Mereduksi tool call menjadi signature nama dan parameter inti tanpa payload besar."""
name = tool_call.get("function", {}).get("name", "unknown_tool")
raw_args = tool_call.get("function", {}).get("arguments", "{}")
# Ekstraksi path atau parameter kunci jika ada
path_match = re.search(r'["'](?:path|file|command)["']s*:s*["']([^"']+)["']', raw_args)
target = path_match.group(1) if path_match else ""
sig = f"{name}({target})" if target else f"{name}(...)"
return sig[:self.max_tool_sig]
def compact_turns(self, turns: List[AgentMessage]) -> Tuple[List[AgentMessage], List[AgentMessage]]:
"""
Algoritma 1: CliffCompaction Core.
Membuang kompresi lama C_{t-1}, memotong thinking, memangkas tool result > 500 chars,
dan menjaga K pasang turn terakhir secara utuh (verbatim).
"""
k_turns_count = self.k_recent * 2
if len(turns) <= k_turns_count:
return [], turns
old_turns = turns[:-k_turns_count]
recent_turns = turns[-k_turns_count:]
compacted_parts: List[str] = []
for m in old_turns:
# Aturan 1: Buang riwayat kompresi sebelumnya (Never compact a compaction)
if m.is_prior_compaction:
continue
# Aturan 2: Assistant messages -> pangkas thinking & ringkas tool calls
elif m.role == "assistant":
part_lines = []
if m.thinking:
truncated_think = m.thinking[:self.max_thinking].strip()
part_lines.append(f"[THOUGHT]: {truncated_think}...")
if m.tool_calls:
sigs = [self.extract_tool_signature(tc) for tc in m.tool_calls]
part_lines.append(f"[TOOL_CALLS]: {', '.join(sigs)}")
if part_lines:
compacted_parts.append("\n".join(part_lines))
# Aturan 3: Tool results -> pertahankan jika <= 500 karakter, buang jika > 500 karakter
elif m.role == "tool":
content = m.content or ""
if len(content) <= self.max_tool_result:
compacted_parts.append(f"[TOOL_RESULT {m.tool_call_id or ''}]: {content.strip()}")
else:
# Output besar (misal read_file 2000 baris) dibuang karena dapat dibaca ulang on-demand
compacted_parts.append(f"[TOOL_RESULT {m.tool_call_id or ''}]: ")
# Bungkus partisi terkompresi sebagai single flat block
c_block = AgentMessage(
role="user",
content="=== CLIFFCOMPACTION HISTORY (VERBATIM EXCERPTS) ===\n" + "\n---\n".join(compacted_parts),
is_prior_compaction=True
)
return [c_block], recent_turns
def process_context(
self,
messages: List[AgentMessage],
approx_token_count: int
) -> List[AgentMessage]:
"""
Evaluasi ambang batas B. Jika terlampaui, trigger tebing kompresi (Cliff).
Konteks awal (System prompt & task prompt) dipertahankan 100%.
"""
if approx_token_count < self.b_threshold or len(messages) <= 2:
return messages
system_msg = messages[0]
task_msg = messages[1]
trajectory = messages[2:]
c_block_list, recent_turns = self.compact_turns(trajectory)
new_context = [system_msg, task_msg]
new_context.extend(c_block_list)
new_context.extend(recent_turns)
return new_context
7. Rekomendasi Arsitektural untuk Tim AI Engineering & Platform 2026
Bagi organisasi yang sedang membangun infrastruktur AI coding assistants, autonomous QA bots, atau multi-agent scaffolding, terobosan dari riset CliffCompaction memberikan 3 panduan rekayasa esensial:
Jangan meminta model meringkas riwayat percakapan yang sudah merupakan ringkasan dari turn sebelumnya. Gunakan pendekatan verbatim berbasis kuota: pertahankan pesan sistem dan prompt tugas awal 100%, buang output tool di atas 500 karakter karena filesystem lokal adalah memori deterministik terbaik, dan simpan beberapa turn percakapan terakhir secara utuh.
Sliding window dinamis setiap turn adalah musuh utama sistem serving berbasis vLLM/SGLang karena menyebabkan 100% cache miss pada prompt prefix. Desainlah sistem di mana konteks dibiarkan tumbuh secara statis hingga ambang batas tertentu ($B$), lalu lakukan pemadatan masif satu kali (cliff drop). Ini menjamin tingkat cache hit mendekati 90% pada fase pertumbuhan.
Memadukan 2-3 rollout model open-weight berkualitas tinggi (seperti Kimi K2.6 atau GLM-5.1) dengan konteks terikat (16K/32K) dan selektor verifikasi sederhana (SGV) memberikan rasio akurasi-terhadap-biaya yang jauh melampaui pemanggilan tunggal model frontier termahal. Ini membuka jalan bagi sistem autonomous coding komersial yang beroperasi 24/7 tanpa risiko pembengkakan anggaran komputasi cloud.
Referensi & Sumber Terverifikasi
- [1]CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents(arXiv:2609.26779 [cs.AI] — Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers (Carnegie Mellon University & Bosch Center for AI))
- [2]Terminal-Bench: Evaluating Autonomous Agents on Real-World Command-Line Tasks(arXiv:2604.08912 / Merrill et al. (Stanford University & UC Berkeley, 2026))
- [3]KernelBench: Can LLMs Write GPU Kernels Fast Enough for Production?(arXiv:2512.18901 / Dettmers et al. (Carnegie Mellon University & Hugging Face, 2025))
- [4]SWE-bench: Can Language Models Resolve Real-World GitHub Issues?(ICLR 2024 / Carlos E. Jimenez et al. (Princeton University))
- [5]Harness Engineering 2026: Anatomi Sumber Kode 11 Production Coding Harnesses(arXiv:2609.00006 / NEWSAINT Systems Architecture Review)
- [6]CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents(arXiv:2609.26779 [cs.AI] — Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers (Carnegie Mellon University & Bosch Center for AI))
- [7]Terminal-Bench: Evaluating Autonomous Agents on Real-World Command-Line Tasks(arXiv:2604.08912 / Merrill et al. (Stanford University & UC Berkeley, 2026))
- [8]KernelBench: Can LLMs Write GPU Kernels Fast Enough for Production?(arXiv:2512.18901 / Dettmers et al. (Carnegie Mellon University & Hugging Face, 2025))
- [9]SWE-bench: Can Language Models Resolve Real-World GitHub Issues?(ICLR 2024 / Carlos E. Jimenez et al. (Princeton University))
- [10]Harness Engineering 2026: Anatomi Sumber Kode 11 Production Coding Harnesses(arXiv:2609.00006 / NEWSAINT Systems Architecture Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.