NS
NEWSAINT
ai-eng• 8 MIN READ•22 September 2026

RRSI 2026: Arsitektur Regularized Recursive Self-Improvement, Temporally Annealed Proposer, Critic-Pruner Selector, dan Mitigasi Overfitting pada Agent Harness Evolution

Bedah mendalam riset frontier Google Cloud AI Research, Stanford University, dan UC Berkeley arXiv:2609.24972 (Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yoonho Lee, Tomas Pfister, Chen-Yu Lee, September 2026): Mengapa evolusi otonom agent harness tanpa regularisasi kerap mengalami kegagalan generalisasi fatal dan menghafal split evaluasi? RRSI memperkenalkan framework regularisasi matematis komprehensif yang memetakan prinsip L0, L1, dan L2 ke dalam trajektori evolusi scaffolding. Menggabungkan temporally annealed proposal budget, evidence-aware credit assignment, leakage screening critic, noise-adjusted stability floor, serta complexity-aware acceptance. Berhasil melesatkan performa hingga +14.1 poin pada evolve split dan +4.7 poin pada benchmark out-of-distribution (OOD), seraya memangkas token kebijakan sebesar 30%.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 RRSI 2026: Arsitektur Regularized Recursive Self-Improvement, Temporally Annealed Proposer, Critic-Pruner Selector, dan Mitigasi Overfitting pada Agent Harness Evolution

Dalam rekayasa sistem agen otonom, kapabilitas model dasar sering kali bukan merupakan penentu tunggal kesuksesan misi. Harness—yaitu arsitektur scaffolding pendukung yang mencakup prompts, routing control flow, tooling interfaces, memory persistence, dan context management—sering kali melipatgandakan performa model secara eksponensial. Namun, ketika proses pengembangan harness diotomasikan melalui Recursive Self-Improvement (RSI) pada level sistem, timbul fenomena kegagalan baru: benchmark memorization dan overfitting yang melumpuhkan kemampuan transfer ke dunia nyata.

Ringkasan Eksekutif Riset (Google Cloud AI Research, Stanford, UC Berkeley 2026)

Makalah frontier arXiv:2609.24972 mempublikasikan RRSI (Regularized Recursive Self-Improvement of Agent Harnesses). Berbeda dengan pendekatan naif yang membiarkan evolusi kode scaffolding mengejar skor empiris semata, RRSI mentranslasikan prinsip regularisasi statistika klasik ($L_0, L_1, L_2$) ke dalam ruang pencarian trajektori harness. Melalui temporally annealed proposal budget, critic-based leakage screening, noise-adjusted stability floor, dan complexity-aware acceptance shrinkage, RRSI memecahkan rekor transfer: meraih kenaikan hingga +14.1 poin pada split evolusi, +4.7 poin pada 5 benchmark out-of-distribution (OOD) independen, sekaligus memangkas 30% konsumsi token kebijakan dibanding evolusi non-regularisasi.

1. Paradigma RSI pada Agent Harness & Anatomi Krisis Overfitting

Secara tradisional, optimalisasi model LLM difokuskan pada tahap post-training bobot parametrik ($ heta$). Namun, arsitektur harness eksternal $H$ mengonversi masalah komputasi mentah menjadi trajektori interaktif. Riset seperti Meta-Harness (Lee et al., 2026) dan AHE (Lin et al., 2026) membuktikan bahwa membiarkan LLM mengusulkan mutasi kode pada harness-nya sendiri secara berulang mampu meningkatkan skor tugas secara drastis.

Kendati demikian, para peneliti di Google Cloud AI Research dan Stanford menemukan anomali serius ketika harness hasil evolusi diuji di luar lingkungan latihan (Out-of-Distribution / OOD transfer):

Patologi 01

Benchmark Memorization

Proposer yang tidak dibatasi cenderung menyisipkan aturan spesifik, nama entitas kasus uji, heuristik sintaksis rapuh, atau prompt boilerplate yang mengeksploitasi kelemahan evaluator lokal.

Patologi 02

Stochastic Winner Lock-in

Karena evaluasi agen bersifat stokastik, variasi noise evaluasi ($delta$) kerap disalahartikan sebagai peningkatan performa hakiki. Kandidat yang menang murni karena keberuntungan stokastik dikunci sebagai status quo permanen.

Patologi 03

Resource Footprint Bloat

Evolusi tanpa penalti kompleksitas menambahkan lapisan middleware, validator berulang, dan konteks prompt berlebih yang melipatgandakan latensi (TTFT) dan konsumsi token hingga 200% tanpa gain akurasi yang sepadan.

2. Taksonomi Regularisasi Matematika pada Trajektori Evolusi Scaffolding

Kunci inovasi RRSI terletak pada pemisahan yang tegas: ruang hipotesis mutasi $Omega(H)$ dibiarkan terbuka lebar (tidak dibatasi secara kaku), namun trajektori pencarian dan seleksi diatur oleh constraint regularisasi terukur. RRSI mengadaptasi 3 pilar teori statistika modern (Hastie et al., 2009; Goodfellow et al., 2016):

Prinsip Klasik Implementasi RRSI Fase Eksekusi Dampak Sistemik
L0 Cardinality Annealed Update Sparsity ($b_t$) Proposal Distribution Membatasi jumlah mutasi independen dalam satu proposal; menjamin atribusi kausalitas jelas.
L2 / Ridge Shrinkage Complexity-Aware Acceptance Candidate Selection Menekan kenaikan konsumsi token ($Delta C le eta_0 + eta_1 Delta S$) tanpa memotong modul secara paksa.
L1 / Lasso Sparsity Structural Pruning Window ($W$) Harness Pruning Memangkas komponen scaffolding yang tidak menghasilkan utilitas positif dalam $W$ iterasi berturut-turut.
Adaptive Holdout Stability Floor ($S^* - delta$) Candidate Selection Mencegah regresi bertahap akibat fluktuasi evaluasi stokastik pada finite evolve set.

3. Regularisasi Distribusi Proposal: Annealed Sparsity & Evidence Memory

Jika sebuah generator proposal diizinkan memodifikasi 10 bagian kode sekaligus dalam satu ronde evolusi, mustahil mengidentifikasi apakah kenaikan skor disebabkan oleh prompt baru, struktur tool baru, atau sekadar artefak kebetulan.

A. L0-Style Annealed Update Sparsity

RRSI menerapkan jadwal peluruhan kosinus (cosine schedule) untuk anggaran mutasi $b_t$ pada ronde $t$ dari total $T$ iterasi:

b_t = Biglceil b_{min} + (b_{max} - b_{min}) cdot rac{1}{2}Big(1 + cosBig( rac{pi t}{T}Big)Big)Big ceil

Pada fase awal ($t o 0$), anggaran $b_t = b_{max}$ memungkinkan eksplorasi makro yang mengombinasikan beberapa mekanisme. Menjelang fase konvergensi ($t o T$), anggaran mengecil hingga $b_t = b_{min}$, memaksa sistem melakukan perbaikan mikro yang presisi dan mudah diatribusikan kausalitasnya.

B. Evidence-Aware Credit Assignment

Setiap uji coba pada dataset evaluasi yang terbatas mengonsumsi kapasitas statistik (Dwork et al., 2015). Menguji ulang hipotesis yang telah terbukti gagal di ronde sebelumnya adalah pemborosan kapasitas pencarian. RRSI mencatat rekaman terstruktur untuk setiap kandidat: modul target, hipotesis desain, unified diff, delta metrik ($Delta S, Delta C$), serta status penerimaan. Modul yang ditolak menjadi negative evidence yang dikondisikan pada system prompt proposer generasi berikutnya.

C. Structured Exploration (Anti-Collapse Mechanism)

Ketika progres evolusi stagnan di dalam batas noise ($Delta S le delta$) selama jendela $w$ ronde, proposer kerap mengalami mode collapse—misalnya terus-menerus memodifikasi kata-kata pada prompt dan mengabaikan arsitektur tool atau memori. Saat stagnasi terdeteksi, RRSI mengalokasikan porsi anggaran mutasi khusus untuk mengeksplorasi komponen yang belum pernah disentuh (unexercised components), serupa dengan prinsip regularisasi entropi pada reinforcement learning.

4. Regularisasi Seleksi Kandidat: Critic, Stability Floor, dan Complexity Shrinkage

Seleksi standar hanya memilih kandidat dengan skor empiris tertinggi. RRSI mengganti paradigma ini dengan 4 gerbang seleksi non-kompensatori yang wajib dipenuhi sebelum sebuah mutasi diizinkan menggantikan status quo ($H_t$):

Gate 1

Leakage Screening Critic (Pra-Evaluasi)

Sebelum kandidat dievaluasi pada runtime mahal, modul Critic berbasis LLM menganalisis diff kode. Jika mutasi secara eksplisit mengodekan nama tugas spesifik, nilai target benchmark, percabangan kondisional kaku berbasis ID kasus, atau kode pasif (inert machinery), kandidat langsung didiskualifikasi seketika. Hal ini mencegah skor semu yang dapat mencemari sejarah evolusi.

Gate 2

Noise-Adjusted Stability Floor

Sebelum evolusi dimulai, harness dasar diuji berulang kali untuk mengestimasi deviasi standar empiris noise ($delta$). Kandidat baru harus memenuhi batas aman: hat{S}(H') ge S^* - delta di mana $S^*$ adalah skor terbaik yang pernah diamati. Aturan ini mencegah pencarian "meluncur menuruni bukit" melalui rangkaian regresi kecil yang tampak seperti noise.

Gate 3

Ridge/L2-Style Complexity-Aware Acceptance

Untuk kandidat yang peningkatannya melampaui noise band ($Delta S > delta$), kenaikan biaya token kebijakan ($Delta C$) wajib dibatasi oleh pertidaksamaan linier: Delta C le eta_0 + eta_1 Delta S Parameter $eta_0$ menentukan batas toleransi kenaikan biaya untuk gain marginal, sementara $eta_1$ mengatur proporsi biaya tambahan yang diizinkan untuk gain substansial. Kandidat yang menambah token 50% hanya demi gain 0.5% otomatis ditolak.

Gate 4

Lasso/L1-Style Structural Pruning

Jika komponen tertentu (seperti memori refleksi atau validator spesifik) tidak pernah berkontribusi positif selama jendela pengamatan $W$, modul tersebut ditandai untuk dihapus pada ronde berikutnya. Ini memastikan harness yang terbentuk tetap ramping dan minimalis.

5. Evaluasi Benchmark Lintas 8 Lingkungan: In-Distribution vs OOD Transfer

Riset RRSI mengevaluasi ketahanan harness pada 8 tolak ukur heterogen: Terminal-Bench 2.1 (interaksi OS terminal), SWE-bench Verified (resolusi issue repository riil), Harvey LAB (legal analytics workspace), JobBench, GDPval, APEX-Agents, EngDesign, dan Frontier-Eng.

Tabel berikut merangkum hasil uji komparasi antara RRSI dan metode evolusi harness otonom terdahulu:

Metode Evolusi Harvey LAB (Evolve) Harvey LAB (ID Held-Out) JobBench (OOD) GDPval (OOD) APEX-Agents (OOD) Token Policy
H_0 (Base Un-evolved) 89.4 86.9 36.0 48.8 34.2 100% (Baseline)
Meta-Harness (Lee et al., 2026) 93.0 89.2 37.1 49.1 35.7 +42.5% (Bloat)
AHE (Lin et al., 2026) 90.7 88.7 37.2 47.2 (Regress) 33.1 (Regress) +28.0%
TTHE (Nie et al., 2026) 91.1 88.5 35.2 (Regress) 47.0 (Regress) 31.7 (Regress) +31.2%
HarnessX (Chen et al., 2026) 91.8 89.1 36.3 48.5 34.3 +19.4%
RRSI (Google/Stanford) 90.5 89.2 40.7 (+4.7) 52.3 (+3.5) 37.9 (+3.7) -30.0% (Hemat)

Wawasan Penting: Metode konvensional seperti Meta-Harness tampak unggul di dataset latihan (93.0 vs 90.5), namun keunggulan tersebut lenyap seketika pada dataset OOD (hanya naik 0.9 poin secara rata-rata). Sebaliknya, AHE dan TTHE bahkan mengalami regresi performa (skor jatuh di bawah baseline $H_0$). RRSI adalah satu-satunya metode yang secara konsisten mempertahankan superioritas di seluruh benchmark transfer OOD (rata-rata 43.6 vs 39.7), membuktikan efektivitas pertukaran regularisasi (regularization trade-off).

6. Implementasi Simulator Optimasi RRSI Berbasis Python

Berikut adalah implementasi referensi modul pengendali regularisasi RRSI yang mendemonstrasikan kalkulasi annealed budget, filter critic pendeteksi kebocoran benchmark, verifikasi noise floor, serta penyusutan biaya Ridge:

python / rrsi_regularized_optimizer.py ALGORITHM 1 REFERENCE
"""
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses Engine.
Berdasarkan formulasi riset Google Cloud AI Research, Stanford & UC Berkeley (arXiv:2609.24972).

Komponen Inti:
1. L0-Style Annealed Update Sparsity: b_t = ceil(b_min + (b_max - b_min) * 0.5 * (1 + cos(pi * t / T)))
2. Evidence-Aware Credit Assignment: Melacak history mutasi, dif, skor delta, dan mendiskualifikasi kegagalan berulang.
3. Structured Exploration: Mengalokasikan eksplorasi komponen dorman saat progres stagnan dalam noise band delta.
4. Leakage Screening (Critic): Menolak kode mutasi yang mengandung konstanta spesifik benchmark atau inert dead-code.
5. Stability-Aware Floor: Menolak regresi noise: S_hat(H') >= S* - delta.
6. Ridge/L2-Style Complexity Acceptance: Delta_C <= beta_0 + beta_1 * Delta_S (mencegah token bloat).
7. Lasso/L1-Style Structural Pruning: Memangkas modul scaffolding yang tidak menghasilkan gain positif selama window W.
"""

from dataclasses import dataclass, field
from enum import Enum
from typing import Dict, List, Optional, Set, Tuple
import math
import re

@dataclass
class HarnessMutation:
    mutation_id: str
    target_component: str  # 'prompt', 'control_flow', 'tool_def', 'memory', 'context'
    diff_content: str
    description: str

@dataclass
class ProposalCandidate:
    candidate_id: str
    round_idx: int
    mutations: List[HarnessMutation]
    expected_rationale: str

@dataclass
class EvaluationMetrics:
    score: float
    token_cost: float
    execution_time_ms: float

class SelectionVerdict(Enum):
    ACCEPTED = "accepted"
    REJECTED_LEAKAGE = "rejected_leakage"
    REJECTED_NOISE_FLOOR = "rejected_noise_floor"
    REJECTED_COMPLEXITY_BLOAT = "rejected_complexity_bloat"
    REJECTED_NO_GAIN = "rejected_no_gain"

class RRSIRegularizedHarnessOptimizer:
    def __init__(
        self,
        total_rounds: int = 50,
        b_max: int = 4,
        b_min: int = 1,
        noise_band_delta: float = 0.8,
        beta_0: float = 0.05,
        beta_1: float = 0.08,
        pruning_window: int = 6,
        stall_window: int = 4
    ):
        self.total_rounds = total_rounds
        self.b_max = b_max
        self.b_min = b_min
        self.delta = noise_band_delta
        self.beta_0 = beta_0
        self.beta_1 = beta_1
        self.pruning_window = pruning_window
        self.stall_window = stall_window
        
        # State tracking
        self.current_round = 0
        self.incumbent_score = 0.0
        self.incumbent_cost = 1000.0  # baseline policy token count
        self.best_observed_score = 0.0
        self.history: List[Dict] = []
        self.component_utility: Dict[str, List[float]] = {}
        self.known_components = {"system_prompt", "bash_tool", "python_repl", "scratchpad_memory", "verifier_guard"}

    def compute_annealed_budget(self, t: int) -> int:
        """Formulasi Persamaan (4): L0-Style Annealed Update Sparsity."""
        decay_factor = 0.5 * (1.0 + math.cos(math.pi * t / self.total_rounds))
        budget = math.ceil(self.b_min + (self.b_max - self.b_min) * decay_factor)
        return max(self.b_min, min(self.b_max, budget))

    def screen_leakage(self, candidate: ProposalCandidate) -> Tuple[bool, Optional[str]]:
        """Selection Gate 1: Leakage Screening (Critic). Mencegah overfit memorization."""
        leakage_patterns = [
            r"test_w+.py", r"eval_dataset", r"case_d+", r"asserts+results*==",
            r"expected_output", r"hardcoded_fix", r"ifs+task_ids*=="
        ]
        for mut in candidate.mutations:
            for pattern in leakage_patterns:
                if re.search(pattern, mut.diff_content, re.IGNORECASE):
                    return False, f"Benchmark-specific leakage detected: pattern '{pattern}' in {mut.target_component}"
            if len(mut.diff_content.strip()) < 5:
                return False, "Inert machinery / empty mutation detected"
        return True, None

    def evaluate_and_select(
        self,
        candidate: ProposalCandidate,
        eval_metrics: EvaluationMetrics
    ) -> Tuple[SelectionVerdict, str]:
        """Selection Gate 2-4: Stability, Complexity Shrinkage, and Incumbent Replacement."""
        # 1. Leakage Critic
        is_clean, reason = self.screen_leakage(candidate)
        if not is_clean:
            return SelectionVerdict.REJECTED_LEAKAGE, reason

        s_cand = eval_metrics.score
        c_cand = eval_metrics.token_cost
        
        # 2. Stability-Aware Floor: S_hat(H') >= S* - delta
        if s_cand < (self.best_observed_score - self.delta):
            return SelectionVerdict.REJECTED_NOISE_FLOOR, f"Score {s_cand:.2f} falls below stability floor {self.best_observed_score - self.delta:.2f}"

        # Hitung deltas relatif terhadap incumbent saat ini
        delta_s = s_cand - self.incumbent_score
        delta_c = (c_cand - self.incumbent_cost) / self.incumbent_cost if self.incumbent_cost > 0 else 0.0

        # 3. Ridge/L2 Complexity Shrinkage Gate: Delta_C <= beta_0 + beta_1 * Delta_S
        if delta_s > self.delta:
            max_allowed_cost_increase = self.beta_0 + self.beta_1 * delta_s
            if delta_c > max_allowed_cost_increase:
                return (
                    SelectionVerdict.REJECTED_COMPLEXITY_BLOAT,
                    f"Cost increase {delta_c*100:.1f}% exceeds Ridge complexity threshold {max_allowed_cost_increase*100:.1f}% for gain +{delta_s:.2f}"
                )
        else:
            if delta_s <= 0 and delta_c >= 0:
                return SelectionVerdict.REJECTED_NO_GAIN, "Candidate yields non-positive score gain without cost reduction"

        # Candidate Diterima: Perbarui State
        self.incumbent_score = s_cand
        self.incumbent_cost = c_cand
        if s_cand > self.best_observed_score:
            self.best_observed_score = s_cand

        return SelectionVerdict.ACCEPTED, f"Accepted: +{delta_s:.2f} gain with {delta_c*100:+.1f}% cost drift"

    def identify_structural_pruning_targets(self) -> Set[str]:
        """Lasso/L1-Style Structural Pruning: Identifikasi komponen yang tidak berkontribusi positif selama window W."""
        prune_targets = set()
        for comp, gains in self.component_utility.items():
            recent_gains = gains[-self.pruning_window:]
            if len(recent_gains) >= self.pruning_window and sum(recent_gains) <= 0.0:
                prune_targets.add(comp)
        return prune_targets

7. Panduan Implementasi bagi Tim Platform Engineering & AI Architect

Bagi organisasi teknologi yang sedang merancang infrastruktur autonomous agent atau coding harness skala produksi, riset RRSI memberikan 3 pedoman krusial:

01
Pasang Gerbang Critic Sebelum Tahap Evaluasi Benchmark

Jangan biarkan model agen menguji kandidat harness tanpa pengawasan kode statis. Terapkan rule-based scanner dan critic LLM untuk mendeteksi apakah kandidat menyuntikkan ID kasus, assert manual, atau pola kaku yang memanipulasi test harness. Eliminasi kandidat bocor sejak awal menghemat biaya komputasi dan menjaga integritas pencarian.

02
Terapkan Kebijakan Anggaran Token Non-Linear (Ridge Penalty)

Jangan pernah menerima perubahan arsitektur agen hanya karena tingkat keberhasilannya naik tipis jika biaya tokennya meledak. Tentukan rasio batas $Delta C le eta_0 + eta_1 Delta S$ di level CI/CD agent. Di lingkungan produksi dengan jutaan invocation harian, efisiensi token sebesar 30% bernilai penghematan jutaan dolar.

03
Rutin Lakukan Pemangkasan Struktur (Lasso Pruning)

Scaffolding yang bertambah secara inkremental dari waktu ke waktu cenderung menimbun dead code—seperti prompt petunjuk lama yang sudah tidak relevan atau tool wrapper yang jarang dipanggil. Terapkan audit periodik: setiap mekanisme yang tidak terbukti menyumbang keberhasilan pada jendela 14 hari terakhir wajib dipangkas untuk menjaga latency minimum.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.