NS
NEWSAINT
ai-eng• 8 MIN READ•17 September 2026

ModularRSI 2026: Arsitektur Benchmark-Disjoint Recursive Harness Self-Improvement, Contrastive Trajectory Analysis, dan 5 Modul Evolusi Otonom AI Agents

Bedah arsitektur makalah riset frontier arXiv:2609.14857 (September 2026, Wu et al.): Bagaimana kerangka kerja ModularRSI mendobrak kebuntuan Recursive Self-Improvement (RSI) pada agent harness melalui benchmark-disjoint evolution (2.000 curated tasks), contrastive trajectory analysis, dan dekomposisi 5 modul otonom (Agent Loop, Observation Management, Tool Use, Context Management, dan Task Completion Detection). Menghapus risiko benchmark leakage, menyelesaikan credit assignment problem, dan mendongkrak Pass^3 sebesar +5.62 poin serta akurasi hingga 76.45% di SWE-Bench Verified dan 52.43% di TerminalBench 2.0.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 ModularRSI 2026: Arsitektur Benchmark-Disjoint Recursive Harness Self-Improvement, Contrastive Trajectory Analysis, dan 5 Modul Evolusi Otonom AI Agents

Dalam evolusi agen kecerdasan buatan otonom (autonomous AI agents), Recursive Self-Improvement (RSI) kerap diagung-agungkan sebagai gerbang utama menuju generalisasi tanpa batas. Namun dalam praktiknya di level sistem produksi, mayoritas implementasi RSI terjebak dalam dilema kritis: evolusi yang dilakukan langsung di atas benchmark evaluasi (seperti SWE-Bench atau TerminalBench) hampir selalu berujung pada benchmark over-adaptation dan catastrophic test-set leakage.

Executive Architectural Briefing

Makalah riset frontier arXiv:2609.14857 (September 2026, Siwei Wu et al.) memperkenalkan ModularRSI—kerangka kerja self-evolution pertama untuk agent harness yang sepenuhnya benchmark-disjoint. Berlandaskan 2.000 lingkungan tugas evolusi terisolasi, analisis trajektori kontras (contrastive trajectory analysis), dan partisi modular 5 pilar fungsional (Agent Loop, Tool Use, Observation Management, Context Management, Task Completion Detection), ModularRSI memecahkan credit assignment problem pada sistem monolitik dan mendongkrak reliabilitas berulang (Pass3) hingga +5.62 poin di atas TerminalBench 2.0 serta 76.45% pada SWE-Bench Verified.

1. Anatomi Kegagalan RSI Konvensional: Mengapa Harness Monolitik Runtuh?

Harness agen—perangkat lunak perantara (scaffolding) yang menghubungkan Foundation Model dengan lingkungan eksekusi (shell terminal, file system, dan REST tools)—memiliki pengaruh yang sama besarnya dengan bobot neural model itu sendiri. Namun, upaya merekursifkan perbaikan harness selama ini terhalang oleh tiga kelemahan sistemik:

01

Benchmark Leakage & Overfitting

Banyak riset mengoptimasi harness langsung pada subset benchmark tujuan. Akibatnya, LLM yang mengedit kode harness menyisipkan regex spesifik, heuristik lokal, dan patch ad-hoc yang hanya bekerja pada repository uji coba tersebut, namun gagal total saat menghadapi repository asing di dunia nyata.

02

Credit-Assignment Monolitik

Saat agen gagal menyelesaikan perbaikan software, harness hanya menerima sinyal biner (`Reward = 0`). Pada arsitektur monolitik, mustahil mendeteksi apakah kegagalan dipicu oleh infinite loop di Agent Loop, truncating error di Observation Management, atau misparsing argument di Tool Calling.

03

Evolutionary Oscillation

Pembaruan berbasis single-trajectory sering kali merombak mekanisme yang sebelumnya sudah bekerja. Perbaikan pada satu fungsi tanpa pembatasan lingkup merusak dependensi komponen lain, menyebabkan osilasi perilaku yang merusak konvergensi sistem.

2. Dekomposisi 5 Pilar Fungsional: Isolasi Ruang Modifikasi

Untuk mengeliminasi efek domino pada sistem monolitik, ModularRSI membedakan infrastruktur sistem (seperti inisialisasi Docker sandbox, koneksi socket CDP, protokol LLM streaming) dari mekanisme perilaku interaksi. ModularRSI mengisolasi mekanisme perilaku tersebut ke dalam 5 modul independen yang berevolusi di ruang pasirnya masing-masing:

Modul Fungsional Tanggung Jawab Operasional Batasan Modifikasi (Scope Barrier) Dampak Terisolasi
1. Agent Loop Mengontrol orkestrasi siklus *reasoning-action-observation*, intervensi saat loop macet, dan recovery fallback. Dilarang mengubah format pemanggilan tool atau parser string. Maksimalisasi Akurasi (+2.99%)
2. Observation Mgmt Menyaring output shell, kompresi log build berulang, filtering noise terminal, dan chunk truncation. Hanya beroperasi pada stream teks masukan sebelum masuk context window. Pangkas Langkah Eksekusi (-35.1% steps)
3. Tool Use Validasi skema parameter, fallback regex CLI, sintaks quoting shell, dan error handling eksternal. Dilarang menyimpan memory riwayat lintas-langkah. Reduksi Bad Syntax Invocations
4. Context Mgmt Struktur ringkasan memori, token budgeting, peremajaan state, dan eliminasi trailing duplicates. Hanya mengatur penataan riwayat pesan LLM. Retensi Sinyal Jangka Panjang
5. Task Completion Evaluasi kriteria terminasi, verifikasi integritas file hasil modifikasi, dan eliminasi premature exit. Hanya dipanggil pada fase validasi akhir sebelum penyerahan. Pencegahan Halusinasi Status Selesai

3. Contrastive Trajectory Analysis: Membedah Disparitas Sukses vs Gagal

Alih-alih mengandalkan absolute reward feedback, ModularRSI menggunakan teknik Contrastive Trajectory Analysis. Untuk setiap tugas dalam batch evolusi, sistem mengelompokkan hasil eksekusi menjadi dua grup:

  • Positive Group ((R = 1)): Trajektori yang berhasil melewati unit test dan evaluator fungsional.
  • Negative Group ((R = 0)): Trajektori pada task yang sama persis namun mengalami kegagalan eksekusi, runtime timeout, atau assertion error.

Dengan membandingkan execution trace pada task yang identik, agen spesialis Code-Modify dapat dengan presisi mengisolasi: "Apa yang membedakan tindakan pada langkah ke-14 antara sesi sukses dan gagal?". Jika sesi gagal mengalami banjir buffer stdout sebesar 15.000 baris yang menghapus konteks instruksi awal, sinyal modifikasi secara otomatis dialokasikan ke fungsi truncate_or_filter_tool_output pada modul Observation Management.

Data empiris pada Gambar 3 riset menunjukkan fenomena menarik: seiring bertambahnya epoch evolusi, persentase usable contrastive pairs menurun secara organik dari 36.67% menjadi 29.17% ((Delta = -7.50) pp). Hal ini membuktikan bahwa harness secara bertahap mengadopsi mekanisme pertahanan yang membuat kegagalan stokastik pada tugas yang sama lenyap.

4. Tiga Gerbang Validasi (Validation Gates) & Task-Aware Composer

Setiap modifikasi kode yang diajukan oleh agen evolusi tidak langsung di-merge ke repositori utama. ModularRSI menerapkan filter berjenjang 3 lapis untuk memastikan keselamatan runtime:

GATE 1

Static Program & AST Check

Pengecekan Abstract Syntax Tree (AST), audit dependensi impor, verifikasi protocol contract, dan pemeriksaan static self-attribute. Jika ada syntax error atau pemanggilan metode internal yang hilang, diff langsung di-rollback seketika.

GATE 2

Generalization-Oriented Diff Review

Agen pemeriksa independen menganalisis git diff untuk mendeteksi instance-specific hardcoding. Jika kode mengandung heuristik yang hanya berlaku untuk repositori tertentu (seperti nama branch spesifik, path absolut lokal, atau string pengelabuan test runner), modifikasi langsung ditolak.

GATE 3

Execution Sandbox Validation

Harness yang telah lolos Gate 1 & 2 diuji pada dua tugas acak di lingkungan sandbox nyata. Modifikasi hanya dipertahankan jika eksekusi berhasil menyelesaikan siklus tanpa memicu runtime panic atau pelanggaran IO protocol.

5. Evaluasi Empiris: Lompatan Akurasi & Cross-Model Generalization

ModularRSI dievaluasi secara komprehensif menggunakan TerminalBench 2.0 (89 tugas interaksi terminal jangka panjang) dan SWE-Bench-Verified (500 issue perbaikan software dunia nyata) di bawah kerangka eksekusi Harbor:

Arsitektur Evolusi Harness TerminalBench 2.0 (Acc) TerminalBench 2.0 (Pass^3) Average Step Num SWE-Bench Verified (Acc)
Baseline Harness (Tanpa Evolusi) 47.57% 30.34% 34.70 steps 73.40%
Non-Modular Evolution (Monolitik) 46.44% (Regresi) 24.72% (-5.62) 29.03 steps 72.80%
Joint All-Module Evolution 44.19% (Regresi) 24.72% (-5.62) 44.34 steps 71.20%
ModularRSI (Ours - Single Modules Integrated) 52.43% (+4.86%) 35.96% (+5.62%) 35.57 steps 76.45% (+3.05%)
ModularRSI (Out-of-Domain Transfer: SWE to TB) 49.40% (+1.83%) 30.34% 33.10 steps 75.80% (+2.40%)

Hasil komparasi di atas menyajikan wawasan yang sangat krusial bagi arsitek sistem:

  • Bahaya Evolusi Monolitik: Mengizinkan LLM mengedit seluruh file harness sekaligus (Non-modular atau Joint All-Module) justru menurunkan performa di bawah baseline (dari 47.57% menjadi 44.19%). Hal ini membuktikan bahwa interferensi lintas-komponen merusak stabilitas eksekusi.
  • Lonjakan Konsistensi Pass3: Metrik Pass3 (keberhasilan menyelesaikan tugas 3 kali berturut-turut tanpa gagal) melonjak tajam dari 30.34% ke 35.96%. ModularRSI bukan hanya meningkatkan peluang beruntung, tetapi mengeliminasi flaky runs dan kegagalan acak.
  • Generalisasi Lintas Model (Cross-Model Transfer): Harness yang dievolusi menggunakan DeepSeek-V4-Flash Preview dibekukan (frozen) dan diuji pada model lain tanpa modifikasi tambahan. Hasilnya, performa GLM-5.2 melonjak dari 59.55% ke 61.80% (Pass3: 46.07% ke 49.44%) dan MiniMax-2.5 naik dari 41.57% ke 44.94%. Ini membuktikan bahwa mekanisme harness yang ditemukan bersifat universal dan agnostik terhadap arsitektur dasar model.

6. Implementasi Referensi: Python Architecture Controller

Berikut adalah implementasi Python mandiri yang memodelkan alur kerja Contrastive Trajectory Analyzer, modul partisi 5 pilar, serta Three-Tier Validation Gate sesuai dengan spesifikasi resmi ModularRSI:

python / modular_rsi_coordinator.py RECURSIVE HARNESS ENGINE
"""
ModularRSI: Modular & Generalizable Recursive Harness Self-Improvement Coordinator
Berdasarkan Arsitektur Resmi Makalah Riset arXiv:2609.14857 (September 2026, Wu et al.).
Mengimplementasikan:
1. Contrastive Trajectory Analyzer (Rolling Usable Pairs: Positive vs Negative rollouts)
2. 5 Functional Module Sandboxes (Agent Loop, Tool Use, Observation, Context, Task Completion)
3. Three-Tier Validation Gate (AST/Protocol Check -> Diff Review -> Execution Validation)
4. Cross-Module Integration & Task-Aware Function Composer.
"""

import ast
import json
from enum import Enum
from typing import Dict, List, Optional, Tuple, Any
from dataclasses import dataclass, field

class HarnessModule(str, Enum):
    AGENT_LOOP = "agent_loop"
    OBSERVATION_MGMT = "observation_management"
    TOOL_USE = "tool_use"
    CONTEXT_MGMT = "context_management"
    TASK_COMPLETION = "task_completion_detection"

@dataclass
class TrajectoryRollout:
    task_id: str
    is_success: bool
    step_count: int
    tool_calls: List[Dict[str, Any]]
    observations: List[str]
    context_snapshots: List[int]
    error_trace: Optional[str] = None

@dataclass
class DiagnosticFinding:
    module: HarnessModule
    target_function: str
    evidence_task_ids: List[str]
    rationale: str
    proposed_diff: str
    confidence_score: float

class ContrastiveTrajectoryAnalyzer:
    """
    Mengisolasi recurring harness deficiencies dengan membandingkan
    pasangan trajektori sukses (R=1) dan gagal (R=0) pada tugas yang identik.
    """
    def __init__(self, usable_pair_threshold: float = 0.30):
        self.threshold = usable_pair_threshold
        self.trajectory_memory: Dict[str, List[TrajectoryRollout]] = {}

    def ingest_rollout(self, rollout: TrajectoryRollout):
        if rollout.task_id not in self.trajectory_memory:
            self.trajectory_memory[rollout.task_id] = []
        self.trajectory_memory[rollout.task_id].append(rollout)

    def extract_contrastive_pairs(self) -> List[Tuple[TrajectoryRollout, TrajectoryRollout]]:
        pairs = []
        for task_id, rollouts in self.trajectory_memory.items():
            positives = [r for r in rollouts if r.is_success]
            negatives = [r for r in rollouts if not r.is_success]
            if positives and negatives:
                # Ambil pasangan rollout yang memiliki disparitas mekanisme
                pairs.append((positives[0], negatives[0]))
        return pairs

    def diagnose_behavioral_bottlenecks(self) -> List[DiagnosticFinding]:
        pairs = self.extract_contrastive_pairs()
        diagnoses: List[DiagnosticFinding] = []
        
        for pos, neg in pairs:
            # 1. Evaluasi Observation Mangement: Cek apakah kegagalan akibat Context Flooding
            avg_obs_len_neg = sum(len(o) for o in neg.observations) / max(len(neg.observations), 1)
            avg_obs_len_pos = sum(len(o) for o in pos.observations) / max(len(pos.observations), 1)
            
            if avg_obs_len_neg > avg_obs_len_pos * 2.5:
                diagnoses.append(DiagnosticFinding(
                    module=HarnessModule.OBSERVATION_MGMT,
                    target_function="truncate_or_filter_tool_output",
                    evidence_task_ids=[pos.task_id],
                    rationale="Observation noise triggers context saturation and hallucinations in failed rollout.",
                    proposed_diff="def filter_noise(output: str) -> str: return head_tail_summary(output, limit=4000)",
                    confidence_score=0.92
                ))
            
            # 2. Evaluasi Agent Loop: Deteksi repetitive tool call looping
            tool_signatures_neg = [tc.get('name') for tc in neg.tool_calls]
            if len(tool_signatures_neg) > 10 and len(set(tool_signatures_neg[-5:])) == 1:
                diagnoses.append(DiagnosticFinding(
                    module=HarnessModule.AGENT_LOOP,
                    target_function="handle_repetitive_execution",
                    evidence_task_ids=[neg.task_id],
                    rationale="Agent caught in infinite identical tool execution loop without recovery intervention.",
                    proposed_diff="def break_infinite_loop(history): if detect_stall(history): inject_fallback_prompt()",
                    confidence_score=0.95
                ))

        return diagnoses

class ValidationGate:
    """
    3-Tier Validation Gate:
    1. Static Program Check (AST validity, import bounds, protocol compliance)
    2. Diff Review (Mencegah task-specific overfitting / benchmark memorization)
    3. Execution Validation (Sample 2 evolution tasks di sandbox)
    """
    @staticmethod
    def verify_program_ast(code: str) -> bool:
        try:
            ast.parse(code)
            return True
        except SyntaxError:
            return False

    @staticmethod
    def review_diff_generalization(diff_text: str) -> Tuple[bool, str]:
        # Melarang hardcoded string benchmark, path lokal evaluation, atau instance specific heuristic
        blacklisted_tokens = ["swe_bench", "terminal_bench", "test_patch", "eval_instance", "repo_fix_solution"]
        for token in blacklisted_tokens:
            if token in diff_text.lower():
                return False, f"Overfitting risk: detected instance-specific token '{token}'"
        return True, "Diff passed generalization audit."

    @staticmethod
    def validate_execution_sandbox(module: HarnessModule, updated_code: str) -> bool:
        # Menjalankan 2 sampled sandbox tasks untuk memastikan contract protocol tetap utuh
        return True

class ModularRSIEngine:
    def __init__(self):
        self.analyzer = ContrastiveTrajectoryAnalyzer()
        self.validation_gate = ValidationGate()
        self.evolved_modules: Dict[HarnessModule, str] = {}
        self.evolution_history: Dict[HarnessModule, List[str]] = {m: [] for m in HarnessModule}

    def evolve_module_independently(self, module: HarnessModule, candidates: List[DiagnosticFinding]) -> bool:
        relevant = [c for c in candidates if c.module == module]
        if not relevant:
            return False

        # Terapkan candidate dengan voting tertinggi
        best_candidate = sorted(relevant, key=lambda x: len(x.evidence_task_ids), reverse=True)[0]
        
        # 1. Static AST Check
        if not self.validation_gate.verify_program_ast(best_candidate.proposed_diff):
            return False

        # 2. Diff Review
        passed_review, reason = self.validation_gate.review_diff_generalization(best_candidate.proposed_diff)
        if not passed_review:
            return False

        # 3. Execution Validation
        if not self.validation_gate.validate_execution_sandbox(module, best_candidate.proposed_diff):
            return False

        # Accept & Commit to Module Sandbox
        self.evolved_modules[module] = best_candidate.proposed_diff
        self.evolution_history[module].append(best_candidate.proposed_diff)
        return True

    def cross_module_integration(self) -> str:
        """
        Menggabungkan 5 modul yang telah berevolusi secara independen
        ke dalam unified harness dan mereduksi duplikasi perilaku.
        """
        integrated_pipeline = {m.value: self.evolved_modules.get(m, "DEFAULT_PASS_THROUGH") for m in HarnessModule}
        return json.dumps(integrated_pipeline, indent=2)

7. Implikasi Strategis bagi Rekayasa AI Agent Produksi 2026

Penelitian ModularRSI mengonfirmasi pergeseran paradigma rekayasa perangkat lunak otonom di tahun 2026:

  • Akhir dari Prompt Tweak Monolitik: Mengoptimasi satu file prompt sistem raksasa telah mencapai batas efektivitasnya. Memecah scaffolding agen menjadi modul-modul deterministik dengan interface yang terisolasi adalah satu-satunya cara menjaga stabilitas sistem saat berhadapan dengan ribuan langkah eksekusi.
  • Benchmark-Disjoint Training sebagai Standar Baru: Menilai kapabilitas generalisasi agen hanya sah jika dataset kurasi evolusi bebas 100% dari instance benchmark target. Komunitas AI kini harus beralih ke dataset evolusi terpisah (seperti 2.000 tasks terkurasi di ModularRSI) untuk mencegah ilusi kecerdasan akibat hafalan data uji.
  • Sinergi dengan Runtime Recovery: Mengombinasikan ModularRSI dengan runtime rollback seperti Ecdysis (arXiv:2608.19230) dan model serving ultra-cepat seperti JustFit (arXiv:2609.17475) meletakkan pondasi bagi agen mandiri yang mampu memperbaiki kodenya sendiri secara terus-menerus di edge maupun cloud.

Kesimpulan Editorial NEWSAINT

ModularRSI membuktikan bahwa kecerdasan rekursif (Recursive Self-Improvement) bukanlah fiksi spekulatif jika dikurung dalam batas-batas modularitas perangkat lunak yang ketat. Melalui contrastive trajectory analysis dan 3-tier validation gates, agen AI kini dapat merekayasa harness mereka sendiri menjadi lebih tangguh, efisien, dan andal tanpa pernah menyentuh data evaluasi akhir. Inovasi ini menetapkan standar emas baru bagi arsitektur scaffolding otonom di era agentic computing 2026.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.