NS
NEWSAINT
ai-eng• 8 MIN READ•24 September 2026

AEWM & EditAct 2026: Arsitektur Agent-Editing World Model, Mengeliminasi Task-State Contamination, Action Judge, dan State Revision pada Autonomous Agents

Bedah tuntas riset terobosan Gaoling School of Artificial Intelligence, Renmin University of China (arXiv:2609.28416, Shuang Sun, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ji-Rong Wen, September 2026): Mengapa simulasi observasi lingkungan (observation-predictive world models) terbukti mubazir dan berlatensi tinggi ketika respons tool riil tersedia? AEWM memperkenalkan paradigma Agent-Editing World Model yang secara langsung memodelkan dan mengintervensi state penalaran dan aksi agen sebelum dieksekusi melalui kerangka kerja EditAct. Dilengkapi Action Judge berakurasi 70.5% Macro-F1 (unggul +10.6 poin dari frontier model) untuk mendeteksi keputusan Critical, Exploratory, dan Noisy, serta modul State Revision untuk merevisi trajektori tanpa kontaminasi state (task-state contamination), EditAct mendongkrak performa hingga +13.3 poin di BrowseComp, DeepSearchQA, Terminal-Bench 2.0, Doc2Repo, NL2Repo, dan SWE-Bench Pro, bahkan memungkinkan model 9B melampaui kinerja ReAct pada model 35B.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 AEWM & EditAct 2026: Arsitektur Agent-Editing World Model, Mengeliminasi Task-State Contamination, Action Judge, dan State Revision pada Autonomous Agents

Selama bertahun-tahun, riset kecerdasan buatan meyakini dogma bahwa untuk membangun agen otonom yang mampu bernalar jangka panjang (long-horizon reasoning), kita harus melatih model dunia berbasis bahasa (language world models) yang bertugas memprediksi observasi lingkungan (observation prediction). Namun, penelitian frontier terbaru dari Gaoling School of Artificial Intelligence, Renmin University of China (arXiv:2609.28416, 23 September 2026) membalikkan asumsi dasar tersebut: mensimulasikan respons tools atau keluaran terminal yang berentropi tinggi terbukti mubazir, tidak akurat, dan memicu halusinasi berantai ketika lingkungan riil selalu siap memberikan umpan balik nyata.

Tesis Inti Riset: Dari Simulasi Observasi ke Intervensi State Agen

Alih-alih meramal bagaimana server atau terminal merespons sebuah perintah CLI, arsitektur Agent-Editing World Model (AEWM) berfokus pada intervensi langsung terhadap state penalaran dan rencana agen itu sendiri. Melalui kerangka kerja EditAct, sistem membedakan keputusan CRITICAL, EXPLORATORY, dan NOISY sebelum eksekusi, serta merevisi rencana spekulatif secara zero-overhead. Hasilnya? Agen 9B mampu menumbangkan model 35B, dan trajektori yang dihasilkan memberikan fondasi superior untuk Rejection Sampling Fine-Tuning (AEWM-RFT).

1. Mengapa World Model Konvensional Gagal pada Autonomous Agents?

Dalam domain Embodied AI dan simulasi video (seperti Sora atau Genie), model dunia bertindak sebagai simulator fisika: memprediksi piksel atau posisi spasial objek berikutnya berdasarkan gaya yang diterapkan. Ketika paradigma ini ditranslasikan secara mentah ke ranah agen LLM (Software Engineering, Web Search, Terminal Ops), para peneliti melatih model untuk memprediksi token observasi:

Paradigma Konvensional (Observation Prediction): s_t —[ M_obs ]→ hat{o}_t

Para peneliti di Renmin University of China mengidentifikasi dua patologi fatal dari pendekatan konvensional ini:

  • Entropi Tinggi & Informasi Redundan: Umpan balik eksekusi (seperti stack trace puluhan kilobita, ribuan baris log linter, atau HTML mentah dari web scraping) memiliki ruang token yang sangat masif dan stokastik. Meminta model memprediksi karakter per karakter respons git status atau pytest adalah pemborosan komputasi yang ekstrem, padahal mesin riil dapat mengeksekusinya dalam hitungan milidetik.
  • Fenomena Task-State Contamination: Masalah terbesar agen otonom bukanlah ketiadaan rencana, melainkan akumulasi asumsi palsu. Ketika sebuah rencana gagal, hipotesis keliru, variabel fiktif, dan penalaran usang tetap tersimpan di riwayat konteks ($h_t$). Agen yang membaca riwayat tercemar ini akan terjebak dalam bias konfirmasi (confirmation bias), mengulang-ulang aksi destruktif, dan mengalami disorientasi tujuan.

2. Arsitektur AEWM: Dekomposisi Action Judge & State Revision

AEWM mendefinisikan ulang world model bukan sebagai peramal lingkungan eksternal, melainkan sebagai pengawas dinamika kognitif internal agen. Hubungan formal intervensi dirumuskan sebagai:

Paradigma AEWM (Agent-State Editing): s_t —[ M_SR ]→ tilde{s}_t = h_t ⊕ (tilde{r}_t, tilde{a}_t)

Arsitektur AEWM terdiri dari dua pilar modular yang beroperasi secara seimbang:

Pilar I: Action Judge (M_AJ)

Berfungsi sebagai evaluator prospektif pra-eksekusi. Tanpa menunggu aksi dijalankan di lingkungan, Action Judge mengevaluasi riwayat $h_t$ bersama proposal penalaran dan aksi $(hat{r}_t, hat{a}_t)$, kemudian mengklasifikasikannya ke dalam tiga kategori diskret:

  • CRITICAL: Keputusan determinan yang langsung mengubah state repositori atau memecahkan subtugas inti.
  • EXPLORATORY: Pengumpulan informasi yang valid dan terukur untuk mengurangi ketidakpastian.
  • NOISY: Penalaran halusinatif, spekulasi tanpa bukti, atau pengulangan tindakan yang gagal.

Pilar II: State Revision (M_SR)

Diaktifkan hanya saat Action Judge memancarkan label NOISY. Alih-alih memberikan critique pasif teks panjang yang menambah beban token, modul ini secara langsung merevisi pasangan penalaran dan aksi menjadi $( ilde{r}_t, ilde{a}_t)$ yang berorientasi pada pencarian bukti empiris (evidence-seeking).

Aksi yang telah direvisi kemudian dikirimkan ke lingkungan riil $mathcal{E}$, dan observasi riil $o_t$ disuntikkan ke dalam riwayat baru $h_{t+1} = h_t oplus (r_t, a_t, o_t)$.

3. Kurikulum Dua Tahap: Mid-Training 52B Tokens & Rejection Sampling

Membangun model pengedit state yang presisi membutuhkan kalibrasi mendalam. Tim peneliti merancang kurikulum pelatihan yang ketat:

  1. Mid-Training Skala Besar (~52 Miliar Token): Pelatihan dasar menggabungkan korpus trajektori agen asli lintas tiga domain (Web Search, Terminal, Software Engineering) dengan data sintesis Action Judge dan State Revision. Tahap ini menanamkan representasi mendalam mengenai kausalitas antara bukti observasi masa lalu dengan validitas rencana masa depan.
  2. Supervised Fine-Tuning (SFT) Terkalibrasi: Mengaktifkan kemampuan diskriminasi halus menggunakan sampel yang telah lolos validasi konsistensi ganda, penyelarasan aksi-observasi, dan eliminasi bias pasca-eksekusi (no future-leakage).
  3. Internalisasi Otonom via AEWM-RFT: Keunggulan terbesar EditAct adalah kemampuannya menghasilkan trajektori bersih. Dengan melakukan Rejection Sampling Fine-Tuning (RFT) pada trajektori yang telah disempurnakan oleh EditAct, model dasar dapat menginternalisasi disiplin penulisan rencana tanpa memerlukan inferensi AEWM saat produksi (zero-runtime overhead)!

4. Evaluasi Komparatif & Benchmark Empiris

Evaluasi dilakukan secara komprehensif pada enam tolok ukur terkemuka yang mencakup in-distribution dan out-of-distribution: BrowseComp, DeepSearchQA, Terminal-Bench 2.0, Doc2Repo, NL2Repo, dan SWE-Bench Pro.

Model Backbone Metode Inferensi BrowseComp DeepSearchQA Terminal-Bench 2.0 Doc2Repo SWE-Bench Pro Rata-Rata Skomparatif
Qwen3.5-4B ReAct (Baseline) 31.5% 60.9% 17.6% 23.8% 27.6% 28.5%
Qwen3.5-4B Step-level Best@3 36.9% 63.8% 27.7% 33.4% 33.1% 35.1%
Qwen3.5-4B EditAct (AEWM) 41.2% 75.1% 37.1% 40.4% 38.9% 41.8% (+13.3)
Qwen3.5-9B ReAct (Baseline) 34.1% 65.7% 26.6% 31.0% 34.2% 34.5%
Qwen3.5-9B EditAct (AEWM) 42.3% 76.4% 39.3% 45.2% 41.2% 44.1% (+9.6)
Qwen3.5-35B-A3B ReAct (Baseline) 40.9% 69.4% 37.1% 42.8% 40.6% 42.2%
Qwen3.5-35B-A3B EditAct (AEWM) 48.1% 78.6% 48.3% 48.9% 43.8% 48.8% (+6.6)

Sorotan Penemuan Kritis:

  • Efek Lonjakan Skala (Scale Leap): Model Qwen3.5-9B yang dipersenjatai EditAct mencetak rata-rata skor 44.1%, melampaui performa model Qwen3.5-35B-A3B berbasis ReAct konvensional (42.2%). Ini membuktikan bahwa intervensi kualitas state jauh lebih bernilai daripada sekadar menambah jumlah parameter.
  • Akurasi Action Judge Unggul: Pada benchmark Action Judge 3.000 keputusan, AEWM meraih 70.5% Macro-F1, mengungguli DeepSeek-V4-Pro (59.9%), GPT-5.5 (55.3%), GLM-5.2 (53.2%), dan Gemini-3-Pro (45.1%).
  • Pengurangan Putaran Eksekusi (Turn Efficiency): Pada evaluasi RFT, model yang dilatih dengan jejak EditAct memangkas jumlah putaran interaksi sebesar 30.0% di BrowseComp dan 16.7% di Terminal-Bench 2.0, menandakan agen berhenti melakukan eksplorasi buta.

5. Analisis Studi Ablasi: Mengapa Desain Intervensi Sangat Menentukan?

Tabel ablasi pada riset membuktikan bahwa setiap elemen dalam EditAct memiliki peran kausal yang tak tergantikan:

Ablasi 1: EditAct vs Kritik Berbasis Petunjuk (AEWM Hint)

Mengganti revisi langsung dengan pemberian petunjuk (hint agar agen berpikir ulang) menurunkan performa dari 48.1% ke 41.8% di BrowseComp. Agen yang sudah terkontaminasi asumsi keliru cenderung merasionalkan kembali kesalahannya jika hanya diberi petunjuk verbal pasif.

Ablasi 2: Revisi Gabungan (Reasoning + Action) vs Parsial

Mengedit aksi saja tanpa memperbaiki penalaran (Action-only Revision) menghasilkan penurunan performa ke 45.8%, sementara mengedit penalaran saja (Reasoning-only) jatuh ke 41.8%. Koreksi harus menyentuh logika dasar sekaligus panggilan API agar sejarah konteks masa depan bersih seutuhnya.

6. Implementasi Produksi: Blueprint AewmEditActEngine Python

Berikut adalah implementasi referensi industri AewmEditActEngine yang mengintegrasikan Action Judge klasifikasi tiga kelas, deteksi task-state contamination, modul State Revision, serta loop eksekusi EditAct ke lingkungan produksi:

python / aewm_editact_engine.py Reference Architecture
"""
AewmEditActEngine: Arsitektur Agent-Editing World Model & EditAct Runtime.
Berdasarkan formulasi riset Gaoling School of AI, Renmin University of China (arXiv:2609.28416, Sun et al., September 2026).

Komponen Arsitektur Utama:
1. Decision Judgment Layer (Action Judge): Mengklasifikasikan kelanjutan (reasoning, action) ke dalam {CRITICAL, EXPLORATORY, NOISY}.
2. Task-State Contamination Detector: Mencegah propagasi asumsi halusinatif dan rencana usang ke dalam history h_t.
3. State Revision Module (M_SR): Menggantikan pasangan (r_t, a_t) noisy dengan pasangan terkalibrasi (tilde_r_t, tilde_a_t) secara zero-overhead.
4. Grounded Execution Bridge (EditAct Loop): Menghubungkan intervensi state editing langsung ke environment fisik tanpa simulasi observasi artifisial.
5. AEWM-RFT Trajectory Collector: Mengumpulkan pasangan rollout terverifikasi untuk Rejection Sampling Fine-Tuning.
"""

from dataclasses import dataclass, field
from enum import Enum
from typing import List, Dict, Any, Optional, Tuple, Callable
import json
import re

class DecisionEffect(str, Enum):
    CRITICAL = "critical"        # Keputusan krusial yang esensial bagi progres penyelesaian tugas
    EXPLORATORY = "exploratory"  # Eksplorasi sah untuk mengumpulkan bukti atau memvalidasi hipotesis
    NOISY = "noisy"              # Keputusan berulang, spekulatif tanpa bukti, atau rencana kadaluarsa (state contamination)

@dataclass
class Continuation:
    reasoning: str
    action: str
    arguments: Dict[str, Any] = field(default_factory=dict)
    metadata: Dict[str, Any] = field(default_factory=dict)

@dataclass
class StepRecord:
    step_idx: int
    reasoning: str
    action: str
    arguments: Dict[str, Any]
    observation: str
    decision_effect: Optional[DecisionEffect] = None
    was_edited: bool = False

class ActionJudge:
    """
    Action Judge M_AJ memprediksi efek keputusan hilir (downstream contribution)
    dari konteks pra-eksekusi s_t = h_t oplus (hat_r_t, hat_a_t).
    Dilatih pada mid-training 52B tokens + SFT terkalibrasi (Macro-F1 70.5%).
    """
    def __init__(self, model_endpoint: Optional[str] = None):
        self.model_endpoint = model_endpoint

    def judge(self, task_instruction: str, history: List[StepRecord], proposed: Continuation) -> DecisionEffect:
        # Evaluasi pola state contamination dan redundansi aksi
        recent_actions = [s.action for s in history[-3:]] if len(history) >= 3 else []
        
        # 1. Deteksi Loop dan Redundansi Tindakan Tanpa Progres Baru
        if proposed.action in recent_actions and proposed.action != "view_file":
            # Jika aksi sama diulang tanpa bukti observasi baru, tandai sebagai NOISY
            last_obs = history[-1].observation if history else ""
            if "error" in last_obs.lower() or "not found" in last_obs.lower():
                return DecisionEffect.NOISY

        # 2. Deteksi Asumsi Halusinatif Tanpa Dasar Bukti (Task-State Contamination)
        unsupported_markers = [
            "saya berasumsi file ini ada",
            "mungkin bug ini disebabkan oleh x tanpa membaca",
            "langsung ubah kode tanpa verifikasi test",
            "assume without inspecting",
            "skip testing because it should work"
        ]
        if any(marker in proposed.reasoning.lower() for marker in unsupported_markers):
            return DecisionEffect.NOISY

        # 3. Klasifikasi Aksi Kritis (Modifikasi file, commit, submission jawaban)
        critical_verbs = ["write_file", "patch", "git_commit", "submit_solution", "rm", "database_migration"]
        if any(v in proposed.action.lower() for v in critical_verbs):
            return DecisionEffect.CRITICAL

        # 4. Eksplorasi Sah (Pencarian kode, inspeksi log, uji coba CLI)
        return DecisionEffect.EXPLORATORY

class StateRevisionModule:
    """
    State Revision M_SR menggantikan kelanjutan noisy (hat_r_t, hat_a_t)
    dengan (tilde_r_t, tilde_a_t) yang mencari bukti empiris atau memulihkan rencana.
    """
    def __init__(self):
        pass

    def revise(self, task_instruction: str, history: List[StepRecord], noisy: Continuation) -> Continuation:
        last_step = history[-1] if history else None
        
        # Skenario 1: Terjebak kegagalan tool sebelumnya -> alihkan ke inspeksi log / trace
        if last_step and ("error" in last_step.observation.lower() or "failed" in last_step.observation.lower()):
            return Continuation(
                reasoning=(
                    f"Intervensi State Revision: Rencana sebelumnya gagal akibat '{last_step.observation[:80]}...'. "
                    f"Alih-alih mengulang asumsi, lakukan inspeksi struktur kode dan verifikasi dependensi secara deterministik."
                ),
                action="inspect_diagnostics",
                arguments={"target": "recent_failure", "scope": "full_trace"},
                metadata={"revised_from_noisy": True}
            )

        # Skenario 2: Asumsi spekulatif -> ubah menjadi aksi pencarian bukti
        return Continuation(
            reasoning=(
                "Intervensi State Revision: Mendeteksi asumsi spekulatif yang tidak didukung bukti empiris. "
                "Mengganti rencana dengan langkah verifikasi baca file sebelum melakukan modifikasi struktural."
            ),
            action="read_file_or_search",
            arguments={"query": task_instruction[:60], "verify_first": True},
            metadata={"revised_from_noisy": True}
        )

class EditActRuntime:
    """
    Siklus Inferensi EditAct:
    Memadukan penilaian state dan intervensi revisi langsung sebelum aksi dipancarkan ke lingkungan riil.
    """
    def __init__(self, action_judge: ActionJudge, state_revision: StateRevisionModule):
        self.action_judge = action_judge
        self.state_revision = state_revision
        self.history: List[StepRecord] = []

    def step(
        self,
        task_instruction: str,
        propose_fn: Callable[[str, List[StepRecord]], Continuation],
        execute_fn: Callable[[str, Dict[str, Any]], str]
    ) -> StepRecord:
        # Langkah 1: Agen dasar mengajukan (hat_r_t, hat_a_t)
        proposed = propose_fn(task_instruction, self.history)
        
        # Langkah 2: Action Judge mengevaluasi kelanjutan
        decision_label = self.action_judge.judge(task_instruction, self.history, proposed)
        
        # Langkah 3: Intervensi selektif jika NOISY
        was_edited = False
        if decision_label == DecisionEffect.NOISY:
            effective_continuation = self.state_revision.revise(task_instruction, self.history, proposed)
            was_edited = True
        else:
            effective_continuation = proposed

        # Langkah 4: Eksekusi aksi terpilih pada real environment E
        # Observasi riil o_t diperoleh dari dunia nyata, BUKAN disimulasikan oleh world model!
        observation = execute_fn(effective_continuation.action, effective_continuation.arguments)

        # Langkah 5: Simpan ke jejak interaksi h_{t+1} = h_t oplus (r_t, a_t, o_t)
        step_record = StepRecord(
            step_idx=len(self.history) + 1,
            reasoning=effective_continuation.reasoning,
            action=effective_continuation.action,
            arguments=effective_continuation.arguments,
            observation=observation,
            decision_effect=decision_label,
            was_edited=was_edited
        )
        self.history.append(step_record)
        return step_record

7. Kesimpulan: Pergeseran Paradigma Menuju State-Editing World Models

Riset AEWM (arXiv:2609.28416) menjadi penanda berakhirnya era simulasi observasi lingkungan yang tidak efisien dalam ekosistem agen AI. Dengan mengubah orientasi model dunia menjadi pengawas dan penyunting kualitas internal state, pengembang sistem otonom dapat menuntaskan problem mendasar task-state contamination tanpa harus membayar penalti latensi ganda.

Bagi praktisi rekayasa AI dan arsitek agen perusahaan, mengintegrasikan mekanisme Action Judge dan State Revision ke dalam runtime eksekusi merupakan rute tercepat untuk memangkas loop eksekusi yang macet, menghemat biaya komputasi inferensi, dan meningkatkan ketahanan agen dalam menyelesaikan tugas-tugas repositori perangkat lunak skala masif.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.