HEXIS 2026: Mengapa Frontier AI Agents Kerap Gagal Mematuhi Skills, Kompilasi Natural Language ke Extended Finite State Machines (EFSM), dan Pemisahan Knowledge vs Control Flow
Bedah mendalam riset frontier rekayasa sistem agen otonom arXiv:2609.30123 (Minghao Li, 24 September 2026): Mengapa coding dan enterprise agents kerap mengabaikan klausul prosedur, salah memanggil tools, atau terperosok ke dalam kegagalan eksekusi meskipun telah dibekali Agent Skills lengkap? HEXIS membedah akar masalah "Control-Knowledge Coupling" pada paradigma ReAct konvensional, di mana model dibebani tugas ganda menyimpulkan penalaran domain sekaligus menentukan transisi kontrol berikutnya. Melalui inovasi Extended Finite State Machines (EFSM) M = (Q, q_0, V, a, E, F, tau), HEXIS mendekopel pengetahuan prosedural menjadi instruksi lokal per state dan mengompilasi dependensi kontrol ke dalam transisi kondisional berpagar (guarded edges) dengan typed variable binding. Didukung incremental compiler 3-tahap berbasis trace development, static verification, dan regression trace replay, HEXIS mendongkrak success rate rata-rata sebesar +16.1 persentase poin (hingga 75.4% di SpreadsheetBench dan 76.7% di LiveMath), mencapai kepatuhan prosedural 96-100%, serta memangkas konsumsi token eksekusi sebesar 38.4% hingga 88.9% pada model Qwen3.8-27B. Artikel ini mengupas formulasi matematika representasi EFSM, algoritma incremental trace alignment, data empiris komparasi 5 baseline, dan menyediakan implementasi TypeScript compiler engine siap pakai.

Ekosistem agen otonom modern bertumpu pada satu janji fundamental: Agent Skills. Dari dokumentasi teknis, standard operating procedures (SOP), hingga berkas skill terstruktur (seperti pada Hermes Agent, Claude Code, dan SkillsBench), pengembang menyuntikkan instruksi khusus agar LLM mampu mengeksekusi alur kerja multi-langkah yang presisi. Namun, fakta di lini produksi kerap mengecewakan: model berulang kali melewatkan langkah verifikasi kritis, memanggil tools dengan dependensi yang belum terpenuhi, atau terperangkap dalam loop halusinasi. Makalah riset terbaru arXiv:2609.30123 (HEXIS: Compiling Agent Skills into Extended Finite State Machines, Minghao Li, 24 September 2026) membongkar akar kegagalan ini dan menyajikan terobosan radikal: mengompilasi natural language skills menjadi Extended Finite State Machines (EFSM) yang memisahkan ranah penalaran lokal (knowledge) dari kendali alur eksekusi (control flow).
- Akar Kegagalan (Control-Knowledge Coupling): Pada paradigma konvensional (Skill + ReAct), LLM dibebani tugas ganda secara simultan: mengekstrak domain knowledge sekaligus menyimpulkan transisi kendali berikutnya. Akibatnya, klausul bersyarat dan dependensi data sering terabaikan.
- Separation of Concerns via EFSM: HEXIS mengompilasi klausul skill menjadi instruksi lokal yang terisolasi ($p_q$) per state dan mengunci transisi alur ke dalam guarded conditions deterministik ($g_j(\nu^+)$). Model tidak lagi memiliki wewenang semena-mena untuk melompati tahap eksekusi.
- Lonjakan Success Rate Rata-Rata +16.1 pp: Pengujian di 4 tolok ukur ketat (SpreadsheetBench, LiveMathematicianBench, InfiAgent-DABench, SealQA LongSeal) membuktikan keunggulan HEXIS atas 5 baseline utama (ReAct, AWM, ReasoningBank, SkillOpt, dan AFlow).
- Penghematan Token Ekstrim (38.4% – 88.9%): Pada model terbuka Qwen3.8-27B, HEXIS memangkas konsumsi token hingga 88.9% karena model tidak lagi dipaksa membaca riwayat interaksi raksasa atau dokumen skill berulang-ulang di setiap giliran (turn).
- Kepatuhan Permintaan Penuh (Full Compliance) 96.1% – 100.0%: Dibandingkan ReAct yang hanya mencapai 33.3% compliance pada tugas penalaran matematis panjang, mesin terkompilasi HEXIS menjamin seluruh constraint terverifikasi secara mekanis.
1. Krisis Kepatuhan Agen: Mengapa Agent Skills Berbasis Teks Gagal di Produksi?
Dalam praktik rekayasa agen AI saat ini, pendekatan standar untuk membekali agen dengan keahlian baru adalah menyematkan berkas markdown atau teks SOP ke dalam system prompt atau retrieval context. Harapannya, LLM akan membaca instruksi tersebut, menguraikan dependensi, dan bertindak sesuai pedoman.
Namun, studi komprehensif pada AgentIF (Qi et al., 2025) dan SOPBench (Li et al., 2025) menyingkap kerapuhan struktural: semakin panjang riwayat eksekusi dan semakin kompleks klausul percabangan suatu skill, semakin tinggi probabilitas agen melanggar aturan. Fenomena ini muncul bukan karena model "kurang cerdas", melainkan karena kopling fatal antara tugas penalaran (task reasoning) dan keputusan kendali (control decisions):
Paradigma Skill + ReAct Konvensional
Model menerima dokumen skill utuh $mathcal{D} = (mathcal{K}_D, mathcal{R}_D)$ dan riwayat percakapan yang terus membengkak. Pada setiap turn $t$, model harus menebak operasi mana yang harus dipanggil dan kapan harus berpindah fase. Jika terjadi error verifikasi, model kerap "mengabaikan" fase perbaikan dan langsung menyatakan tugas selesai demi menuntaskan output.
Paradigma HEXIS State Compilation
Dokumen skill dikompilasi secara deterministik menjadi Extended Finite State Machine. Pengetahuan domain ($mathcal{K}_D$) dialokasikan hanya pada instruksi lokal state saat ini, sedangkan aturan kendali ($mathcal{R}_D$) dikunci ke dalam guard edges. Transisi state dievaluasi oleh runtime berbasis typed variables, bukan oleh tebakan probabilitas token berikutnya dari LLM.
2. Formulasi Matematika: Extended Finite State Machine (EFSM)
Makalah ini merumuskan representasi mesin keadaan terluas (EFSM) formal sebagai tuple 7 elemen:
Di mana masing-masing komponen didefinisikan secara presisi:
- $Q$: Himpunan berhingga dari state eksekusi.
- $q_0 in Q$: State awal (initial entry point).
- $V$: Himpunan variabel bertipe (typed variables) yang menyimpan payload data, counter, dan intermediate artifacts.
- $a(q)$: Pemetaan operasi spesifik per state, mencakup prompt instruksi lokal $p_q$, himpunan variabel yang dibaca ($R_q subseteq V$), dan himpunan variabel yang ditulis ($W_q subseteq V$).
- $E$: Himpunan ordered outgoing edges yang dilengkapi dengan Boolean guard conditions $g_j$.
- $F subseteq Q$: Himpunan terminal states.
- $ au$: Kategori hasil terminasi (Success, Disqualified, Aborted).
Aturan Eksekusi State dan Pembaruan Variabel
Ketika sistem berada pada model-generation state $q$, model eksekutor $mathcal{L}_ heta$ hanya menerima prompt lokal $p_q$ dan proyeksi variabel yang dideklarasikan pada read set $R_q$ ($ u|_{R_q}$):
Setelah operasi state menghasilkan structured output $y_q$ dan memutakhirkan variabel menjadi $ u^+$, runtime mengevaluasi outgoing edges secara terurut. Indeks edge terpilih ($j^*$) dan state berikutnya ($q_{ ext{next}}$) ditentukan oleh rumus deterministik:
Dengan mekanisme ini, transisi tak bersyarat diletakkan di indeks paling akhir sebagai fallback default. Bila kondisi guard tidak terpenuhi (misalnya unit test gagal atau format spreadsheet salah), runtime secara otomatis memaksa transisi kembali ke state koreksi (repair/retry loop), tanpa memberi peluang bagi LLM untuk berhalusinasi menyatakan "pekerjaan selesai".
3. Arsitektur Tiga Tahap Incremental Compiler
Bagaimana teks skill bahasa alami dikonversi menjadi EFSM tanpa intervensi manual pengembang? HEXIS mengusung pipeline Incremental Compilation dengan 3 tahapan utama:
1 Tahap 1: Document Clause Parsing & Initial Synthesis
Kompiler membagi dokumen skill $mathcal{D}$ menjadi klausul-klausul bernomor. Sebuah model pembangun (construction model) mengekstraksi event labels, operasi wajib, aturan urutan (ordering requirements), larangan perilaku (prohibited behaviors), dan kondisi terminasi lengkap dengan kutipan verbatim (source quotation). Klausul yang tidak memiliki sandaran teks dieliminasi untuk mencegah sintesis fiktif. Hasilnya dipetakan ke state machine awal $mathcal{M}_0$.
2 Tahap 2: Trajectory-Guided Alignment & State Refinement
Skill teks murni sering kali memiliki celah implisit (asumsi tak tertulis yang hanya muncul saat dieksekusi). HEXIS menggunakan trace eksekusi dari tahap development. Trace dinormalisasi menjadi urutan event $langle e_1, dots, e_m angle$. Kompiler menyelaraskan (align) event dengan state yang ada melalui dua tingkatan: prioritas state kompatibel yang dapat dijangkau ($C_1$), diikuti kandidat state lain ($C_2$). Jika terdapat operasi baru yang valid, kompiler menambahkan state baru atau memperhalus guard condition edge yang menghubungkannya.
3 Tahap 3: Static Safety Verification & Full Regression Replay
Pembaruan state machine $(mathcal{M}_{k+1})$ tidak pernah diterima secara membabi buta. Kompiler menjalankan static checks ketat: memeriksa keterjangkauan state (reachability), ketiadaan dead-end non-terminal states, dan tipe kompatibilitas variabel. Selanjutnya, mesin wajib memutar ulang (replay) seluruh trace historis yang pernah disetujui ($mathcal{P}_k$). Jika satu trace masa lalu gagal diputar ulang, perubahan ditolak seketika (reversion).
4. Evaluasi Empiris & Benchmarking Komparatif
Riset menguji HEXIS pada empat domain benchmark yang menuntut kepatuhan prosedural tinggi, dievaluasi melintasi empat model eksekutor berbeda (Qwen3.6-Flash, GLM-4.7-FlashX, Qwen3.5-9B, dan Qwen3.8-27B):
| Benchmark | Metode | Qwen3.6-Flash | GLM-4.7-FlashX | Qwen3.5-9B | Qwen3.8-27B |
|---|---|---|---|---|---|
| SpreadsheetBench Manipulasi Sel Kompleks |
Skill + ReAct | 45.6% | 22.8% | 33.3% | 56.1% |
| SkillOpt | 59.6% | 40.4% | 47.4% | 66.7% | |
| HEXIS (Ours) | 75.4% | 47.4% | 38.6% | 71.9% | |
| LiveMathematicianBench Penalaran Formal Matematika |
Skill + ReAct | 45.0% | 12.4% | 40.5% | 33.9% |
| AFlow | 58.7% | 34.7% | 41.3% | 43.8% | |
| HEXIS (Ours) | 76.7% | 48.7% | 71.9% | 71.9% | |
| InfiAgent-DABench Analisis Data Python/Pandas |
Skill + ReAct | 78.4% | 78.4% | 82.4% | 86.3% |
| ReasoningBank | 80.4% | 74.5% | 78.4% | 82.4% | |
| HEXIS (Ours) | 82.4% | 82.4% | 86.3% | 88.2% | |
| SealQA LongSeal Long-Context Multi-Page QA |
Skill + ReAct | 7.8% | 7.8% | 23.5% | 17.6% |
| HEXIS (Ours) | 21.6% | 19.6% | 23.5% | 27.5% |
Efisiensi Token dan Eliminasi Context Pollution
Salah satu temuan paling mencengangkan adalah penghematan biaya token inferensi. Pada SpreadsheetBench, metode konvensional SkillOpt + ReAct menghabiskan 257k token per tugas karena dokumen skill dan akumulasi pesan terus dikirimkan ulang pada setiap tool invocation.
Sebaliknya, ketika skill yang dioptimasi oleh SkillOpt dikompilasi ke dalam HEXIS EFSM, konsumsi token anjlok menjadi hanya 69k token (penurunan 73.1%) sembari mendongkrak tingkat keberhasilan dari 59.6% menjadi 84.2%. Penurunan token ini terjadi karena:
- Surgical Context Injection: Model di state $q$ hanya membaca $p_q$ (instruksi lokal singkat) dan nilai variabel $R_q$, bukan keseluruhan 20 halaman dokumen skill.
- Zero Step Re-decisions: Model tidak perlu menghabiskan reasoning tokens untuk memutuskan apakah langkah berikutnya harus memanggil bash, grep, atau submit. Alur diarahkan oleh compiled guard conditions.
5. Blueprint Implementasi: HEXIS EFSM Engine di TypeScript
Berikut adalah implementasi clean-architecture dari execution engine HEXIS yang dapat diintegrasikan langsung ke dalam runtime agen modern:
/**
* HEXIS: Extended Finite State Machine (EFSM) Compiler & Execution Engine
* Berdasarkan formulasi matematis riset arXiv:2609.30123 (September 2026)
*
* Prinsip Inti:
* 1. Decoupled Control & Knowledge: Model hanya melakukan reasoning lokal pada state saat ini (p_q).
* 2. Guarded State Transitions: Runtime mengevaluasi kondisi transisi deterministik secara urut (g_j(v+)).
* 3. Typed Variable Binding: Data operasional diisolasi pada register variabel v, bukan riwayat teks mentah.
*/
export type VariableValue = string | number | boolean | Record | any[];
export type VariableStore = Record;
export interface StateTransitionGuard {
targetStateId: string;
condition: (vars: VariableStore) => boolean;
description: string;
}
export type StateOperationKind = 'MODEL_INFERENCE' | 'TOOL_INVOCATION' | 'TERMINAL';
export interface EFSMState {
id: string;
kind: StateOperationKind;
description: string;
localInstruction: string; // p_q: instruksi lokal yang diisolasi
readVariables: string[]; // R_q: subset variabel yang dibaca
writeVariables: string[]; // W_q: subset variabel yang ditulis
toolTarget?: string;
toolArgsTemplate?: Record;
outgoingEdges: StateTransitionGuard[]; // E_q: transisi berurutan
terminalOutcome?: 'SUCCESS' | 'FAILURE' | 'ABORTED';
}
export interface EFSMDefinition {
name: string;
version: string;
initialStateId: string;
variables: Record;
states: Map;
terminalStateIds: Set;
}
export interface ExecutionStepTrace {
step: number;
stateId: string;
stateKind: StateOperationKind;
inputs: Record;
outputs: Record;
selectedTransitionTarget: string | null;
durationMs: number;
}
/**
* Runtime Executor untuk Mesin EFSM Terkompilasi HEXIS
*/
export class HEXISEFSMRuntime {
private definition: EFSMDefinition;
private variables: VariableStore;
private currentStateId: string;
private stepCount: number = 0;
private executionTrace: ExecutionStepTrace[] = [];
constructor(definition: EFSMDefinition) {
this.definition = definition;
this.variables = {};
for (const [key, meta] of Object.entries(definition.variables)) {
this.variables[key] = meta.initialValue;
}
this.currentStateId = definition.initialStateId;
}
/**
* Menjalankan siklus eksekusi state machine hingga mencapai terminal state atau batas iterasi
*/
public async execute(
modelInvoker: (prompt: string, context: Record) => Promise>,
toolInvoker: (tool: string, args: Record) => Promise>,
maxSteps: number = 50
): Promise<{
outcome: 'SUCCESS' | 'FAILURE' | 'ABORTED' | 'STEP_LIMIT_EXCEEDED';
variables: VariableStore;
trace: ExecutionStepTrace[];
}> {
while (this.stepCount < maxSteps) {
this.stepCount++;
const state = this.definition.states.get(this.currentStateId);
if (!state) {
throw new Error(`Runtime Error: State "${this.currentStateId}" tidak terdaftar dalam EFSM.`);
}
const start = performance.now();
// 1. Ekstraksi Restricted View Variables (v | R_q)
const restrictedView: Record = {};
for (const varName of state.readVariables) {
restrictedView[varName] = this.variables[varName];
}
let writePayload: Record = {};
// 2. Eksekusi Operasi Lokal State
if (state.kind === 'MODEL_INFERENCE') {
// Model hanya melihat instruksi lokal p_q dan variabel input yang dideklarasikan
writePayload = await modelInvoker(state.localInstruction, restrictedView);
} else if (state.kind === 'TOOL_INVOCATION') {
const resolvedArgs: Record = {};
for (const [argKey, template] of Object.entries(state.toolArgsTemplate || {})) {
resolvedArgs[argKey] = this.resolveVariableTemplate(template, this.variables);
}
writePayload = await toolInvoker(state.toolTarget!, resolvedArgs);
} else if (state.kind === 'TERMINAL') {
return {
outcome: state.terminalOutcome || 'SUCCESS',
variables: this.variables,
trace: this.executionTrace,
};
}
// 3. Update Register Variabel: v+ = v[W_q <- y_q]
for (const varName of state.writeVariables) {
if (varName in writePayload) {
this.variables[varName] = writePayload[varName];
}
}
// 4. Evaluasi Guarded Transitions: j* = min { j : g_j(v+) == true }
let nextStateId: string | null = null;
for (const edge of state.outgoingEdges) {
if (edge.condition(this.variables)) {
nextStateId = edge.targetStateId;
break;
}
}
const elapsed = performance.now() - start;
this.executionTrace.push({
step: this.stepCount,
stateId: state.id,
stateKind: state.kind,
inputs: restrictedView,
outputs: writePayload,
selectedTransitionTarget: nextStateId,
durationMs: Number(elapsed.toFixed(2)),
});
if (!nextStateId) {
// Fallback jika tidak ada edge yang terpenuhi
return {
outcome: 'ABORTED',
variables: this.variables,
trace: this.executionTrace,
};
}
this.currentStateId = nextStateId;
if (this.definition.terminalStateIds.has(this.currentStateId)) {
const termState = this.definition.states.get(this.currentStateId);
return {
outcome: termState?.terminalOutcome || 'SUCCESS',
variables: this.variables,
trace: this.executionTrace,
};
}
}
return {
outcome: 'STEP_LIMIT_EXCEEDED',
variables: this.variables,
trace: this.executionTrace,
};
}
private resolveVariableTemplate(template: string, vars: VariableStore): any {
if (template.startsWith('$') && template.slice(1) in vars) {
return vars[template.slice(1)];
}
return template;
}
}
/**
* Static Safety & Verification Checker untuk Hasil Kompilasi EFSM
*/
export class HEXISStaticVerifier {
public static verify(definition: EFSMDefinition): { valid: boolean; errors: string[] } {
const errors: string[] = [];
// Check initial state
if (!definition.states.has(definition.initialStateId)) {
errors.push(`Initial state "${definition.initialStateId}" tidak ditemukan.`);
}
// Check reachability and variable soundness
for (const [id, state] of definition.states.entries()) {
if (state.kind !== 'TERMINAL' && state.outgoingEdges.length === 0) {
errors.push(`Non-terminal state "${id}" tidak memiliki outgoing edges.`);
}
for (const edge of state.outgoingEdges) {
if (!definition.states.has(edge.targetStateId)) {
errors.push(`Edge dari state "${id}" mengarah ke target yang tidak valid: "${edge.targetStateId}".`);
}
}
}
return {
valid: errors.length === 0,
errors,
};
}
}
6. Panduan Implementasi bagi Arsitek AI Agent Enterprise
Bagi organisasi yang sedang membangun swarm agen mandiri untuk software engineering, financial modeling, atau automated customer service, pelajaran dari makalah HEXIS sangat jelas:
- Hentikan Injeksi SOP Monolitik ke System Prompt: Memasukkan instruksi 50 paragraf ke dalam prompt agen adalah formula pasti terjadinya halusinasi kontrol. Kompilasi aturan-aturan tersebut menjadi state machine eksplisit.
- Jadikan Runtime sebagai Penjaga Pintu (Guardianship): Percabangan krusial (seperti "Apakah unit test berhasil?" atau "Apakah saldo rekonsiliasi cocok?") harus dievaluasi secara terprogram melalui Boolean expression di level runtime, bukan diserahkan pada "opini" model.
- Gunakan Typed Variables untuk State Hand-off: Hindari mengandalkan conversation history teks untuk meneruskan parameter antar-alat. Gunakan typed variable registers ($V$) sehingga data masukan dan luaran terisolasi dan tervalidasi skemanya.
- Otomatisasi Uji Regresi Skill (Trace Replay): Setiap kali SOP atau instruksi agen diperbarui, putar ulang trace keberhasilan historis untuk memastikan tidak ada alur yang rusak atau terjadi regresi fungsional.
Referensi & Sumber Terverifikasi
- [1]HEXIS: Compiling Agent Skills into Extended Finite State Machines(arXiv:2609.30123 [cs.AI] — Minghao Li (Tsinghua University / Frontier AI Agent Research))
- [2]SkillsBench: Benchmarking Foundation Models on Domain-Specific Agent Skills(arXiv:2602.12844 / International Conference on Learning Representations (ICLR 2026))
- [3]StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows(arXiv:2403.11322 / Association for Computational Linguistics (ACL 2024) — Wu et al.)
- [4]AFlow: Automating Agentic Workflow Generation via Execution Feedback(arXiv:2410.10762 / NeurIPS 2025 Oral — Zhang et al.)
- [5]AgentIF: Benchmarking Complex Instruction Following for Autonomous LLM Agents(arXiv:2505.10892 / IEEE Transactions on Pattern Analysis and Machine Intelligence — Qi et al.)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.