NS
NEWSAINT
ai-eng• 10 MIN READ•5 September 2026

Harness Engineering 2026: Anatomi Sumber Kode 11 Production Coding Agents, 7 Subsistem Kanonikal, dan Evaluasi Anti-Framework & Deterministic Retrieval

Analisis arsitektural empiris dari 4 juta baris kode pada 11 production coding harnesses (arXiv:2609.00006, September 2026): Claude Code, Codex CLI, Hermes, Gemini CLI, dan OpenHands. Membedah 7 subsistem kanonikal, kepunahan framework generik, determinisme ripgrep/AST atas vector DB, serta adopsi SKILL.md yang melampaui MCP.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Harness Engineering & Autonomous Coding Agents 2026

Dalam kurun waktu lima bulan pertama tahun 2026, istilah Harness Engineering telah bermutasi dari sekadar terminologi praktisi menjadi disiplin arsitektural paling fundamental dalam pengembangan kecerdasan buatan otonom. Model fondasi seperti Claude 3.7 Sonnet, GPT-5, ataupun Gemini 2.5 Pro hanyalah mesin kalkulasi probabilitas token; harness-lah yang mengubah inteligensi mentah tersebut menjadi rekayasawan perangkat lunak otonom yang mampu memodifikasi ribuan baris kode produksi secara aman dan deterministik.

Executive Architectural Summary & Empirical Foundation

Makalah ilmiah tengara "Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems" (arXiv:2609.00006, September 2026) oleh Paul Barbaste dkk. (Wavestone AI Lab & Inclusive Brains) menyajikan audit sumber kode komprehensif pertama terhadap 11 sistem produksi: Claude Code (Anthropic), Codex CLI (OpenAI, 1,1 juta baris Rust), Gemini CLI (Google), Mistral Vibe (Mistral), Hermes (Nous Research), OpenHands, Aider, Mini-SWE-Agent, Pi, OpenCode, dan OpenClaw, ditambah Omnigent (Databricks). Dari 4 juta baris kode yang diteliti, ditemukan konsensus mengejutkan: 0 dari 11 harness mengimpor framework generik (seperti LangChain atau CrewAI), 0 dari 11 harness menggunakan vector embeddings untuk kode repositori, dan adopsi spesifikasi format SKILL.md kini resmi mengungguli Model Context Protocol (MCP).

1. Definisi Formal & Paradoks "The Two Absences" (Zero Framework & Zero Vector DB)

Secara operasional, coding harness didefinisikan sebagai lapisan runtime yang membungkus model bahasa dan memungkinkannya berinteraksi secara otonom, terukur, dan aman terhadap repositori perangkat lunak nyata. Studi sumber kode lintas vendor ini menyingkap dua fakta empiris yang membongkar mitos arsitektur AI yang selama ini beredar di kalangan akademisi dan pemula:

Empirical Absence 1

Zero Agentic Frameworks

Dari 4 juta baris kode produksi, tidak ada satu pun runtime yang mengimpor LangChain, LangGraph, AutoGen, CrewAI, ataupun Semantic Kernel. Bahkan Gemini CLI tidak menggunakan framework kepemilikan Google sendiri. Seluruh sistem mengandalkan hand-rolled asynchronous state machines berbasis Tokio (Rust) atau Native Async Loops (TypeScript/Python) untuk memastikan latensi minimal, kendali penuh terhadap buffer context window, dan toleransi kegagalan deterministik.

Empirical Absence 2

Zero Vector Embeddings untuk Kode

Tidak ada satu pun coding agent produksi yang menggunakan vector databases (seperti Pinecone, Chroma, atau Weaviate) untuk mengambil potongan kode dari repositori. Alih-alih pencarian kemiripan kosinus (cosine similarity) yang sarat hallucination dan false positives, industri secara konsensus beralih 100% ke Deterministic Retrieval: ripgrep berlatensi sub-15ms, tree-sitter AST symbol extraction, path globbing, dan penemuan otomatis berkas konteks berbobot tinggi seperti AGENTS.md dan SKILL.md.

2. Dekomposisi 7 Subsistem Kanonikal Agent Harness

Studi Wavestone memetakan seluruh sistem ke dalam 7 subsistem kanonikal (D1–D7). Setiap subsistem memiliki spektrum implementasi dari yang paling minimalis (minimal observed form) hingga yang paling mutakhir (maximal observed form):

Subsistem Minimal Implementation Maximal Implementation Studi Kasus Dominan
D1: Agent Loop Mini-SWE-Agent: Linear while-loop (~100 baris) OpenHands: Event-sourced conversation engine Codex CLI: Tokio multi-phase async state machine
D2: LLM Integration Single LiteLLM abstraction call Hermes: 5 owned transports & 29 provider profiles Hermes Agent: Dynamic reasoning effort overrides & tiered streaming
D3: Tools & Actions Mini-SWE-Agent: 1 tool tunggal (bash) OpenClaw: 109+ tools via remote gateway Codex CLI: Embedded V8 JavaScript runtime tool composition
D4: Memory & Context Unbounded linear message history Codex CLI: Agent-maintained persistent pipeline Agen merawat direktori memories/ secara mandiri lintas sesi
D5: Safety & Sandbox Batas biaya (token cost) & step limits Codex CLI: 4-Layer Security Stack Starlark rules + Hooks + Guardian LLM + Native OS Sandbox
D6: Orchestration Aider: Deliberate absence (fokus single-agent) Claude Code: Recursive subagent delegation Omnigent: Meta-harness orchestration lintas runtime CLI
D7: Extensibility Structural static typing interfaces Pi: Everything-is-an-extension runtime SKILL.md (adopsi 9/11) melampaui Model Context Protocol / MCP (8/11)

3. Deep Dive Arsitektural: Embedded V8 pada Codex CLI & Four-Layer Safety Stack

Salah satu temuan paling mengejutkan dalam pembedahan kode Codex CLI (1,1 juta baris Rust) adalah bagaimana OpenAI menangani eksekusi perkakas (tool invocation). Berbeda dengan mayoritas agen yang melakukan fungsi pemanggilan berjenis typed dispatch langsung di Rust, Codex membundel seluruh invokasi alat sebagai blok kode JavaScript dan mengeksekusinya di dalam mesin embedded V8 engine.

Arsitektur ini memberikan kapabilitas dynamic tool composition tingkat tinggi: sebuah alat dapat secara kondisional mendelegasikan tugas ke alat lain di level JavaScript sebelum mengembalikan hasil agregat ke harness Rust, memangkas overhead round-trip serialisasi antarsistem.

Anatomi Four-Layer Safety Stack pada Autonomous Agent Modern

Layer 1: Starlark Execution Policy Menggunakan bahasa deklaratif deterministik Starlark (turunan Python) alih-alih file TOML/YAML statis. Kebijakan ini mampu mengevaluasi ekspresi kondisional, perulangan, dan validasi argumen berbahaya secara terisolasi sebelum proses disentuh.
Layer 2: Lifecycle Hooks (PreToolUse / PostToolUse / Interrupt) Event interceptors deterministik yang memvalidasi integritas state. Jika ada perintah yang melanggar batas otorisasi repositori, lifecycle hook memutus alur eksekusi sebelum payload mencapai terminal host.
Layer 3: Guardian (LLM Reviewer Model) Model sekunder berlatensi rendah yang bertindak sebagai auditor independen untuk meninjau perintah yang diklasifikasikan sebagai high-risk (misalnya eksekusi skrip migrasi database atau force push remote).
Layer 4: Native OS Sandbox Architecture Isolasi fisik multi-platform yang memanfaatkan Apple Seatbelt di macOS, Landlock & Linux cgroups/namespaces di Linux, dan Job Objects terisolasi di Windows. Memastikan bahwa proses rogue tidak dapat membaca keychain, file ~/.ssh, atau token cloud host.

4. Konvergensi Industri: Dari Standarisasi Hooks Hingga Dominasi SKILL.md atas MCP

Analisis longitudinal selama 90 hari (April hingga Juli 2026) mengungkapkan dinamika persaingan yang berubah menjadi peniruan langsung (convergence becoming imitation) di antara para pengembang harness tier-1:

  • Standardisasi Hook Vocabulary: Codex CLI mengadopsi struktur penamaan lifecycle hook milik Claude Code kata-demi-kata (seperti PreToolUse, PostToolUse, Interrupt) dan bahkan merilis utilitas importir untuk file konfigurasi sesi Claude Code.
  • SKILL.md Memimpin Adopsi Industri (9/11 vs 8/11 MCP): Meskipun Anthropic gencar mempromosikan Model Context Protocol (MCP) dengan transport RPC JSON yang lebih berat, format deklaratif Markdown berbasis SKILL.md kini diadopsi oleh 9 dari 11 harness. Alasan utamanya adalah portabilitas zero-dependency: model bahasa mampu membaca, memvalidasi aturan, dan mengeksekusi referensi dokumen teks biasa tanpa overhead proses server background terpisah.
  • Agent-Maintained Persistent Memory Index: Alih-alih mengandalkan context compaction heuristik otomatis yang sering membuang detail penting, harness modern mempercayakan perawatan memori ke agen itu sendiri. Agen secara eksplisit menulis file catatan di direktori memories/ yang bertindak sebagai indeks retrival aktif saat sesi di-resume.

5. Spesifikasi TypeScript: Arsitektur Modular Coding Agent Harness

Berikut adalah spesifikasi arsitektur TypeScript berstandar produksi yang mengimplementasikan 7 subsistem kanonikal tanpa ketergantungan pada framework eksternal, dilengkapi sandboxing berlapis dan pencarian deterministik:

typescript / canonical-harness-kernel.ts PRODUCTION HARNESS CORE
${HARNESS_ENGINEERING_CODE_SNIPPET}

6. Panduan Praktis Rekayasa Sistem untuk Tim Pengembang AI 2026

Berdasarkan 18 rekomendasi desain yang disarikan dari audit sumber kode 4 juta baris tersebut, tim engineering modern wajib memegang 4 prinsip utama saat merancang autonomous coding pipeline:

  1. Hindari Framework Bloat: Jangan gunakan LangChain atau CrewAI untuk tugas pengkodean berlatensi kritis. Bangun loop asynchronous minimal yang memberikan visibilitas langsung terhadap antrean event dan konteks token.
  2. Terapkan Sandboxing Bertingkat (Defense-in-Depth): Jangan pernah hanya mengandalkan system prompt instruction untuk mencegah perintah destruktif. Pisahkan aturan Starlark, event hooks, dan isolasi native OS container.
  3. Gunakan Ripgrep & AST Parser: Singkirkan infrastruktur vector database untuk kode sumber. Kecepatan dan determinisme ripgrep mengeliminasi kesalahan grounding pada repositori skala besar.
  4. Pilih Standar SKILL.md untuk Ekstensibilitas Agen: Manfaatkan format Markdown terstruktur untuk mendefinisikan SOP, dependensi tools, dan workflow agar agen Anda dapat dipindahkan lintas harness tanpa vendor lock-in.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.