Harness Engineering 2026: Anatomi Sumber Kode 11 Production Coding Agents, 7 Subsistem Kanonikal, dan Evaluasi Anti-Framework & Deterministic Retrieval
Analisis arsitektural empiris dari 4 juta baris kode pada 11 production coding harnesses (arXiv:2609.00006, September 2026): Claude Code, Codex CLI, Hermes, Gemini CLI, dan OpenHands. Membedah 7 subsistem kanonikal, kepunahan framework generik, determinisme ripgrep/AST atas vector DB, serta adopsi SKILL.md yang melampaui MCP.

Dalam kurun waktu lima bulan pertama tahun 2026, istilah Harness Engineering telah bermutasi dari sekadar terminologi praktisi menjadi disiplin arsitektural paling fundamental dalam pengembangan kecerdasan buatan otonom. Model fondasi seperti Claude 3.7 Sonnet, GPT-5, ataupun Gemini 2.5 Pro hanyalah mesin kalkulasi probabilitas token; harness-lah yang mengubah inteligensi mentah tersebut menjadi rekayasawan perangkat lunak otonom yang mampu memodifikasi ribuan baris kode produksi secara aman dan deterministik.
Executive Architectural Summary & Empirical Foundation
Makalah ilmiah tengara "Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems" (arXiv:2609.00006, September 2026) oleh Paul Barbaste dkk. (Wavestone AI Lab & Inclusive Brains) menyajikan audit sumber kode komprehensif pertama terhadap 11 sistem produksi: Claude Code (Anthropic), Codex CLI (OpenAI, 1,1 juta baris Rust), Gemini CLI (Google), Mistral Vibe (Mistral), Hermes (Nous Research), OpenHands, Aider, Mini-SWE-Agent, Pi, OpenCode, dan OpenClaw, ditambah Omnigent (Databricks). Dari 4 juta baris kode yang diteliti, ditemukan konsensus mengejutkan: 0 dari 11 harness mengimpor framework generik (seperti LangChain atau CrewAI), 0 dari 11 harness menggunakan vector embeddings untuk kode repositori, dan adopsi spesifikasi format SKILL.md kini resmi mengungguli Model Context Protocol (MCP).
1. Definisi Formal & Paradoks "The Two Absences" (Zero Framework & Zero Vector DB)
Secara operasional, coding harness didefinisikan sebagai lapisan runtime yang membungkus model bahasa dan memungkinkannya berinteraksi secara otonom, terukur, dan aman terhadap repositori perangkat lunak nyata. Studi sumber kode lintas vendor ini menyingkap dua fakta empiris yang membongkar mitos arsitektur AI yang selama ini beredar di kalangan akademisi dan pemula:
Zero Agentic Frameworks
Dari 4 juta baris kode produksi, tidak ada satu pun runtime yang mengimpor LangChain, LangGraph, AutoGen, CrewAI, ataupun Semantic Kernel. Bahkan Gemini CLI tidak menggunakan framework kepemilikan Google sendiri. Seluruh sistem mengandalkan hand-rolled asynchronous state machines berbasis Tokio (Rust) atau Native Async Loops (TypeScript/Python) untuk memastikan latensi minimal, kendali penuh terhadap buffer context window, dan toleransi kegagalan deterministik.
Zero Vector Embeddings untuk Kode
Tidak ada satu pun coding agent produksi yang menggunakan vector databases (seperti Pinecone, Chroma, atau Weaviate) untuk mengambil potongan kode dari repositori. Alih-alih pencarian kemiripan kosinus (cosine similarity) yang sarat hallucination dan false positives, industri secara konsensus beralih 100% ke Deterministic Retrieval: ripgrep berlatensi sub-15ms, tree-sitter AST symbol extraction, path globbing, dan penemuan otomatis berkas konteks berbobot tinggi seperti AGENTS.md dan SKILL.md.
2. Dekomposisi 7 Subsistem Kanonikal Agent Harness
Studi Wavestone memetakan seluruh sistem ke dalam 7 subsistem kanonikal (D1–D7). Setiap subsistem memiliki spektrum implementasi dari yang paling minimalis (minimal observed form) hingga yang paling mutakhir (maximal observed form):
| Subsistem | Minimal Implementation | Maximal Implementation | Studi Kasus Dominan |
|---|---|---|---|
| D1: Agent Loop | Mini-SWE-Agent: Linear while-loop (~100 baris) | OpenHands: Event-sourced conversation engine | Codex CLI: Tokio multi-phase async state machine |
| D2: LLM Integration | Single LiteLLM abstraction call | Hermes: 5 owned transports & 29 provider profiles | Hermes Agent: Dynamic reasoning effort overrides & tiered streaming |
| D3: Tools & Actions | Mini-SWE-Agent: 1 tool tunggal (bash) | OpenClaw: 109+ tools via remote gateway | Codex CLI: Embedded V8 JavaScript runtime tool composition |
| D4: Memory & Context | Unbounded linear message history | Codex CLI: Agent-maintained persistent pipeline | Agen merawat direktori memories/ secara mandiri lintas sesi |
| D5: Safety & Sandbox | Batas biaya (token cost) & step limits | Codex CLI: 4-Layer Security Stack | Starlark rules + Hooks + Guardian LLM + Native OS Sandbox |
| D6: Orchestration | Aider: Deliberate absence (fokus single-agent) | Claude Code: Recursive subagent delegation | Omnigent: Meta-harness orchestration lintas runtime CLI |
| D7: Extensibility | Structural static typing interfaces | Pi: Everything-is-an-extension runtime | SKILL.md (adopsi 9/11) melampaui Model Context Protocol / MCP (8/11) |
3. Deep Dive Arsitektural: Embedded V8 pada Codex CLI & Four-Layer Safety Stack
Salah satu temuan paling mengejutkan dalam pembedahan kode Codex CLI (1,1 juta baris Rust) adalah bagaimana OpenAI menangani eksekusi perkakas (tool invocation). Berbeda dengan mayoritas agen yang melakukan fungsi pemanggilan berjenis typed dispatch langsung di Rust, Codex membundel seluruh invokasi alat sebagai blok kode JavaScript dan mengeksekusinya di dalam mesin embedded V8 engine.
Arsitektur ini memberikan kapabilitas dynamic tool composition tingkat tinggi: sebuah alat dapat secara kondisional mendelegasikan tugas ke alat lain di level JavaScript sebelum mengembalikan hasil agregat ke harness Rust, memangkas overhead round-trip serialisasi antarsistem.
Anatomi Four-Layer Safety Stack pada Autonomous Agent Modern
~/.ssh, atau token cloud host.
4. Konvergensi Industri: Dari Standarisasi Hooks Hingga Dominasi SKILL.md atas MCP
Analisis longitudinal selama 90 hari (April hingga Juli 2026) mengungkapkan dinamika persaingan yang berubah menjadi peniruan langsung (convergence becoming imitation) di antara para pengembang harness tier-1:
-
Standardisasi Hook Vocabulary: Codex CLI mengadopsi struktur penamaan lifecycle hook milik Claude Code kata-demi-kata (seperti
PreToolUse,PostToolUse,Interrupt) dan bahkan merilis utilitas importir untuk file konfigurasi sesi Claude Code. -
SKILL.md Memimpin Adopsi Industri (9/11 vs 8/11 MCP): Meskipun Anthropic gencar mempromosikan Model Context Protocol (MCP) dengan transport RPC JSON yang lebih berat, format deklaratif Markdown berbasis SKILL.md kini diadopsi oleh 9 dari 11 harness. Alasan utamanya adalah portabilitas zero-dependency: model bahasa mampu membaca, memvalidasi aturan, dan mengeksekusi referensi dokumen teks biasa tanpa overhead proses server background terpisah.
-
Agent-Maintained Persistent Memory Index: Alih-alih mengandalkan context compaction heuristik otomatis yang sering membuang detail penting, harness modern mempercayakan perawatan memori ke agen itu sendiri. Agen secara eksplisit menulis file catatan di direktori
memories/yang bertindak sebagai indeks retrival aktif saat sesi di-resume.
5. Spesifikasi TypeScript: Arsitektur Modular Coding Agent Harness
Berikut adalah spesifikasi arsitektur TypeScript berstandar produksi yang mengimplementasikan 7 subsistem kanonikal tanpa ketergantungan pada framework eksternal, dilengkapi sandboxing berlapis dan pencarian deterministik:
${HARNESS_ENGINEERING_CODE_SNIPPET}
6. Panduan Praktis Rekayasa Sistem untuk Tim Pengembang AI 2026
Berdasarkan 18 rekomendasi desain yang disarikan dari audit sumber kode 4 juta baris tersebut, tim engineering modern wajib memegang 4 prinsip utama saat merancang autonomous coding pipeline:
- Hindari Framework Bloat: Jangan gunakan LangChain atau CrewAI untuk tugas pengkodean berlatensi kritis. Bangun loop asynchronous minimal yang memberikan visibilitas langsung terhadap antrean event dan konteks token.
- Terapkan Sandboxing Bertingkat (Defense-in-Depth): Jangan pernah hanya mengandalkan system prompt instruction untuk mencegah perintah destruktif. Pisahkan aturan Starlark, event hooks, dan isolasi native OS container.
- Gunakan Ripgrep & AST Parser: Singkirkan infrastruktur vector database untuk kode sumber. Kecepatan dan determinisme
ripgrepmengeliminasi kesalahan grounding pada repositori skala besar. - Pilih Standar SKILL.md untuk Ekstensibilitas Agen: Manfaatkan format Markdown terstruktur untuk mendefinisikan SOP, dependensi tools, dan workflow agar agen Anda dapat dipindahkan lintas harness tanpa vendor lock-in.
Referensi & Sumber Terverifikasi
- [1]Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems(arXiv:2609.00006 [cs.SE, cs.AI] — Inclusive Brains & Wavestone AI Lab)
- [2]Inside the Harness: What a Source-Code Study of Eleven Coding Agents Reveals About Codex CLI Architecture(Systems & Architecture Research Journal / Daniel Vaughan)
- [3]Codex CLI v0.152.0-alpha: Proactive Multi-Agent Instructions & Starlark Execution Policy Engine(OpenAI Engineering Releases & Architecture Specifications)
- [4]Hermes Agent Architecture & Dynamic Transports: 5 Owned Transports and 29 Provider Profiles(Nous Research Engineering Documentation)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.