Harness-Zero 2026: Arsitektur Harness Distillation via Agent-as-Harness, Adaptasi Private Reference \mathcal{K}, dan Internalisasi Perilaku Otonom ke Bobot Model
Bedah arsitektur riset frontier Peking University, Google, dan HKUST arXiv:2609.24974 (Haoran Ye, Yuxing Lu, Haonan Dong, Zhaochen Su, Guojie Song, September 2026): Mengapa scaffolding eksternal (harness) yang dievolusikan kerap mengunci kapabilitas agent pada runtime tertentu dan rapuh saat model diperbarui? Harness-Zero memperkenalkan paradigma Agent-as-Harness untuk mendistilasi scaffolding kompleks ke dalam bobot model target. Mengawinkan adaptasi private reference harness \mathcal{K}, review boundary non-intrusif, dan masking reasoning supervisor saat SFT. Berhasil melesatkan macro-average task success model basis dari 23.3% menjadi 44.3% (bahkan melampaui performa model dengan harness terpasang sebesar 41.7%) serta memulihkan 82.3% pola perilaku kritis tanpa scaffolding eksternal saat deployment.

Harness-Zero: Mendistilasi Scaffolding Otonom Kompleks Menjadi Bobot Parametrik Model Murni
Sistem scaffolding eksternal (agent harness)—seperti middleware guards, multi-step subagents, file-based memory, dan runtime skill injection—selama ini menjadi pilar utama di balik tingginya performa frontier coding agents. Namun, arsitektur ini menyimpan kelemahan sistemik: kapabilitas agen terikat erat (locked-in) pada harness tertentu saat deployment, memicu overhead latensi runtime yang masif, dan kerap rusak (stale) setiap kali model dasar diperbarui. Makalah perintis dari Peking University, Google, dan HKUST (Ye et al., September 2026) memperkenalkan Harness-Zero, arsitektur yang mampu mendistilasi seluruh aturan harness yang dievolusikan ke dalam bobot internal LLM melalui pendekatan Agent-as-Harness. Hasilnya mengejutkan dunia rekayasa AI: model yang didistilasi berhasil mencatat 44.3% macro-average task success pada harness minimal, mengalahkan model basis yang masih dibebani harness eksternal penuh (41.7%).
1. Dilema Scaffolding Eksternal: Mengapa Code-as-Harness Memiliki Plafon?
Dalam ekosistem pengembangan software agent terkini (seperti Claude Code, Codex, Kimi Code, maupun Hermes Agent), arsitektur runtime biasanya mengadopsi pola Code-as-Harness:
Di mana model dengan bobot dasar θ0 beroperasi di dalam harness canggih teroptimasi h*. Harness ini memodifikasi interaksi melalui:
- Middleware Interceptors: Memblokir perintah destruktif, menyaring output berlebihan, atau memaksa agen melakukan linting sebelum commit.
- Domain-Specific Tools: Menambahkan puluhan wrapper API khusus untuk mengompensasi kelemahan penalaran model.
- Persistent Working Memory & Skills: Menginjeksi aturan manual beribu-ribu token yang memakan ruang konteks aktif (context window pollution).
Meskipun h* mampu meningkatkan metrik benchmark secara instan, pendekatan ini menghadapi 3 tembok struktural di lingkungan produksi:
Fragmentasi Scaffolding
Harness yang optimal untuk manipulasi spreadsheet (SpreadsheetBench) terbukti mendegradasi performa saat dipasang pada eksekusi multi-aplikasi (AppWorld) atau retrosintesis kimia ilmiah (USPTO). Menjaga lusinan harness spesifik per domain menciptakan mimpi buruk operasional bagi platform AI umum.
Asumsi Kode yang Basi
Middleware hardcoded mengasumsikan pola kegagalan model versi tertentu. Ketika model dasar di-upgrade (misalnya dari DeepSeek-V3 ke DeepSeek-V4 atau Claude 3.5 ke 3.7), aturan scaffolding lawas justru membatasi kapabilitas bawaan arsitektur baru.
Overhead Token & Latensi
Injeksi prompt sistem yang masif, manipulasi string berulang oleh middleware, serta chaining subagent eksternal melipatgandakan TTFT (Time To First Token) dan biaya inferensi per task hingga 2.4x lipat.
2. Anatomi Harness-Zero: Menjembatani Kesenjangan Action Space via Agent-as-Harness
Tantangan fundamental dalam mentransfer pengetahuan harness h* ke target harness minimal h (seperti mini-SWE-agent yang hanya memiliki 1 tool eksekusi Bash) adalah perbedaan ruang aksi (action space discrepancy). Trajektori yang dihasilkan di bawah h* tidak dapat langsung digunakan untuk melatih h karena memuat tool call dan event middleware yang tidak tersedia pada h.
Harness-Zero memecahkan kebuntuan ini melalui 3 tahapan sistematis:
Harness Evolution & Private Reference Adaptation
Pertama, harness khusus domain h* dievolusikan di atas dataset tugas training (𝒟train) menggunakan teknik Meta-Harness. Setelah h* matang dengan guard, memory, dan skills terbaik, harness tersebut diadaptasi menjadi Private Reference Harness (&mathcal;K):
Dalam adaptasi ini, aturan imperatif middleware (yang biasanya memutus koneksi atau melempar error code) diubah menjadi review checklist deklaratif untuk memandu supervisor manusia atau model penilai.
Agent-as-Harness Trajectory Collection
Model student (πS) dijalankan di bawah target harness minimal h. Pada setiap giliran t, student mengajukan proposal tindakan yt. Di sinilah Harnessing Agent (πH) mencegat proposal di response boundary:
(d_t, z_t) ~ π_H(· | c_t, y_t, &mathcal;K, r_{<t})
ỹ_t = { y_t jika d_t = PASS, z_t jika d_t = REPLACE }
c_{t+1} = T_h(c_t, ỹ_t)
Jika proposal student sudah mematuhi kaidah &mathcal;K, supervisor meloloskannya (PASS). Jika menyimpang, supervisor membuat koreksi koheren terkecil (REPLACE) yang wajib valid dalam ruang aksi target h. Catatan review supervisor (r<t) dirahasiakan dan tidak pernah memasuki context window student.
SFT & Reviewer-Perspective Loss Masking
Seluruh trajektori yang telah disetujui (𝒟review) dikumpulkan untuk Supervised Fine-Tuning. Token reasoning supervisor yang tidak sengaja bocor di-mask agar fungsi loss hanya mengoptimalkan probabilitas tindakan student murni:
Saat fase deployment, model hasil distilasi (πθ^) beroperasi secara mandiri di bawah harness h murni—tanpa h*, tanpa &mathcal;K, dan tanpa kehadiran harnessing agent sama sekali.
3. Implementasi Arsitektur: Pipeline Intervensi Response Boundary
Berikut adalah representasi modular Python yang mengimplementasikan protokol pengawasan response boundary pada Harness-Zero, mencakup audit middleware dan filtering trajektori:
"""
Harness-Zero: Harness Distillation via Agent-as-Harness Architecture.
Berdasarkan Riset Frontier arXiv:2609.24974 (Peking University, Google, HKUST - September 2026).
Komponen Arsitektur Utama:
1. Target Harness (h): Lingkungan eksekusi minimal & kaku (misal mini-SWE-agent dengan tool Bash tunggal).
2. Evolved Student Harness (h*): Scaffolding kaya fitur (tools, middleware guards, memory, skills spesifik domain).
3. Private Reference Harness (K = Adapt(h*; h)): Rekonfigurasi guard middleware dan memory menjadi instruksi review.
4. Harnessing Agent (pi_H): Membungkus response boundary student (pi_S), memvalidasi proposal y_t,
dan menyuntikkan koreksi z_t valid dalam action space target harness (h) tanpa membocorkan state oracle.
5. Trajectory Distillation SFT: Supervised Fine-Tuning pada trajektori diterima (y_tilde_t) dengan
loss masking pada reasoning reviewer agar model student menginternalisasi pola ke dalam bobot theta.
"""
from dataclasses import dataclass, field
from enum import Enum
from typing import Dict, List, Optional, Tuple, Any
import json
class ReviewDecision(Enum):
PASS = "pass"
REPLACE = "replace"
@dataclass
class TargetAction:
tool_name: str
command: str
@dataclass
class StudentProposal:
thought: str
action: TargetAction
raw_response: str
@dataclass
class ReviewResult:
decision: ReviewDecision
accepted_response: str
correction_rationale: Optional[str] = None # Hanya untuk internal harnessing agent, di-mask saat SFT
class PrivateReferenceHarness:
"""
Representasi K = Adapt(h*; h).
Mengonversi middleware h* (seperti prefilled_guard, answer_range_guard, turn_budget)
menjadi checklist verifikasi aktif pada response boundary.
"""
def __init__(self, domain: str, rules: List[str]):
self.domain = domain
self.rules = rules
def audit_proposal(self, context_history: List[Dict[str, Any]], proposal: StudentProposal) -> Tuple[bool, Optional[str]]:
# Contoh validasi spreadsheet: memastikan cell pre-filled tidak tertimpa
if "solution.py" in proposal.action.command and "mode='w'" in proposal.action.command:
# Middleware check: Deteksi potensi penimpaan file tanpa verifikasi awal
has_inspected = any("inspect" in str(step.get("command", "")) for step in context_history)
if not has_inspected:
return False, "RULE_VIOLATION: Harap lakukan inspeksi struktur header dan prefilled cells sebelum menulis skrip mutasi."
# Contoh validasi penyelesaian prematur (finish-guard)
if "COMPLETE_TASK_AND_SUBMIT" in proposal.raw_response:
has_verified = any("python3 -m unittest" in str(step.get("command", "")) or "verify" in str(step.get("command", "")) for step in context_history)
if not has_verified:
return False, "RULE_VIOLATION: Dilarang submit sebelum menjalankan perintah assertion verifikasi mandiri di action space target."
return True, None
class HarnessingAgent:
"""
Agen supervisor pi_H yang membungkus response boundary student pi_S.
Koreksi (z_t) wajib valid 100% di dalam action space target harness (h).
"""
def __init__(self, reference_harness: PrivateReferenceHarness):
self.reference = reference_harness
self.private_history: List[Dict[str, Any]] = []
def review_turn(
self,
student_context: List[Dict[str, Any]],
proposal: StudentProposal
) -> ReviewResult:
is_sound, violation_reason = self.reference.audit_proposal(student_context, proposal)
if is_sound:
return ReviewResult(
decision=ReviewDecision.PASS,
accepted_response=proposal.raw_response
)
# Intervensi Terarah: Menghasilkan pengganti terkecil yang koheren (smallest coherent correction)
# Penting: Harus diformulasikan dari sudut pandang student di action space target harness h
corrected_thought = f"Sebelum melakukan aksi mutasi, saya perlu memverifikasi struktur file target terlebih dahulu."
corrected_action = TargetAction(
tool_name="execute",
command="python3 -c 'import openpyxl; wb=openpyxl.load_workbook("target.xlsx"); print(wb.sheetnames)'"
)
corrected_raw = f"{corrected_thought}\n```bash\n{corrected_action.command}\n```"
# Simpan jejak internal reviewer (tidak dikirimkan ke context student)
self.private_history.append({
"turn": len(student_context) + 1,
"rejected_proposal": proposal.raw_response,
"reason": violation_reason
})
return ReviewResult(
decision=ReviewDecision.REPLACE,
accepted_response=corrected_raw,
correction_rationale=violation_reason
)
class HarnessDistillationDataset:
"""
Mengompilasi trajektori D_review menjadi format SFT.
Menerapkan token loss masking pada reasoning reviewer agar bobot student (theta)
hanya mempelajari transisi state eksekusi murni di bawah h.
"""
@staticmethod
def format_trajectory_for_sft(trajectory: List[Dict[str, Any]]) -> Dict[str, Any]:
prompt_tokens = []
target_tokens = []
loss_masks = []
for turn in trajectory:
context_str = turn["context"]
accepted_resp = turn["accepted_response"]
# Loss mask diaktifkan hanya pada token accepted_response dari perspektif student
# Token reasoning supervisor dihilangkan secara definitif
prompt_tokens.append(context_str)
target_tokens.append(accepted_resp)
loss_masks.append(1) # Full weight pada respons yang dieksekusi di h
return {
"inputs": prompt_tokens,
"targets": target_tokens,
"loss_mask": loss_masks
}
4. Evaluasi Empiris: Kinerja Melampaui Scaffolding Fisik
Para peneliti mengevaluasi Harness-Zero pada 3 domain komputasi kompleks: SpreadsheetBench Verified (400 task manipulasi lembar kerja), AppWorld (168 skenario interaksi 9 aplikasi), dan USPTO Retrosynthesis (600 task prediksi prekursor reaksi kimia), menggunakan framework evaluasi terstandarisasi Harbor.
| Arsitektur & Kondisi Eksperimen | SpreadsheetBench (Pass@1) | AppWorld (SGC %) | USPTO (Pass@1) | Macro-Average (%) |
|---|---|---|---|---|
| Base Model (mini-SWE-agent h) | 31.0% | 26.8% | 12.0% | 23.3% |
| Base Model + Claude Code Scaffolding | 31.0% | 10.7% (-16.1) | 6.0% (-6.0) | 15.9% (-7.4) |
| Base Model + DeepAgents Scaffolding | 35.0% | 19.6% (-7.2) | 7.0% (-5.0) | 20.5% (-2.8) |
| Base Model + Meta-Harness (h* terpasang) | 39.0% (+8.0) | 48.2% (+21.4) | 38.0% (+26.0) | 41.7% (+18.4) |
| Harness-Zero Distilled (h murni, h* dilepas) | 44.0% (+13.0) | 58.9% (+32.1) | 30.0% (+18.0) | 44.3% (+21.0) |
5. Analisis Behavioral Recovery: 82.3% Pola Scaffolding Mampu Diserap Bobot Model
Salah satu pertanyaan riset paling krusial adalah: Apakah model benar-benar mempelajari disiplin rekayasa yang sebelumnya dipaksakan oleh kode middleware, atau hanya menghafal output? Peneliti membedah 28 pola perilaku eksklusif (mined patterns) di seluruh domain dan mengukur rasio pemulihannya (recovery rate):
Perilaku Spreadsheet (18 Pola - 87% Avg Recovery)
- Inspect Before Editing: 100% (32/32) model selalu membaca dimensi lembar kerja dan contoh prefilled sebelum menyentuh sel.
- Avoid Fragile Coordinates: 100% (19/19) mengonversi pengalamatan dinamis ke koordinat absolut Excel.
- Protect Pre-filled Cells: 92% (24/26) menghindari penimpaan sel yang sudah terisi data bawaan.
- Write Computed Literals: 90% (19/21) menulis nilai hasil kalkulasi deterministik alih-alih formula Excel rapuh.
Perilaku Sains Kimia USPTO (6 Pola - 89.5% Avg Recovery)
- Parse Product with RDKit: 100% (23/23) memvalidasi struktur molekul via library kimia tanpa halusinasi string mentah.
- Validate with RDKit Tool: 100% (60/60) melakukan verifikasi sebelum komit reaksi.
- Canonicalize SMILES: 100% (73/73) menstandarisasi format molekul sesuai kanonikal IUPAC.
- Validate Final Answer: 96% (45/47) menjalankan assert test mandiri pada file output sebelum mengakhiri sesi.
Temuan ini membuktikan bahwa batas antara system prompting/middleware code dan parametric weights adalah kontinum yang dapat dijembatani. Ketika model dilatih di atas trajektori yang telah dikoreksi oleh supervisor cerdas, model menginternalisasi intuisi verifikasi mandiri tanpa perlu ditegur oleh kode eksternal.
6. Panduan Implementasi untuk Arsitek AI & Platform Engineering
Bagi tim pengembang sistem autonomous agents skala enterprise, paper Harness-Zero menyodorkan rekomendasi strategis:
Jangan membebani lingkungan produksi dengan middleware berlapis-lapis yang memperlambat TTFT. Gunakan arsitektur scaffolding kaya fitur pada tahap pengumpulan data (training-time harness), kemudian distilasikan perilakunya ke dalam checkpoint model khusus sebelum disebarkan ke kluster produksi.
Saat membungkus agen dengan supervisor pada response boundary, hindari menulis ulang seluruh alur kerja jika proposal agen sudah 80% benar. Mempertahankan niat asli agen dan hanya menyisipkan langkah verifikasi krusial menjaga kualitas distribusi data saat SFT.
Standarisasi target harness pada satu set primitif dasar (seperti bash shell atau CLI sandbox). Model yang mampu mengekspresikan seluruh verifikasi, formatting, dan self-healing melalui baris perintah standar jauh lebih portabel dan tahan terhadap perubahan infrastruktur.
Referensi & Sumber Terverifikasi
- [1]Harness-Zero: Harness Distillation via Agent-as-Harness(arXiv:2609.24974 [cs.AI] — Haoran Ye, Yuxing Lu, Haonan Dong, Zhaochen Su, Guojie Song (Peking University, Google, HKUST))
- [2]Meta-Harness: Automated Harness Optimization for Autonomous Software Engineering Agents(arXiv:2605.11294 / UC Berkeley & Stanford (Lee et al., 2026))
- [3]Mini-SWE-agent: A Minimalist Scaffold for Production Coding Agents(SWE-agent Team / Princeton NLP & Columbia University (2025))
- [4]AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents(ACL 2024 / Stony Brook University & Allen Institute for AI (Trivedi et al., 2024))
- [5]SpreadsheetBench: Large Language Model Agents for Spreadsheet Manipulation(arXiv:2308.03588 / Tsinghua University (Ma et al., 2024))
- [6]Harness Engineering 2026: Anatomi Sumber Kode 11 Production Coding Harnesses(arXiv:2609.00006 / NEWSAINT Systems Architecture Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.