Executive Summary: Mengapa GUI-Native Harness Membatasi Potensi Model & Bagaimana Terminal Minimal Mengubah Paradigma Digital Agent
Makalah riset frontier arXiv:2610.04116 (Oktober 2026) berjudul "CUAWright: A Minimal Unified Interface for Digital Agents" yang dipublikasikan oleh kolaborasi peneliti Microsoft Research, The Ohio State University, National University of Singapore (NUS), dan Carnegie Mellon University (CMU) (Yadong Lu, Theodore Lee, Yifei Li, Lawrence Keunho Jang, Tianci Xue, Yu Su, Huan Sun, Ahmed Hassan Awadallah) membongkar kekeliruan mendasar pada arsitektur Computer-Use Agent (CUA) konvensional: menghubungkan agen digital ke GUI visual melalui klik koordinat dan tool-calling domain-spesifik yang kaku justru menciptakan overhead konteks masif, kerapuhan grounding visual, dan membatasi kapabilitas penalaran kode tingkat tinggi model frontier.
Sebagai solusinya, para peneliti memperkenalkan CUAWright, sebuah harness terminal minimalis yang hanya tersusun dari sekitar 3.000 baris kode (~3K LOC). CUAWright menetapkan bahwa setiap aksi agen adalah perintah terminal (Bash), sistem berkas lokal bertindak sebagai ruang memori eksternal yang dapat berevolusi, dan observasi visual bersifat Vision-on-Demand. Evaluasi lintas 6 tolok ukur bergengsi membuktikan keunggulan spektakuler CUAWright: peningkatan +33.2% relative partial reward di OSWorld 2.0 dengan penghematan biaya API sebesar 37.5%, kenaikan kesuksesan +44.0% pada tugas web horizon-panjang Odysseys, serta lonjakan IoU dari 55.8% ke 79.0% (+23.2%) pada pemodelan CAD 3D di BenchCAD.
Daftar Isi Pembahasan Arsitektur CUAWright
- 1. Mengapa Antarmuka GUI & Static Tool-Harness Menjadi Bottleneck Utama Frontier Agent?
- 2. Formulasi Teoretis: Partially Observable Markov Decision Process & Aksi Terminal Tunggal
- 3. Vision-on-Demand: Menghilangkan Screenshot Inflasi & Memotong Biaya Hingga Sepertiga
- 4. Workspace Sistem Berkas sebagai Substrat Memori Eksternal & Konstruksi Perkakas Dinamis
- 5. Analisis Hasil Empiris: OSWorld 2.0, Odysseys, Online-Mind2Web, BenchCAD, dan WeaveBench
- 6. Studi Ablasi Mendalam: Single-Agent vs Multi-Agent & Pengaruh Vital Akses Filesystem
- 7. Desain Arsitektur Produksi: CUAWright Minimalist Harness Engine (TypeScript)
- 8. Panduan Rekayasa 2026: Mengapa Lingkungan Digital Jauh Lebih Programmable daripada GUI-nya
1. Mengapa Antarmuka GUI & Static Tool-Harness Menjadi Bottleneck Utama Frontier Agent?
Dalam beberapa tahun terakhir, penelitian mengenai Computer-Use Agents (CUA) berpusat pada peniruan interaksi manusia di tingkat permukaan: menggerakkan kursor mouse ke koordinat $(x, y)$, mengeklik tombol grafis, mengetikkan string ke input field aktif, atau menafsirkan accessibility tree (AXTree / DOM snapshot). Pendekatan ini diwujudkan melalui harness domain-spesifik seperti ekstensi browser, peramban Playwright, atau desktop virtual VNC.
Namun, seiring pesatnya lonjakan kapabilitas penalaran simbolik dan pembuatan kode (coding proficiency) pada model frontier seperti GPT-5.5, GPT-5.6 Sol, Claude Opus 5, dan Qwen3.5, paradigma antarmuka GUI statis ini justru menjadi hambatan sistemik yang melumpuhkan kemampuan model:
- Pembengkakan Konteks Visual yang Eksplosif: Pada agen interaktif konvensional, setiap pergantian langkah (turn) selalu menyertakan screenshot layar penuh beresolusi tinggi (atau pohon DOM berukuran puluhan ribu node). Pada tugas horizon-panjang yang menuntut 80 hingga 150 langkah eksekusi, akumulasi gambar ini menghabiskan kuota context window dalam hitungan menit dan melambungkan biaya token API hingga puluhan dolar per tugas.
- Kerapuhan Grounding Koordinat (Visual Hallucination): Meminta model memprediksi koordinat piksel $(x, y)$ untuk mengeklik elemen di tengah antarmuka desktop yang dinamis (misalnya dropdown menu yang menutup otomatis atau pop-up modal bertumpuk) memiliki tingkat kegagalan fatal tinggi. Kesalahan geser 5 piksel saja dapat membatalkan seluruh transaksi alur kerja.
- Rigiditas Tool Harness yang Terkunci (Static Toolset): Harness konvensional membekukan daftar alat (tool definitions) sebelum eksekusi dimulai. Jika agen menghadapi skenario khusus—seperti kebutuhan memfilter berkas CSV ratusan megabita, mengekstrak arsip terkompresi, atau melakukan kueri regex berulang—agen tidak memiliki kebebasan untuk menyusun utilitas otomasi baru.
2. Formulasi Teoretis: Partially Observable Markov Decision Process & Aksi Terminal Tunggal
Dalam makalah CUAWright, tugas agen digital dimodelkan secara matematis sebagai Partially Observable Markov Decision Process (POMDP) dengan tupel formal:
di mana:
- $\mathcal{S}$: Ruang keadaan lingkungan yang didekomposisi menjadi $s_t = (x_t, f_t)$, dengan $x_t$ merepresentasikan keadaan internal aplikasi/sistem dan $f_t$ merepresentasikan keadaan sistem berkas persisten (filesystem).
- $\mathcal{O}$: Ruang observasi, di mana $o_t$ secara default hanya berupa keluaran teks standar (stdout/stderr) dari eksekusi terminal sebelumnya.
- $\mathcal{A}_{\text{term}}$: Ruang tindakan terminal terpadu, di mana setiap aksi $a_t$ adalah perintah Bash yang valid.
- $\mathcal{T}$: Fungsi transisi keadaan yang menghasilkan transisi $s_{t+1} = \mathcal{T}_E(s_t, a_t)$ dan observasi $o_{t+1}$.
Berbeda dari model hybrid yang mencampurkan aksi bash dengan puluhan tool khusus (misalnya click_mouse, press_key, navigate_browser), CUAWright mempertahankan ruang aksi $\mathcal{A}_{\text{term}}$ tetap seragam dan invarian lintas domain. Ketika manipulasi GUI memang tak terhindarkan (misalnya pada aplikasi desktop warisan yang tidak memiliki CLI), agen menggunakan perkakas baris perintah standar seperti xdotool, pyautogui, atau skrip Python khusus yang dipanggil melalui terminal.
3. Vision-on-Demand: Menghilangkan Screenshot Inflasi & Memotong Biaya Hingga Sepertiga
Salah satu inovasi paling berdampak dalam desain arsitektur CUAWright adalah prinsip Vision on Demand, Not by Default.
Pada paradigma konvensional:
Di sini setiap langkah selalu menyuntikkan gambar snapshot layar ke konteks model. Pada CUAWright, observasi $o_t$ secara default murni terdiri dari teks respons terminal. Jika dan hanya jika agen membutuhkan verifikasi visual, agen memanggil alur inspeksi dua langkah:
- Agen mengeksekusi tool CLI penangkap layar dengan jalur penyimpanan berkas tertentu (misalnya:
python3 -m cuawright.vision capture --out /workspace/inspect.png). - Agen mengeksekusi tool pemuatan gambar (image loader CLI) untuk menyuntikkan berkas visual tersebut ke dalam konteks penalaran langkah berikutnya.
Hasilnya sangat mengejutkan: pada benchmark desktop OSWorld 2.0 yang menuntut interaksi intensif, biaya token API berkurang dari $13.90 menjadi $4.40 per tugas pada GPT-5.6 Sol (-68.3%) dan dari $16.10 menjadi $10.10 pada GPT-5.5 (-37.5%), sembari secara simultan meningkatkan skor akurasi karena model tidak terganggu oleh noise visual berulang.
4. Workspace Sistem Berkas sebagai Substrat Memori Eksternal & Konstruksi Perkakas Dinamis
Banyak framework agen modern menyusun arsitektur memori yang teramat rumit: basis data vektor terpisah, graf pengetahuan ad-hoc, atau modul memori semantik dengan API kustom. CUAWright menolak kompleksitas tersebut dan mengandalkan struktur yang telah teruji selama setengah abad: Sistem Berkas Lokal ($w_t \subseteq f_t$).
Memori Eksternal Tanpa State Khusus
Setiap kali agen ingin mempertahankan informasi penting—seperti nilai variabel yang diekstrak, log eksekusi menengah, atau catatan kegagalan langkah sebelumnya—agen menuliskannya ke berkas di $w_t$. Operasi memori menjadi aksi terminal biasa (cat, grep, sed, rm). Jika sebuah catatan menjadi usang, agen cukup menghapus atau memodifikasinya, mencegah akumulasi memori basi yang tidak dapat dihapus.
Konstruksi Perkakas Dinamis ($P_t$)
Himpunan program efektif agen didefinisikan sebagai $P_t = P_{\text{env}} \cup P_{\text{agent}}(w_t)$. Agen dapat membuat skrip Python baru di $w_t$, mengujinya di terminal, memodifikasi kodenya jika terjadi bug, dan menggunakannya berulang kali di langkah-langkah berikutnya. Ini memungkinkan agen menciptakan kemampuan baru yang disesuaikan secara instan dengan tantangan tugas.
5. Analisis Hasil Empiris: OSWorld 2.0, Odysseys, Online-Mind2Web, BenchCAD, dan WeaveBench
CUAWright dievaluasi secara ketat pada 6 lingkungan tugas digital dunia nyata:
| Benchmark & Lingkungan | Baseline Resmi / Harness Lain | CUAWright (Model yang Sama) | Delta Peningkatan | Dampak Biaya API |
|---|---|---|---|---|
| OSWorld 2.0 (Desktop Full) | GPT-5.5 Official: 47.5% | GPT-5.5: 63.2% | +15.7 pp (+33.1% rel) | Hemat $6.0 / task |
| OSWorld 2.0 (Desktop Full) | GPT-5.6 Sol Official: 62.7% | GPT-5.6 Sol: 67.9% | +5.2 pp (+8.3% rel) | Hemat $9.5 / task (-68%) |
| Odysseys (Long-Horizon Web) | GPT-5.4 GUI Native: 33.5% | GPT-5.4: 77.5% | +44.0 pp (2.31x lipat) | Rerata 76.1 langkah |
| Odysseys (Long-Horizon Web) | Claude Opus 4.6: 44.5% | GPT-5.5: 88.0% | +54.5 pp di atas GUI | Kestabilan multi-domain |
| Online-Mind2Web (Live Web) | GPT-5.4 GUI Native: 83.4% | GPT-5.4: 88.1% | +4.7 pp (+5.6% rel) | Lompatan tugas hard: +12.2% |
| BenchCAD (Vision2Code CAD) | GPT-5.5 + Python Tool: 55.8% | GPT-5.5: 79.0% | +23.2 pp IoU score | Render & ukur iteratif |
| WeaveBench (114 Coding Tasks) | Codex CLI Harness: 35.1% | GPT-5.5: 53.5% | +18.4 pp PassRate | Skor agregat 49.9 → 66.4 |
6. Studi Ablasi Mendalam: Single-Agent vs Multi-Agent & Pengaruh Vital Akses Filesystem
Makalah ini menyajikan dua studi ablasi penting yang mematahkan sejumlah mitos populer dalam rekayasa agen AI:
Ablasi 1: Apakah Sistem Multi-Agent Selalu Mengungguli Single-Agent?
Banyak praktisi mengasumsikan bahwa memecah alur kerja menjadi hierarki Planner-Worker-Verifier akan otomatis mendongkrak performa. Pada pengujian OSWorld 2.0, konfigurasi Multi-Agent CUAWright pada GPT-5.6 Sol menghasilkan skor 67.3%, sementara konfigurasi Single-Agent meraih skor 67.9%.
Analisis jejak eksekusi mengungkap bahwa agen Planner sering kali menetapkan kriteria verifikasi yang terlalu kaku dan tidak realistis, memicu re-eksekusi yang tidak perlu. Lebih lanjut, konfigurasi multi-agent melipatgandakan jumlah interaksi median dari 101 turn menjadi 151 turn, meningkatkan latensi dan biaya tanpa memberikan keuntungan akurasi nyata. Model frontier modern telah memiliki kemampuan self-verification internal yang cukup matang jika diberi antarmuka terminal yang jelas.
Ablasi 2: Seberapa Kritis Keberadaan Akses Filesystem Langsung?
Ketika peneliti menguji CUAWright dengan mematikan akses langsung ke filesystem (agen dipaksa berinteraksi dengan berkas hanya melalui operasi GUI via mouse/keyboard xdotool), skor partial reward pada GPT-5.6 Sol anjlok drastis dari 67.9% menjadi 55.5% (-12.4 pp), dan skor strict reward anjlok dari 27.6% menjadi 15.5% (-12.1 pp).
Hal ini membuktikan secara empiris bahwa kemampuan membaca, menyunting, dan menyusun berkas secara terprogram melalui terminal adalah pilar utama di balik superioritas CUAWright.
7. Desain Arsitektur Produksi: CUAWright Minimalist Harness Engine (TypeScript)
Berikut adalah implementasi referensi arsitektur runtime CUAWright dalam TypeScript, yang memadukan eksekusi sandboxed Bash, inspeksi visual on-demand, dan persistent workspace management:
// Production Architecture: CUAWright Minimal Unified Terminal Harness
// Berdasarkan Arsitektur Sistem Riset arXiv:2610.04116 (Oktober 2026 - Microsoft Research, OSU, NUS, CMU)
//
// Karakteristik Inti:
// 1. Single Action Space: Bash execution sebagai satu-satunya antarmuka tindakan agen.
// 2. Vision-on-Demand: Screenshot tidak dimuat secara default; visual di-load via CLI tool eksplisit saat diperlukan.
// 3. Persistent Workspace: Sistem berkas lokal (wt) sebagai memori eksternal tanpa overhead state terpisah.
// 4. Dynamic Tool Construction: Agen menulis skrip otomasi baru ke dalam workspace untuk digunakan kembali.
export interface ExecutionObservation {
stdout: string;
stderr: string;
exitCode: number;
visualArtifactUri?: string;
executionDurationMs: number;
}
export interface WorkspaceArtifact {
path: string;
type: 'script' | 'log' | 'intermediate_data' | 'visual_cache';
sizeBytes: number;
lastModified: number;
}
export class CUAWrightTerminalHarness {
private readonly workspaceRoot: string;
private readonly bashTimeoutMs: number;
private trajectoryHistory: Array<{ command: string; observation: ExecutionObservation }> = [];
constructor(workspaceRoot: string = '/tmp/agent_workspace', bashTimeoutMs: number = 30000) {
this.workspaceRoot = workspaceRoot;
this.bashTimeoutMs = bashTimeoutMs;
}
/**
* Action Step a_t in A_term:
* Menjalankan perintah bash deterministik di dalam persistent workspace environment.
*/
public async executeAction(command: string): Promise {
const startTime = performance.now();
try {
// Menjalankan command dalam subshell dengan working directory terkunci ke workspace
const result = await this.spawnSandboxedBash(command, this.workspaceRoot, this.bashTimeoutMs);
const observation: ExecutionObservation = {
stdout: result.stdout,
stderr: result.stderr,
exitCode: result.exitCode,
executionDurationMs: Math.round(performance.now() - startTime),
};
this.trajectoryHistory.push({ command, observation });
return observation;
} catch (error: any) {
return {
stdout: '',
stderr: error.message || 'Subprocess execution error',
exitCode: 1,
executionDurationMs: Math.round(performance.now() - startTime),
};
}
}
/**
* Vision on Demand:
* Mengambil screenshot hanya saat agen mengeksekusi tool CLI secara sadar,
* memangkas ukuran context window dan biaya token hingga 37.5%.
*/
public async requestVisualInspection(targetRegion?: string): Promise {
const captureCommand = targetRegion
? `python3 -m cuawright.vision capture --region "${targetRegion}" --out ${this.workspaceRoot}/inspect.png`
: `python3 -m cuawright.vision capture --fullscreen --out ${this.workspaceRoot}/inspect.png`;
const obs = await this.executeAction(captureCommand);
if (obs.exitCode !== 0) {
throw new Error(`Failed to capture visual state: ${obs.stderr}`);
}
return `${this.workspaceRoot}/inspect.png`;
}
/**
* Dynamic Tool Materialization:
* Mengizinkan agen menulis alat bantu baru ke disk, memverifikasi sintaksnya,
* dan menambahkannya ke himpunan program efektif P_t.
*/
public async materializeCustomTool(scriptName: string, scriptContent: string): Promise {
const scriptPath = `${this.workspaceRoot}/tools/${scriptName}`;
const writeCommand = `cat << 'EOF' > ${scriptPath}\n${scriptContent}\nEOF\nchmod +x ${scriptPath}`;
const res = await this.executeAction(writeCommand);
return res.exitCode === 0;
}
private async spawnSandboxedBash(cmd: string, cwd: string, timeout: number): Promise<{ stdout: string; stderr: string; exitCode: number }> {
// Implementasi runtime interface OS (Node.js child_process / eBPF sandbox)
return { stdout: 'EXECUTION_SUCCESS', stderr: '', exitCode: 0 };
}
}
8. Panduan Rekayasa 2026: Mengapa Lingkungan Digital Jauh Lebih Programmable daripada GUI-nya
Hasil riset CUAWright memberikan implikasi mendalam bagi para arsitek sistem, AI engineer, dan perancang agen otonom di era 2026:
- Hentikan Overengineering GUI Wrapper: Jangan menghabiskan waktu membangun puluhan tool kustom berformat JSON Schema untuk setiap tombol atau menu aplikasi. Cukup sediakan satu antarmuka shell Unix yang aman dengan hak akses yang terisolasi. Model frontier jauh lebih andal menulis skrip one-liner Bash atau skrip Python ad-hoc daripada menebak argumen tool kustom.
- Terapkan Vision-on-Demand: Jangan pernah mengirimkan screenshot secara otomatis pada setiap langkah agen. Ambil screenshot hanya ketika agen mengalami status kegagalan (non-zero exit code), saat melakukan verifikasi akhir hasil keluaran grafis, atau ketika agen secara eksplisit memanggil perintah inspeksi visual.
-
Jadikan Filesystem sebagai Memori Utama: Hindari arsitektur memori in-memory kompleks yang hilang saat restart atau membebani context window. Berikan direktori kerja persisten kepada agen, biarkan agen mengelola berkas
TODO.md, skrip utilitas, dan log intermediate secara mandiri.



