Executive Summary: Menguji Batas Kemampuan Agen Web Otonom di Luar Dominasi Bahasa Inggris & Konten Teks Statis
Makalah riset frontier arXiv:2610.03574 (Oktober 2026) berjudul "HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents" yang dipimpin oleh Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. (konsorsium riset internasional dari MBZUAI, Mila – Quebec AI Institute, Inception AI, Alibaba Group, dan AI Singapore) memperkenalkan tolok ukur evaluasi paling ketat dan komprehensif bagi autonomous web-browsing agents.
Berbeda dengan benchmark web klasik seperti BrowseComp, WebArena, dan GAIA yang didominasi oleh pertanyaan trivia berbahasa Inggris dan ekstraksi teks HTML sederhana, HyperBrowseComp menyajikan 423 pertanyaan multi-hop bernilai tunggal yang ditulis secara independen oleh penutur asli melintasi 13 bahasa dunia (termasuk Bahasa Indonesia 9.2% dan Bahasa Jawa 8.3%) serta menuntut ekstraksi bukti melintasi 8 modalitas heterogen (Video YouTube 39.0%, Berkas PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Audio 10.6%, Tabel 10.2%, Peta 9.7%, dan Plot/Grafik 1.9%).
Daftar Isi Pembahasan Komprehensif
- 1. Krisis Evaluasi Web Agent: Saturasi Pengetahuan Parametrik & Jebakan Monolingual
- 2. Metodologi HyperBrowseComp: 423 Soal, 13 Bahasa, 8 Modalitas, dan Protokol Anti-Kontaminasi
- 3. Hasil Pengujian Model Frontier: Performa Native Search, Exa API, dan OWL Harness
- 4. Fenomena Harness Inversion: Mengapa Mengganti Retrieval API Mengacaukan Performa Model?
- 5. Evaluasi Manusia vs Agen AI: Disparitas Kinerja pada Bahasa Non-Inggris (Indonesia, Thai, Vietnam)
- 6. Implementasi Arsitektur Produksi: Resilient Multimodal Browsing Harness & Circuit Breaker (TypeScript)
- 7. Rekomendasi Rekayasa untuk Pengembang Sistem Autonomous Agent 2026
1. Krisis Evaluasi Web Agent: Saturasi Pengetahuan Parametrik & Jebakan Monolingual
Sejak paruh kedua tahun 2025, pergeseran paradigma dari Large Language Model (LLM) percakapan pasif menuju Autonomous Agent yang mengoperasikan perkakas (tool-using agents) telah mengubah arsitektur aplikasi AI di seluruh dunia. Agen kini diharapkan mampu menjelajahi web terbuka, membaca dokumentasi, melakukan scraping terarah, memverifikasi bukti silang, dan menarik kesimpulan faktual berlatensi tinggi.
Namun, perkembangan pesat ini membentur dinding besar pada infrastruktur tolok ukur (benchmarking). Benchmark generasi sebelumnya seperti GAIA, WebArena, dan BrowseComp mulai mengalami saturasi diskriminatif akibat dua cacat struktural:
- Saturasi Pengetahuan Parametrik (Parametric Leakage): Banyak pertanyaan dalam BrowseComp memiliki karakteristik trivia faktual yang ternyata telah terhafalkan di dalam bobot model selama fase pre-training. Model sering kali memberikan jawaban benar bukan karena keberhasilan browsing, melainkan karena halusinasi yang kebetulan akurat berdasarkan memori internal.
- Monolingual & Text-Centric Bias: Web dunia nyata tidak hanya tersusun dari artikel berita berbahasa Inggris. Sekitar 60% informasi operasional, logistik lokal, dan arsip pemerintah tersimpan dalam format visual (PDF hasil pindaian scan/OCR), rekaman video YouTube lokal, infografis peta, serta ditulis dalam bahasa non-Inggris yang memiliki terminologi budaya spesifik.
2. Metodologi HyperBrowseComp: 423 Soal, 13 Bahasa, 8 Modalitas, dan Protokol Anti-Kontaminasi
HyperBrowseComp dibangun dengan filosofi Single Short Answer: setiap pertanyaan memiliki jawaban tunggal yang ringkas, objektif, dan tidak ambigu (nama entitas, tanggal pasti, angka numerik presisi). Hal ini mengeliminasi perdebatan subjektif pada tahap penjurian otomatis.
Yang membuat tolok ukur ini luar biasa adalah kenyataan bahwa seluruh pertanyaan ditulis langsung oleh penutur asli (native speakers), bukan diterjemahkan dari dataset benih bahasa Inggris. Hal ini menjaga nuansa pencarian lokal, idiom, serta kebiasaan navigasi web yang autentik.
| Dimensi Klasifikasi | Komposisi & Distribusi | Contoh Kasus Nyata & Tantangan Ekstraksi |
|---|---|---|
| Bahasa Sumber (13 Bahasa) | Indonesia (9.2%), Thai (9.2%), Jerman (9.0%), Filipino (8.5%), Jawa (8.3%), Korea (8.3%), Spanyol (8.3%), Mandarin (8.0%), Telugu (8.0%), Arab Mesir (7.6%), Vietnam (5.9%), Rusia (5.2%), Uzbek (4.5%) | Penelusuran nama lurah desa di Jawa Tengah dari dokumen PDF SK bupati, atau tanggal renovasi pasar tradisional di Chiang Mai dari video berita lokal. |
| Modalitas Bukti (8 Modalitas) | Video YouTube (39.0%), PDF/Buku/OCR (29.8%), Aritmetika (28.1%), Gambar (18.4%), Audio (10.6%), Tabel (10.2%), Peta (9.7%), Grafik (1.9%) | 64.3% pertanyaan membutuhkan minimal satu modalitas non-teks. Agen harus menonton segmen video tertentu atau melakukan OCR pada struk/peta navigasi. |
| Domain Masalah (12+ Domain) | Ekonomi & Bisnis (18.9%), Media & Hiburan (15.8%), Pendidikan (11.3%), Geografi & Transportasi (9.0%), Games (7.8%), Musik (7.3%), Sains (6.9%) | Menghitung selisih tarif kargo pelabuhan, mengecek tanggal rilis patch game regional, hingga menafsirkan peraturan pemilu lokal. |
3. Hasil Pengujian Model Frontier: Performa Native Search, Exa API, dan OWL Harness
Penelitian ini menguji lima model bahasa frontier komersial dalam konfigurasi mesin penelusuran bawaan penyedia (built-in search), serta membandingkannya dengan mesin penelusuran saraf eksternal Exa dan harness agen visual interaktif berbasis browser nyata OWL.
| Arsitektur Harness | Model Penguji | Soal Benar (423) | Akurasi (%) | Total Token (M) | Waktu Eksekusi (Jam) |
|---|---|---|---|---|---|
| Built-in Native | Gemini 3.7 Flash | 134 / 423 | 31.68% | 14.1 M | 129.5 h |
| Built-in Native | Gemini 3.1 Pro Preview | 108 / 423 | 25.53% | 10.2 M | 45.3 h |
| Built-in Native | GPT-5.6 Sol | 81 / 423 | 19.15% | 43.6 M | 19.9 h |
| Built-in Native | GPT-5.6 Terra | 67 / 423 | 15.84% | 33.1 M | 11.1 h |
| Built-in Native | GPT-5.6 Luna | 49 / 423 | 11.58% | 27.5 M | 8.5 h |
| Exa Neural Search | GPT-5.6 Sol | 113 / 423 | 26.71% (+7.56%) | 928.8 M | 75.1 h |
| Exa Neural Search | Gemini 3.7 Flash | 94 / 423 | 22.22% (-9.46%) | 663.9 M | 22.7 h |
| Exa Neural Search | Gemini 3.1 Pro Preview | 77 / 423 | 18.20% (-7.33%) | 558.3 M | 51.3 h |
| OWL Browser Harness | Gemini 3.7 Flash | 75 / 423 | 17.73% (-13.95%) | 195.3 M | 125.1 h |
4. Fenomena Harness Inversion: Mengapa Mengganti Retrieval API Mengacaukan Performa Model?
Salah satu temuan paling berharga dari studi HyperBrowseComp adalah bukti empiris mengenai Harness Inversion: asumsi bahwa mesin pencarian saraf (seperti Exa) adalah pengganti serbaguna (drop-in replacement) yang selalu meningkatkan kecerdasan agen ternyata keliru secara mendasar.
Dampak Positif pada GPT-5.6 Sol (+7.56%)
Pencarian bawaan ChatGPT (Sol) memiliki filter heuristik agresif yang kerap memotong kueri multi-bahasa yang tidak umum. Dengan Exa, agen mendapatkan akses ke scraping halaman penuh dan indeks neural yang lebih luas, melonjakkan akurasi dari 19.15% ke 26.71%. Namun, konsumsi token melonjak drastis hingga 928.8 juta token (21x lipat lebih boros).
Degradasi Parah pada Gemini 3.7 Flash (-9.46%)
Gemini 3.7 Flash dilatih secara mendalam untuk berinteraksi dengan API Google Search bawaan yang mengembalikan cuplikan terstruktur ringkas dan sitasi indeks asli. Ketika dipaksa memakai Exa melalui prompt ReAct, model mengalami kelebihan muatan konteks (context pollution), mengalami halusinasi tautan, dan akurasinya merosot dari 31.68% ke 22.22%.
5. Evaluasi Manusia vs Agen AI: Disparitas Kinerja pada Bahasa Non-Inggris (Indonesia, Thai, Vietnam)
Untuk mengkalibrasi tingkat kesulitan benchmark, peneliti merekrut penutur asli untuk menyelesaikan sampel 30 pertanyaan (masing-masing 10 pertanyaan dalam Bahasa Indonesia, Thai, dan Vietnam) tanpa bantuan LLM, dengan batas waktu maksimal 60 menit per soal.
| Bahasa Pengujian | Akurasi Manusia (10 Soal) | Waktu Rata-Rata Manusia | Akurasi Gemini 3.7 Flash | Tingkat Kegagalan Total Model |
|---|---|---|---|---|
| Bahasa Indonesia | 6 / 10 (60.0%) | 40.2 menit (Cepat) | 3 / 10 (30.0%) | 69.2% Gagal (27/39) |
| Bahasa Thai | 3 / 10 (30.0%) | 159.7 menit (Lambat) | 3 / 10 (30.0%) | 66.7% Gagal (26/39) |
| Bahasa Vietnam | 6 / 10 (60.0%) | 68.6 menit | 7 / 10 (70.0%) | 40.0% Gagal (10/25) |
| Total Agregat (30 Soal) | 15 / 30 (50.0%) | 89.5 menit | 13 / 30 (43.3%) | 57.68% Rerata Global |
Perhatikan kontras yang sangat menarik: Penutur asli Indonesia mampu memecahkan soal dengan akurasi 60% dalam waktu tercepat (40.2 menit), memanfaatkan pemahaman kontekstual terhadap situs portal berita daerah, portal pemerintah daerah, dan istilah slang. Namun sebaliknya, model AI frontier paling canggih justru mengalami kegagalan hingga 69.2% pada Bahasa Indonesia. Model sering kali gagal memahami singkatan birokrasi lokal, salah menafsirkan penulisan tanggal di portal web daerah, atau terjebak pada halaman paywall/reklame.
6. Implementasi Arsitektur Produksi: Resilient Multimodal Browsing Harness & Circuit Breaker (TypeScript)
Berdasarkan kelemahan fatal yang terungkap pada HyperBrowseComp, arsitektur agen penelusuran web di tingkat enterprise harus meninggalkan pola naive ReAct tunggal. Di bawah ini adalah modul arsitektur Resilient Multimodal Browsing Harness yang mengimplementasikan Circuit Breaker, Dynamic Harness Routing, serta isolasi modalitas untuk mencegah kegagalan beruntun:
// Production Architecture: Resilient Multilingual & Multimodal Web-Browsing Agent Harness
// Mengatasi Masalah Harness Inversion, Tool Fragility, dan Multi-Hop Clue Chaining
// Berdasarkan Analisis Empiris HyperBrowseComp (arXiv:2610.03574 - Oktober 2026)
export interface SearchEvidence {
sourceUrl: string;
modality: 'text' | 'image' | 'video_transcript' | 'pdf_ocr' | 'map' | 'table';
language: string;
extractedSnippet: string;
confidenceScore: number;
retrievalLatencyMs: number;
circuitBreakerState: 'CLOSED' | 'HALF_OPEN' | 'OPEN';
}
export interface ClueTrajectoryStep {
stepIndex: number;
queryFormulated: string;
detectedModality: string;
targetLanguage: string;
selectedHarness: 'PROVIDER_NATIVE' | 'EXA_NEURAL' | 'BROWSER_CDP_OWL';
rawResponseTokens: number;
verifiedAnswerPart?: string;
}
export class ResilientBrowsingHarness {
private consecutiveFailures: Map = new Map();
private maxAllowedConsecutiveErrors = 2; // Mencegah 93 terminal tool crashes seperti pada OWL
/**
* Adaptive Harness Router:
* Mengatasi Harness Inversion di mana model tertentu (misal GPT-5.6) optimal pada Exa,
* sedangkan keluarga Gemini membutuhkan built-in retrieval API untuk mempertahankan efisiensi token.
*/
public selectOptimalHarness(
modelFamily: 'gemini' | 'gpt' | 'claude' | 'open_weights',
modality: SearchEvidence['modality'],
depthHop: number
): 'PROVIDER_NATIVE' | 'EXA_NEURAL' | 'BROWSER_CDP_OWL' {
if (this.isCircuitBroken('BROWSER_CDP_OWL') && modality === 'map') {
return 'EXA_NEURAL';
}
if (modelFamily === 'gpt') {
// Data empiris: Exa meningkatkan GPT-5.6 Sol sebesar +7.56%
return modality === 'text' || modality === 'table' ? 'EXA_NEURAL' : 'PROVIDER_NATIVE';
}
if (modelFamily === 'gemini') {
// Data empiris: Exa menurunkan akurasi Gemini 3.7 (-9.46%) dan memboroskan token 47x lipat
return 'PROVIDER_NATIVE';
}
// Default fallback untuk modalitas visual interaktif (maps, dynamic canvas)
return depthHop > 3 ? 'EXA_NEURAL' : 'BROWSER_CDP_OWL';
}
public recordStepFailure(harness: string): void {
const current = this.consecutiveFailures.get(harness) || 0;
this.consecutiveFailures.set(harness, current + 1);
}
public isCircuitBroken(harness: string): boolean {
return (this.consecutiveFailures.get(harness) || 0) >= this.maxAllowedConsecutiveErrors;
}
}
7. Rekomendasi Rekayasa untuk Pengembang Sistem Autonomous Agent 2026
Bagi tim rekayasa perangkat lunak dan arsitek AI yang membangun sistem autonomous agent di tahun 2026, hasil riset HyperBrowseComp memberikan panduan taktis yang sangat berharga:
-
1. Jangan Pernah Mengandalkan Satu Provider Retrieval Tunggal: Model yang berbeda memiliki bias representasi yang berbeda terhadap format snippet pencarian. Gunakan orkestrasi adaptif: kirim kueri faktual ke native provider search, namun alihkan kueri crawling mendalam ke API neural (seperti Exa/Firecrawl) dengan sanitasi token yang ketat.
-
2. Terapkan Fail-Closed Circuit Breaker pada Tool Browser Interaktif: Kegagalan 93 run pada harness OWL membuktikan bahwa tool browser interaktif (CDP/Playwright) sangat rentan terhadap DOM freeze dan canvas tak terbaca. Pasang batas toleransi maksimal 2 kegagalan berturut-turut sebelum secara otomatis menurunkan (graceful degradation) mode agen ke ekstraksi teks terstruktur atau API langsung.
-
3. Prioritaskan Pipeline OCR & Transkrip Multimodal Lokal: Dengan 64.3% pertanyaan membutuhkan bukti non-teks, agen web yang hanya mengandalkan parser HTML akan gagal total. Integrasikan modul ekstraksi OCR gambar dan transkripsi audio/video berlatensi rendah sebelum meneruskan payload ke context window reasoning model.



