NS
NEWSAINT
ai-eng• 8 MIN READ•5 Oktober 2026

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Breakthrough Frontier Evaluation arXiv:2610.03574 [cs.CL, cs.AI]

Executive Summary: Menguji Batas Kemampuan Agen Web Otonom di Luar Dominasi Bahasa Inggris & Konten Teks Statis

Makalah riset frontier arXiv:2610.03574 (Oktober 2026) berjudul "HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents" yang dipimpin oleh Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. (konsorsium riset internasional dari MBZUAI, Mila – Quebec AI Institute, Inception AI, Alibaba Group, dan AI Singapore) memperkenalkan tolok ukur evaluasi paling ketat dan komprehensif bagi autonomous web-browsing agents.

Berbeda dengan benchmark web klasik seperti BrowseComp, WebArena, dan GAIA yang didominasi oleh pertanyaan trivia berbahasa Inggris dan ekstraksi teks HTML sederhana, HyperBrowseComp menyajikan 423 pertanyaan multi-hop bernilai tunggal yang ditulis secara independen oleh penutur asli melintasi 13 bahasa dunia (termasuk Bahasa Indonesia 9.2% dan Bahasa Jawa 8.3%) serta menuntut ekstraksi bukti melintasi 8 modalitas heterogen (Video YouTube 39.0%, Berkas PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Audio 10.6%, Tabel 10.2%, Peta 9.7%, dan Plot/Grafik 1.9%).

31.68%
Akurasi Tertinggi (Gemini 3.7 Flash)
57.68%
Shared Failure (Tak Terpecahkan Semua Model)
-9.46%
Harness Inversion Penalti Exa pada Gemini
93 Runs
Crash Fatal Runtime Tool pada Harness OWL

1. Krisis Evaluasi Web Agent: Saturasi Pengetahuan Parametrik & Jebakan Monolingual

Sejak paruh kedua tahun 2025, pergeseran paradigma dari Large Language Model (LLM) percakapan pasif menuju Autonomous Agent yang mengoperasikan perkakas (tool-using agents) telah mengubah arsitektur aplikasi AI di seluruh dunia. Agen kini diharapkan mampu menjelajahi web terbuka, membaca dokumentasi, melakukan scraping terarah, memverifikasi bukti silang, dan menarik kesimpulan faktual berlatensi tinggi.

Namun, perkembangan pesat ini membentur dinding besar pada infrastruktur tolok ukur (benchmarking). Benchmark generasi sebelumnya seperti GAIA, WebArena, dan BrowseComp mulai mengalami saturasi diskriminatif akibat dua cacat struktural:

  • Saturasi Pengetahuan Parametrik (Parametric Leakage): Banyak pertanyaan dalam BrowseComp memiliki karakteristik trivia faktual yang ternyata telah terhafalkan di dalam bobot model selama fase pre-training. Model sering kali memberikan jawaban benar bukan karena keberhasilan browsing, melainkan karena halusinasi yang kebetulan akurat berdasarkan memori internal.
  • Monolingual & Text-Centric Bias: Web dunia nyata tidak hanya tersusun dari artikel berita berbahasa Inggris. Sekitar 60% informasi operasional, logistik lokal, dan arsip pemerintah tersimpan dalam format visual (PDF hasil pindaian scan/OCR), rekaman video YouTube lokal, infografis peta, serta ditulis dalam bahasa non-Inggris yang memiliki terminologi budaya spesifik.
Pembersihan Kontaminasi Parametrik yang Ketat: Untuk memastikan tolok ukur menguji murni penelusuran bukti di web alih-alih hafalan parametrik, tim peneliti HyperBrowseComp menyaring seluruh calon pertanyaan menggunakan 7 model frontier tanpa akses internet sama sekali (Gemini 3.1 Pro Preview, Gemini 3.7 Flash, GLM-4.7, GPT-OSS-120B, Kimi K2 Thinking, MiniMax-M2, dan DeepSeek-V3.2). Setiap pertanyaan yang berhasil dijawab dengan benar oleh 2 model tanpa internet langsung dieliminasi. Dari seleksi ketat ini, 77 pertanyaan disingkirkan, menyisakan 423 pertanyaan yang murni membutuhkan penelusuran web aktif.

2. Metodologi HyperBrowseComp: 423 Soal, 13 Bahasa, 8 Modalitas, dan Protokol Anti-Kontaminasi

HyperBrowseComp dibangun dengan filosofi Single Short Answer: setiap pertanyaan memiliki jawaban tunggal yang ringkas, objektif, dan tidak ambigu (nama entitas, tanggal pasti, angka numerik presisi). Hal ini mengeliminasi perdebatan subjektif pada tahap penjurian otomatis.

Yang membuat tolok ukur ini luar biasa adalah kenyataan bahwa seluruh pertanyaan ditulis langsung oleh penutur asli (native speakers), bukan diterjemahkan dari dataset benih bahasa Inggris. Hal ini menjaga nuansa pencarian lokal, idiom, serta kebiasaan navigasi web yang autentik.

Dimensi Klasifikasi Komposisi & Distribusi Contoh Kasus Nyata & Tantangan Ekstraksi
Bahasa Sumber (13 Bahasa) Indonesia (9.2%), Thai (9.2%), Jerman (9.0%), Filipino (8.5%), Jawa (8.3%), Korea (8.3%), Spanyol (8.3%), Mandarin (8.0%), Telugu (8.0%), Arab Mesir (7.6%), Vietnam (5.9%), Rusia (5.2%), Uzbek (4.5%) Penelusuran nama lurah desa di Jawa Tengah dari dokumen PDF SK bupati, atau tanggal renovasi pasar tradisional di Chiang Mai dari video berita lokal.
Modalitas Bukti (8 Modalitas) Video YouTube (39.0%), PDF/Buku/OCR (29.8%), Aritmetika (28.1%), Gambar (18.4%), Audio (10.6%), Tabel (10.2%), Peta (9.7%), Grafik (1.9%) 64.3% pertanyaan membutuhkan minimal satu modalitas non-teks. Agen harus menonton segmen video tertentu atau melakukan OCR pada struk/peta navigasi.
Domain Masalah (12+ Domain) Ekonomi & Bisnis (18.9%), Media & Hiburan (15.8%), Pendidikan (11.3%), Geografi & Transportasi (9.0%), Games (7.8%), Musik (7.3%), Sains (6.9%) Menghitung selisih tarif kargo pelabuhan, mengecek tanggal rilis patch game regional, hingga menafsirkan peraturan pemilu lokal.

3. Hasil Pengujian Model Frontier: Performa Native Search, Exa API, dan OWL Harness

Penelitian ini menguji lima model bahasa frontier komersial dalam konfigurasi mesin penelusuran bawaan penyedia (built-in search), serta membandingkannya dengan mesin penelusuran saraf eksternal Exa dan harness agen visual interaktif berbasis browser nyata OWL.

Arsitektur Harness Model Penguji Soal Benar (423) Akurasi (%) Total Token (M) Waktu Eksekusi (Jam)
Built-in Native Gemini 3.7 Flash 134 / 423 31.68% 14.1 M 129.5 h
Built-in Native Gemini 3.1 Pro Preview 108 / 423 25.53% 10.2 M 45.3 h
Built-in Native GPT-5.6 Sol 81 / 423 19.15% 43.6 M 19.9 h
Built-in Native GPT-5.6 Terra 67 / 423 15.84% 33.1 M 11.1 h
Built-in Native GPT-5.6 Luna 49 / 423 11.58% 27.5 M 8.5 h
Exa Neural Search GPT-5.6 Sol 113 / 423 26.71% (+7.56%) 928.8 M 75.1 h
Exa Neural Search Gemini 3.7 Flash 94 / 423 22.22% (-9.46%) 663.9 M 22.7 h
Exa Neural Search Gemini 3.1 Pro Preview 77 / 423 18.20% (-7.33%) 558.3 M 51.3 h
OWL Browser Harness Gemini 3.7 Flash 75 / 423 17.73% (-13.95%) 195.3 M 125.1 h

4. Fenomena Harness Inversion: Mengapa Mengganti Retrieval API Mengacaukan Performa Model?

Salah satu temuan paling berharga dari studi HyperBrowseComp adalah bukti empiris mengenai Harness Inversion: asumsi bahwa mesin pencarian saraf (seperti Exa) adalah pengganti serbaguna (drop-in replacement) yang selalu meningkatkan kecerdasan agen ternyata keliru secara mendasar.

Dampak Positif pada GPT-5.6 Sol (+7.56%)

Pencarian bawaan ChatGPT (Sol) memiliki filter heuristik agresif yang kerap memotong kueri multi-bahasa yang tidak umum. Dengan Exa, agen mendapatkan akses ke scraping halaman penuh dan indeks neural yang lebih luas, melonjakkan akurasi dari 19.15% ke 26.71%. Namun, konsumsi token melonjak drastis hingga 928.8 juta token (21x lipat lebih boros).

Degradasi Parah pada Gemini 3.7 Flash (-9.46%)

Gemini 3.7 Flash dilatih secara mendalam untuk berinteraksi dengan API Google Search bawaan yang mengembalikan cuplikan terstruktur ringkas dan sitasi indeks asli. Ketika dipaksa memakai Exa melalui prompt ReAct, model mengalami kelebihan muatan konteks (context pollution), mengalami halusinasi tautan, dan akurasinya merosot dari 31.68% ke 22.22%.

Kerapuhan Runtime pada Interaksi Browser Penuh (OWL Failure): Pada harness OWL yang mengendalikan browser nyata secara visual, tercatat 93 kegagalan terminal (unhandled runtime exceptions) dari 423 uji coba. Agen sering kali terjebak dalam loop klik tanpa batas, elemen DOM yang tidak merespons, atau kebocoran memori saat membuka stream video. Hal ini membuktikan bahwa agen browser modern menderita akibat kerapuhan perkakas (tool brittleness) jauh lebih besar daripada keterbatasan penalaran murni.

5. Evaluasi Manusia vs Agen AI: Disparitas Kinerja pada Bahasa Non-Inggris (Indonesia, Thai, Vietnam)

Untuk mengkalibrasi tingkat kesulitan benchmark, peneliti merekrut penutur asli untuk menyelesaikan sampel 30 pertanyaan (masing-masing 10 pertanyaan dalam Bahasa Indonesia, Thai, dan Vietnam) tanpa bantuan LLM, dengan batas waktu maksimal 60 menit per soal.

Bahasa Pengujian Akurasi Manusia (10 Soal) Waktu Rata-Rata Manusia Akurasi Gemini 3.7 Flash Tingkat Kegagalan Total Model
Bahasa Indonesia 6 / 10 (60.0%) 40.2 menit (Cepat) 3 / 10 (30.0%) 69.2% Gagal (27/39)
Bahasa Thai 3 / 10 (30.0%) 159.7 menit (Lambat) 3 / 10 (30.0%) 66.7% Gagal (26/39)
Bahasa Vietnam 6 / 10 (60.0%) 68.6 menit 7 / 10 (70.0%) 40.0% Gagal (10/25)
Total Agregat (30 Soal) 15 / 30 (50.0%) 89.5 menit 13 / 30 (43.3%) 57.68% Rerata Global

Perhatikan kontras yang sangat menarik: Penutur asli Indonesia mampu memecahkan soal dengan akurasi 60% dalam waktu tercepat (40.2 menit), memanfaatkan pemahaman kontekstual terhadap situs portal berita daerah, portal pemerintah daerah, dan istilah slang. Namun sebaliknya, model AI frontier paling canggih justru mengalami kegagalan hingga 69.2% pada Bahasa Indonesia. Model sering kali gagal memahami singkatan birokrasi lokal, salah menafsirkan penulisan tanggal di portal web daerah, atau terjebak pada halaman paywall/reklame.

6. Implementasi Arsitektur Produksi: Resilient Multimodal Browsing Harness & Circuit Breaker (TypeScript)

Berdasarkan kelemahan fatal yang terungkap pada HyperBrowseComp, arsitektur agen penelusuran web di tingkat enterprise harus meninggalkan pola naive ReAct tunggal. Di bawah ini adalah modul arsitektur Resilient Multimodal Browsing Harness yang mengimplementasikan Circuit Breaker, Dynamic Harness Routing, serta isolasi modalitas untuk mencegah kegagalan beruntun:

typescript / agent-harness/resilient-browser.ts PRODUCTION HARNESS SPEC
// Production Architecture: Resilient Multilingual & Multimodal Web-Browsing Agent Harness
// Mengatasi Masalah Harness Inversion, Tool Fragility, dan Multi-Hop Clue Chaining
// Berdasarkan Analisis Empiris HyperBrowseComp (arXiv:2610.03574 - Oktober 2026)

export interface SearchEvidence {
  sourceUrl: string;
  modality: 'text' | 'image' | 'video_transcript' | 'pdf_ocr' | 'map' | 'table';
  language: string;
  extractedSnippet: string;
  confidenceScore: number;
  retrievalLatencyMs: number;
  circuitBreakerState: 'CLOSED' | 'HALF_OPEN' | 'OPEN';
}

export interface ClueTrajectoryStep {
  stepIndex: number;
  queryFormulated: string;
  detectedModality: string;
  targetLanguage: string;
  selectedHarness: 'PROVIDER_NATIVE' | 'EXA_NEURAL' | 'BROWSER_CDP_OWL';
  rawResponseTokens: number;
  verifiedAnswerPart?: string;
}

export class ResilientBrowsingHarness {
  private consecutiveFailures: Map = new Map();
  private maxAllowedConsecutiveErrors = 2; // Mencegah 93 terminal tool crashes seperti pada OWL

  /**
   * Adaptive Harness Router:
   * Mengatasi Harness Inversion di mana model tertentu (misal GPT-5.6) optimal pada Exa,
   * sedangkan keluarga Gemini membutuhkan built-in retrieval API untuk mempertahankan efisiensi token.
   */
  public selectOptimalHarness(
    modelFamily: 'gemini' | 'gpt' | 'claude' | 'open_weights',
    modality: SearchEvidence['modality'],
    depthHop: number
  ): 'PROVIDER_NATIVE' | 'EXA_NEURAL' | 'BROWSER_CDP_OWL' {
    if (this.isCircuitBroken('BROWSER_CDP_OWL') && modality === 'map') {
      return 'EXA_NEURAL';
    }

    if (modelFamily === 'gpt') {
      // Data empiris: Exa meningkatkan GPT-5.6 Sol sebesar +7.56%
      return modality === 'text' || modality === 'table' ? 'EXA_NEURAL' : 'PROVIDER_NATIVE';
    }

    if (modelFamily === 'gemini') {
      // Data empiris: Exa menurunkan akurasi Gemini 3.7 (-9.46%) dan memboroskan token 47x lipat
      return 'PROVIDER_NATIVE';
    }

    // Default fallback untuk modalitas visual interaktif (maps, dynamic canvas)
    return depthHop > 3 ? 'EXA_NEURAL' : 'BROWSER_CDP_OWL';
  }

  public recordStepFailure(harness: string): void {
    const current = this.consecutiveFailures.get(harness) || 0;
    this.consecutiveFailures.set(harness, current + 1);
  }

  public isCircuitBroken(harness: string): boolean {
    return (this.consecutiveFailures.get(harness) || 0) >= this.maxAllowedConsecutiveErrors;
  }
}

7. Rekomendasi Rekayasa untuk Pengembang Sistem Autonomous Agent 2026

Bagi tim rekayasa perangkat lunak dan arsitek AI yang membangun sistem autonomous agent di tahun 2026, hasil riset HyperBrowseComp memberikan panduan taktis yang sangat berharga:

  • 1. Jangan Pernah Mengandalkan Satu Provider Retrieval Tunggal: Model yang berbeda memiliki bias representasi yang berbeda terhadap format snippet pencarian. Gunakan orkestrasi adaptif: kirim kueri faktual ke native provider search, namun alihkan kueri crawling mendalam ke API neural (seperti Exa/Firecrawl) dengan sanitasi token yang ketat.
  • 2. Terapkan Fail-Closed Circuit Breaker pada Tool Browser Interaktif: Kegagalan 93 run pada harness OWL membuktikan bahwa tool browser interaktif (CDP/Playwright) sangat rentan terhadap DOM freeze dan canvas tak terbaca. Pasang batas toleransi maksimal 2 kegagalan berturut-turut sebelum secara otomatis menurunkan (graceful degradation) mode agen ke ekstraksi teks terstruktur atau API langsung.
  • 3. Prioritaskan Pipeline OCR & Transkrip Multimodal Lokal: Dengan 64.3% pertanyaan membutuhkan bukti non-teks, agen web yang hanya mengandalkan parser HTML akan gagal total. Integrasikan modul ekstraksi OCR gambar dan transkripsi audio/video berlatensi rendah sebelum meneruskan payload ke context window reasoning model.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.

Ilustrasi Arsitektur Teknis 16:9 AutoCompact 2026: Arsitektur Proactive Context Compaction pada Long-Horizon Coding Agents, Eliminasi Context Bloat Tanpa Menunggu Window Overflow, dan Terobosan SFT + Outcome-Based RL

AutoCompact 2026: Arsitektur Proactive Context Compaction pada Long-Horizon Coding Agents, Eliminasi Context Bloat Tanpa Menunggu Window Overflow, dan Terobosan SFT + Outcome-Based RL

Analisis arsitektur sistemik riset frontier software engineering autonomous agents (arXiv:2610.02163, Xuan Zhang, Longtao Zheng, Cunxiao Du, Bo An, Xin Dong — SMU, NTU, Harvard): Mengapa strategi pemadatan konteks tradisional (length-triggered compaction) gagal total pada trajectory panjang repository-level karena baru merangkum setelah mencapai batas context window (16K/32K/128K). Memperkenalkan AutoCompact, framework yang mengintegrasikan aksi proactive compact() ke dalam policy model itu sendiri. Melalui 3 pilar penentu (When to compact, What to keep, How to continue), pengumpulan data on-policy berbasis online judge correction (Trigger 24%, Working-state 53%, Continuation 23%), serta joint training SFT dilanjutkan Outcome-Based RL (GRPO dengan binary task success), AutoCompact mendongkrak pass rate SWE-bench Verified sebesar +9.2% dan SWE-PolyBench Verified sebesar +5.0%, membuktikan bahwa konteks panjang 256K sekalipun membutuhkan pembersihan proaktif dari akumulasi hipotesis usang dan noise eksplorasi.