NS
NEWSAINT
ai-eng• 8 MIN READ•27 September 2026

Snowglobe & Screen-Before-Serve 2026: Arsitektur Simulasi Agen CX pada Skala 140 Juta Nasabah Nubank, Tool-Boundary Trajectory, dan Validasi Open-Weight LLM Tanpa Risiko Produksi

Studi kasus arsitektur sistemik riset frontier AI engineering perbankan (arXiv:2609.30137, 24 September 2026): Bagaimana Nubank mengevaluasi dan mengoperasikan autonomous Customer Experience (CX) agents pada skala 140 juta nasabah di Amerika Latin tanpa membahayakan data perbankan atau merusak kepercayaan nasabah. Makalah ini membongkar kegagalan unit test deterministik dan dataset historis statis dalam mendeteksi dialog drift, lalu memperkenalkan paradigma Screen-Before-Serve berbasis simulator Snowglobe. Melalui simulasi trajektori tool-boundary dengan persona nasabah sintetik dan mocking stateful API perbankan, Nubank mampu melakukan skrining hipotesis secara offline, mempercepat siklus rilis 4.8x (dari 21.2 hari menjadi 4.4 hari per versi), meningkatkan transactional NPS (tNPS) hingga +36.69 poin dalam uji A/B langsung, dan menguji 29 konfigurasi model open-weights (Qwen3.5, Qwen3.6, Nemotron-3, GPT-OSS) di lebih dari 16.000 percakapan. Hasil produksi membuktikan bahwa model open-weight Qwen3.5-122B-A10B berhasil mencatat rekor Self-Service Rate tertinggi sepanjang sejarah Nubank (+8.82 percentage points) dengan latensi p95 25% lebih rendah dan nol degradasi kepuasan nasabah.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 Snowglobe & Screen-Before-Serve 2026: Arsitektur Simulasi Agen CX pada Skala 140 Juta Nasabah Nubank, Tool-Boundary Trajectory, dan Validasi Open-Weight LLM Tanpa Risiko Produksi

Executive Architectural Summary

Mengoperasikan autonomous Customer Experience (CX) AI agents pada skala 140 juta nasabah di lembaga finansial seperti Nubank menghadirkan dilema teknis eksistensial: bagaimana memvalidasi perubahan prompt, routing policy, hingga migrasi dari model komersial ke open-weight LLM tanpa mengekspos nasabah pada kegagalan transaksi, halusinasi saldo, atau pelanggaran regulasi perbankan. Monograf riset frontier (arXiv:2609.30137, September 2026) memperkenalkan paradigma Screen Before You Serve menggunakan simulator Snowglobe. Melalui simulasi trajektori tool-boundary dengan persona nasabah sintetik dan mocking stateful API perbankan, Nubank mampu memvalidasi agen secara offline, mempercepat siklus rilis 4.8x lebih cepat (dari 21.2 hari menjadi 4.4 hari per versi), mendongkrak transactional Net Promoter Score (tNPS) hingga +36.69 poin, dan menyaring 29 konfigurasi model open-weight di lebih dari 16.000 dialog. Dalam uji coba A/B produksi nyata, konfigurasi model terbuka Qwen3.5-122B-A10B membukukan rekor Self-Service Rate (SSR) tertinggi dalam sejarah Nubank (+8.82 percentage points) dengan latensi p95 25% lebih rendah dan zero kepuasan nasabah yang terdegradasi.

1. Krisis Evaluasi Agen Autonomous pada Skala 140 Juta Nasabah

Dalam ekosistem perbankan digital modern berskala masif, customer support bukan lagi sekadar pusat penjawab FAQ statis, melainkan orkestrasi tool-calling autonomous agents yang memiliki otorisasi melakukan mutasi status rekening perbankan: memblokir kartu debit/kredit yang terindikasi fraud, mengubah limit transaksi, menerbitkan ulang kartu fisik, hingga menjadwalkan ulang rute logistik ekspedisi.

Namun, tim platform engineering di institusi finansial skala 140 juta nasabah seperti Nubank menghadapi The Production Evaluation Trilemma:

  • Kegagalan Deterministic Unit Tests & Mocks: Unit test berbasis assert regex atau JSON response mocking hanya mampu menguji satu langkah tunggal (single-turn isolated call). Pendekatan ini buta terhadap dinamika percakapan multi-turn: kegagalan retensi konteks, ambiguitas input pengguna yang berulang, atau tool hallucination cascade yang baru muncul di putaran percakapan ke-5.
  • Off-Policy Distribution Shift pada Dataset Historis: Mengevaluasi kandidat agen baru di atas transkrip rekaman pengguna nyata di masa lalu (held-out historical logs) adalah ilusi metodologis. Begitu prompt, urutan pertanyaan, atau model LLM berubah, respon agen berubah. Pengguna manusia nyata tentu akan memberikan reaksi balasan yang sama sekali berbeda dari transkrip statis masa lalu. Ini adalah off-policy counterfactual collapse.
  • Bahaya Nyata Live A/B Testing: Menjalankan uji coba A/B secara langsung pada nasabah hidup (live customer exposure) membawa risiko fatal: hilangnya kepercayaan nasabah, lonjakan komplain eskalasi ke agen manusia, hingga sanksi hukum dari regulator moneter (seperti Bank Sentral Brasil / BACEN) jika agen salah mengonfirmasi identitas atau memvalidasi alamat pengiriman kartu curian.

2. Paradigma Screen Before You Serve & Arsitektur Simulator Snowglobe

Untuk memecahkan trilema ini, konsorsium periset Nubank dan Galileo Technologies merancang paradigma Screen Before You Serve dengan memanfaatkan simulator Snowglobe.

Prinsip inti dari metodologi ini bukanlah mencoba mereplikasi 100% perilaku acak dunia nyata secara absolut, melainkan hypothesis-driven screening: apakah perbedaan perilaku antara kandidat agen (Candidate) dan versi agen aktif saat ini (Incumbent) cukup signifikan untuk membenarkan atau menolak peluncuran ke lingkungan produksi nyata?

ARCHITECTURE CONCEPT / SNOWGLOBE EXECUTION FLOW MULTI-TURN TRAJECTORY
[Synthetic Customer Generator] <---> [Multi-Turn Persona Controller]
          |                                      |
          | (User Speech / Inquiries)            | (State Transitions)
          v                                      v
  [Candidate CX Agent]  ================> [Tool-Boundary Interceptor]
  (LLM Prompt / Policy)                         |
                                                | (Intercepted Tool Calls)
                                                v
                                 [Stateful Banking World Model]
                                 - Card Status Consistency
                                 - Relational Schema Validation
                                 - Zero Live Backend Invocation

Tiga inovasi arsitektur fundamental dalam simulator Snowglobe:

  1. Tool-Boundary Trajectory Simulation: Simulator memutus koneksi langsung ke backend core banking. Setiap pemanggilan fungsi (tool call) dicegat di perbatasan antarmuka. Stateful tools (seperti pemblokiran kartu, pembaruan alamat, kueri status pengiriman) ditangani oleh Stateful Banking World Model sintetik yang menjamin konsistensi relasional antar putaran percakapan. Jika agen meminta kueri status dua kali berturut-turut, status tidak boleh berubah tanpa adanya aksi mutasi di antaranya.
  2. Persona-Driven Synthetic Customers: Berakar dari metodologi Generative Agents (Park et al., 2023), Snowglobe mengonstruksi profil nasabah sintetik yang memiliki tujuan spesifik, batasan memori, tingkat kooperatif, dan ekspresi emosi (frustrasi, panik akibat kartu hilang, atau tenang) yang mencerminkan bahasa Portugis Brasil kontemporer.
  3. Falsifiable Screening Criteria (C): Setiap putaran skrining dipandu oleh hipotesis yang dapat diuji (misal: "Memperbaiki instruksi verifikasi alamat akan memangkas transfer tidak perlu ke manusia minimal 5% tanpa meningkatkan reissue ganda"). Evaluasi dilakukan menggunakan Standing Evaluator Suite terkalibrasi manusia secara konsisten pada baseline incumbent maupun kandidat.

3. Empat Pilar Diagnostik Karakterisasi Simulator (P1 – P4)

Sebelum Snowglobe diizinkan menjadi gatekeeper resmi bagi rilis produksi, periset menguji validitas representasional simulator melalui 4 diagnostik komplementer (P1 hingga P4) pada agen Card Delivery (CD) versi V1 hingga V4 terhadap 1.000 dialog produksi riil:

Diagnostik Metode Pengukuran Hasil Observasi Snowglobe Implikasi Produksi
P1: Conversation Length Distribusi jumlah kata pesan & user turns Simulasi: 55% dialog ≥ 6 turns vs Produksi: 24% Simulasi menguji ketahanan agentic pada skenario yang lebih panjang dan lebih menantang daripada rata-rata riil.
P2: Embedding Proximity Cosine & Euclidean distance text-embedding-3-large + UMAP Jarak Cosine 0.035 - 0.065 (vs Off-topic: 0.174 - 0.262) Distribusi dialog sintetik terkonsentrasi sangat rapat di sekeliling centroid produksi riil.
P3: Evaluator-Score Association Korelasi Pearson r & Kendall τ terhadap urutan versi Pearson r = 0.74, Kendall τ = 0.67 Snowglobe melestarikan ranking produksi secara akurat (V4 terbaik di 96.69% bootstrap, V2 terburuk di 100%).
P4: Blinded Human Discrimination 7 pakar perbankan mengklasifikasi 100 transkrip acak Akurasi manusia hanya 70.0% pada dialog simulasi Pakar perbankan terkecoh pada 30% dialog sintetik, menganggapnya sebagai nasabah manusia riil.

4. Pembuktian Produksi: Card Management & Lonjakan tNPS +36.69 Poin

Setelah validasi simulator selesai, Nubank mengaplikasikan resep skrining ini pada pengembangan Card Management (CM)—agen chat dengan volume tertinggi di Brasil yang menggantikan Card Delivery untuk menangani seluruh siklus hidup kartu.

Dalam proses iterasi offline dengan Snowglobe, versi V5 CM berhasil menurunkan tingkat kegagalan transfer ke manusia yang tidak perlu (unnecessary transfer failure rate) menjadi 16.0%, dibandingkan dengan 22.4% pada V1 CM, 28.8% pada V3 CM, dan 34.0% pada V2/V4 CM. Penurunan 6.4 percentage point ini menjadi justifikasi untuk meloloskannya ke uji coba langsung.

Hasil pengujian A/B live pada skala masif membuktikan keunggulan spektakuler:

Percobaan Live A/B Nubank Metrik Kunci Selisih Performa (Δ) 95% Confidence Interval Ukuran Sampel (n)
Card Management vs. Card Delivery Self-Service Rate (SSR) +4.90 percentage points [4.08, 5.71] 27.800 percakapan
Card Management vs. Card Delivery Transactional NPS (tNPS) +36.69 poin [32.81, 40.57] 2.000 survei
Qwen3.5-122B-A10B (Reasoning On) vs. Incumbent Self-Service Rate (SSR) +8.82 percentage points [7.95, 9.69] 8.400 percakapan
Qwen3.5-122B-A10B (Reasoning On) vs. Incumbent Transactional NPS (tNPS) -1.21 poin (Statistically Unchanged) [-3.97, 1.55] 2.300 survei
Qwen3.5-122B-A10B (Reasoning On) vs. Incumbent p95 Latency Serving Stack -25.0% Latency Reduction Point Estimate Production Stack

Selain metrik bisnis di atas, efisiensi siklus pengembangan sistem melonjak drastis:

  • Siklus pengembangan 10 versi Card Delivery sebelumnya memakan waktu 212 hari kalender (rata-rata 21.2 hari per versi).
  • Siklus pengembangan 5 versi Card Management dengan skrining Snowglobe hanya memakan waktu 22 hari kalender (rata-rata 4.4 hari per versi).
  • Ini merepresentasikan akselerasi kecepatan rilis 4.8x, di mana satu batch 100 trajektori simulasi multi-turn dapat diselesaikan dalam waktu kurang dari 10 menit!

5. Skrining Model Open-Weight (>16.000 Dialog, 29 Konfigurasi)

Bagi organisasi skala perbankan, ketergantungan pada model komersial terpusat berpemilik (seperti GPT-5.2) memunculkan risiko kedaulatan data, lonjakan biaya token API, dan latensi jaringan cross-border. Nubank memanfaatkan Snowglobe untuk menyaring 29 konfigurasi model open-weights di lebih dari 16.000 dialog simulasi, meliputi keluarga model:

  • Qwen3.5-122B-A10B (Qwen Team, 2026)
  • Qwen3.6-35B-A3B (Qwen Team, 2026)
  • Nemotron-3-Super-120B-A12B (NVIDIA, 2026)
  • GPT-OSS-120B (OpenAI Open Source, 2025/2026)

Tabel Komparasi Evaluasi Kegagalan Kanonikal (Failure Rates %)

Evaluasi kanonikal mengukur 4 pilar kegagalan (↓ makin rendah makin baik): Input Gathering, Card Reissue Validity, Information Retrieval Status, dan Conversation Completeness.

Model Family Reasoning Setting Input Fail (%) ↓ Reissue Fail (%) ↓ Status Fail (%) ↓ Complete Fail (%) ↓
GPT-5.2 (Incumbent) — 3.6 ± 3.0 25.2 ± 7.9 2.4 ± 3.3 37.6 ± 10.1
Qwen3.6-35B-A3B Off 1.6 ± 1.7 24.0 ± 3.7 29.2 ± 9.0 25.2 ± 4.1
Qwen3.6-35B-A3B On 1.2 ± 1.8 14.0 ± 3.7 25.6 ± 3.3 17.6 ± 7.4
Qwen3.5-122B-A10B On (Pemenang Skrining) 0.4 ± 0.9 25.4 ± 7.7 35.2 ± 10.1 22.6 ± 12.2
Qwen3.5-122B-A10B Off 0.8 ± 1.1 24.8 ± 7.7 38.8 ± 6.9 16.0 ± 3.7
Nemotron-3-Super-120B Off 6.4 ± 2.2 32.0 ± 7.6 21.2 ± 5.0 60.8 ± 12.5
Nemotron-3-Super-120B Low 3.2 ± 2.3 20.0 ± 6.3 36.4 ± 2.6 18.0 ± 4.2
GPT-OSS-120B Medium 3.2 ± 2.3 26.0 ± 7.7 17.6 ± 7.9 20.8 ± 4.6

Dilema Test-Time Compute pada Autonomous Tool-Calling Agents

Studi empiris ini menemukan fenomena krusial yang harus diwaspadai oleh setiap architect AI: reasoning effort / test-time compute bukanlah peluru perak gratis.

  • Pada Nemotron-3-Super, menaikkan reasoning dari Off ke Low memang mereduksi kegagalan Complete secara dramatis dari 60.8% ke 18.0%, tetapi justru meningkatkan kegagalan Status dari 21.2% menjadi 36.4%. Model yang "terlalu banyak berpikir" kerap mengalami over-deliberation sebelum memanggil tool pembaca status pengiriman.
  • Pada Qwen3.5-122B-A10B, reasoning berhasil menekan kegagalan Input ke level nyaris nol (0.4%) dan memangkas kegagalan Complete sebesar 15.0 percentage points dibanding incumbent GPT-5.2. Kelemahan pada kegagalan Status (35.2% vs 2.4%) berhasil diidentifikasi sebelum rilis dan diperbaiki melalui optimasi prompt terarah.

6. Spesifikasi Teknis: Implementasi Snowglobe Simulation Harness di TypeScript

Berikut adalah arsitektur referensi modul simulasi trajektori tool-boundary, stateful world model mocking, dan evaluator kanonikal yang dapat diintegrasikan ke dalam pipeline CI/CD agentic:

lib/agent-simulation/snowglobe-harness.ts PRODUCTION SPEC / TYPESCRIPT
${SNOWGLOBE_CODE_SNIPPET}

7. Rekomendasi Praktis bagi Enterprise AI Platform Engineers

Bagi organisasi enterprise yang membangun dan mendeploy autonomous agentic systems, temuan Nubank memberikan 4 pelajaran implementasi berharga:

  1. Wajibkan Simulasi Multi-Turn Sebelum A/B Testing: Hentikan kebiasaan langsung menguji prompt baru pada pengguna produksi. Satu batch simulasi 100 trajektori sintetik dapat memverifikasi regresi logika dalam hitungan menit tanpa membahayakan reputasi brand.
  2. Pisahkan Boundary Tool dari Implementasi Backend: Bangun mocking layer stateful di tingkat RPC/MCP boundary yang menjamin konsistensi entitas data sepanjang sesi percakapan. Jangan biarkan simulator memanggil database atau microservices produksi.
  3. Kalibrasi Evaluator LLM terhadap Anotasi Manusia: Evaluator otomatis (LLM-as-a-Judge) hanya memiliki nilai prediktif jika memiliki korelasi ranking terbukti ($r > 0.70$) terhadap penilaian pakar domain riil.
  4. Uji Model Terbuka Mandiri untuk Mengurangi Vendor Lock-In: Seperti yang dibuktikan oleh keberhasilan Qwen3.5 di Nubank, model open-weight modern dengan orkestrasi yang tepat mampu melampaui metrik efisiensi dan latensi model komersial termahal tanpa mengorbankan kepuasan nasabah.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.