NS
NEWSAINT
ai-eng• 16 MIN READ•6 Oktober 2026

CUAWright 2026: Arsitektur Minimal Terminal Harness ~3K LOC untuk Digital Agents, Eliminasi Bottleneck GUI-Native, Vision-on-Demand, dan Lompatan Performa +44.0% pada Long-Horizon Tasks

Analisis arsitektur sistem frontier riset digital agents (arXiv:2610.04116, Microsoft Research, OSU, NUS, CMU — Yadong Lu, Theodore Lee, Yifei Li, Lawrence Keunho Jang, Tianci Xue, Yu Su, Huan Sun, Ahmed Hassan Awadallah): Mengapa paradigma Computer-Use Agent (CUA) berbasis GUI visual dan static domain-specific harness membentur inefisiensi biaya serta kerapuhan grounding koordinat. Memperkenalkan CUAWright, minimal terminal harness (~3K baris kode) yang menjadikan perintah Bash sebagai antarmuka aksi tunggal (sole action interface), workspace sistem berkas sebagai memori eksternal berevolusi, dan vision-on-demand alih-alih screenshot otomatis tiap langkah. Evaluasi komprehensif pada 6 benchmark frontier membuktikan CUAWright melesat dengan lonjakan partial reward +33.2% dan pemangkasan biaya token 37.5% di OSWorld 2.0 (GPT-5.6 Sol / GPT-5.5), keunggulan +44.0% success rate di Odysseys, +4.7% di Online-Mind2Web, serta lompatan skor Vision2Code hingga 79.0% di BenchCAD.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
CUAWright Minimal Unified Interface for Digital Agents 2026
Frontier AI Agent Architecture arXiv:2610.04116 [cs.AI, cs.SE]

Executive Summary: Mengapa GUI-Native Harness Membatasi Potensi Model & Bagaimana Terminal Minimal Mengubah Paradigma Digital Agent

Makalah riset frontier arXiv:2610.04116 (Oktober 2026) berjudul "CUAWright: A Minimal Unified Interface for Digital Agents" yang dipublikasikan oleh kolaborasi peneliti Microsoft Research, The Ohio State University, National University of Singapore (NUS), dan Carnegie Mellon University (CMU) (Yadong Lu, Theodore Lee, Yifei Li, Lawrence Keunho Jang, Tianci Xue, Yu Su, Huan Sun, Ahmed Hassan Awadallah) membongkar kekeliruan mendasar pada arsitektur Computer-Use Agent (CUA) konvensional: menghubungkan agen digital ke GUI visual melalui klik koordinat dan tool-calling domain-spesifik yang kaku justru menciptakan overhead konteks masif, kerapuhan grounding visual, dan membatasi kapabilitas penalaran kode tingkat tinggi model frontier.

Sebagai solusinya, para peneliti memperkenalkan CUAWright, sebuah harness terminal minimalis yang hanya tersusun dari sekitar 3.000 baris kode (~3K LOC). CUAWright menetapkan bahwa setiap aksi agen adalah perintah terminal (Bash), sistem berkas lokal bertindak sebagai ruang memori eksternal yang dapat berevolusi, dan observasi visual bersifat Vision-on-Demand. Evaluasi lintas 6 tolok ukur bergengsi membuktikan keunggulan spektakuler CUAWright: peningkatan +33.2% relative partial reward di OSWorld 2.0 dengan penghematan biaya API sebesar 37.5%, kenaikan kesuksesan +44.0% pada tugas web horizon-panjang Odysseys, serta lonjakan IoU dari 55.8% ke 79.0% (+23.2%) pada pemodelan CAD 3D di BenchCAD.

+33.2%
Relative Partial Reward (OSWorld 2.0)
-37.5%
Pemangkasan Biaya Token / Tugas
+44.0%
Lonjakan Sukses di Odysseys Web Benchmark
~3K LOC
Footprint Kode Harness Minimalis

1. Mengapa Antarmuka GUI & Static Tool-Harness Menjadi Bottleneck Utama Frontier Agent?

Dalam beberapa tahun terakhir, penelitian mengenai Computer-Use Agents (CUA) berpusat pada peniruan interaksi manusia di tingkat permukaan: menggerakkan kursor mouse ke koordinat $(x, y)$, mengeklik tombol grafis, mengetikkan string ke input field aktif, atau menafsirkan accessibility tree (AXTree / DOM snapshot). Pendekatan ini diwujudkan melalui harness domain-spesifik seperti ekstensi browser, peramban Playwright, atau desktop virtual VNC.

Namun, seiring pesatnya lonjakan kapabilitas penalaran simbolik dan pembuatan kode (coding proficiency) pada model frontier seperti GPT-5.5, GPT-5.6 Sol, Claude Opus 5, dan Qwen3.5, paradigma antarmuka GUI statis ini justru menjadi hambatan sistemik yang melumpuhkan kemampuan model:

  • Pembengkakan Konteks Visual yang Eksplosif: Pada agen interaktif konvensional, setiap pergantian langkah (turn) selalu menyertakan screenshot layar penuh beresolusi tinggi (atau pohon DOM berukuran puluhan ribu node). Pada tugas horizon-panjang yang menuntut 80 hingga 150 langkah eksekusi, akumulasi gambar ini menghabiskan kuota context window dalam hitungan menit dan melambungkan biaya token API hingga puluhan dolar per tugas.
  • Kerapuhan Grounding Koordinat (Visual Hallucination): Meminta model memprediksi koordinat piksel $(x, y)$ untuk mengeklik elemen di tengah antarmuka desktop yang dinamis (misalnya dropdown menu yang menutup otomatis atau pop-up modal bertumpuk) memiliki tingkat kegagalan fatal tinggi. Kesalahan geser 5 piksel saja dapat membatalkan seluruh transaksi alur kerja.
  • Rigiditas Tool Harness yang Terkunci (Static Toolset): Harness konvensional membekukan daftar alat (tool definitions) sebelum eksekusi dimulai. Jika agen menghadapi skenario khusus—seperti kebutuhan memfilter berkas CSV ratusan megabita, mengekstrak arsip terkompresi, atau melakukan kueri regex berulang—agen tidak memiliki kebebasan untuk menyusun utilitas otomasi baru.
Wawasan Inti Tim Riset Microsoft & OSU: Lingkungan digital pada dasarnya jauh lebih dapat diprogram (programmable) daripada representasi visual antarmukanya. Sebagian besar aplikasi desktop modern, sistem operasi, browser peramban, dan sistem CAD berakar pada antarmuka sistem operasi yang dapat dieksekusi secara terprogram. Memberikan akses terminal Bash murni kepada model memberikan fleksibilitas tanpa batas untuk memanipulasi keadaan sistem secara langsung.

2. Formulasi Teoretis: Partially Observable Markov Decision Process & Aksi Terminal Tunggal

Dalam makalah CUAWright, tugas agen digital dimodelkan secara matematis sebagai Partially Observable Markov Decision Process (POMDP) dengan tupel formal:

$$\mathcal{M} = \langle \mathcal{S}, \mathcal{O}, \mathcal{A}_{\text{term}}, \mathcal{T} \rangle$$

di mana:

  • $\mathcal{S}$: Ruang keadaan lingkungan yang didekomposisi menjadi $s_t = (x_t, f_t)$, dengan $x_t$ merepresentasikan keadaan internal aplikasi/sistem dan $f_t$ merepresentasikan keadaan sistem berkas persisten (filesystem).
  • $\mathcal{O}$: Ruang observasi, di mana $o_t$ secara default hanya berupa keluaran teks standar (stdout/stderr) dari eksekusi terminal sebelumnya.
  • $\mathcal{A}_{\text{term}}$: Ruang tindakan terminal terpadu, di mana setiap aksi $a_t$ adalah perintah Bash yang valid.
  • $\mathcal{T}$: Fungsi transisi keadaan yang menghasilkan transisi $s_{t+1} = \mathcal{T}_E(s_t, a_t)$ dan observasi $o_{t+1}$.

Berbeda dari model hybrid yang mencampurkan aksi bash dengan puluhan tool khusus (misalnya click_mouse, press_key, navigate_browser), CUAWright mempertahankan ruang aksi $\mathcal{A}_{\text{term}}$ tetap seragam dan invarian lintas domain. Ketika manipulasi GUI memang tak terhindarkan (misalnya pada aplikasi desktop warisan yang tidak memiliki CLI), agen menggunakan perkakas baris perintah standar seperti xdotool, pyautogui, atau skrip Python khusus yang dipanggil melalui terminal.

3. Vision-on-Demand: Menghilangkan Screenshot Inflasi & Memotong Biaya Hingga Sepertiga

Salah satu inovasi paling berdampak dalam desain arsitektur CUAWright adalah prinsip Vision on Demand, Not by Default.

Pada paradigma konvensional:

$$o_t^{\text{conventional}} = \{ o_t^{\text{image}}, o_t^{\text{a11y}} \}$$

Di sini setiap langkah selalu menyuntikkan gambar snapshot layar ke konteks model. Pada CUAWright, observasi $o_t$ secara default murni terdiri dari teks respons terminal. Jika dan hanya jika agen membutuhkan verifikasi visual, agen memanggil alur inspeksi dua langkah:

  1. Agen mengeksekusi tool CLI penangkap layar dengan jalur penyimpanan berkas tertentu (misalnya: python3 -m cuawright.vision capture --out /workspace/inspect.png).
  2. Agen mengeksekusi tool pemuatan gambar (image loader CLI) untuk menyuntikkan berkas visual tersebut ke dalam konteks penalaran langkah berikutnya.

Hasilnya sangat mengejutkan: pada benchmark desktop OSWorld 2.0 yang menuntut interaksi intensif, biaya token API berkurang dari $13.90 menjadi $4.40 per tugas pada GPT-5.6 Sol (-68.3%) dan dari $16.10 menjadi $10.10 pada GPT-5.5 (-37.5%), sembari secara simultan meningkatkan skor akurasi karena model tidak terganggu oleh noise visual berulang.

4. Workspace Sistem Berkas sebagai Substrat Memori Eksternal & Konstruksi Perkakas Dinamis

Banyak framework agen modern menyusun arsitektur memori yang teramat rumit: basis data vektor terpisah, graf pengetahuan ad-hoc, atau modul memori semantik dengan API kustom. CUAWright menolak kompleksitas tersebut dan mengandalkan struktur yang telah teruji selama setengah abad: Sistem Berkas Lokal ($w_t \subseteq f_t$).

Memori Eksternal Tanpa State Khusus

Setiap kali agen ingin mempertahankan informasi penting—seperti nilai variabel yang diekstrak, log eksekusi menengah, atau catatan kegagalan langkah sebelumnya—agen menuliskannya ke berkas di $w_t$. Operasi memori menjadi aksi terminal biasa (cat, grep, sed, rm). Jika sebuah catatan menjadi usang, agen cukup menghapus atau memodifikasinya, mencegah akumulasi memori basi yang tidak dapat dihapus.

Konstruksi Perkakas Dinamis ($P_t$)

Himpunan program efektif agen didefinisikan sebagai $P_t = P_{\text{env}} \cup P_{\text{agent}}(w_t)$. Agen dapat membuat skrip Python baru di $w_t$, mengujinya di terminal, memodifikasi kodenya jika terjadi bug, dan menggunakannya berulang kali di langkah-langkah berikutnya. Ini memungkinkan agen menciptakan kemampuan baru yang disesuaikan secara instan dengan tantangan tugas.

5. Analisis Hasil Empiris: OSWorld 2.0, Odysseys, Online-Mind2Web, BenchCAD, dan WeaveBench

CUAWright dievaluasi secara ketat pada 6 lingkungan tugas digital dunia nyata:

Benchmark & Lingkungan Baseline Resmi / Harness Lain CUAWright (Model yang Sama) Delta Peningkatan Dampak Biaya API
OSWorld 2.0 (Desktop Full) GPT-5.5 Official: 47.5% GPT-5.5: 63.2% +15.7 pp (+33.1% rel) Hemat $6.0 / task
OSWorld 2.0 (Desktop Full) GPT-5.6 Sol Official: 62.7% GPT-5.6 Sol: 67.9% +5.2 pp (+8.3% rel) Hemat $9.5 / task (-68%)
Odysseys (Long-Horizon Web) GPT-5.4 GUI Native: 33.5% GPT-5.4: 77.5% +44.0 pp (2.31x lipat) Rerata 76.1 langkah
Odysseys (Long-Horizon Web) Claude Opus 4.6: 44.5% GPT-5.5: 88.0% +54.5 pp di atas GUI Kestabilan multi-domain
Online-Mind2Web (Live Web) GPT-5.4 GUI Native: 83.4% GPT-5.4: 88.1% +4.7 pp (+5.6% rel) Lompatan tugas hard: +12.2%
BenchCAD (Vision2Code CAD) GPT-5.5 + Python Tool: 55.8% GPT-5.5: 79.0% +23.2 pp IoU score Render & ukur iteratif
WeaveBench (114 Coding Tasks) Codex CLI Harness: 35.1% GPT-5.5: 53.5% +18.4 pp PassRate Skor agregat 49.9 → 66.4

6. Studi Ablasi Mendalam: Single-Agent vs Multi-Agent & Pengaruh Vital Akses Filesystem

Makalah ini menyajikan dua studi ablasi penting yang mematahkan sejumlah mitos populer dalam rekayasa agen AI:

Ablasi 1: Apakah Sistem Multi-Agent Selalu Mengungguli Single-Agent?

Banyak praktisi mengasumsikan bahwa memecah alur kerja menjadi hierarki Planner-Worker-Verifier akan otomatis mendongkrak performa. Pada pengujian OSWorld 2.0, konfigurasi Multi-Agent CUAWright pada GPT-5.6 Sol menghasilkan skor 67.3%, sementara konfigurasi Single-Agent meraih skor 67.9%.

Analisis jejak eksekusi mengungkap bahwa agen Planner sering kali menetapkan kriteria verifikasi yang terlalu kaku dan tidak realistis, memicu re-eksekusi yang tidak perlu. Lebih lanjut, konfigurasi multi-agent melipatgandakan jumlah interaksi median dari 101 turn menjadi 151 turn, meningkatkan latensi dan biaya tanpa memberikan keuntungan akurasi nyata. Model frontier modern telah memiliki kemampuan self-verification internal yang cukup matang jika diberi antarmuka terminal yang jelas.

Ablasi 2: Seberapa Kritis Keberadaan Akses Filesystem Langsung?

Ketika peneliti menguji CUAWright dengan mematikan akses langsung ke filesystem (agen dipaksa berinteraksi dengan berkas hanya melalui operasi GUI via mouse/keyboard xdotool), skor partial reward pada GPT-5.6 Sol anjlok drastis dari 67.9% menjadi 55.5% (-12.4 pp), dan skor strict reward anjlok dari 27.6% menjadi 15.5% (-12.1 pp).

Hal ini membuktikan secara empiris bahwa kemampuan membaca, menyunting, dan menyusun berkas secara terprogram melalui terminal adalah pilar utama di balik superioritas CUAWright.

7. Desain Arsitektur Produksi: CUAWright Minimalist Harness Engine (TypeScript)

Berikut adalah implementasi referensi arsitektur runtime CUAWright dalam TypeScript, yang memadukan eksekusi sandboxed Bash, inspeksi visual on-demand, dan persistent workspace management:

typescript / cuawright-harness-runtime.ts PRODUCTION SPEC (~3K LOC PHILOSOPHY)
// Production Architecture: CUAWright Minimal Unified Terminal Harness
// Berdasarkan Arsitektur Sistem Riset arXiv:2610.04116 (Oktober 2026 - Microsoft Research, OSU, NUS, CMU)
//
// Karakteristik Inti:
// 1. Single Action Space: Bash execution sebagai satu-satunya antarmuka tindakan agen.
// 2. Vision-on-Demand: Screenshot tidak dimuat secara default; visual di-load via CLI tool eksplisit saat diperlukan.
// 3. Persistent Workspace: Sistem berkas lokal (wt) sebagai memori eksternal tanpa overhead state terpisah.
// 4. Dynamic Tool Construction: Agen menulis skrip otomasi baru ke dalam workspace untuk digunakan kembali.

export interface ExecutionObservation {
  stdout: string;
  stderr: string;
  exitCode: number;
  visualArtifactUri?: string;
  executionDurationMs: number;
}

export interface WorkspaceArtifact {
  path: string;
  type: 'script' | 'log' | 'intermediate_data' | 'visual_cache';
  sizeBytes: number;
  lastModified: number;
}

export class CUAWrightTerminalHarness {
  private readonly workspaceRoot: string;
  private readonly bashTimeoutMs: number;
  private trajectoryHistory: Array<{ command: string; observation: ExecutionObservation }> = [];

  constructor(workspaceRoot: string = '/tmp/agent_workspace', bashTimeoutMs: number = 30000) {
    this.workspaceRoot = workspaceRoot;
    this.bashTimeoutMs = bashTimeoutMs;
  }

  /**
   * Action Step a_t in A_term:
   * Menjalankan perintah bash deterministik di dalam persistent workspace environment.
   */
  public async executeAction(command: string): Promise {
    const startTime = performance.now();
    try {
      // Menjalankan command dalam subshell dengan working directory terkunci ke workspace
      const result = await this.spawnSandboxedBash(command, this.workspaceRoot, this.bashTimeoutMs);
      const observation: ExecutionObservation = {
        stdout: result.stdout,
        stderr: result.stderr,
        exitCode: result.exitCode,
        executionDurationMs: Math.round(performance.now() - startTime),
      };

      this.trajectoryHistory.push({ command, observation });
      return observation;
    } catch (error: any) {
      return {
        stdout: '',
        stderr: error.message || 'Subprocess execution error',
        exitCode: 1,
        executionDurationMs: Math.round(performance.now() - startTime),
      };
    }
  }

  /**
   * Vision on Demand:
   * Mengambil screenshot hanya saat agen mengeksekusi tool CLI secara sadar,
   * memangkas ukuran context window dan biaya token hingga 37.5%.
   */
  public async requestVisualInspection(targetRegion?: string): Promise {
    const captureCommand = targetRegion 
      ? `python3 -m cuawright.vision capture --region "${targetRegion}" --out ${this.workspaceRoot}/inspect.png`
      : `python3 -m cuawright.vision capture --fullscreen --out ${this.workspaceRoot}/inspect.png`;

    const obs = await this.executeAction(captureCommand);
    if (obs.exitCode !== 0) {
      throw new Error(`Failed to capture visual state: ${obs.stderr}`);
    }

    return `${this.workspaceRoot}/inspect.png`;
  }

  /**
   * Dynamic Tool Materialization:
   * Mengizinkan agen menulis alat bantu baru ke disk, memverifikasi sintaksnya,
   * dan menambahkannya ke himpunan program efektif P_t.
   */
  public async materializeCustomTool(scriptName: string, scriptContent: string): Promise {
    const scriptPath = `${this.workspaceRoot}/tools/${scriptName}`;
    const writeCommand = `cat << 'EOF' > ${scriptPath}\n${scriptContent}\nEOF\nchmod +x ${scriptPath}`;
    const res = await this.executeAction(writeCommand);
    return res.exitCode === 0;
  }

  private async spawnSandboxedBash(cmd: string, cwd: string, timeout: number): Promise<{ stdout: string; stderr: string; exitCode: number }> {
    // Implementasi runtime interface OS (Node.js child_process / eBPF sandbox)
    return { stdout: 'EXECUTION_SUCCESS', stderr: '', exitCode: 0 };
  }
}

8. Panduan Rekayasa 2026: Mengapa Lingkungan Digital Jauh Lebih Programmable daripada GUI-nya

Hasil riset CUAWright memberikan implikasi mendalam bagi para arsitek sistem, AI engineer, dan perancang agen otonom di era 2026:

  • Hentikan Overengineering GUI Wrapper: Jangan menghabiskan waktu membangun puluhan tool kustom berformat JSON Schema untuk setiap tombol atau menu aplikasi. Cukup sediakan satu antarmuka shell Unix yang aman dengan hak akses yang terisolasi. Model frontier jauh lebih andal menulis skrip one-liner Bash atau skrip Python ad-hoc daripada menebak argumen tool kustom.
  • Terapkan Vision-on-Demand: Jangan pernah mengirimkan screenshot secara otomatis pada setiap langkah agen. Ambil screenshot hanya ketika agen mengalami status kegagalan (non-zero exit code), saat melakukan verifikasi akhir hasil keluaran grafis, atau ketika agen secara eksplisit memanggil perintah inspeksi visual.
  • Jadikan Filesystem sebagai Memori Utama: Hindari arsitektur memori in-memory kompleks yang hilang saat restart atau membebani context window. Berikan direktori kerja persisten kepada agen, biarkan agen mengelola berkas TODO.md, skrip utilitas, dan log intermediate secara mandiri.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 UndoBench 2026: Memisahkan Task Competence dari Recovery Capability pada AI Agents, Bahaya Naive Retry, dan Arsitektur Fault Recovery Lintas 8 Domain Enterprise

UndoBench 2026: Memisahkan Task Competence dari Recovery Capability pada AI Agents, Bahaya Naive Retry, dan Arsitektur Fault Recovery Lintas 8 Domain Enterprise

Analisis mendalam riset frontier arXiv:2610.05622 (Dolly Sah, Tanmay Sah, Harshul Jain, & Tanya Sah, Oktober 2026): Mengapa benchmark agen otonom populer (SWE-bench, GAIA) menyesatkan industri dengan hanya mengukur nominal task completion pada kondisi ideal. Memperkenalkan UndoBench, benchmark counterfactual 36 alur kerja dan 36 skenario kegagalan lintas 8 domain enterprise dengan wire-level effect oracles. Mengungkap temuan kritis di mana nominal competence mencapai 83.54% namun Conditional Recovery Success Rate (CRSR) anjlok ke 46.72%, dengan 53.33% naive retry memicu duplicate external effects fatal (double charging & orphaned cloud resources). Dilengkapi panduan arsitektur produksi SAGA compensation, server-side idempotency, dan read-before-retry pattern.

Ilustrasi Arsitektur Teknis 16:9 SHIFT 2026: Arsitektur Dynamic Multi-Agent Harness Search Per-Query via Policy-Value Prediction MCTS, Eliminasi Search Execution Overhead, dan Lompatan Akurasi +7.2 Poin Melampaui 17 Baseline

SHIFT 2026: Arsitektur Dynamic Multi-Agent Harness Search Per-Query via Policy-Value Prediction MCTS, Eliminasi Search Execution Overhead, dan Lompatan Akurasi +7.2 Poin Melampaui 17 Baseline

Analisis mendalam arsitektur riset frontier (arXiv:2610.04137, Google Cloud AI Research & Arizona State University — Som Sagar, Shasha Li, Hejie Cui, Ransalu Senanayake, Sercan O. Arik): Mengapa konfigurasi harness multi-agent (peran, instruksi, perkakas, dan topologi komunikasi) yang statis atau per-query search berbasis eksekusi langsung membentur latensi masif dan pembengkakan biaya token. Memperkenalkan SHIFT, framework yang memindahkan eksekusi keluar dari search loop per-query melalui arsitektur lokal Policy-Value Architect (Gemma 2 2B) yang memandu Monte Carlo Tree Search (MCTS) untuk menyusun executable graph optimal. Evaluasi komprehensif pada 9.193 tugas lintas 6 benchmark (GSM8K, HotpotQA, MBPP, SpreadsheetBench, OfficeQA Pro, GAIA) dengan eksekutor Gemini 3.5 Flash membuktikan SHIFT mencatat akurasi rerata tertinggi 80.0% (+7.2 poin di atas baseline terkuat), memangkas 32% token eksekusi, serta membuktikan bahwa optimasi simultan topologi, prompt, dan tools menghasilkan keunggulan +9.1 poin dibanding optimasi parsial.

Ilustrasi Arsitektur Teknis 16:9 SourceLearn 2026: Arsitektur Persistent Source Model, Self-Directed & Task-Guided Learning, serta Peningkatan Akurasi hingga +22.6 Poin Melampaui Hybrid RAG pada Autonomous AI Agents

SourceLearn 2026: Arsitektur Persistent Source Model, Self-Directed & Task-Guided Learning, serta Peningkatan Akurasi hingga +22.6 Poin Melampaui Hybrid RAG pada Autonomous AI Agents

Analisis arsitektur sistem riset frontier AI (arXiv:2610.02150, Georgia Tech, UIUC, UCLA — Lucheng Fu, Kejing Xia, Yiyang Wang, Yiqiao Jin, Jinjin He, Xiyuan Yang, Haoxin Liu, Ye Yu, Haibo Jin, Yijia Xiao, Wenke Lee, B. Aditya Prakash, Haohan Wang): Mengapa sistem RAG konvensional (Hybrid RAG, RAPTOR, HippoRAG 2) dan agent-memory (AWM) gagal mengembangkan pemahaman kumulatif atas sumber eksternal otoritatif yang diakses berulang kali. Memperkenalkan SourceLearn, paradigma source learning yang membangun Persistent Source Model (M) melalui dua mekanisme komplementer: Self-Directed Source Learning (siklus Inspect-Study-Consolidate untuk menambal fragmentasi relasi entitas) dan Task-Guided Source Learning (Failure-guided local refinement & Cross-task representation learning). Evaluasi empiris lintas 5 benchmark (MultiDoc2Dial, NarrativeQA, SWE-QA, APIBench, AppWorld) dan 3 LLM backend (GPT-5.6-Luna, gpt-oss-120b, DeepSeek-V4.1-Flash) membuktikan keunggulan SourceLearn pada 13 dari 15 pengujian dengan lonjakan akurasi hingga +22.6 poin di atas Hybrid RAG.