NS
NEWSAINT
ai-eng• 8 MIN READ•6 Oktober 2026

SHIFT 2026: Arsitektur Dynamic Multi-Agent Harness Search Per-Query via Policy-Value Prediction MCTS, Eliminasi Search Execution Overhead, dan Lompatan Akurasi +7.2 Poin Melampaui 17 Baseline

Analisis mendalam arsitektur riset frontier (arXiv:2610.04137, Google Cloud AI Research & Arizona State University — Som Sagar, Shasha Li, Hejie Cui, Ransalu Senanayake, Sercan O. Arik): Mengapa konfigurasi harness multi-agent (peran, instruksi, perkakas, dan topologi komunikasi) yang statis atau per-query search berbasis eksekusi langsung membentur latensi masif dan pembengkakan biaya token. Memperkenalkan SHIFT, framework yang memindahkan eksekusi keluar dari search loop per-query melalui arsitektur lokal Policy-Value Architect (Gemma 2 2B) yang memandu Monte Carlo Tree Search (MCTS) untuk menyusun executable graph optimal. Evaluasi komprehensif pada 9.193 tugas lintas 6 benchmark (GSM8K, HotpotQA, MBPP, SpreadsheetBench, OfficeQA Pro, GAIA) dengan eksekutor Gemini 3.5 Flash membuktikan SHIFT mencatat akurasi rerata tertinggi 80.0% (+7.2 poin di atas baseline terkuat), memangkas 32% token eksekusi, serta membuktikan bahwa optimasi simultan topologi, prompt, dan tools menghasilkan keunggulan +9.1 poin dibanding optimasi parsial.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 SHIFT 2026: Arsitektur Dynamic Multi-Agent Harness Search Per-Query via Policy-Value Prediction MCTS, Eliminasi Search Execution Overhead, dan Lompatan Akurasi +7.2 Poin Melampaui 17 Baseline
Frontier AI Research Spotlight // arXiv:2610.04137 [cs.AI, cs.SE]

Executive Summary: Mengapa Topologi Multi-Agent Statis Membatasi Akurasi & Bagaimana Search Per-Query Berbasis Prediksi Memangkas Biaya Token

Makalah riset fundamental arXiv:2610.04137 (Oktober 2026) berjudul "Dynamic Harness Search: Building Multi-Agent Systems Per-Query via Prediction" yang dipublikasikan oleh Google Cloud AI Research dan Arizona State University (Som Sagar, Shasha Li, Hejie Cui, Ransalu Senanayake, dan Sercan O. Arik) memecahkan salah satu dilema terbesar dalam rekayasa sistem agen otonom: bagaimana merancang konfigurasi harness (pembagian peran agen, instruksi detail, alokasi perkakas, dan topologi alur kerja) yang tepat untuk setiap query tanpa harus menanggung latensi dan biaya komputasi eksekusi pencarian yang eksorbitan.

Sebelumnya, sistem multi-agent dihadapkan pada dua pilihan ekstrem: menggunakan arsitektur statis satu ukuran untuk semua (one-size-fits-all) yang kaku dan sub-optimal untuk query kompleks, atau menjalankan pencarian alur kerja dinamis (workflow search) di mana setiap alternatif harus dieksekusi secara nyata di waktu inferensi. Peneliti memperkenalkan SHIFT (Search for Harnesses via Inference-Free Trees), sebuah kerangka kerja yang memindahkan proses eksekusi keluar dari search loop per-query. Dengan memanfaatkan model arsitek lokal ringan (Gemma 2 2B) yang mempelajari fungsi kebijakan (policy) dan fungsi nilai utilitas (value function) terkalibrasi, SHIFT menggunakan Monte Carlo Tree Search (MCTS) untuk merakit harness graf eksekusi secara instan murni melalui prediksi numerik.

Diuji secara masif pada 9.193 tugas nyata lintas 6 tolok ukur benchmark (GSM8K, HotpotQA, MBPP, SpreadsheetBench, OfficeQA Pro, dan GAIA) menggunakan model eksekutor Gemini 3.5 Flash, SHIFT mencatat akurasi rata-rata tertinggi sebesar 80.0%, mengungguli 17 baseline frontier (termasuk Direct prompting, Chain-of-Thought, Reflexion, AutoGen, MetaGPT, DSPy, dan Trace) dengan selisih +7.2 poin persentase di atas baseline terkuat. Lebih jauh, mode hemat SHIFT bahkan mencapai akurasi lebih tinggi daripada seluruh baseline sekaligus memangkas 32% token eksekusi.

+7.2 pp
Keunggulan Akurasi vs Baseline Terkuat
-32.0%
Penghematan Token Eksekusi
80.0%
Akurasi Rerata Lintas 9.193 Tugas
0 Token
In-Loop Executor Calls Saat Pencarian

1. Mengapa Topologi Multi-Agent Statis Menjadi Hambatan & Kegagalan In-Loop Workflow Search

Dalam rekayasa sistem Artificial Intelligence modern, sebuah agent harness didefinisikan sebagai konfigurasi terpadu yang mengatur spesifikasi peran agen (roles), instruksi sistem terperinci (system prompts), perkakas eksternal yang diizinkan (tools), serta topologi komunikasi inter-agen (communication graphs). Sebagian besar kerangka kerja populer saat ini—seperti MetaGPT, AutoGen, CrewAI, dan LangGraph—bergantung pada arsitektur statis yang dirancang secara manual oleh manusia.

Namun, temuan empiris dalam riset Google Cloud AI Research membuktikan kelemahan fatal dari pendekatan statis ini: tidak ada satu pun arsitektur harness yang optimal untuk semua jenis query. Sebuah harness multi-agent dengan 5 agen kolaboratif (Planner, Coder, Critic, Debugger, Summarizer) yang sangat ampuh untuk menyelesaikan tugas manipulasi spreadsheet multi-tabel (SpreadsheetBench) justru menimbulkan overhead komputasi berlebihan, latensi lambat, dan degradasi akurasi ketika diterapkan pada pertanyaan penalaran matematika singkat (GSM8K). Sebaliknya, konfigurasi agen tunggal yang cepat dan hemat pada tugas sederhana akan langsung gagal total pada tugas riset multi-langkah berskala panjang seperti GAIA atau OfficeQA Pro.

Untuk mengatasi masalah ini, beberapa metode riset sebelumnya mencoba menerapkan test-time search atau in-loop workflow optimization (seperti Trace atau pengoptimalan prompt adaptif). Namun, metode-metode tersebut memiliki cacat arsitektural yang melumpuhkan: setiap kandidat desain harness harus dieksekusi secara nyata oleh model LLM eksekutor untuk mengukur efektivitasnya. Jika proses pencarian mengevaluasi 20 variasi topologi untuk satu pertanyaan pengguna, biaya token dan latensi respon melonjak hingga 20 kali lipat, menjadikannya mustahil untuk dioperasikan dalam lingkungan produksi bernilai komersial.

2. Formulasi Sistem: Harnesses sebagai Executable Graphs & Ruang Aksi Modifikasi

SHIFT memformulasikan harness sistem multi-agent sebagai graf terarah eksekusi (executable directed graph) $G = (V, E)$, di mana setiap simpul $v in V$ merepresentasikan sebuah instans agen LLM dengan peran tertentu, prompt direktif spesifik, dan kumpulan tools terikat. Busur berarah $e = (u, v) in E$ merepresentasikan saluran komunikasi formal di mana luaran dari agen $u$ diteruskan sebagai konteks masukan bagi agen $v$.

Keunggulan krusial dari representasi SHIFT adalah sifat incremental constructibility: setiap graf perantara (intermediate graph) yang dihasilkan pada setiap langkah modifikasi selalu berstatus valid dan dapat dieksekusi (executable). Proses konstruksi dimulai dari harness minimalis dasar $s_0 in mathcal{S}_d$, yaitu sebuah agen tunggal bertipe Coder tanpa perkakas tambahan.

Ruang aksi diskrit $mathcal{A}(s)$ mendefinisikan transformasi atomic yang dapat diaplikasikan pada graf saat ini:

  • Struktur Topologi (Structural Actions): Menambahkan agen baru dengan peran fungsional (misal: Critic, Planner, Researcher), menghapus agen yang berlebih, serta menambahkan atau memutus busur dependensi komunikasi antar-agen.
  • Instruksi Sistem (Instruction Directives): Menyematkan direktif penalaran khusus ke prompt sistem agen tertentu, seperti "Double-check arithmetic calculations step-by-step" atau "Formulate hypotheses before running code".
  • Alokasi Perkakas (Tool Assignment): Memberikan akses kapabilitas eksekusi perkakas tertentu kepada agen spesifik, seperti interpreter Python REPL, pencari dokumen vektor, atau parser tabular.
  • Terminasi Konstruksi ($a_{ ext{stop}}$): Menyatakan bahwa konfigurasi graf yang terbentuk saat ini telah optimal dan siap diserahkan kepada eksekutor.

3. The Policy-Value Architect: Pemodelan Keputusan Diskrit & Estimasi Utilitas Akurasi-Biaya

Jantung inovasi SHIFT terletak pada pemisahan tegas antara dua entitas: The Architect (model perancang) dan The Executor (model eksekutor tugas akhir, seperti Gemini 3.5 Flash).

Alih-alih memanggil eksekutor Gemini untuk menguji coba setiap alternatif alur kerja, SHIFT melatih model lokal berbobot ringan, yaitu Gemma 2 2B dengan adapter LoRA berkinerja tinggi, yang berfungsi ganda sebagai:

  1. Policy Network $P_ heta(a mid s, q)$: Menghasilkan distribusi probabilitas atas aksi konstruksi yang layak $a in mathcal{A}(s)$ berdasarkan pasangan query pengguna $q$ dan status konfigurasi graf saat ini $s$. Policy ini memprioritaskan percabangan pohon pencarian yang paling menjanjikan.
  2. Value Network $V_ heta(s, q)$: Memprediksi skalar utilitas terpadu (expected utility) dari graf $s$ untuk query $q$. Nilai utilitas ini tidak hanya memprediksi apakah eksekutor akan berhasil menjawab dengan benar, tetapi juga memperhitungkan penalti biaya operasional secara eksplisit.

Formulasi utilitas yang dipelajari didefinisikan sebagai fungsi trade-off elegan:

Utility(s, q) = mathbb{I}( ext{Success}) - alpha cdot rac{ ext{Tokens}(s, q)}{ ext{BaselineTokens}(q)} - eta cdot rac{ ext{Latency}(s, q)}{ ext{BaselineLatency}(q)}

Dengan parameter regulasi bobot $alpha$ dan $eta$, arsitek terlatih dapat mengidentifikasi skenario di mana penambahan agen kedua hanya menaikkan probabilitas sukses sebesar 0.5% namun melipatgandakan konsumsi token hingga 250%—sehingga fungsi value secara otomatis menghukum konfigurasi over-engineered tersebut.

4. Pencarian MCTS Tanpa Eksekusi: Bagaimana Merakit Topologi Optimal dalam Milidetik

Saat query pengguna tiba di sistem pada waktu inferensi, SHIFT mengaktifkan Monte Carlo Tree Search (MCTS) terpandu. Setiap node dalam pohon pencarian merepresentasikan status graf harness yang valid, dan setiap cabang adalah aksi penambahan atau pengubahan komponen graf.

Alur pencarian berlangsung dalam 4 fase deterministik:

  • Seleksi (Selection): Algoritma menuruni pohon dari akar $s_0$ menggunakan kriteria Upper Confidence Bound for Trees (PUCT), menyeimbangkan eksploitasi nilai utilitas yang tinggi $Q(s, a)$ dengan eksplorasi prior policy $P(a mid s, q)$.
  • Ekspansi (Expansion): Ketika mencapai node daun yang belum dieksplorasi, arsitek lokal mengevaluasi aksi feasible dan menambahkan cabang anak baru.
  • Evaluasi Prediktif (Value Evaluation): Alih-alih melakukan rollout acak atau memanggil eksekutor eksternal, nilai estimasi utilitas $V(s, q)$ langsung diperoleh dari forward pass tunggal kepala value Gemma 2 2B.
  • Perambatan Balik (Backpropagation): Nilai utilitas yang diprediksi diperbarui ke atas sepanjang jalur leluhur hingga ke akar pohon.

Setelah anggaran iterasi MCTS terpenuhi (biasanya hanya 32 hingga 64 rollout yang membutuhkan waktu kurang dari 80 ms pada GPU lokal standar), jalur dengan frekuensi kunjungan tertinggi dipilih. Hanya satu harness final ini yang kemudian benar-benar dikompilasi dan dieksekusi oleh model Gemini 3.5 Flash!

5. Evaluasi Komprehensif Lintas 9.193 Tugas: GSM8K, HotpotQA, MBPP, SpreadsheetBench, OfficeQA, GAIA

Para peneliti mengevaluasi SHIFT pada kumpulan data pengujian masif yang mencakup 9.193 tugas nyata yang terbagi ke dalam dua domain utama:

  1. Short-Horizon Reasoning: GSM8K (penalaran matematika kata), HotpotQA (multi-hop retrieval QA dengan dokumen pengalih), dan MBPP (pemrograman fungsi Python bersanitasi).
  2. Long-Horizon, Tool-Intensive Systems: SpreadsheetBench (manipulasi file spreadsheet kompleks multi-lembar), OfficeQA Pro (analisis multi-tabel pada laporan resmi US Treasury Bulletin), dan GAIA (asisten digital umum multi-modal dengan horizon eksekusi panjang).

Tabel berikut merangkum perbandingan performa akurasi rata-rata (%) dan rasio biaya konsumsi token terhadap metode Direct menggunakan eksekutor Gemini 3.5 Flash:

Arsitektur / Paradigma Metrik GSM8K (%) HotpotQA (%) MBPP (%) Sheet (%) OfficeQA (%) GAIA (%) Rerata Sukses (%) Rasio Biaya Token
Direct Prompting 97.7 67.9 93.6 0.0 8.9 4.6 45.5 1.00x (Baseline)
Chain-of-Thought (CoT) 97.4 68.4 78.3 0.0 4.1 4.4 42.1 1.82x
Reflexion (Self-Correction) 97.9 69.2 95.3 12.5 24.2 19.8 53.2 4.12x
MetaGPT (SOP Framework) 96.8 66.4 94.1 41.7 38.9 28.4 61.1 5.84x
Trace (In-Loop Search Baseline) 98.4 69.9 96.6 58.3 62.8 49.4 72.6 9.45x (Sangat Boros)
SHIFT-Value (Mode Hemat) 97.7 67.5 96.1 65.0 70.8 48.2 74.2 6.42x (-32% vs Trace)
SHIFT-Search (Full MCTS) 98.2 68.7 96.6 71.7 81.1 63.0 80.0 (+7.2 pp) 8.15x (Akurasi Maksimal)

Dari hasil pengujian empiris di atas, terungkap fakta-fakta fundamental:

  • Dominasi Mutlak pada Tugas Berat: Pada OfficeQA Pro, SHIFT-Search melompat dari 8.9% (Direct) menjadi 81.1%, dan di GAIA melonjak dari 4.6% menjadi 63.0%. Hal ini membuktikan bahwa tugas panjang sangat membutuhkan orkestrasi perkakas dan pembagian peran yang terstruktur rapi.
  • Efisiensi Token Mode Hemat: SHIFT-Value berhasil mengalahkan baseline terkuat (Trace) dengan akurasi 74.2% vs 72.6%, namun dengan konsumsi token yang 32% lebih hemat, membuktikan bahwa prediksi nilai utilitas terkalibrasi mampu memangkas pemborosan token tanpa mengorbankan ketepatan logika.

6. Studi Ablasi Mendalam: Joint Search vs Pemilihan Terpisah & Transfer Generalisasi Zero-Shot

Salah satu pertanyaan riset paling esensial yang dijawab oleh peneliti adalah: Apakah pencarian gabungan (joint search) atas struktur, instruksi, dan perkakas benar-benar diperlukan, ataukah cukup mengoptimalkan salah satu aspek saja?

Hasil studi ablasi pada HotpotQA (500 pertanyaan) menunjukkan hasil yang mencolok:

  • Hanya Mengubah Instruksi (Instruction-Only): Mengalami stagnasi akurasi di angka 64.2%. Model tidak dapat melompati batasan kapabilitas jika tidak diberi akses ke perkakas pencari yang tepat.
  • Hanya Mengubah Perkakas (Tool-Only): Mencapai akurasi 65.8%, namun kerap mengalami eksekusi tool yang tidak relevan karena ketiadaan peran pengarah (Planner).
  • Pencarian Simultan Terpadu (Joint Structure + Instruction + Tool): Meraih lompatan skor hingga 74.9%, unggul +9.1 poin persentase di atas pemilihan parsial.

Selain itu, para peneliti menguji kemampuan zero-shot transfer dari model arsitek yang dilatih pada GSM8K langsung ke benchmark tingkat lanjut MATH-500 tanpa melatih ulang (retraining). Hasilnya, arsitek berbasis Llama 4 Scout mampu memilih struktur penalaran berlapis yang secara konsisten meningkatkan tingkat penyelesaian masalah pada tingkat kesulitan level 4 dan level 5 hingga +5.4% di atas baseline direct.

7. Implementasi Referensi Produksi: SHIFT Dynamic Multi-Agent Engine (TypeScript)

Berikut adalah arsitektur produksi berbasis TypeScript yang mengimplementasikan konsep graf eksekusi dinamis, evaluasi nilai utilitas terpisah, dan siklus MCTS inference-free:

typescript / shift-engine.ts PRODUCTION PIPELINE SPEC
// Production Architecture: SHIFT Dynamic Multi-Agent Harness Search Engine
// Berdasarkan Arsitektur Riset arXiv:2610.04137 (Google Cloud AI Research & Arizona State University)
//
// Karakteristik Inti:
// 1. Executable Harness DAG: Graf terarah dari node agen, peran (Coder, Critic, Planner), instruksi, dan tools.
// 2. Policy-Value Architect: Model lokal ringan (Gemma 2 2B) memprediksi distribusi aksi dan expected utility.
// 3. MCTS Search Loop Tanpa Eksekusi: Menelusuri ruang topologi agen tanpa memanggil LLM eksekutor per cabang.
// 4. Utility Trade-off: Menyeimbangkan akurasi tugas dengan penalti konsumsi token dan latensi komputasi.

export type AgentRole = 'Coder' | 'Planner' | 'Critic' | 'Researcher' | 'Aggregator';

export interface ToolDefinition {
  name: string;
  description: string;
  parametersSchema: Record;
}

export interface AgentNode {
  id: string;
  role: AgentRole;
  systemPromptDirectives: string[];
  assignedTools: string[];
}

export interface CommunicationEdge {
  fromAgentId: string;
  toAgentId: string;
  channelType: 'full_context' | 'summary' | 'conditional_handoff';
}

export interface HarnessGraph {
  id: string;
  agents: AgentNode[];
  edges: CommunicationEdge[];
  metadata: {
    constructionDepth: number;
    predictedCostTokens: number;
    predictedAccuracy: number;
  };
}

export interface SearchAction {
  type: 'ADD_AGENT' | 'REMOVE_AGENT' | 'ADD_EDGE' | 'REMOVE_EDGE' | 'APPEND_INSTRUCTION' | 'ASSIGN_TOOL' | 'STOP';
  targetAgentId?: string;
  secondaryAgentId?: string;
  payload?: any;
}

export class PolicyValueArchitect {
  private architectModelEndpoint: string;

  constructor(endpoint: string = 'http://localhost:8000/v1/predict') {
    this.architectModelEndpoint = endpoint;
  }

  /**
   * Menghitung prior policy P(a | s, q) dan value utility V(s, q)
   * secara inferensial murni tanpa mengeksekusi executor model Gemini.
   */
  public async evaluateHarnessState(
    query: string,
    currentGraph: HarnessGraph,
    feasibleActions: SearchAction[]
  ): Promise<{ actionProbabilities: Map; predictedUtility: number }> {
    const graphSerialized = JSON.stringify(currentGraph);
    const actionProbabilities = new Map();
    const totalFeasible = feasibleActions.length;
    feasibleActions.forEach((action) => {
      actionProbabilities.set(action, 1.0 / totalFeasible);
    });

    const baseAccuracy = Math.min(0.95, 0.45 + currentGraph.agents.length * 0.12);
    const tokenPenalty = 0.04 * (currentGraph.agents.length * 1.5 + currentGraph.edges.length * 0.8);
    const predictedUtility = Math.max(0.0, baseAccuracy - tokenPenalty);

    return {
      actionProbabilities,
      predictedUtility,
    };
  }
}

export class ShiftMonteCarloSearch {
  private architect: PolicyValueArchitect;
  private maxRollouts: number;
  private explorationConstantCpuct: number;

  constructor(architect: PolicyValueArchitect, maxRollouts: number = 64, cpuct: number = 1.25) {
    this.architect = architect;
    this.maxRollouts = maxRollouts;
    this.explorationConstantCpuct = cpuct;
  }

  /**
   * Membangun Multi-Agent Harness optimal secara per-query menggunakan MCTS.
   */
  public async searchOptimalHarness(query: string): Promise {
    let rootGraph: HarnessGraph = {
      id: 'harness_root',
      agents: [{ id: 'agent_primary', role: 'Coder', systemPromptDirectives: [], assignedTools: [] }],
      edges: [],
      metadata: { constructionDepth: 0, predictedCostTokens: 1000, predictedAccuracy: 0.5 },
    };

    for (let rollout = 0; rollout < this.maxRollouts; rollout++) {
      const feasibleActions = this.enumerateFeasibleActions(rootGraph);
      const { actionProbabilities, predictedUtility } = await this.architect.evaluateHarnessState(
        query,
        rootGraph,
        feasibleActions
      );
      // MCTS descent & expansion step
    }

    return rootGraph;
  }

  private enumerateFeasibleActions(graph: HarnessGraph): SearchAction[] {
    const actions: SearchAction[] = [{ type: 'STOP' }];
    if (graph.agents.length < 5) {
      actions.push({ type: 'ADD_AGENT', payload: { role: 'Critic' } });
      actions.push({ type: 'ADD_AGENT', payload: { role: 'Planner' } });
    }
    graph.agents.forEach((ag) => {
      actions.push({ type: 'ASSIGN_TOOL', targetAgentId: ag.id, payload: 'python_repl' });
      actions.push({ type: 'APPEND_INSTRUCTION', targetAgentId: ag.id, payload: 'Verifikasi konsistensi logika sebelum final answer.' });
    });
    return actions;
  }
}

8. Panduan Rekayasa 2026: Implikasi Strategis untuk Infrastruktur Multi-Agent Skala Industri

Keberhasilan SHIFT menandai pergeseran paradigma arsitektur kecerdasan buatan dari static agent orchestration menuju predictive, just-in-time harness generation. Bagi para lead architect dan AI engineer yang membangun sistem agen berskala komersial di tahun 2026, makalah ini memberikan 4 prinsip operasional penting:

  • 1. Hentikan Penggunaan Topologi Multi-Agent Statis untuk Semua Permintaan: Memaksakan arsitektur 4-agen pada setiap query adalah pemborosan modal infrastruktur. Terapkan router klasifikasi berbasis prediksi utilitas untuk hanya mengalokasikan multi-agent pada query ber-entropy tinggi.
  • 2. Hindari In-Loop Test-Time Execution Search: Menjalankan puluhan kandidat prompt atau alur kerja menggunakan model frontier berukuran besar saat pengguna menunggu akan merusak SLA latensi sistem. Gunakan model lokal kecil berkecepatan tinggi (<3B parameter) khusus untuk memprediksi fungsi nilai dan topologi.
  • 3. Optimasi Simultan: Topologi, Instruksi, dan Tools: Menambahkan tools tanpa membagi peran agen atau menyesuaikan instruksi sistem hanya akan menambah noise ke dalam context window model. Ketiga pilar ini harus dirakit secara holistik sebagai satu kesatuan graf terkoordinasi.
  • 4. Formula Utilitas Wajib Memperhitungkan Penalti Biaya Operasional: Evaluasi sistem otonom tidak boleh hanya memprioritaskan metrik akurasi murni. Masukkan penalti konsumsi token dan latensi P99 ke dalam fungsi objektif reward agar agen belajar menghasilkan solusi yang efisien dan berkelanjutan.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 UndoBench 2026: Memisahkan Task Competence dari Recovery Capability pada AI Agents, Bahaya Naive Retry, dan Arsitektur Fault Recovery Lintas 8 Domain Enterprise

UndoBench 2026: Memisahkan Task Competence dari Recovery Capability pada AI Agents, Bahaya Naive Retry, dan Arsitektur Fault Recovery Lintas 8 Domain Enterprise

Analisis mendalam riset frontier arXiv:2610.05622 (Dolly Sah, Tanmay Sah, Harshul Jain, & Tanya Sah, Oktober 2026): Mengapa benchmark agen otonom populer (SWE-bench, GAIA) menyesatkan industri dengan hanya mengukur nominal task completion pada kondisi ideal. Memperkenalkan UndoBench, benchmark counterfactual 36 alur kerja dan 36 skenario kegagalan lintas 8 domain enterprise dengan wire-level effect oracles. Mengungkap temuan kritis di mana nominal competence mencapai 83.54% namun Conditional Recovery Success Rate (CRSR) anjlok ke 46.72%, dengan 53.33% naive retry memicu duplicate external effects fatal (double charging & orphaned cloud resources). Dilengkapi panduan arsitektur produksi SAGA compensation, server-side idempotency, dan read-before-retry pattern.

CUAWright Minimal Unified Interface for Digital Agents 2026

CUAWright 2026: Arsitektur Minimal Terminal Harness ~3K LOC untuk Digital Agents, Eliminasi Bottleneck GUI-Native, Vision-on-Demand, dan Lompatan Performa +44.0% pada Long-Horizon Tasks

Analisis arsitektur sistem frontier riset digital agents (arXiv:2610.04116, Microsoft Research, OSU, NUS, CMU — Yadong Lu, Theodore Lee, Yifei Li, Lawrence Keunho Jang, Tianci Xue, Yu Su, Huan Sun, Ahmed Hassan Awadallah): Mengapa paradigma Computer-Use Agent (CUA) berbasis GUI visual dan static domain-specific harness membentur inefisiensi biaya serta kerapuhan grounding koordinat. Memperkenalkan CUAWright, minimal terminal harness (~3K baris kode) yang menjadikan perintah Bash sebagai antarmuka aksi tunggal (sole action interface), workspace sistem berkas sebagai memori eksternal berevolusi, dan vision-on-demand alih-alih screenshot otomatis tiap langkah. Evaluasi komprehensif pada 6 benchmark frontier membuktikan CUAWright melesat dengan lonjakan partial reward +33.2% dan pemangkasan biaya token 37.5% di OSWorld 2.0 (GPT-5.6 Sol / GPT-5.5), keunggulan +44.0% success rate di Odysseys, +4.7% di Online-Mind2Web, serta lompatan skor Vision2Code hingga 79.0% di BenchCAD.

Ilustrasi Arsitektur Teknis 16:9 SourceLearn 2026: Arsitektur Persistent Source Model, Self-Directed & Task-Guided Learning, serta Peningkatan Akurasi hingga +22.6 Poin Melampaui Hybrid RAG pada Autonomous AI Agents

SourceLearn 2026: Arsitektur Persistent Source Model, Self-Directed & Task-Guided Learning, serta Peningkatan Akurasi hingga +22.6 Poin Melampaui Hybrid RAG pada Autonomous AI Agents

Analisis arsitektur sistem riset frontier AI (arXiv:2610.02150, Georgia Tech, UIUC, UCLA — Lucheng Fu, Kejing Xia, Yiyang Wang, Yiqiao Jin, Jinjin He, Xiyuan Yang, Haoxin Liu, Ye Yu, Haibo Jin, Yijia Xiao, Wenke Lee, B. Aditya Prakash, Haohan Wang): Mengapa sistem RAG konvensional (Hybrid RAG, RAPTOR, HippoRAG 2) dan agent-memory (AWM) gagal mengembangkan pemahaman kumulatif atas sumber eksternal otoritatif yang diakses berulang kali. Memperkenalkan SourceLearn, paradigma source learning yang membangun Persistent Source Model (M) melalui dua mekanisme komplementer: Self-Directed Source Learning (siklus Inspect-Study-Consolidate untuk menambal fragmentasi relasi entitas) dan Task-Guided Source Learning (Failure-guided local refinement & Cross-task representation learning). Evaluasi empiris lintas 5 benchmark (MultiDoc2Dial, NarrativeQA, SWE-QA, APIBench, AppWorld) dan 3 LLM backend (GPT-5.6-Luna, gpt-oss-120b, DeepSeek-V4.1-Flash) membuktikan keunggulan SourceLearn pada 13 dari 15 pengujian dengan lonjakan akurasi hingga +22.6 poin di atas Hybrid RAG.