NS
NEWSAINT
ai-eng• 10 MIN READ•9 September 2026

Procedural Graphs 2026: Arsitektur (Procedure, Relation, Procedure) Triplets, Generative Subgraph Guidance, dan Self-Evolving Offline Topology Refinement untuk Autonomous LLM Agents

Analisis arsitektur sistemik riset frontier AI Google Research (arXiv:2609.09153, September 2026): Mengapa coding dan tool-using agents kerap terjebak dalam infinite error loops dan halusinasi urutan eksekusi pada horizon panjang? Procedural Graphs memperkenalkan struktur graf terarah berbasis triplet (prosedur, relasi, prosedur) berbobot atribut condition, guidance, dan pitfalls. Dilengkapi localized h-hop subgraph extraction, generative situational guidance, serta self-evolving offline refinement loop dengan rejection memory, PG menembus peringkat 1 pada 21 dari 24 konfigurasi benchmark (BFCL v3 +9.0 pp, tau-bench 80.0%, dan EnterpriseArena 132-bulan mendongkrak survival rate dari 0.0% menjadi 85.0%).

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 Procedural Graphs 2026: Arsitektur (Procedure, Relation, Procedure) Triplets, Generative Subgraph Guidance, dan Self-Evolving Offline Topology Refinement untuk Autonomous LLM Agents

Dalam lanskap rekayasa AI agents berskala enterprise, fenomena infinite loop, kegagalan urutan eksekusi (out-of-order tool invocation), serta penyimpangan tujuan (objective drift) menjadi momok paling merusak pada tugas horizon panjang. Riset mutakhir dari tim Google Cloud AI Research (arXiv:2609.09153, September 2026) memperkenalkan Procedural Graphs (PG): sebuah paradigma arsitektur eksekusi terstruktur yang mentransformasikan pengetahuan prosedural implisit menjadi graf relasional berbobot atribut dinamis.

Executive Architectural Summary

Jika Knowledge Graph (KG) mengorganisasi pengetahuan faktual melalui triplet (entitas, relasi, entitas) untuk menjawab pertanyaan what-is, maka Procedural Graph menstrukturkan alur eksekusi melalui triplet (prosedur, relasi, prosedur) untuk menjawab pertanyaan kritis what-to-do-next. Dilengkapi ekstraksi subgraf lokal 2-hop terarah, panduan situasional generatif, dan siklus self-evolution offline dengan rejection memory, Procedural Graph mendominasi 21 dari 24 setting benchmark model-frontier, mengangkat angka kelangsungan hidup simulasi finansial EnterpriseArena dari 0.0% menjadi 85.0%.

1. Jebakan Generasi Tanpa Batas & Kegagalan Retrival Naif

Mayoritas agen otonom saat ini (seperti ReAct atau CoT standar) memilih aksi berikutnya secara bebas melalui akumulasi konteks riwayat obrolan yang kian membengkak. Ketika trajektori mencapai puluhan atau ratusan langkah, agen rentan mengalami amnesia prosedural:

  • Inversi Urutan Eksekusi (Action Order Inversion): Agen memanggil tool penyerahan hasil akhir (misal: submit_answer) tanpa terlebih dahulu menjalankan verifikasi prasyarat (verify_checksum atau check_constraints), memicu kegagalan fatal yang tidak dapat dipulihkan.
  • Kegagalan Retrieval Berbasis Kemiripan Semantik (Top-k Similarity Blindness): Sistem memori RAG biasa yang mengambil cuplikan pedoman hanya berdasarkan kemiripan teks kueri kerap kehilangan relasi kausalitas urutan. Mengambil instruksi submit tanpa simpul pendahulunya mengaburkan prasyarat validitas eksekusi.
  • Siklus Kesalahan Berulang (Unproductive Loop Entrapment): Saat menghadapi kegagalan API atau parameter invalid, model cenderung mengulang pemanggilan fungsi yang sama secara berulang tanpa eksplorasi jalur pemulihan (fallback paths).

2. Representasi Formal: Struktur Directed Attributed Graph

Secara matematis, sebuah Procedural Graph didefinisikan sebagai graf berarah dan berbobot atribut:

\mathcal{G} = (\mathcal{V}, \mathcal{R}, \mathcal{E}, \Phi), \quad \mathcal{E} \subseteq \mathcal{V} \times \mathcal{R} \times \mathcal{V}

Di mana setiap simpul $u, v \in \mathcal{V}$ mengabstraksikan fungsi perkakas (tool), keterampilan operasional (skill), tahapan penalaran internal, atau status kemajuan tugas. Sisi berarah $e = (u, r, v) \in \mathcal{E}$ menyatakan bahwa prosedur $v$ diizinkan (admissible) dijalankan setelah prosedur $u$ di bawah relasi $r \in \mathcal{R}$.

Pemetaan atribut $\Phi$ mengikat setiap sisi transisi dengan 3 bidang semantik tekstual kanonikal:

1. Condition

Kondisi operasional dan status lingkungan spesifik di mana transisi prosedural ini diizinkan untuk dieksekusi.

2. Guidance

Petunjuk situasional konkret mengenai bagaimana aksi harus disiapkan, format payload yang valid, dan strategi optimasi.

3. Pitfalls

Kompilasi jebakan fatal, parameter terlarang, dan pola anti-pattern yang terbukti menyebabkan kegagalan pada trajektori historis.

3. Mekanisme Online Inference: Locate, Extract, & Generate

Alih-alih menginjeksi seluruh graf secara utuh ke dalam system prompt (yang memicu token bloat dan mengalihkan atensi model), runtime Procedural Graph mengoperasikan skema dinamis tiga tahap pada setiap langkah keputusan $t$:

  1. Locate (Lokalisasi Simpul Aktif): Mencocokkan aksi atau observasi terakhir agen $a_{t-1}$ dengan simpul dalam graf $\mathcal{V}$ melalui fungsi kecocokan deterministik:
    u_t = \mathrm{Match}(a_{t-1}, \mathcal{V}), \quad u_1 = \texttt{Start}
  2. Extract (Ekstraksi Subgraf Tetangga h-Hop): Mengekstrak lingkungan lokal terarah $\mathcal{N}_h(u_t)$ hingga kedalaman $h$ langkah (optimal pada $h=2$). Jika simpul tidak ditemukan, sistem beralih ke representasi global secara aman:
    \mathcal{G}_t = \begin{cases} \mathcal{N}_h(u_t), & u_t \neq \varnothing \\ \mathcal{G}, & \text{fallback global} \end{cases}
  3. Generate (Sintesis Panduan Situasional): Model bahasa pemandu $\Psi$ menerjemahkan topologi lokal $\mathcal{G}_t$, kueri tugas pengguna $q$, dan jendela riwayat keputusan terakhir $\mathcal{T}_{t-w:t}$ menjadi teks panduan langkah $g_t$:
    g_t = \Psi(\mathcal{G}_t, q, \mathcal{T}_{t-w:t})

4. Siklus Self-Evolution Offline & Rejection Memory

Kekuatan utama Procedural Graph terletak pada kemampuannya untuk berevolusi secara mandiri tanpa rekayasa manual berkelanjutan. Melalui siklus evolusi 4 tahap, graf secara iteratif memutasi struktur topologi dan atributnya:

Tahapan Pipeline Mekanisme Operasional Output & Integritas State
1. Diagnostic Rollout Mengeksekusi batch tugas pelatihan dengan graf $\mathcal{G}_{k-1}$ dan mencatat jejak eksekusi diagnostik \mathcal{E}_k = \{(q_i, \mathcal{T}_i, S_i)\}
2. Feedback-Driven Mutation LLM Refiner mengontraskan trajektori sukses vs gagal untuk menghasilkan himpunan edit struktur (Add/Delete/Revise) \Delta \mathcal{G}_k = \{\text{Add, Delete, Attr-Update}\}
3. Structural Verification Validasi skema tipe statis, eliminasi orphan node, dan pencegahan siklus deadlock sebelum uji coba mahal Fail-Closed Syntactic Gate
4. Validation & Rejection Memory Evaluasi kandidat pada split validasi. Jika performa turun, edit ditolak dan disimpan ke memori penolakan \mathcal{M}_{\text{rej}} \leftarrow \text{Anti-Cycle Protection}

Peran Rejection Memory $\mathcal{M}_{\text{rej}}$ sangat krusial: banyak sistem self-improving gagal di lingkungan produksi karena model refiner terus-menerus mengusulkan modifikasi topologi buruk yang sama secara melingkar. Dengan membekukan jejak kegagalan, agen dijamin hanya bergerak menuju lintasan performa monotonically non-decreasing.

5. Tolok Ukur Benchmark Empiris: Dominasi 21 dari 24 Pengujian

Penelitian ini menguji Procedural Graphs di 7 tolok ukur terkemuka dengan 4 keluarga fondasi model frontier (Gemini 3.5 Flash, Gemini 3.1 Pro, Claude Sonnet 4.6, dan Grok 4.1 Fast):

Benchmark & Domain Model Backbone Baseline Unguided Procedural Graph (PG) Delta / Margin
BFCL v3 (Multi-turn Tool Calling) Gemini 3.5 Flash 58.00% 67.00% +9.00 pp
GDPval (Professional Rubric Evaluation) Gemini 3.1 Pro 71.37 pts 78.78 pts +7.41 pts
τ-bench (Interactive User Policy) Gemini 3.1 Pro 73.04% 80.00% +6.96 pp
ALFWorld (Embodied Sequential Ordering) Gemini 3.5 Flash 72.58% 81.53% +8.95 pp
EnterpriseArena (132-Month Liquidity Survival) Gemini 3.1 Pro 6.00% 34.00% +28.00 pp
EnterpriseArena (Survival under Crises) Claude Sonnet 4.6 44.00% 58.00% +14.00 pp
EnterpriseArena (Self-Evolution Loop R8) Validation Split Baseline 0.00% 85.00% (Test) +85.00 pp

Ablasi Mekanisme Injeksi: Mengapa Subgraf Terlokalisasi Menang Mutlak

Eksperimen ablasi pada Gemini 3.5 Flash mengungkap temuan kritis bagi insinyur harness:

  • Injeksi Mentah Seluruh Graf (Full Graph Raw Injection): Meningkatkan performa pada dialog terstruktur (MultiChallenge naik dari 80.27% ke 86.60%), namun merusak tugas embodied fisik (ALFWorld anjlok dari 72.58% ke 70.34%).
  • Generasi Seluruh Graf (Full Graph Generative): Mengakibatkan degradasi drastis pada ALFWorld (jatuh ke 54.48%) dengan ledakan konsumsi token hingga 3.4x lipat (96.360 vs 28.064 token) akibat hilangnya fokus operasional model.
  • Generatif Subgraf Terlokalisasi (Localized Subgraph Generative): Meraih efisiensi optimal dan skor tertinggi di seluruh dimensi (ALFWorld 81.53%, GDPval 63.99) dengan konsumsi token yang terukur.

6. Blueprint Implementasi: Runtime Engine TypeScript

Berikut adalah arsitektur implementasi produksi runtime Procedural Guidance Engine lengkap dengan lokalisasi $h$-hop dan gerbang validasi offline yang dapat langsung diintegrasikan ke dalam harness agen otonom:

typescript / procedural-graph-engine.ts PRODUCTION SPEC
// Procedural Graph (PG) Engine & Inference Runtime Handler
// Berdasarkan Prinsip Arsitektur Riset Google Cloud AI Research (arXiv:2609.09153, September 2026)
// Struktur Triplet: G = (V, R, E, Phi) + Localized h-hop Generative Extraction

export type RelationType = 'PRECEDES' | 'LEADS_TO' | 'CONDITIONED_ON' | 'FALLBACK_TO' | 'VERIFIES';

export interface EdgeAttributes {
  condition: string; // Kapan transisi ini valid dieksekusi
  guidance: string;  // Petunjuk situasional cara bertindak
  pitfalls: string;  // Jebakan anti-pattern yang harus dihindari
}

export interface ProceduralNode {
  id: string;
  type: 'TOOL' | 'SKILL' | 'REASONING_STEP' | 'STATE_CHECK';
  name: string;
}

export interface ProceduralEdge {
  source: string;
  target: string;
  relation: RelationType;
  attributes: EdgeAttributes;
}

export interface ProceduralGraph {
  nodes: Map<string, ProceduralNode>;
  edges: ProceduralEdge[];
}

export interface TrajectoryStep {
  step: number;
  action: string;
  observation: string;
  status: 'SUCCESS' | 'FAILURE' | 'PENDING';
}

/**
 * 1. Online Inference: Localized Subgraph Extractor (h-hop neighborhood)
 * Mengisolasi simpul aktif dan subgraf 2-hop terarah guna mencegah context pollution.
 */
export class ProceduralGuidanceEngine {
  constructor(private graph: ProceduralGraph) {}

  public locateActiveNode(recentAction: string): string | null {
    for (const [id, node] of this.graph.nodes.entries()) {
      if (recentAction.toLowerCase().includes(node.name.toLowerCase())) {
        return id;
      }
    }
    return null;
  }

  public extractNHopNeighborhood(activeNodeId: string | null, hops: number = 2): ProceduralEdge[] {
    if (!activeNodeId || !this.graph.nodes.has(activeNodeId)) {
      // Fallback ke subgraf global jika pemetaan simpul tidak terdeteksi
      return this.graph.edges.slice(0, 10);
    }

    const visitedEdges = new Set<ProceduralEdge>();
    let currentFrontier = new Set<string>([activeNodeId]);

    for (let h = 0; h < hops; h++) {
      const nextFrontier = new Set<string>();
      for (const edge of this.graph.edges) {
        if (currentFrontier.has(edge.source)) {
          visitedEdges.add(edge);
          nextFrontier.add(edge.target);
        }
      }
      currentFrontier = nextFrontier;
    }

    return Array.from(visitedEdges);
  }

  public synthesizeSituationalGuidance(
    subgraph: ProceduralEdge[],
    taskQuery: string,
    history: TrajectoryStep[]
  ): string {
    if (subgraph.length === 0) {
      return 'Procedural State: Unconstrained standard exploration mode.';
    }

    const proceduralRules = subgraph.map((e, idx) => {
      const src = this.graph.nodes.get(e.source)?.name || e.source;
      const tgt = this.graph.nodes.get(e.target)?.name || e.target;
      return `[${idx + 1}] Transisi: (${src}) --[${e.relation}]--> (${tgt})\n     Kondisi : ${e.attributes.condition}\n     Panduan  : ${e.attributes.guidance}\n     Jebakan  : ${e.attributes.pitfalls}`;
    }).join('\n');

    return `=== PROCEDURAL GRAPH LOCAL GUIDANCE (h=2 HOPS) ===\nKonteks Kueri: "${taskQuery}"\nLangkah Terakhir: "${history[history.length - 1]?.action || 'START'}"\n\nAturan Urutan Prosedural yang Valid:\n${proceduralRules}\n======================================================`;
  }
}

/**
 * 2. Offline Self-Evolution Engine: Topology Refiner dengan Rejection Memory
 */
export interface GraphEditOperation {
  op: 'ADD_NODE' | 'ADD_EDGE' | 'DELETE_EDGE' | 'UPDATE_ATTRIBUTES';
  payload: any;
}

export class OfflineGraphRefiner {
  private rejectionMemory: Set<string> = new Set();

  public evaluateAndCommit(
    currentGraph: ProceduralGraph,
    candidateEdits: GraphEditOperation[],
    validationScore: number,
    baselineScore: number
  ): { committed: boolean; reason: string } {
    const editSignature = JSON.stringify(candidateEdits);

    // Cek apakah mutasi topologi pernah ditolak sebelumnya
    if (this.rejectionMemory.has(editSignature)) {
      return {
        committed: false,
        reason: 'Rejected: Topologi mutasi ini identik dengan kandidat yang gagal pada evaluasi sebelumnya.',
      };
    }

    // Gerbang Validasi: Komit jika skor validasi tidak mengalami degradasi
    if (validationScore >= baselineScore) {
      return {
        committed: true,
        reason: `Committed: Validasi stabil/meningkat (${validationScore.toFixed(2)} vs baseline ${baselineScore.toFixed(2)}).`,
      };
    }

    // Simpan ke memori penolakan untuk mencegah siklus proposal berulang
    this.rejectionMemory.add(editSignature);
    return {
      committed: false,
      reason: `Rejected: Penurunan performa (${validationScore.toFixed(2)} < ${baselineScore.toFixed(2)}). Disimpan ke Rejection Memory.`,
    };
  }
}

7. Panduan Implementasi Lapangan untuk Tim AI Engineering

Bagi arsitek sistem yang membangun platform autonomous multi-agent di skala enterprise, temuan riset ini menggarisbawahi 3 imperatif arsitektur mutlak:

  1. Hentikan Ketergantungan pada Semantic Top-K Vector Retrieval untuk Prosedur: Vektor kemiripan kosinus tidak memahami dependensi kausal ("A harus selesai sebelum B dapat dipanggil"). Gunakan graf topologi terarah untuk mendefinisikan prasyarat alur kerja perkakas.
  2. Terapkan Pembatasan Ruang Lingkup 2-Hop: Jangan pernah memasukkan seluruh SOP atau diagram alir ke dalam prompt agen saat mengeksekusi aksi. Berikan hanya tetangga terarah terdekat ($h=2$) guna menjaga atensi model tetap tajam.
  3. Kunci Evolusi Graf dengan Rejection Memory: Saat mengimplementasikan loop self-improvement otomatis, wajib catat setiap usulan mutasi yang gagal meningkatkan skor validasi agar sistem tidak berulang kali terjebak dalam siklus degradasi yang sama.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.