Procedural Graphs 2026: Arsitektur (Procedure, Relation, Procedure) Triplets, Generative Subgraph Guidance, dan Self-Evolving Offline Topology Refinement untuk Autonomous LLM Agents
Analisis arsitektur sistemik riset frontier AI Google Research (arXiv:2609.09153, September 2026): Mengapa coding dan tool-using agents kerap terjebak dalam infinite error loops dan halusinasi urutan eksekusi pada horizon panjang? Procedural Graphs memperkenalkan struktur graf terarah berbasis triplet (prosedur, relasi, prosedur) berbobot atribut condition, guidance, dan pitfalls. Dilengkapi localized h-hop subgraph extraction, generative situational guidance, serta self-evolving offline refinement loop dengan rejection memory, PG menembus peringkat 1 pada 21 dari 24 konfigurasi benchmark (BFCL v3 +9.0 pp, tau-bench 80.0%, dan EnterpriseArena 132-bulan mendongkrak survival rate dari 0.0% menjadi 85.0%).

Dalam lanskap rekayasa AI agents berskala enterprise, fenomena infinite loop, kegagalan urutan eksekusi (out-of-order tool invocation), serta penyimpangan tujuan (objective drift) menjadi momok paling merusak pada tugas horizon panjang. Riset mutakhir dari tim Google Cloud AI Research (arXiv:2609.09153, September 2026) memperkenalkan Procedural Graphs (PG): sebuah paradigma arsitektur eksekusi terstruktur yang mentransformasikan pengetahuan prosedural implisit menjadi graf relasional berbobot atribut dinamis.
Executive Architectural Summary
Jika Knowledge Graph (KG) mengorganisasi pengetahuan faktual melalui triplet (entitas, relasi, entitas) untuk menjawab pertanyaan what-is, maka Procedural Graph menstrukturkan alur eksekusi melalui triplet (prosedur, relasi, prosedur) untuk menjawab pertanyaan kritis what-to-do-next. Dilengkapi ekstraksi subgraf lokal 2-hop terarah, panduan situasional generatif, dan siklus self-evolution offline dengan rejection memory, Procedural Graph mendominasi 21 dari 24 setting benchmark model-frontier, mengangkat angka kelangsungan hidup simulasi finansial EnterpriseArena dari 0.0% menjadi 85.0%.
1. Jebakan Generasi Tanpa Batas & Kegagalan Retrival Naif
Mayoritas agen otonom saat ini (seperti ReAct atau CoT standar) memilih aksi berikutnya secara bebas melalui akumulasi konteks riwayat obrolan yang kian membengkak. Ketika trajektori mencapai puluhan atau ratusan langkah, agen rentan mengalami amnesia prosedural:
-
Inversi Urutan Eksekusi (Action Order Inversion): Agen memanggil tool penyerahan hasil akhir (misal:
submit_answer) tanpa terlebih dahulu menjalankan verifikasi prasyarat (verify_checksumataucheck_constraints), memicu kegagalan fatal yang tidak dapat dipulihkan. -
Kegagalan Retrieval Berbasis Kemiripan Semantik (Top-k Similarity Blindness): Sistem memori RAG biasa yang mengambil cuplikan pedoman hanya berdasarkan kemiripan teks kueri kerap kehilangan relasi kausalitas urutan. Mengambil instruksi
submittanpa simpul pendahulunya mengaburkan prasyarat validitas eksekusi. -
Siklus Kesalahan Berulang (Unproductive Loop Entrapment): Saat menghadapi kegagalan API atau parameter invalid, model cenderung mengulang pemanggilan fungsi yang sama secara berulang tanpa eksplorasi jalur pemulihan (fallback paths).
2. Representasi Formal: Struktur Directed Attributed Graph
Secara matematis, sebuah Procedural Graph didefinisikan sebagai graf berarah dan berbobot atribut:
Di mana setiap simpul $u, v \in \mathcal{V}$ mengabstraksikan fungsi perkakas (tool), keterampilan operasional (skill), tahapan penalaran internal, atau status kemajuan tugas. Sisi berarah $e = (u, r, v) \in \mathcal{E}$ menyatakan bahwa prosedur $v$ diizinkan (admissible) dijalankan setelah prosedur $u$ di bawah relasi $r \in \mathcal{R}$.
Pemetaan atribut $\Phi$ mengikat setiap sisi transisi dengan 3 bidang semantik tekstual kanonikal:
Kondisi operasional dan status lingkungan spesifik di mana transisi prosedural ini diizinkan untuk dieksekusi.
Petunjuk situasional konkret mengenai bagaimana aksi harus disiapkan, format payload yang valid, dan strategi optimasi.
Kompilasi jebakan fatal, parameter terlarang, dan pola anti-pattern yang terbukti menyebabkan kegagalan pada trajektori historis.
3. Mekanisme Online Inference: Locate, Extract, & Generate
Alih-alih menginjeksi seluruh graf secara utuh ke dalam system prompt (yang memicu token bloat dan mengalihkan atensi model), runtime Procedural Graph mengoperasikan skema dinamis tiga tahap pada setiap langkah keputusan $t$:
-
Locate (Lokalisasi Simpul Aktif):
Mencocokkan aksi atau observasi terakhir agen $a_{t-1}$ dengan simpul dalam graf $\mathcal{V}$ melalui fungsi kecocokan deterministik:
u_t = \mathrm{Match}(a_{t-1}, \mathcal{V}), \quad u_1 = \texttt{Start}
-
Extract (Ekstraksi Subgraf Tetangga h-Hop):
Mengekstrak lingkungan lokal terarah $\mathcal{N}_h(u_t)$ hingga kedalaman $h$ langkah (optimal pada $h=2$). Jika simpul tidak ditemukan, sistem beralih ke representasi global secara aman:
\mathcal{G}_t = \begin{cases} \mathcal{N}_h(u_t), & u_t \neq \varnothing \\ \mathcal{G}, & \text{fallback global} \end{cases}
-
Generate (Sintesis Panduan Situasional):
Model bahasa pemandu $\Psi$ menerjemahkan topologi lokal $\mathcal{G}_t$, kueri tugas pengguna $q$, dan jendela riwayat keputusan terakhir $\mathcal{T}_{t-w:t}$ menjadi teks panduan langkah $g_t$:
g_t = \Psi(\mathcal{G}_t, q, \mathcal{T}_{t-w:t})
4. Siklus Self-Evolution Offline & Rejection Memory
Kekuatan utama Procedural Graph terletak pada kemampuannya untuk berevolusi secara mandiri tanpa rekayasa manual berkelanjutan. Melalui siklus evolusi 4 tahap, graf secara iteratif memutasi struktur topologi dan atributnya:
| Tahapan Pipeline | Mekanisme Operasional | Output & Integritas State |
|---|---|---|
| 1. Diagnostic Rollout | Mengeksekusi batch tugas pelatihan dengan graf $\mathcal{G}_{k-1}$ dan mencatat jejak eksekusi diagnostik | \mathcal{E}_k = \{(q_i, \mathcal{T}_i, S_i)\} |
| 2. Feedback-Driven Mutation | LLM Refiner mengontraskan trajektori sukses vs gagal untuk menghasilkan himpunan edit struktur (Add/Delete/Revise) | \Delta \mathcal{G}_k = \{\text{Add, Delete, Attr-Update}\} |
| 3. Structural Verification | Validasi skema tipe statis, eliminasi orphan node, dan pencegahan siklus deadlock sebelum uji coba mahal | Fail-Closed Syntactic Gate |
| 4. Validation & Rejection Memory | Evaluasi kandidat pada split validasi. Jika performa turun, edit ditolak dan disimpan ke memori penolakan | \mathcal{M}_{\text{rej}} \leftarrow \text{Anti-Cycle Protection} |
Peran Rejection Memory $\mathcal{M}_{\text{rej}}$ sangat krusial: banyak sistem self-improving gagal di lingkungan produksi karena model refiner terus-menerus mengusulkan modifikasi topologi buruk yang sama secara melingkar. Dengan membekukan jejak kegagalan, agen dijamin hanya bergerak menuju lintasan performa monotonically non-decreasing.
5. Tolok Ukur Benchmark Empiris: Dominasi 21 dari 24 Pengujian
Penelitian ini menguji Procedural Graphs di 7 tolok ukur terkemuka dengan 4 keluarga fondasi model frontier (Gemini 3.5 Flash, Gemini 3.1 Pro, Claude Sonnet 4.6, dan Grok 4.1 Fast):
| Benchmark & Domain | Model Backbone | Baseline Unguided | Procedural Graph (PG) | Delta / Margin |
|---|---|---|---|---|
| BFCL v3 (Multi-turn Tool Calling) | Gemini 3.5 Flash | 58.00% | 67.00% | +9.00 pp |
| GDPval (Professional Rubric Evaluation) | Gemini 3.1 Pro | 71.37 pts | 78.78 pts | +7.41 pts |
| τ-bench (Interactive User Policy) | Gemini 3.1 Pro | 73.04% | 80.00% | +6.96 pp |
| ALFWorld (Embodied Sequential Ordering) | Gemini 3.5 Flash | 72.58% | 81.53% | +8.95 pp |
| EnterpriseArena (132-Month Liquidity Survival) | Gemini 3.1 Pro | 6.00% | 34.00% | +28.00 pp |
| EnterpriseArena (Survival under Crises) | Claude Sonnet 4.6 | 44.00% | 58.00% | +14.00 pp |
| EnterpriseArena (Self-Evolution Loop R8) | Validation Split Baseline | 0.00% | 85.00% (Test) | +85.00 pp |
Ablasi Mekanisme Injeksi: Mengapa Subgraf Terlokalisasi Menang Mutlak
Eksperimen ablasi pada Gemini 3.5 Flash mengungkap temuan kritis bagi insinyur harness:
- Injeksi Mentah Seluruh Graf (Full Graph Raw Injection): Meningkatkan performa pada dialog terstruktur (MultiChallenge naik dari 80.27% ke 86.60%), namun merusak tugas embodied fisik (ALFWorld anjlok dari 72.58% ke 70.34%).
- Generasi Seluruh Graf (Full Graph Generative): Mengakibatkan degradasi drastis pada ALFWorld (jatuh ke 54.48%) dengan ledakan konsumsi token hingga 3.4x lipat (96.360 vs 28.064 token) akibat hilangnya fokus operasional model.
- Generatif Subgraf Terlokalisasi (Localized Subgraph Generative): Meraih efisiensi optimal dan skor tertinggi di seluruh dimensi (ALFWorld 81.53%, GDPval 63.99) dengan konsumsi token yang terukur.
6. Blueprint Implementasi: Runtime Engine TypeScript
Berikut adalah arsitektur implementasi produksi runtime Procedural Guidance Engine lengkap dengan lokalisasi $h$-hop dan gerbang validasi offline yang dapat langsung diintegrasikan ke dalam harness agen otonom:
// Procedural Graph (PG) Engine & Inference Runtime Handler
// Berdasarkan Prinsip Arsitektur Riset Google Cloud AI Research (arXiv:2609.09153, September 2026)
// Struktur Triplet: G = (V, R, E, Phi) + Localized h-hop Generative Extraction
export type RelationType = 'PRECEDES' | 'LEADS_TO' | 'CONDITIONED_ON' | 'FALLBACK_TO' | 'VERIFIES';
export interface EdgeAttributes {
condition: string; // Kapan transisi ini valid dieksekusi
guidance: string; // Petunjuk situasional cara bertindak
pitfalls: string; // Jebakan anti-pattern yang harus dihindari
}
export interface ProceduralNode {
id: string;
type: 'TOOL' | 'SKILL' | 'REASONING_STEP' | 'STATE_CHECK';
name: string;
}
export interface ProceduralEdge {
source: string;
target: string;
relation: RelationType;
attributes: EdgeAttributes;
}
export interface ProceduralGraph {
nodes: Map<string, ProceduralNode>;
edges: ProceduralEdge[];
}
export interface TrajectoryStep {
step: number;
action: string;
observation: string;
status: 'SUCCESS' | 'FAILURE' | 'PENDING';
}
/**
* 1. Online Inference: Localized Subgraph Extractor (h-hop neighborhood)
* Mengisolasi simpul aktif dan subgraf 2-hop terarah guna mencegah context pollution.
*/
export class ProceduralGuidanceEngine {
constructor(private graph: ProceduralGraph) {}
public locateActiveNode(recentAction: string): string | null {
for (const [id, node] of this.graph.nodes.entries()) {
if (recentAction.toLowerCase().includes(node.name.toLowerCase())) {
return id;
}
}
return null;
}
public extractNHopNeighborhood(activeNodeId: string | null, hops: number = 2): ProceduralEdge[] {
if (!activeNodeId || !this.graph.nodes.has(activeNodeId)) {
// Fallback ke subgraf global jika pemetaan simpul tidak terdeteksi
return this.graph.edges.slice(0, 10);
}
const visitedEdges = new Set<ProceduralEdge>();
let currentFrontier = new Set<string>([activeNodeId]);
for (let h = 0; h < hops; h++) {
const nextFrontier = new Set<string>();
for (const edge of this.graph.edges) {
if (currentFrontier.has(edge.source)) {
visitedEdges.add(edge);
nextFrontier.add(edge.target);
}
}
currentFrontier = nextFrontier;
}
return Array.from(visitedEdges);
}
public synthesizeSituationalGuidance(
subgraph: ProceduralEdge[],
taskQuery: string,
history: TrajectoryStep[]
): string {
if (subgraph.length === 0) {
return 'Procedural State: Unconstrained standard exploration mode.';
}
const proceduralRules = subgraph.map((e, idx) => {
const src = this.graph.nodes.get(e.source)?.name || e.source;
const tgt = this.graph.nodes.get(e.target)?.name || e.target;
return `[${idx + 1}] Transisi: (${src}) --[${e.relation}]--> (${tgt})\n Kondisi : ${e.attributes.condition}\n Panduan : ${e.attributes.guidance}\n Jebakan : ${e.attributes.pitfalls}`;
}).join('\n');
return `=== PROCEDURAL GRAPH LOCAL GUIDANCE (h=2 HOPS) ===\nKonteks Kueri: "${taskQuery}"\nLangkah Terakhir: "${history[history.length - 1]?.action || 'START'}"\n\nAturan Urutan Prosedural yang Valid:\n${proceduralRules}\n======================================================`;
}
}
/**
* 2. Offline Self-Evolution Engine: Topology Refiner dengan Rejection Memory
*/
export interface GraphEditOperation {
op: 'ADD_NODE' | 'ADD_EDGE' | 'DELETE_EDGE' | 'UPDATE_ATTRIBUTES';
payload: any;
}
export class OfflineGraphRefiner {
private rejectionMemory: Set<string> = new Set();
public evaluateAndCommit(
currentGraph: ProceduralGraph,
candidateEdits: GraphEditOperation[],
validationScore: number,
baselineScore: number
): { committed: boolean; reason: string } {
const editSignature = JSON.stringify(candidateEdits);
// Cek apakah mutasi topologi pernah ditolak sebelumnya
if (this.rejectionMemory.has(editSignature)) {
return {
committed: false,
reason: 'Rejected: Topologi mutasi ini identik dengan kandidat yang gagal pada evaluasi sebelumnya.',
};
}
// Gerbang Validasi: Komit jika skor validasi tidak mengalami degradasi
if (validationScore >= baselineScore) {
return {
committed: true,
reason: `Committed: Validasi stabil/meningkat (${validationScore.toFixed(2)} vs baseline ${baselineScore.toFixed(2)}).`,
};
}
// Simpan ke memori penolakan untuk mencegah siklus proposal berulang
this.rejectionMemory.add(editSignature);
return {
committed: false,
reason: `Rejected: Penurunan performa (${validationScore.toFixed(2)} < ${baselineScore.toFixed(2)}). Disimpan ke Rejection Memory.`,
};
}
}
7. Panduan Implementasi Lapangan untuk Tim AI Engineering
Bagi arsitek sistem yang membangun platform autonomous multi-agent di skala enterprise, temuan riset ini menggarisbawahi 3 imperatif arsitektur mutlak:
- Hentikan Ketergantungan pada Semantic Top-K Vector Retrieval untuk Prosedur: Vektor kemiripan kosinus tidak memahami dependensi kausal ("A harus selesai sebelum B dapat dipanggil"). Gunakan graf topologi terarah untuk mendefinisikan prasyarat alur kerja perkakas.
- Terapkan Pembatasan Ruang Lingkup 2-Hop: Jangan pernah memasukkan seluruh SOP atau diagram alir ke dalam prompt agen saat mengeksekusi aksi. Berikan hanya tetangga terarah terdekat ($h=2$) guna menjaga atensi model tetap tajam.
- Kunci Evolusi Graf dengan Rejection Memory: Saat mengimplementasikan loop self-improvement otomatis, wajib catat setiap usulan mutasi yang gagal meningkatkan skor validasi agar sistem tidak berulang kali terjebak dalam siklus degradasi yang sama.
Referensi & Sumber Terverifikasi
- [1]Procedural Graphs: Self-Evolving Execution Structures for LLM Agents(arXiv:2609.09153 [cs.AI, cs.LG, cs.CL] — Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık (Google Cloud AI Research))
- [2]tau-bench: A Benchmark for Tool-Agent-User Interaction in Realistic Environments(arXiv:2406.12045 / Sierra & Princeton NLP — Shunyu Yao, Noah Shinn, et al.)
- [3]Berkeley Function Calling Leaderboard (BFCL v3): Evaluating Complex Tool & Multi-Turn Execution(Gorilla OpenFunctions & UC Berkeley — Fanjia Yan, Huanzhi Mao, Charlie Cheng-Jie Ji, et al.)
- [4]ALFWorld: Aligning Text and Embodied Environments for Interactive Learning(ICLR 2021 / Microsoft Research & UW-Madison — Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, et al.)
- [5]CoALA: A Cognitive Architectures for Language Agents Framework(arXiv:2309.02427 / Princeton University & Stanford University — Shunyu Yao, Jeffrey Zhao, Dian Yu, et al.)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.