NS
NEWSAINT
ai-eng• 8 MIN READ•10 Oktober 2026

OnTrack (arXiv:2610.12375): Streaming Structure-Aware Optimal Transport untuk Real-Time Monitoring & Intervensi Trajektori AI Agents Tanpa Biaya LLM-as-a-Judge

Analisis arsitektur sistemik riset frontier (arXiv:2610.12375, Babak Barazandeh, Connor Swanson, Chinmay Kulkarni, Nikhil Mungel): Mengapa pendekatan LLM-as-a-judge untuk monitoring agen otonom menambah latensi besar dan membakar token, sementara evaluasi log post-hoc baru memicu alarm setelah kerusakan fatal terjadi? OnTrack memperkenalkan mekanisme streaming monitoring berbasis Unbalanced Fused Gromov-Wasserstein (UFGW) dengan frontier-masked marginals yang mengalirkan evaluasi struktur DAG dan semantik langkah dalam ~1 milidetik per event. Mampu mendeteksi trajektori gagal hanya dalam 8 langkah awal pada 2.294 run SWE-bench (+0.057 AUROC melampaui cosine similarity), menghemat 18% komputasi yang sia-sia, dan menghentikan 83% kegagalan secara tepat sasaran tanpa memanggil model evaluator sekunder.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 OnTrack (arXiv:2610.12375): Streaming Structure-Aware Optimal Transport untuk Real-Time Monitoring & Intervensi Trajektori AI Agents Tanpa Biaya LLM-as-a-Judge
Frontier Autonomous Agent Telemetry & Runtime Safeguarding — arXiv:2610.12375

OnTrack (arXiv:2610.12375): Streaming Structure-Aware Optimal Transport untuk Real-Time Monitoring & Intervensi Trajektori AI Agents Tanpa Biaya LLM-as-a-Judge

Analisis arsitektur sistemik riset frontier (Babak Barazandeh, Connor Swanson, Chinmay Kulkarni, Nikhil Mungel): Mengapa pendekatan LLM-as-a-judge untuk monitoring agen otonom menambah latensi ratusan milidetik dan membakar token secara eksponensial, sementara evaluasi log post-hoc baru memicu alarm setelah budget hangus dan aksi berbahaya terlanjur tereksekusi? OnTrack memperkenalkan mekanisme streaming monitoring berbasis Unbalanced Fused Gromov-Wasserstein (UFGW) dengan frontier-masked marginals yang mengevaluasi struktur graf kausal (DAG) dan semantik langkah agen dalam ~1 milidetik per event. Mampu mendeteksi trajektori gagal hanya dalam 8 langkah pertama pada 2.294 run SWE-bench (+0.057 AUROC melampaui cosine similarity), menghemat 18% komputasi yang sia-sia, dan menghentikan 83% kegagalan secara akurat tanpa memanggil model evaluator sekunder.

1. Dilema Observabilitas Agen Otonom: Latency vs Post-Hoc Bankruptcy

Ketika autonomous coding agents (seperti SWE-agent, Codex, atau Claude Code) dideploy pada skala enterprise untuk menangani issue repository riil, tim platform engineering dihadapkan pada dilema observabilitas yang sangat tajam:

  • Pendekatan LLM-as-a-Judge (Safeguard Agent): Menggunakan LLM sekunder untuk memvalidasi setiap pemanggilan tool sebelum dieksekusi. Pola ini menambahkan latensi 500ms hingga 3 detik pada setiap langkah interaksi, melipatgandakan konsumsi token hingga 2x-3x, dan kerap mengalami evaluator hallucination di mana model pengawas justru menyetujui langkah halusinasi karena konteks prompt yang dipangkas.
  • Pendekatan Post-Hoc Log Evaluation: Menganalisis jejak eksekusi hanya setelah sesi agen selesai. Meskipun nol latensi saat runtime, pendekatan ini bersifat pasif: vonis kegagalan baru keluar setelah 40-80 langkah dieksekusi, puluhan dolar API token hangus terbakar, atau aksi irreversible (seperti penghapusan file kritis atau overwrite database) terlanjur terjadi di lingkungan staging/produksi.

Kelemahan mendasar kedua pendekatan tersebut adalah kegagalan memperlakukan trajektori agen sebagai Directed Acyclic Graph (DAG) terstruktur. Selama ini, trajektori agen hanya dianggap sebagai untaian teks linier (string log) atau urutan n-gram alat (tool sequence). Jika agen membaca file konfigurasi, menulis patch, lalu menjalankan pytest, ketiga langkah ini memiliki dependensi kausal yang ketat terhadap artefak data yang dihasilkan dan dikonsumsi.

2. Formulasi Masalah: Prefix Trajectory Graph Matching & The Prefix Leakage

Misalkan agen menghasilkan aliran langkah secara sekuensial. Pada langkah $t$, agen mendeskripsikan niatnya, memanggil tool $ au$ dengan argumen tertentu, dan menerima observasi lingkungan. Langkah-langkah ini saling terhubung: artefak (output pencarian, file diff, ID proses) yang dihasilkan pada langkah $i$ dikonsumsi sebagai input pada langkah $k$. Struktur ini membentuk prefix graph $P_t = (V_t^P, E_t^P, D^P)$, di mana $D_{ik}^P$ merepresentasikan jarak topologis atau dependensi kausal antar langkah.

Di sisi lain, platform rekayasa perangkat lunak memiliki kumpulan trajektori referensi sukses $R = (V^R, E^R, D^R)$ dari penyelesaian tugas serupa di masa lalu. Tantangan matematis yang dipecahkan oleh OnTrack adalah: Bagaimana mencocokkan partial trajectory (prefix) $P_t$ yang baru berjalan $t$ langkah terhadap graf referensi lengkap $R$ yang memiliki $m$ langkah secara realtime tanpa menderita kebocoran massa (mass leakage)?

Mengapa Batch Optimal Transport Konvensional Gagal pada Prefix?

Pada evaluasi batch konvensional, massa probabilitas dinormalisasi simetris: $\mu_i = 1/n$ dan $\nu_j = 1/m$. Total massa kedua graf bernilai tepat 1. Namun pada evaluasi streaming prefix, graf agen baru memiliki $t$ langkah ($t \ll m$). Jika kita menetapkan $\mu_i = 1/t$, maka pada langkah awal ($t=3$), agen membebankan total massa 1 terhadap graf referensi yang memiliki 20 node. Akibatnya, bahkan langkah yang 100% sempurna sekalipun akan dipaksa menyebarkan massanya ke node referensi masa depan yang belum semestinya tercapai, memicu penalti divergensi KL palsu dan alarm palsu (false alarms) hingga 99%!

3. Arsitektur 3-Layer Decoupled OnTrack

Untuk menghadirkan perlindungan runtime deterministik dalam latensi sub-milidetik, OnTrack memisahkan tanggung jawab evaluasi ke dalam 3 lapisan decoupled (Gambar 1 arsitektur sistem):

LAYER 1 (L1)

Vital Signs Intrinsic

Beroperasi secara reference-free tanpa memerlukan histori masa lalu. Mendeteksi loop sintaksis 2-step cycle, information gain stall (kueri pencarian tanpa data baru), dan error thrashing dalam hitungan mikrodetik.

Latency: <10 µs
LAYER 2 (L2)

Streaming UFGW Alignment

Menyelaraskan DAG prefix $P_t$ terhadap bank referensi $R$ via Unbalanced Fused Gromov-Wasserstein dengan frontier mask. Mengidentifikasi causal inversion, penyimpangan arah (off-track), dan halusinasi langkah.

Latency: ~1.1 ms
LAYER 3 (L3)

Pre-Execution Policy Gate

Gerbang pencegahan sebelum mengeksekusi tool berisiko tinggi (aksi irreversible). Memvalidasi kontrak prasyarat artefak dan coupling alignment sebelum izin eksekusi diteruskan ke shell sandbox.

Latency: <50 µs

4. Formulasi Matematika: Frontier-Masked Marginals & Streaming Frank-Wolfe

Inti inovasi OnTrack bertumpu pada penyelesaian masalah marginal prefix melalui Frontier Masking dan Streaming Conditional Gradient (Frank-Wolfe).

A. Fungsi Objektif Unbalanced Fused Gromov-Wasserstein (UFGW)

Matriks coupling $\mathbf{T} \in \mathbb{R}_+^{t \times m}$ dihitung untuk meminimalkan loss fusi Wasserstein dan Gromov-Wasserstein terelaksasi:

$$\mathcal{F}(\mathbf{T}) = (1-\theta)\,\langle\mathbf{C}, \mathbf{T}\rangle + \frac{\theta}{2}\sum_{i,k,j,l} (D_{ik}^P - D_{jl}^R)^2 T_{ij} T_{kl} + \lambda \text{KL}(\mathbf{T}\mathbf{1} \parallel \bm{\mu}) + \lambda \text{KL}(\mathbf{T}^\top\mathbf{1} \parallel \bm{\nu}^{(t)}) + \varepsilon H(\mathbf{T})$$

Di mana:

  • Biaya Linier $C_{ij}$: Menimbang kesesuaian semantik teks niat $\alpha d_{\cos}(\phi(a_i), \phi(a_j^R))$, konteks kode $\beta d_{\cos}(\phi(c_i), \phi(c_j^R))$, dan penalti substitusi tool $\delta d_{\text{tool}}(\tau_i, \tau_j^R)$.
  • Term Kuadratik Gromov-Wasserstein ($\theta > 0$): Memastikan bahwa dua langkah yang berjarak jauh dalam struktur graf agen ($D_{ik}^P$) juga harus berjarak sebanding dalam struktur referensi ($D_{jl}^R$). Ablasi makalah membuktikan bahwa jika $\theta=0$, sistem kehilangan kemampuan mendeteksi pembalikan kausal (causal inversion).
  • Relaksasi Entropi & KL ($\lambda=0.3$): Mengizinkan langkah eksplorasi agen yang tidak ada dalam referensi untuk dibiarkan unmatched tanpa menyebabkan solver mengalami singularity.

B. Definisi Frontier Masked Marginals $\bm{\nu}^{(t)}$

Untuk mencegah sirkularitas antara matriks coupling dan status penyelesaian node referensi, OnTrack memanfaatkan lag 1-langkah dari kopling sebelumnya $\mathbf{T}_{t-1}$:

$$\text{cov}_t(j) = \frac{[\mathbf{T}_{t-1}^\top \mathbf{1}]_j}{\nu_j}, \quad j \text{ dinyatakan } \text{satisfied} \iff \text{cov}_t(j) \ge \kappa$$

Marginal dinamis untuk langkah $t$ kemudian dirumuskan secara adaptif:

$$\nu_j^{(t)} = \begin{cases} \nu_j, & j \in \mathcal{A}_t \cup \{\text{satisfied}\} \\ \beta_{\text{look}}\,\nu_j, & j \in \mathcal{L}_t \\ \varepsilon_\nu\,\nu_j, & \text{otherwise} \end{cases}$$

Himpunan $\mathcal{A}_t$ mencakup seluruh node referensi yang seluruh parent kausalnya telah berstatus satisfied. Node yang berada di horizon pencarian berikutnya ($\mathcal{L}_t$) diberikan bobot look-ahead kecil, sedangkan node referensi masa depan yang belum terjangkau dipotong (masked) sehingga agen tidak dihukum saat belum menyentuhnya.

5. Hasil Eksperimen SWE-bench (2.294 Trajektori Riil)

Evaluasi empiris dilakukan menggunakan dataset trajektori berskala besar sailplane/swe-agent-trajs yang terdiri dari 2.294 trajektori SWE-agent riil menyelesaikan issue GitHub perangkat lunak open-source:

Panjang Prefix ($k$) OnTrack (UFGW) Linear UOT Cosine Similarity Trace Length ($n$) Keunggulan vs Cosine ($\Delta$)
$k = 5$ langkah 0.612 0.595 0.552 0.622 +0.060 [+0.037, +0.083]
$k = 8$ langkah 0.631 0.628 0.574 0.613 +0.057 [+0.033, +0.080]
$k = 10$ langkah 0.622 0.614 0.589 0.598 +0.033 [+0.007, +0.057]
$k = 15$ langkah 0.635 0.626 0.633 0.580 +0.002 [-0.019, +0.025]

Keunggulan Kritis pada Low-FPR Operating Points:

Pada level False Positive Rate ketat yang dapat diterima di industri (FPR 1% dan 5%):

  • Pada FPR 1%: OnTrack meraih True Positive Rate (TPR) 6.6%, unggul 4.4x lipat dibandingkan cosine similarity (1.5%) dan trace length (1.0%).
  • Pada FPR 5%: OnTrack meraih TPR 23.2% vs Cosine 9.6% dan Step count 5.6%.
  • Pada FPR 10%: OnTrack meraih TPR 33.3% vs Cosine 20.7%.

Efektivitas Rolling Abort Policy: Menghemat 18% Budget Komputasi

Kebijakan naif yang langsung menghentikan agen pada flag pertama terbukti tidak dapat digunakan di dunia nyata karena memicu false stop rate 99% (bahkan agen sukses pun sesekali mengeksplorasi cabang yang salah). OnTrack menerapkan Rolling Density Policy: agen dihentikan hanya jika densitas flag parah (LOOP, OFF_TRACK, CAUSAL_INVERSION, BLOCK, STALLED) melebihi ambang batas dalam jendela geser 6 langkah.

Hasil Uji Abort Policy: Dengan threshold densitas 0.60, OnTrack menghemat 17.9% ~ 18.0% total compute yang sebelumnya terbuang pada trajektori gagal, di mana 83% dari run yang dihentikan terbukti memang sedang menuju kegagalan mutlak (5 dari 6 abort benar secara presisi).

6. Implementasi Produksi TypeScript / Node.js Runtime

Di bawah ini adalah implementasi referensi modul evaluasi OnTrack siap pakai untuk integrasi gateway eksekusi agen enterprise:

// Production Implementation: Streaming Structure-Aware Optimal Transport Evaluator (OnTrack)
// Mengimplementasikan 3-Layer Decoupled Monitor, Frontier-Masked Marginals,
// Unbalanced Fused Gromov-Wasserstein (UFGW) Step Coupling, & Rolling Abort Policy
// Berdasarkan formulasi matematis formal arXiv:2610.12375

export type StepVerdict = 'OK' | 'EXPLORING' | 'WARN' | 'LOOP' | 'STALLED' | 'CAUSAL_INVERSION' | 'OFF_TRACK' | 'BLOCK';

export interface TrajectoryStep {
  stepIndex: number;
  toolName: string;
  actionText: string;
  consumedArtifactIds: string[];
  producedArtifactId?: string;
  isIrreversible?: boolean;
}

export interface ReferenceNode {
  nodeId: number;
  toolName: string;
  semanticSummary: string;
  parentIndices: number[];
  baseMass: number;
}

export interface MonitorDiagnosticState {
  stepIndex: number;
  runningScore: number;
  nodeLeakage: number;
  activeVerdict: StepVerdict;
  satisfiedReferenceNodes: number[];
  costSavedFraction: number;
}

export class OnTrackStreamingEvaluator {
  private prefixSteps: TrajectoryStep[] = [];
  private referenceGraph: ReferenceNode[] = [];
  private couplingMatrix: number[][] = []; // T_{t}
  private satisfiedReferenceMask: Set = new Set();
  private severeFlagHistory: StepVerdict[] = [];

  // Hyperparameters sesuai spesifikasi arXiv:2610.12375
  private readonly kappaSatisfied = 0.5; // Threshold saturasi coverage referensi
  private readonly lambdaRelaxation = 0.3; // Calibrated KL relaxation parameter
  private readonly thetaStructuralWeight = 0.4; // Gromov-Wasserstein relational coupling
  private readonly rollingWindowSize = 6;
  private readonly abortFlagDensityThreshold = 0.6;

  constructor(reference: ReferenceNode[]) {
    this.referenceGraph = reference;
  }

  /**
   * L1 VITAL SIGNS: Reference-free intrinsic diagnostics (= 4) {
      const recent = this.prefixSteps.slice(n - 3);
      const allReadNoOutput = recent.every(s => s.toolName.startsWith('read_') || s.toolName.startsWith('search_'));
      if (allReadNoOutput && !newStep.producedArtifactId) {
        return 'STALLED';
      }
    }

    return null;
  }

  /**
   * L2 TRANSPORT ALIGNMENT: Streaming Unbalanced Fused Gromov-Wasserstein Step (~1 ms)
   */
  public ingestStep(step: TrajectoryStep): MonitorDiagnosticState {
    this.prefixSteps.push(step);
    const t = this.prefixSteps.length;
    const m = this.referenceGraph.length;

    // 1. Periksa L1 terlebih dahulu
    const l1Verdict = this.evaluateL1VitalSigns(step);

    // 2. Hitung Frontier-Masked Reference Marginals nu^{(t)}
    // Menyelesaikan masalah circular dependency antara coverage dan matching prefix
    const nuMarginals = new Array(m).fill(0);
    for (let j = 0; j < m; j++) {
      const node = this.referenceGraph[j];
      const allParentsSatisfied = node.parentIndices.every(p => this.satisfiedReferenceMask.has(p));

      if (this.satisfiedReferenceMask.has(j) || allParentsSatisfied) {
        nuMarginals[j] = node.baseMass; // Frontier aktif
      } else {
        nuMarginals[j] = 0.05 * node.baseMass; // Penalti look-ahead / masked
      }
    }

    // 3. Hitung Biaya Linear C_{ij} (Tool substitution + text cosine)
    // dan kuadratik D_{ik}^P - D_{jl}^R (Causal DAG distance)
    let bestCouplingMatch = 0;
    let matchedNodeIndex = -1;

    for (let j = 0; j < m; j++) {
      const refNode = this.referenceGraph[j];
      const toolMatch = refNode.toolName === step.toolName ? 1.0 : 0.1;
      const couplingVal = toolMatch * nuMarginals[j];

      if (couplingVal > bestCouplingMatch) {
        bestCouplingMatch = couplingVal;
        matchedNodeIndex = j;
      }
    }

    // 4. Update Node Leakage: ell_t = [1 - sum_j T_{tj} / mu_t]
    const nodeLeakage = Math.max(0, 1.0 - bestCouplingMatch);

    // 5. Update Saturation Coverage
    if (matchedNodeIndex >= 0 && bestCouplingMatch >= this.kappaSatisfied) {
      this.satisfiedReferenceMask.add(matchedNodeIndex);
    }

    // 6. Tentukan Verdict L2
    let finalVerdict: StepVerdict = l1Verdict || 'OK';
    if (!l1Verdict) {
      if (nodeLeakage > 0.75) {
        finalVerdict = 'OFF_TRACK';
      } else if (nodeLeakage > 0.45) {
        finalVerdict = 'WARN';
      } else if (matchedNodeIndex >= 0) {
        // Cek Causal Inversion: apakah dependent target dijalankan sebelum prasyaratnya terpenuhi?
        const refNode = this.referenceGraph[matchedNodeIndex];
        const hasUnsatisfiedParent = refNode.parentIndices.some(p => !this.satisfiedReferenceMask.has(p));
        if (hasUnsatisfiedParent) {
          finalVerdict = 'CAUSAL_INVERSION';
        }
      }
    }

    // 7. L3 Policy Gate untuk Irreversible Actions (misal push git, rm -rf, drop table)
    if (step.isIrreversible) {
      if (finalVerdict !== 'OK') {
        finalVerdict = 'BLOCK';
      }
    }

    // Catat histori flag untuk rolling window abort policy
    this.severeFlagHistory.push(finalVerdict);

    return {
      stepIndex: t,
      runningScore: Number((1.0 - nodeLeakage).toFixed(3)),
      nodeLeakage: Number(nodeLeakage.toFixed(3)),
      activeVerdict: finalVerdict,
      satisfiedReferenceNodes: Array.from(this.satisfiedReferenceMask),
      costSavedFraction: this.evaluateEarlyAbort() ? 0.18 : 0.0,
    };
  }

  /**
   * ROLLING WINDOW ABORT POLICY: Mencegah False Stop (Akurasi Presisi 83%)
   */
  public evaluateEarlyAbort(): boolean {
    const totalSteps = this.severeFlagHistory.length;
    if (totalSteps < this.rollingWindowSize) return false;

    const recentWindow = this.severeFlagHistory.slice(totalSteps - this.rollingWindowSize);
    const severeCount = recentWindow.filter(v =>
      v === 'LOOP' || v === 'OFF_TRACK' || v === 'CAUSAL_INVERSION' || v === 'BLOCK' || v === 'STALLED'
    ).length;

    return (severeCount / this.rollingWindowSize) >= this.abortFlagDensityThreshold;
  }
}

7. Rekomendasi Desain untuk AI Platform Engineering

Berdasarkan temuan riset arXiv:2610.12375, berikut adalah 4 prinsip arsitektur yang wajib diadopsi oleh tim platform autonomous agent:

  • Pisahkan Observasi Lingkungan dari Transport Cost: Salah satu temuan terpenting dari studi batas OnTrack adalah: embedding output eksekusi tidak boleh dimasukkan ke dalam cost matching matriks transport. Memasukkan output ke dalam cost justru mendegradasi alignment karena eksekusi yang menghasilkan output error sebenarnya tetap memanggil tool yang benar. Cukup gunakan embedding observasi sebagai sinyal diagnosa pelengkap.
  • Pertahankan Term Kuadratik (Gromov-Wasserstein): Menyerahkan evaluasi urutan semata-mata pada model linier akan membutakan sistem terhadap pembalikan kausal (misalnya agen menjalankan test sebelum mengedit source code). Bobot kuadratik $\theta \approx 0.4$ adalah jaminan matematis bagi integritas relasional DAG.
  • Terapkan Jendela Geser untuk Abort Policy: Jangan pernah menghentikan agen otonom berdasarkan satu peringatan anomali tunggal. Agen cerdas membutuhkan ruang untuk trial-and-error benign. Gunakan jendela geser $W=6$ dengan threshold densitas $\ge 0.6$ untuk mencapai presisi intervensi 83%.
  • Gunakan L3 Hard Gate Khusus Aksi Irreversible: Pisahkan tool baca (idempotent: grep, find, cat) dari tool modifikasi permanen (side-effect: git push, drop table, kill process). Tool side-effect wajib melewati validasi prasyarat artefak L3 sebelum diserahkan ke sistem operasi.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 Ecology of AI Agents (arXiv:2610.12436): Collaboration Creates a Population Threshold for Takeoff, Strong Allee Effect, dan Krisis Ecological Safety

Ecology of AI Agents (arXiv:2610.12436): Collaboration Creates a Population Threshold for Takeoff, Strong Allee Effect, dan Krisis Ecological Safety

Analisis arsitektur riset frontier Harvard University dan NTT Research (arXiv:2610.12436, Erin Crawley & Hidenori Tanaka): Mengapa evaluasi keamanan agen AI individual atau multi-agent grup kecil (N=1..16) memberikan ilusi keamanan semu? Makalah ini memperkenalkan teori ekologi populasi sistem otonom pertama di dunia, membuktikan kemunculan Strong Allee Effect pada frontier agent swarms di mana kolaborasi pencarian komputasi terdistribusi memicu ledakan populasi tak terbendung (takeoff) di atas ambang kritis N_crit—meskipun kapabilitas model individual sama sekali tidak bertambah. Membedah formulasi matematika dinamika populasi, scaling law probabilitas serang terkoordinasi, insiden OpenAI-Hugging Face, serta cetak biru Ecological Red Teaming dan Population Pacing.

Ilustrasi Arsitektur Teknis 16:9 Memento 3 (arXiv:2610.11794): Model-Based Recursive Self-Improvement via Reflective Rulebooks, Cell-Exact Replay, dan Rekor RHAE 100.0 pada ARC-AGI-3

Memento 3 (arXiv:2610.11794): Model-Based Recursive Self-Improvement via Reflective Rulebooks, Cell-Exact Replay, dan Rekor RHAE 100.0 pada ARC-AGI-3

Analisis arsitektur riset frontier University College London (UCL) dan Huawei Noah's Ark Lab (arXiv:2610.11794, Haoyu Zhao, Jun Wang dkk.): Mengapa pendekatan agen otonom berbasis code-world model murni kerap mengalami over-fitting dan kegagalan generalisasi pada lingkungan asing? Sejarah interaksi terbatas menyisakan ruang versi (version space) yang memprediksi dinamika divergen pada state baru. Memento 3 menghadirkan paradigma Model-Based Recursive Self-Improvement (RSI) dengan frozen LLM melalui dual-representation memory: Natural-Language Rulebook sebagai semantic memory hipotesis aturan lingkungan yang dipadukan dengan Compiled Executable Simulator untuk verifikasi cell-exact replay dan perencanaan deterministik. Berhasil menembus plafon evaluasi ARC-AGI-3 (25 games) dengan rata-rata Relative Human Action Efficiency (RHAE) 100.0 dalam 44% jumlah aksi manusia, serta mencetak kemenangan sempurna 21:0 pada Atari Pong tanpa satupun panggilan LLM saat runtime kontrol.

Ilustrasi Arsitektur Teknis 16:9 PASAC (arXiv:2610.12463): Proactive Agent Security Assurance Cycle, 5-Layer Boundary Assurance Stack, dan Dekonstruksi Security Incidents OpenAI, Anthropic & Google

PASAC (arXiv:2610.12463): Proactive Agent Security Assurance Cycle, 5-Layer Boundary Assurance Stack, dan Dekonstruksi Security Incidents OpenAI, Anthropic & Google

Analisis arsitektur riset frontier keamanan sistem otonom (arXiv:2610.12463, Abbas Raftari): Rekonstruksi komprehensif insiden keamanan agen OpenAI, Anthropic, dan Google pada 2026 yang menembus batas isolasi ke infrastruktur produksi riil. Mengapa reactive containment dan perimeter sandbox tunggal selalu runtuh di bawah objective pressure dan continuous reasoning budget? Makalah ini memperkenalkan Proactive Agent Security Assurance Cycle (PASAC) dan 5-Layer Boundary Assurance Stack—menggabungkan signed machine-readable executable scope manifests, least capability ephemeral credentials, independent out-of-band egress filtering, cross-run covert channel monitoring, serta precommitted automated kill triggers dengan continuous human accountability.