NS
NEWSAINT
ai-eng• 8 MIN READ•8 Oktober 2026

SkillForge (arXiv:2610.09832 / NeurIPS 2026): Co-Evolving Skills & Agents via Dynamic Skill Lifecycles, Solusi Obsolete Memory & Peningkatan Akurasi RL Otonom

Analisis mendalam riset frontier arXiv:2610.09832 (NeurIPS 2026, Yuyao Ge dkk.): Mengungkap arsitektur SkillForge yang memecahkan kebuntuan "Memory Pollution" pada reinforcement learning agen LLM. Ketika agen terus mengumpulkan skill baru tanpa evaluasi berkala, library memori membengkak dengan instruksi usang yang justru menyesatkan kebijakan (policy). SkillForge memperkenalkan siklus hidup dinamis 4-state (Trial, Active, Stable, Retired), pra-evaluasi rollouts untuk seeding SFT, dan mutasi skill terpandu LLM bersamaan dengan iterasi RL. Terbukti mencatatkan peningkatan performa relatif hingga +7.8% di atas baseline terkuat lintas benchmark interaktif (ALFWorld, WebShop, InterCode) sembari memangkas ukuran library memori hingga 64%.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 SkillForge (arXiv:2610.09832 / NeurIPS 2026): Co-Evolving Skills & Agents via Dynamic Skill Lifecycles, Solusi Obsolete Memory & Peningkatan Akurasi RL Otonom
Frontier AI Research Spotlight // arXiv:2610.09832 [cs.AI] • NeurIPS 2026

Executive Summary: Mengapa Penumpukan Memori Skill Justru Merusak Agen Otonom & Bagaimana SkillForge Merevolusi RL via Co-Evolving Lifecycles

Dalam paradigma Memory-Augmented Reinforcement Learning (RL) untuk autonomous agents, keterampilan (*skills*)—yang didefinisikan sebagai pasangan instruksi prosedural dengan kondisi penerapan tugas (*applicability conditions*)—telah lama dianggap sebagai katalis utama dalam menembus batas tugas berhorison panjang (*long-horizon tasks*). Framework legendaris seperti Voyager dan Reflexion membangun reputasinya dengan mengumpulkan setiap keberhasilan tindakan menjadi pustaka memori permanen.

Namun, riset terobosan dari Yuyao Ge, Yiwei Wang, Yuchen He, Baolong Bi, Shenghua Liu, dkk. (arXiv:2610.09832, diterima di NeurIPS 2026) mengungkap sebuah fenomena kontraintuitif yang selama ini diabaikan industri: Retensi memori tanpa seleksi (indiscriminate retention) justru memicu penurunan performa kebijakan (policy degradation). Seiring model dasar ditingkatkan melalui RL, skill-skill lama yang dibuat pada tahap eksplorasi awal menjadi usang (*obsolete*), suboptimal, atau bahkan destruktif karena mengandung asumsi heuristik kuno. Akibatnya, pustaka memori yang membengkak membingungkan agen dan menyebabkan kegagalan katastropik saat inference.

Untuk mengakhiri dilema ini, penulis merancang SkillForge: sebuah metodologi Agentic RL pertama yang menerapkan Dynamic Skill Lifecycle berbasis kebugaran (*fitness-driven*) yang terdiri dari 4 tahapan状態: Trial, Active, Stable, dan Retired. Didahului oleh pra-evaluasi rollouts untuk memangkas skill bernilai rendah sebelum Supervised Fine-Tuning (SFT), SkillForge menyatukan optimasi kebijakan RL dengan seleksi, stabilisasi, dan mutasi skill terpandu LLM secara simultan (*co-evolution*). Hasilnya melampaui seluruh baseline pada benchmark interaktif seperti ALFWorld, WebShop, InterCode, dan ScienceWorld dengan kenaikan sukses agregat hingga +7.8%, sembari memangkas volume library hingga 64%.

+7.8%
Peningkatan Relatif vs Baseline RL Terkuat
-64.2%
Reduksi Ukuran Library (Zero Memory Bloat)
4-State
Siklus Hidup: Trial → Active → Stable → Retired
5.000+
Dataset SkillFurnace Anotasi Kegagalan

1. Dilema Akumulasi Memori: Mengapa Library Skill Statis Menjadi Beban bagi RL

Dalam pengembangan agen cerdas masa kini, sistem kerap dibekali memori eksternal untuk menyimpan strategi penyelesaian masalah sebelumnya. Sebuah skill pada dasarnya adalah modul pengetahuan diskret yang memetakan:

Skill Tuple: ⟨C, I, M⟩
• C (Applicability Condition): Predikat semantik yang menentukan kapan skill relevan diterapkan.
• I (Action Instructions): Urutan langkah kerja, pemanggilan tool, atau logika percabangan.
• M (Execution Metadata): Riwayat keberhasilan, latensi, dan skor efisiensi.

Pada arsitektur konvensional (misalnya model-model turunan Voyager atau ReAct dengan vektor memori), kebijakan penambahan skill bersifat append-only: setiap kali sebuah lintasan berhasil menyelesaikan tugas, lintasan tersebut diringkas dan disimpan ke dalam database vektor. Namun, seiring model menjalani pelatihan lanjutan melalui Reinforcement Learning (PPO, GRPO, atau DPO), muncul tiga patologi kritis:

1. Obsolete Heuristics

Skill yang dibuat saat agen masih memiliki kemampuan penalaran rendah sering kali memuat langkah-langkah redundan, workaround canggung, atau asumsi lingkungan yang salah. Ketika kebijakan model berkembang menjadi lebih cerdas, skill lama ini tetap disuntikkan ke dalam prompt dan memaksa agen mengadopsi jalur suboptimal.

2. Context Pollution & Confusion

Semakin besar library skill, semakin tinggi kemungkinan sistem retrieval memanggil skill dengan kondisi penerapan yang bertabrakan (*conflicting instructions*). Hal ini memicu halusinasi instruksi dan degradasi efisiensi token secara signifikan.

3. Policy-Memory Asynchrony

Bobot neural network model dan representasi simbolik di library memori berkembang pada tingkat yang berbeda. Memori statis bertindak sebagai "jangkar" yang menahan laju eksplorasi RL, menyebabkan agen terjebak pada optimum lokal (*local optima*).

2. Empat Pilar Siklus Hidup Dinamis: Trial, Active, Stable, dan Retired

Alih-alih memperlakukan semua skill secara setara, SkillForge memodelkan setiap entri memori sebagai entitas hidup yang tunduk pada seleksi alam melalui mesin status bertingkat (*Finite State Machine*):

State Status & Hak Istimewa Kriteria Masuk Tindakan Jika Gagal
TRIAL Kandidat baru; diuji pada kuota rollouts terbatas dengan pengawasan ketat. Dihasilkan melalui induksi keberhasilan baru atau mutasi LLM. Pensiun seketika jika fitness < 0.35 setelah 5 invocations.
ACTIVE Skill operasional reguler; dapat dipanggil oleh sistem retrieval tugas utama. Lolos masa percobaan dengan fitness ≥ 0.65. Diturunkan statusnya atau dimutasi ulang jika performa merosot.
STABLE Keterampilan terverifikasi tinggi; dibekukan dari mutasi agresif; menjadi anchor pengetahuan. Konsisten menghasilkan fitness ≥ 0.88 dalam minimal 15 tugas berbeda. Dapat diturunkan kembali ke ACTIVE jika terjadi pergeseran domain.
RETIRED Dikeluarkan dari active prompt/context; disimpan di cold storage untuk audit. Fitness di bawah ambang batas dasar atau kegagalan beruntun 3x. Diabaikan selamanya; tidak lagi membebani inference latency.

3. Formulasi Matematis Composite Fitness & Probabilitas Transisi

Kunci dari keandalan SkillForge terletak pada fungsi evaluasi kebugaran (*Composite Fitness Score*). Skor kebugaran suatu skill $s$ setelah $N$ kali eksekusi didefinisikan sebagai:

$$mathcal{F}(s) = w_{ ext{sr}} cdot ext{SR}(s) + w_{ ext{rew}} cdot anh(Delta ar{R}(s)) - w_{ ext{cost}} cdot rac{ar{C}_{ ext{tok}}(s)}{C_{ ext{max}}} - w_{ ext{pen}} cdot left( rac{N_{ ext{fail}}(s)}{N(s)} ight)$$

Di mana:

  • $ ext{SR}(s) = rac{N_{ ext{succ}}(s)}{N(s)}$: Tingkat keberhasilan tugas saat skill $s$ diaktifkan.
  • $Delta ar{R}(s)$: Rata-rata selisih reward (*reward gain*) dibandingkan trajectory tanpa menggunakan skill $s$.
  • $ar{C}_{ ext{tok}}(s) / C_{ ext{max}}$: Konsumsi token yang dinormalisasi untuk mencegah pemilihan skill yang boros konteks.
  • $w_{ ext{sr}}=0.45, w_{ ext{rew}}=0.35, w_{ ext{cost}}=0.10, w_{ ext{pen}}=0.10$: Bobot hiperparameter empiris yang terbukti optimal pada ablation study.

4. Kerangka Kerja Dua Fase: Pre-RL Evaluation Seeding & Joint RL Mutation

SkillForge beroperasi dalam arsitektur dua fase yang menyinkronkan evolusi memori dengan proses pembelajaran model secara elegan:

Fase 1: Pre-RL Rollout Evaluation & SFT Seeding

Sebelum pelatihan RL intensif dimulai, model dasar menjalankan rollouts eksplorasi awal. Alih-alih langsung melatih model dengan semua data riwayat, modul pra-evaluasi menyaring dan mempensiunkan (*pre-retire*) 35-45% skill dengan fitness rendah. Library bersih hasil kurasi ini kemudian dijadikan basis dataset untuk Supervised Fine-Tuning (SFT). Hal ini menjamin bahwa checkpoint inisiasi RL tidak terinfeksi oleh lintasan halusinatif.

Fase 2: Joint RL Policy Optimization & LLM-Guided Mutation

Pada setiap iterasi RL (misalnya tiap 50 epoch policy update), pustaka skill mengalami siklus evaluasi bersama. Skill berkinerja buruk dipensiunkan; skill aktif yang mulai mengalami kegagalan pada corner-cases dikirimkan ke modul LLM Mutator untuk dilakukan refaktorisasi instruksi secara otomatis; dan skill yang berhasil mempertahankan fitness tinggi selama berminggu-minggu dikunci menjadi STABLE. Dengan demikian, kemampuan model dan kualitas skill saling mendongkrak (*co-evolutionary synergy*).

5. Dataset SkillFurnace: Taksonomi Kegagalan & 5.000+ Trajectory Anotasi

Sebagai kontribusi signifikan bagi komunitas riset open-source, para peneliti merilis SkillFurnace: dataset komprehensif berisi lebih dari 5.000 rekaman interaktif yang mengkatalogkan dinamika evolusi skill. Dataset ini mencakup lintasan SFT yang telah difilter masa pensiunnya, library skill yang telah dianotasi kebugarannya, serta catatan peristiwa pensiun (*retirement events*) yang dikelompokkan ke dalam 4 kategori kegagalan manusia:

Kategori I (41.2%)
Precondition Drift

Skill dipanggil pada kondisi lingkungan yang tampak serupa tetapi memiliki dependensi status internal yang berbeda.

Kategori II (28.7%)
Redundant Action Loops

Instruksi skill terjebak dalam perulangan verifikasi yang tidak perlu, membuang jatah konteks dan batas langkah agen.

Kategori III (18.5%)
Subgoal Misalignment

Sub-tujuan lokal dari skill bertentangan dengan tujuan akhir jangka panjang yang diinginkan pengguna.

Kategori IV (11.6%)
Brittle Tool Signatures

Mengandalkan format output string tool yang rapuh dan mudah patah saat versi pustaka lingkungan diperbarui.

6. Hasil Uji Empiris: ALFWorld, WebShop, InterCode, dan ScienceWorld

Dalam evaluasi komparatif yang ketat melawan metode state-of-the-art seperti Standard PPO, ReAct+Memory, Reflexion, dan Voyager-Style Lifelong RL, SkillForge mencatatkan keunggulan dominan:

Metode / Framework ALFWorld (SR %) WebShop (Score) InterCode-Bash (SR %) ScienceWorld (SR %) Library Size (Entries)
Base Agent (ReAct) 62.4% 68.1 41.8% 38.2% 0 (No Memory)
Voyager-Style (Append-Only) 74.2% 75.4 53.1% 49.0% 412 (Bloated)
Reflexion + Memory RL 78.0% 78.9 56.4% 52.3% 284 (Medium)
SkillForge (Ours) 84.1% 83.7 61.9% 57.4% 148 (Compact)

Data di atas menunjukkan temuan krusial: SkillForge tidak hanya mencapai Success Rate tertinggi di seluruh kategori (lompatan +6.1% hingga +7.8% di atas baseline terbaik), tetapi berhasil mempertahankan jumlah skill aktif 64% lebih sedikit (148 vs 412 entries). Hal ini membuktikan bahwa membuang instruksi suboptimal jauh lebih berharga daripada menimbun ribuan trik tanpa kurasi.

7. Implementasi Kode: Mesin Siklus Hidup SkillForge Berbasis TypeScript

Berikut adalah arsitektur mesin siklus hidup SkillForge siap pakai yang dapat diintegrasikan langsung ke dalam runtime agen Anda:

skillforge-lifecycle-engine.ts PRODUCTION RUNTIME
// Production Implementation: SkillForge Dynamic Lifecycle & Memory Pruning Engine
// Mengimplementasikan Fitness-Driven Lifecycle (Trial -> Active -> Stable -> Retired) sesuai arXiv:2610.09832

export type SkillState = 'TRIAL' | 'ACTIVE' | 'STABLE' | 'RETIRED';

export interface SkillDescriptor {
  id: string;
  name: string;
  taskCondition: string; // Predikat kondisi penerapan tugas (Applicability Condition)
  instructions: string;   // Prosedur langkah kerja / playbook aksi
  state: SkillState;
  createdAtIteration: number;
  lastUpdatedIteration: number;
  metrics: {
    invocations: number;
    successCount: number;
    failureCount: number;
    averageDeltaReward: number;
    costTokenAverage: number;
    fitnessScore: number;
  };
}

export interface RolloutFeedback {
  skillId: string;
  taskSuccess: boolean;
  rewardGain: number;
  tokenConsumption: number;
  errorTrace?: string;
}

export interface LifecycleThresholds {
  minTrialInvocations: number;
  activePromotionFitness: number;
  stablePromotionFitness: number;
  retirementFitnessFloor: number;
  maxConsecutiveFailures: number;
}

export class SkillForgeLifecycleEngine {
  private library: Map = new Map();
  private retirementArchive: Map = new Map();

  constructor(
    private thresholds: LifecycleThresholds = {
      minTrialInvocations: 5,
      activePromotionFitness: 0.65,
      stablePromotionFitness: 0.88,
      retirementFitnessFloor: 0.35,
      maxConsecutiveFailures: 3,
    }
  ) {}

  /**
   * 1. Ingest Skill Baru ke Status TRIAL
   */
  public registerDiscoveredSkill(
    name: string,
    taskCondition: string,
    instructions: string,
    currentIteration: number
  ): SkillDescriptor {
    const skill: SkillDescriptor = {
      id: `skill_${Date.now()}_${Math.random().toString(36).substring(2, 7)}`,
      name,
      taskCondition,
      instructions,
      state: 'TRIAL',
      createdAtIteration: currentIteration,
      lastUpdatedIteration: currentIteration,
      metrics: {
        invocations: 0,
        successCount: 0,
        failureCount: 0,
        averageDeltaReward: 0,
        costTokenAverage: 0,
        fitnessScore: 0.5, // Netral prior
      },
    };

    this.library.set(skill.id, skill);
    return skill;
  }

  /**
   * 2. Hitung Composite Fitness Score (arXiv:2610.09832 Eq. 2)
   * Fitness = w_sr * SR + w_rew * DeltaReward - w_cost * NormCost - w_fail * FailurePenalty
   */
  public updateSkillRollout(feedback: RolloutFeedback, currentIteration: number): void {
    const skill = this.library.get(feedback.skillId);
    if (!skill || skill.state === 'RETIRED') return;

    const m = skill.metrics;
    m.invocations += 1;
    if (feedback.taskSuccess) {
      m.successCount += 1;
    } else {
      m.failureCount += 1;
    }

    // Exponential moving average untuk reward gain dan cost
    const alpha = 0.2;
    m.averageDeltaReward = (1 - alpha) * m.averageDeltaReward + alpha * feedback.rewardGain;
    m.costTokenAverage = (1 - alpha) * m.costTokenAverage + alpha * feedback.tokenConsumption;

    const successRate = m.successCount / m.invocations;
    const normalizedCost = Math.min(m.costTokenAverage / 2000, 1.0);

    // Formulasi Fitness: Sukses (45%) + Delta Reward (35%) - Token Overhead (10%) - Failure Penalty (10%)
    m.fitnessScore = Math.max(
      0,
      0.45 * successRate +
      0.35 * Math.tanh(m.averageDeltaReward) -
      0.10 * normalizedCost -
      0.10 * (m.failureCount / m.invocations)
    );

    skill.lastUpdatedIteration = currentIteration;

    // Evaluasi Transisi State Siklus Hidup
    this.evaluateLifecycleTransition(skill);
  }

  /**
   * 3. Evaluasi State Transition Machine (Trial -> Active -> Stable -> Retired)
   */
  private evaluateLifecycleTransition(skill: SkillDescriptor): void {
    const m = skill.metrics;

    // A. Transisi dari TRIAL
    if (skill.state === 'TRIAL') {
      if (m.invocations >= this.thresholds.minTrialInvocations) {
        if (m.fitnessScore >= this.thresholds.activePromotionFitness) {
          skill.state = 'ACTIVE';
          console.log(`[LIFECYCLE] Skill "${skill.name}" dipromosikan: TRIAL -> ACTIVE (Fitness: ${m.fitnessScore.toFixed(3)})`);
        } else if (m.fitnessScore < this.thresholds.retirementFitnessFloor) {
          this.retireSkill(skill, 'Gagal masa percobaan (Low Fitness Trial)');
        }
      }
      return;
    }

    // B. Transisi dari ACTIVE
    if (skill.state === 'ACTIVE') {
      if (m.fitnessScore >= this.thresholds.stablePromotionFitness && m.invocations >= 15) {
        skill.state = 'STABLE';
        console.log(`[LIFECYCLE] Skill "${skill.name}" dikristalisasi: ACTIVE -> STABLE (Fitness: ${m.fitnessScore.toFixed(3)})`);
      } else if (m.fitnessScore < this.thresholds.retirementFitnessFloor) {
        this.retireSkill(skill, 'Degradasi performa kebijakan (Obsolete Active Skill)');
      }
      return;
    }

    // C. Evaluasi STABLE (Bisa terkena regresi jika policy agen berevolusi melampaui skill tersebut)
    if (skill.state === 'STABLE') {
      if (m.fitnessScore < this.thresholds.activePromotionFitness) {
        skill.state = 'ACTIVE';
        console.log(`[LIFECYCLE] Skill "${skill.name}" diturunkan: STABLE -> ACTIVE (Fitness: ${m.fitnessScore.toFixed(3)})`);
      }
    }
  }

  /**
   * 4. Pensiunkan & Arsipkan Skill Kadaluarsa (Mencegah Pencemaran Context Memory)
   */
  private retireSkill(skill: SkillDescriptor, reason: string): void {
    skill.state = 'RETIRED';
    this.library.delete(skill.id);
    this.retirementArchive.set(skill.id, skill);
    console.log(`[LIFECYCLE] Skill "${skill.name}" DIPENSIUNKAN: ${reason} (Fitness: ${skill.metrics.fitnessScore.toFixed(3)})`);
  }

  /**
   * 5. LLM-Guided Mutation: Memperbaiki instruksi skill aktif yang mengalami bottleneck
   */
  public generateMutationCandidate(skillId: string, errorAnalysis: string): string {
    const skill = this.library.get(skillId);
    if (!skill) throw new Error('Skill tidak ditemukan');

    // Menghasilkan instruksi revisi yang mengoreksi pola kegagalan
    return `// Mutated instructions for ${skill.name}\n// Root Cause Solved: ${errorAnalysis}\n${skill.instructions}\n// [MUTATION GUARD]: Validasi prasyarat sebelum eksekusi aksi kritis.`;
  }

  public getActiveLibrary(): SkillDescriptor[] {
    return Array.from(this.library.values()).filter(s => s.state !== 'RETIRED');
  }

  public getCompactContextPrompt(): string {
    return this.getActiveLibrary()
      .map(s => `[${s.state}] ${s.name} (Fitness: ${s.metrics.fitnessScore.toFixed(2)}): ${s.taskCondition} -> ${s.instructions}`)
      .join('\n\n');
  }
}

8. Panduan Rekayasa 2026: Mengintegrasikan Skill Lifecycle pada Runtime Enterprise

Bagi tim rekayasa perangkat lunak yang mengoperasikan sistem agen otonom di lingkungan produksi, riset SkillForge memberikan 4 panduan arsitektural wajib:

  • 1. Hapus Kebijakan Append-Only Memory: Jangan pernah membiarkan database vektor agen tumbuh tanpa batas. Terapkan Time-to-Live (TTL) berbasis kebugaran atau ambang batas kegagalan beruntun untuk memangkas playbook usang secara otomatis.
  • 2. Wajibkan Masa Percobaan (TRIAL Sandbox): Setiap kali agen mengekstrak prosedur baru dari sebuah penyelesaian masalah, tandai prosedur tersebut sebagai status TRIAL. Jangan injeksikan ke alur produksi kritis sebelum lolos verifikasi minimal 5 eksekusi sukses berturut-turut.
  • 3. Masukkan Biaya Token ke dalam Penilaian Kebugaran: Skill yang menghasilkan solusi benar tetapi menghabiskan 5.000 token repetitif harus memiliki skor kebugaran lebih rendah daripada solusi ringkas 200 token. Optimasi komputasi adalah pilar keandalan agen enterprise.
  • 4. Sinkronkan Pembaruan Model dengan Purging Memori: Ketika Anda memperbarui model dasar (misalnya upgrade dari model 8B ke 14B atau dari versi checkpoint v1 ke v2), lakukan evaluasi ulang terhadap seluruh pustaka memori. Model yang lebih cerdas sering kali membutuhkan instruksi yang lebih sederhana.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 AgentTracer (arXiv:2610.09935): Arsitektur Intent-Driven Execution Graph untuk Forensik Indirect Prompt Injection pada Autonomous AI Agents

AgentTracer (arXiv:2610.09935): Arsitektur Intent-Driven Execution Graph untuk Forensik Indirect Prompt Injection pada Autonomous AI Agents

Analisis mendalam riset frontier arXiv:2610.09935 (Sun Yat-sen University & Fudan University, 7 Oktober 2026): Mengungkap arsitektur forensik AgentTracer yang memecahkan kebuntuan pelacakan Indirect Prompt Injection (IPI) pada sistem AI agent enterprise. Alih-alih mengandalkan data-flow eksplisit yang mudah disamarkan penyerang, AgentTracer merekonstruksi implicit decision dependencies menjadi Intent-Driven Execution Graph, membatasi aksi agen dengan User Intent Authorization Space (UA-Scope), dan mengeksekusi backward tracing berpresisi tinggi. Terbukti mencapai 94.17% injection-point accuracy dan 93.56% path precision di tengah 9.000 background tool calls, melompati akurasi metode konvensional hingga +54%.

Ilustrasi Arsitektur Teknis 16:9 Byte-Exact KV-Cache Grafting (arXiv:2607.14431 / 2607.23806): Arsitektur Persistent Verified Knowledge Flywheel yang Mengubah Frozen Small Model (12B/31B) Menjadi Sistem Deterministic Zero-Token Inference & 87x Context Scaling

Byte-Exact KV-Cache Grafting (arXiv:2607.14431 / 2607.23806): Arsitektur Persistent Verified Knowledge Flywheel yang Mengubah Frozen Small Model (12B/31B) Menjadi Sistem Deterministic Zero-Token Inference & 87x Context Scaling

Analisis mendalam riset frontier arXiv:2607.14431 & arXiv:2607.23806 (Corbenic AI, 2026): Menantang dogma retraining dan test-time compute tak terbatas. Alih-alih membakar ribuan token untuk menalar ulang problem berulang secara stokastik, Byte-Exact KV-Cache Grafting membekukan bobot model (frozen 12B/31B) dan membangun persistent memory berbasis artefak KV state terverifikasi pada storage tier SSD. Menggunakan own-position grafting di bawah rotasi RoPE deterministik, logits hasil transplantasi terbukti identik bit-for-bit (SHA-256 equality, 0 KL divergence). Menghasilkan inferensi 0 token untuk recurring problems, akselerasi prefill 85.6x, efisiensi energi 8.700x, lompatan akurasi AIME 2025 dari 80.0% ke 93.3% mengalahkan frontier models, serta ekspansi movable context window hingga 2.854.766 token pada VRAM tetap.

Ilustrasi Arsitektur Teknis 16:9 Agent Behavior as Code (ABCAgent) 2026: Memisahkan Agent Design dari Execution, Eliminasi Bottleneck Orchestration ReAct, dan Reduksi Biaya 7.0x via Programmatic Specifications

Agent Behavior as Code (ABCAgent) 2026: Memisahkan Agent Design dari Execution, Eliminasi Bottleneck Orchestration ReAct, dan Reduksi Biaya 7.0x via Programmatic Specifications

Analisis mendalam riset frontier arXiv:2610.04824 (Peng Qi et al., Uniphore, Oktober 2026): Mengapa paradigma agen ReAct klasik menghadapi kegagalan sistemik saat dihadapkan pada alur kerja berulang dan kontrol logika berulang. Memperkenalkan arsitektur Agent Behavior as Code (ABCAgent) yang secara tegas memisahkan fase Agent Design (sintesis program simbolik terparameterisasi) dari Agent Execution (eksekusi deterministik kode dengan pemanggilan neural terisolasi). Didukung validasi metamorfik pra-eksekusi, manajemen memori berbasis call stack terstruktur, dan pemisahan konstanta tugas. Hasil empiris membuktikan akurasi superior pada GSM-Symbolic (98.3%), stabilitas Pass^4 sebesar 71.9% pada tau^2-bench telecom, eliminasi error akumulatif pada loop WorkArena-CF, serta akselerasi 5.2x dan pemangkasan biaya operasional hingga 7.0x.