NS
NEWSAINT
ai-eng• 8 MIN READ•9 Oktober 2026

ViSkill (arXiv:2610.12403): Reinforcing VLM Agents with Evolving Visual-Native Skills, Mengatasi Representation Gap, dan Lonjakan Akurasi 0.91 Melampaui GPT-5

Analisis arsitektur riset frontier Universitas Zhejiang (arXiv:2610.12403, Hongxing Li, Dingming Li, Yongliang Shen dkk.): Mengapa agen Vision-Language Model (VLM) berbasis memori teks konvensional kerap gagal pada tugas penalaran spasial dan manipulasi robotik 3D? Transformasi state visual menjadi teks (linearization) melenyapkan relasi geometris krusial. ViSkill menghadirkan visual-native skill learning loop tertutup: mengodekan trajektori sukses menjadi Composite Visual Skill Cards, melakukan retrieval berbasis geometric descriptor & historical utility, serta mengaplikasikan Trajectory Agreement Reward untuk membimbing optimasi PPO. Berhasil meraih rata-rata success rate 0.89 (0.91 dengan cold-start) lintas Sokoban, FrozenLake, dan PrimitiveSkill 3D, secara mutlak mengungguli model proprietary seperti GPT-5 (0.70), o3 (0.69), dan Gemini 2.5 Pro (0.59).

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 ViSkill (arXiv:2610.12403): Reinforcing VLM Agents with Evolving Visual-Native Skills, Mengatasi Representation Gap, dan Lonjakan Akurasi 0.91 Melampaui GPT-5
Executive Architectural Summary — arXiv:2610.12403 (Zhejiang University)

Riset frontier terbaru dari Zhejiang University (ZJU-REAL Lab, arXiv:2610.12403) memecahkan kebuntuan krusial pada arsitektur agen Vision-Language Model (VLM): kegagalan representasi memori teks (Text-Centric Memory) dalam memandu tugas penalaran spasial dan manipulasi objek. Mengubah kondisi visual dan trajektori aksi menjadi deskripsi bahasa natural secara inheren melenyapkan struktur geometri 2D/3D (Lossy Spatial Abstraction). Memperkenalkan ViSkill (Reinforcing VLM Agents with Evolving Visual-Native Skills): arsitektur closed-loop pertama yang mengodekan pengalaman sukses langsung sebagai Composite Visual Skill Cards, mengambil keahlian masa lalu melalui pencocokan deskriptor geometris dan utilitas historis, serta memberikan Trajectory Agreement Reward parsial bagi kegagalan yang searah dengan panduan visual. Dievaluasi pada Sokoban, FrozenLake, dan PrimitiveSkill 3D, ViSkill mencatatkan rata-rata success rate 0.89 (0.91 dengan Cold-Start), melesat jauh di atas model terkuat industri seperti GPT-5 (0.70), o3 (0.69), dan Gemini 2.5 Pro (0.59) dengan konvergensi latihan yang jauh lebih cepat daripada standar PPO.

1. Mengapa Text-Centric Skills Gagal: Dua Kesenjangan Fundamental pada Agen VLM

Dalam domain Embodied AI, GUI Automation, dan interaksi visual interaktif, mentransfer pengalaman dari keberhasilan masa lalu merupakan kunci esensial untuk memangkas jumlah episode eksplorasi yang mahal (sample efficiency). Pada agen berbasis teks konvensional (seperti Reflexion, Voyager, atau ReAct), strategi yang berhasil diekstraksi ke dalam instruksi bahasa natural ("buka laci bawah, ambil sendok, letakkan di meja kanan").

Namun, ketika paradigma berbasis teks ini diterapkan pada model multimodal visual (VLM), para peneliti mengidentifikasi dua jurang pembatas fatal:

Gap 1: Representation Gap

Linearisasi Spasial yang Merusak Konteks

Lingkungan visual menuntut pemahaman terhadap koordinat relatif, jarak Euclidean, rintangan dinamis, dan orientasi rotasi objek. Mentranslasikan konfigurasi geometris ini ke dalam teks mendegradasi resolusi spasial (lossy abstraction). Bahkan ketika teks dirender kembali menjadi gambar (OCR-Skill), model kehilangan topologi alami dari interaksi fisik.

Gap 2: Learning Gap

Pemisahan Pembuatan Skill dari Optimasi Kebijakan (Policy)

Pendekatan visual kontemporer umumnya memisahkan konstruksi memory library dari optimasi reinforcement learning. Skill disimpan secara statis tanpa mekanisme reward shaping yang terikat langsung dengan bobot model kebijakan (policy), sehingga siklus umpan balik positif antara akumulasi keahlian dan peningkatan model tidak pernah terbentuk.

Diagram Konsep ViSkill vs Text-Centric Skills (arXiv:2610.12403)

Gambar 1: Perbandingan representasi keahlian. Pendekatan text-centric (atas) melinearisasi pengalaman spasial menjadi teks yang ambigu, sementara ViSkill (bawah) mempertahankan struktur spasial geometris dalam Composite Visual Skill Cards teranotasi.

2. Arsitektur ViSkill: Loop Umpan Balik Tertutup dan Co-Evolution

ViSkill merestrukturisasi siklus hidup interaksi agen visual menjadi loop tertutup terpadu (closed feedback loop). Seluruh proses dirancang agar akumulasi skill dan optimasi kebijakan saling memperkuat (co-evolving).

Arsitektur Lengkap ViSkill: Closed-Loop Visual-Native Reinforcement (arXiv:2610.12403)

Gambar 2: Arsitektur lengkap ViSkill. Model mengambil skill visual $z_{k^star}$ dari library untuk memandu inferensi, mengumpulkan trajektori $ au$, menyaring trajektori berharga via dual-gating ke dalam library, dan mengoptimalkan kebijakan via Trajectory Agreement Reward + PPO.

Secara formal, setiap entitas skill $z_k$ dalam library ViSkill direpresentasikan sebagai tuple 4-elemen:

$$z_k = (C_k, g_k, u_k, n_k), quad C_k = ext{Render}(d_k, ext{Annotate}(hat{ au}_k))$$
  • $C_k$ (Composite Skill Card): Gambar komposit visual terpadu yang memadukan frame trajektori beranotasi visual ($ ext{Annotate}(hat{ au}_k)$) bersama sintesis teks strategi tingkat tinggi ($d_k$) yang dirender langsung di dalam kanvas gambar.
  • $g_k$ (Geometric Descriptor): Vektor fitur geometris yang merepresentasikan relasi spasial, posisi relatif target, rintangan, dan jarak objek dari konfigurasi awal tugas.
  • $u_k$ (Historical Utility): Skor keandalan historis dari skill tersebut dalam domain $[0, 1]$, diperbarui secara adaptif setiap kali skill dipanggil.
  • $n_k$ (Usage Count): Frekuensi kumulatif pemanggilan skill card tersebut sepanjang proses pelatihan.

3. Formulasi Matematika: Retrieval, Reward Shaping, dan Eviction

A. Geometric Retrieval & Utility Scoring

Pencocokan bahasa semata tidak mampu membedakan dua skenario yang memiliki teks instruksi serupa namun konfigurasi spasial yang bertolak belakang. ViSkill menentukan relevansi skill melalui perpaduan kesamaan geometris dan reliabilitas historis:

$$q_k = alpha s_k + (1 - alpha) u_k$$

Di mana $s_k = ext{sim}(g, g_k)$ mengukur cosine/spatial similarity antara konfigurasi saat ini dengan skill di library, dan $alpha in [0, 1]$ adalah bobot penyeimbang (optimal pada $alpha = 0.90$). Skill dengan skor tertinggi dipilih: $k^star = argmax_k q_k$. Skill hanya akan disuntikkan ke dalam konteks visual model jika $q_{k^star} ge delta_r$ (ambang retrieval $delta_r = 0.80$). Jika tidak ada skill yang memenuhi syarat, agen mengeksplorasi secara mandiri.

Setelah episode berakhir dengan indikator keberhasilan biner $y( au) in {0, 1}$, utilitas historis diperbarui melalui Exponential Moving Average (EMA) dengan koefisien $eta = 0.10$:

$$u_{k^star} leftarrow (1 - eta) u_{k^star} + eta y( au), quad n_{k^star} leftarrow n_{k^star} + 1$$

B. Skill-Guided Reward Shaping (Trajectory Agreement Reward)

Tantangan utama pada sparse reward RL adalah ketika agen gagal menyelesaikan tugas, reward lingkungan bernilai 0 ($R = 0$), meskipun agen telah mengeksekusi 80% langkah awal yang benar sesuai panduan skill visual. Tanpa sinyal gradien parsial, eksplorasi awal menjadi sangat lambat.

ViSkill mengintroduksi Trajectory Agreement Reward: menghitung titik terjauh $ell$ di mana trajektori agen konsisten dengan langkah pada skill referensi visual, dan memberikan penalti untuk deviasi langkah ekstra:

$$r_{ ext{skill}}( au, z) = maxleft(0, rac{ell - (L( au) - ell)}{L_z} ight)$$

Total fungsi reward yang diterima agen dirumuskan sebagai:

$$R( au) = egin{cases} r_{ ext{env}}( au) + lambda r_{ ext{skill}}( au, z), & ext{jika } y( au) = 0 ext{ dan skill } z ext{ dipanggil} \ r_{ ext{env}}( au), & ext{lainnya} end{cases}$$

Dengan mengatur bobot bimbingan $lambda < r_{ ext{succ}}$ (di mana $r_{ ext{succ}}$ adalah bonus sukses terminal), reward parsial ini dibatasi secara ketat sehingga tidak pernah mendistorsi urutan reward global maupun mendorong reward hacking.

C. Dual-Gate Distillation & Utility-Frequency Eviction

Menyimpan semua trajektori sukses ke dalam library akan menyebabkan pembengkakan memori dan polusi skill suboptimal. Trajektori sukses hanya didistilasi menjadi skill baru jika lolos Quality Gate dan Novelty Gate:

$$L( au) le L_{ ext{bud}}(x) quad land quad q_{ ext{max}} < delta_d$$

Panjang langkah $L( au)$ harus berada dalam batas anggaran optimal $L_{ ext{bud}}(x)$, dan skor kecocokan terbaik di library $q_{ ext{max}}$ harus lebih rendah dari ambang keragaman $delta_d = 0.90$. Jika kapasitas library penuh ($N_{ ext{max}}$), ViSkill melakukan eviksi pada entri dengan kombinasi utilitas dan frekuensi penggunaan terendah:

$$k_{ ext{evict}} = argmin_k u_k log(n_k + 1)$$

4. Evaluasi Benchmark Empiris: Sokoban, FrozenLake, dan PrimitiveSkill 3D

ViSkill dievaluasi secara komprehensif pada tiga lingkungan interaktif: penalaran spasial diskret 2D (Sokoban dan FrozenLake) serta manipulasi robotik 3D berkoordinat riil (PrimitiveSkill: Place, Stack, Drawer, Align, dan Swap). Baseline mencakup model proprietary terdepan serta model terbuka yang ditingkatkan RL.

Model & Metode Sokoban (2D) FrozenLake (2D) PrimitiveSkill (3D Avg) Overall Success
GPT-5 (Proprietary) 0.70 0.77 0.64 0.70
OpenAI o3 0.60 0.78 0.69 0.69
Gemini 2.5 Pro 0.58 0.78 0.40 0.59
Claude 4.5 Sonnet 0.31 0.80 0.63 0.58
Qwen2.5-VL-72B 0.18 0.44 0.57 0.40
VAGEN (Qwen2.5-VL-3B + WM) 0.79 0.74 0.88 0.80
AtlasVA (Qwen2.5-VL-3B + Atlas) 0.79 0.83 1.00 0.87
ViSkill (Qwen2.5-VL-3B, No Seeds) 0.82 0.84 1.00 0.89
ViSkill + Cold-Start (γ = 0.2) 0.88 0.85 1.00 0.91 (+21 pp vs GPT-5)

Tabel 1 menunjukkan keunggulan telak ViSkill: dengan backbone kecil Qwen2.5-VL-3B-Instruct, ViSkill melampaui GPT-5 sebesar +21 percentage points pada overall success rate (0.91 vs 0.70). Pada task manipulasi 3D (PrimitiveSkill), ViSkill meraih kesuksesan mutlak 1.00 pada seluruh sub-tugas (Place, Stack, Drawer, Align, dan Swap).

Dinamika Pelatihan PPO vs ViSkill vs ViSkill + Cold-Start (arXiv:2610.12403)

Gambar 3: Dinamika konvergensi pelatihan. ViSkill mengungguli standar PPO sejak iterasi awal di ketiga lingkungan, dan inisialisasi Cold-Start memberikan akselerasi kurva belajar yang drastis pada Sokoban.

5. Studi Ablasi Kunci: Bukti Vital Representasi Visual-Native

Ablasi Format Representasi (Table 2)

  • ViSkill (Visual-Native Cards): 0.82 (Sokoban) / 0.84 (FrozenLake)
  • Text-Skill (Deskripsi Teks Murni): 0.63 (-0.19) / 0.59 (-0.25)
  • OCR-Skill (Gambar Teks Terender): 0.68 (-0.14) / 0.62 (-0.22)

Hasil ini membuktikan bahwa penurunan akurasi pada Text-Skill bukan karena modalitas input, melainkan karena hilangnya struktur visual spatial layout asli.

Ablasi Komponen ViSkill (Table 3)

  • Tanpa Skill-Guided Reward ($lambda = 0$): 0.77 (-0.05) / 0.80 (-0.04)
  • Tanpa Sintesis Strategi ($d_k$): 0.72 (-0.10) / 0.81 (-0.03)
  • Tanpa Optimasi Kebijakan (PPO off): 0.29 (-0.53) / 0.33 (-0.51)

Degradasi terbesar terjadi saat model tidak dioptimalkan secara bersamaan, menegaskan esensi loop ko-evolusi antara memori visual dan update bobot policy.

6. Implementasi TypeScript: Mesin ViSkill Memory & Policy

Berikut adalah implementasi modul TypeScript arsitektur ViSkill tingkat produksi yang dapat langsung diintegrasikan ke dalam runtime agen VLM:

lib/agent/viskill-engine.ts TYPESCRIPT • PRODUCTION SPEC
// Production Implementation: ViSkill Visual-Native Memory & Policy Co-Evolution Engine
// Mengimplementasikan Closed-Loop Visual Skill Cards, Geometric Matching, Dual-Gate Distillation & Agreement Reward
// Berdasarkan spesifikasi formal arXiv:2610.12403 (Zhejiang University)

export interface GeometricDescriptor {
  objectCentroids: Array<{ label: string; x: number; y: number; z?: number }>;
  relativeDistances: Array<{ pair: [string, string]; distance: number }>;
  obstacleBoundaries: Array<{ minX: number; maxX: number; minY: number; maxY: number }>;
  spatialFeatureVector: number[]; // Normalized vector embedding for cosine/euclidean similarity
}

export interface TrajectoryStep {
  observationImageUri: string;
  actionToken: string;
  stepIndex: number;
  coordinates?: { x: number; y: number; z?: number };
}

export interface CompositeSkillCard {
  id: string;
  compositeImageUri: string;      // Rendered unified image containing annotated trajectory + strategy text
  distilledStrategyText: string;   // High-level intent distilled by policy
  referenceTrajectory: TrajectoryStep[];
  geometry: GeometricDescriptor;
  historicalUtility: number;       // u_k in [0, 1]
  usageCount: number;              // n_k
  createdAtStep: number;
}

export interface ViSkillConfig {
  alphaSimilarityWeight: number;   // alpha: bobot kesamaan geometris vs utilitas historis (default: 0.90)
  emaBeta: number;                 // beta: koefisien EMA pembaruan utilitas (default: 0.10)
  lambdaSkillReward: number;       // lambda: bobot trajectory agreement reward (default: 0.80)
  deltaRetrievalThreshold: number; // delta_r: ambang batas skor kueri untuk retrieval (default: 0.80)
  deltaNoveltyThreshold: number;   // delta_d: ambang batas kemiripan maksimum untuk admisi (default: 0.90)
  maxLibraryCapacity: number;      // Kapasitas maksimum skill card sebelum LRU/utility eviction
}

export class ViSkillEngine {
  private library: Map<string, CompositeSkillCard> = new Map();
  private config: ViSkillConfig;

  constructor(customConfig?: Partial<ViSkillConfig>) {
    this.config = {
      alphaSimilarityWeight: customConfig?.alphaSimilarityWeight ?? 0.90,
      emaBeta: customConfig?.emaBeta ?? 0.10,
      lambdaSkillReward: customConfig?.lambdaSkillReward ?? 0.80,
      deltaRetrievalThreshold: customConfig?.deltaRetrievalThreshold ?? 0.80,
      deltaNoveltyThreshold: customConfig?.deltaNoveltyThreshold ?? 0.90,
      maxLibraryCapacity: customConfig?.maxLibraryCapacity ?? 500,
    };
  }

  /**
   * 1. Skill Retrieval: Geometric Similarity Matching + Historical Utility Scoring
   * Formula Eq. (2): q_k = alpha * s_k + (1 - alpha) * u_k
   */
  public retrieveBestSkill(currentGeometry: GeometricDescriptor): {
    skill: CompositeSkillCard | null;
    compositeScore: number;
    highestMatchScore: number;
  } {
    if (this.library.size === 0) {
      return { skill: null, compositeScore: 0, highestMatchScore: 0 };
    }

    let bestSkill: CompositeSkillCard | null = null;
    let highestScore = -Infinity;
    let maxSimilarityAcrossLibrary = 0;

    for (const skill of this.library.values()) {
      const geometricSimilarity = this.calculateGeometricSimilarity(
        currentGeometry.spatialFeatureVector,
        skill.geometry.spatialFeatureVector
      );

      if (geometricSimilarity > maxSimilarityAcrossLibrary) {
        maxSimilarityAcrossLibrary = geometricSimilarity;
      }

      const compositeScore =
        this.config.alphaSimilarityWeight * geometricSimilarity +
        (1 - this.config.alphaSimilarityWeight) * skill.historicalUtility;

      if (compositeScore > highestScore) {
        highestScore = compositeScore;
        bestSkill = skill;
      }
    }

    // Gating Retrieval: Hanya kembalikan skill jika composite score >= delta_r
    const isRetrieved = highestScore >= this.config.deltaRetrievalThreshold;

    return {
      skill: isRetrieved ? bestSkill : null,
      compositeScore: highestScore,
      highestMatchScore: maxSimilarityAcrossLibrary,
    };
  }

  /**
   * 2. Trajectory Agreement Reward Shaping
   * Formula Eq. (6): r_skill(tau, z) = max(0, (ell - (L(tau) - ell)) / L_z)
   * Memberikan partial credit terukur untuk trajektori gagal yang selaras dengan panduan visual
   */
  public computeSkillGuidedReward(
    executedTrajectory: TrajectoryStep[],
    retrievedSkill: CompositeSkillCard | null,
    taskSuccess: boolean,
    environmentReward: number
  ): { finalReward: number; skillAgreementReward: number } {
    if (taskSuccess || !retrievedSkill) {
      return { finalReward: environmentReward, skillAgreementReward: 0 };
    }

    const referenceSteps = retrievedSkill.referenceTrajectory;
    const lz = referenceSteps.length;
    const ltau = executedTrajectory.length;

    if (lz === 0) return { finalReward: environmentReward, skillAgreementReward: 0 };

    // Hitung titik terjauh (ell) di mana trajektori agen konsisten dengan trajektori referensi visual
    let furthestMatchedIndex = 0;
    for (let i = 0; i < Math.min(ltau, lz); i++) {
      if (executedTrajectory[i].actionToken === referenceSteps[i].actionToken) {
        furthestMatchedIndex = i + 1;
      } else {
        break; // Divergence detected
      }
    }

    // Penalti deviasi langkah ekstra di luar kecocokan: (ltau - furthestMatchedIndex)
    const rawAgreement = (furthestMatchedIndex - (ltau - furthestMatchedIndex)) / lz;
    const skillAgreementReward = Math.max(0, rawAgreement);

    // Formula Eq. (7): R(tau) = r_env(tau) + lambda * r_skill(tau, z)
    const finalReward = environmentReward + this.config.lambdaSkillReward * skillAgreementReward;

    return { finalReward, skillAgreementReward };
  }

  /**
   * 3. Update Utility via Exponential Moving Average (EMA)
   * Formula Eq. (3): u_k <- (1 - beta) * u_k + beta * y(tau)
   */
  public updateSkillUtility(skillId: string, taskSuccess: boolean): void {
    const skill = this.library.get(skillId);
    if (!skill) return;

    const outcomeIndicator = taskSuccess ? 1.0 : 0.0;
    skill.historicalUtility =
      (1 - this.config.emaBeta) * skill.historicalUtility +
      this.config.emaBeta * outcomeIndicator;
    skill.usageCount += 1;
  }

  /**
   * 4. Online Skill Distillation with Dual-Gating (Quality & Novelty)
   * Formula Eq. (4): L(tau) <= L_bud(x) AND q_max < delta_d
   */
  public async distillTrajectoryIfEligible(
    trajectory: TrajectoryStep[],
    taskSuccess: boolean,
    lengthBudget: number,
    highestMatchScore: number,
    geometry: GeometricDescriptor,
    policyStrategyDistiller: (traj: TrajectoryStep[]) => Promise<string>,
    visualComposer: (strategyText: string, traj: TrajectoryStep[]) => Promise<string>
  ): Promise<CompositeSkillCard | null> {
    if (!taskSuccess) return null;

    // Quality Gate: Trajektori tidak boleh melebihi batas panjang optimal (menolak rute memutar/suboptimal)
    if (trajectory.length > lengthBudget) {
      return null;
    }

    // Novelty Gate: Library belum mencakup konfigurasi geometris ini
    if (highestMatchScore >= this.config.deltaNoveltyThreshold) {
      return null;
    }

    // Sintesis deskripsi strategi tingkat tinggi & komposisi visual-native card
    const distilledStrategy = await policyStrategyDistiller(trajectory);
    const compositeImageUri = await visualComposer(distilledStrategy, trajectory);

    const newSkill: CompositeSkillCard = {
      id: `viskill-${nanoid(8)}`,
      compositeImageUri,
      distilledStrategyText: distilledStrategy,
      referenceTrajectory: trajectory,
      geometry,
      historicalUtility: 1.0, // Initial optimism for newly verified trajectory
      usageCount: 1,
      createdAtStep: Date.now(),
    };

    // Jika library mencapai batas kapasitas, lakukan eviksi berdasarkan lowest utility-frequency
    // Formula Eq. (5): k_evict = argmin_k (u_k * log(n_k + 1))
    if (this.library.size >= this.config.maxLibraryCapacity) {
      this.evictLowestValueSkill();
    }

    this.library.set(newSkill.id, newSkill);
    return newSkill;
  }

  private evictLowestValueSkill(): void {
    let lowestScore = Infinity;
    let targetEvictionKey: string | null = null;

    for (const [id, skill] of this.library.entries()) {
      const score = skill.historicalUtility * Math.log(skill.usageCount + 1);
      if (score < lowestScore) {
        lowestScore = score;
        targetEvictionKey = id;
      }
    }

    if (targetEvictionKey) {
      this.library.delete(targetEvictionKey);
    }
  }

  private calculateGeometricSimilarity(vecA: number[], vecB: number[]): number {
    if (vecA.length !== vecB.length || vecA.length === 0) return 0;
    let dot = 0;
    let normA = 0;
    let normB = 0;
    for (let i = 0; i < vecA.length; i++) {
      dot += vecA[i] * vecB[i];
      normA += vecA[i] * vecA[i];
      normB += vecB[i] * vecB[i];
    }
    if (normA === 0 || normB === 0) return 0;
    const cosine = dot / (Math.sqrt(normA) * Math.sqrt(normB));
    return Math.max(0, Math.min(1, (cosine + 1) / 2));
  }

  public getLibrarySize(): number {
    return this.library.size;
  }
}

7. Rekomendasi Arsitektural untuk Sistem AI Agent Enterprise

Bagi tim rekayasa yang membangun Computer-Use Agents (CUA), Web Automation Agents, dan robotika berbasis VLM di industri:

  • Hentikan Serialisasi GUI/Layout Menjadi String JSON Murni: Saat agen web beroperasi pada DOM yang padat atau aplikasi desktop yang kompleks, mendeskripsikan hierarki tombol semata-mata dengan teks memicu hilangnya relasi visual (seperti modal overlay yang menutupi tombol). Gunakan screenshot terkomposisi dengan bounding box beranotasi sebagai unit memori utama.
  • Gunakan Dual-Gate Admission untuk Mencegah Memory Bloat: Banyak sistem memory agent gagal karena menyimpan seluruh trace eksekusi yang berhasil. Terapkan filter ketat pada batas panjang langkah (Quality Gate) dan jarak kemiripan (Novelty Gate) agar context window tidak dibanjiri variasi keahlian yang redundan.
  • Implementasikan Trajectory Agreement Reward pada Post-Training: Untuk deployment model agen lokal via fine-tuning, jangan hanya menggunakan binary success flag (+1 / 0). Evaluasi agreement parsial terhadap playbook referensi untuk memberikan sinyal perbaikan bertahap pada failure cases.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 RECAST (arXiv:2610.10507): Arsitektur Adaptive Evidence Routing & Synthesis, Memecahkan Keterbatasan RAG via Sequential Decision Operations, SFT + GRPO, dan Peningkatan Akurasi +15.9%

RECAST (arXiv:2610.10507): Arsitektur Adaptive Evidence Routing & Synthesis, Memecahkan Keterbatasan RAG via Sequential Decision Operations, SFT + GRPO, dan Peningkatan Akurasi +15.9%

Analisis arsitektur riset frontier MIT & Google Research (arXiv:2610.10507, Yilun Hao, Chuchu Fan, Craig Boutilier dkk.): Mengapa sistem Retrieval-Augmented Generation (RAG) konvensional dan agentic RAG berbasis similarity kerap gagal pada dokumen heterogen berskala besar? Jawaban dan bukti verifikasi sering kali tidak tertulis secara eksplisit dalam satu teks tunggal, melainkan harus dihitung, diagregasi, dan difilter lintas sumber data. RECAST (Routing Evidence through Computation, Access, and Synthesized Tools) mentransformasi konstruksi konteks menjadi proses keputusan sekuensial terarah melalui RouterLM (9B) yang dilatih dengan SFT + GRPO, CompilerLM code-synthesis, dan AnswerLM. Berhasil meraih rata-rata akurasi 75.6% (+15.9% di atas baseline terkuat) serta memangkas 82% token window overhead.

Ilustrasi Arsitektur Teknis 16:9 SkillForge (arXiv:2610.09832 / NeurIPS 2026): Co-Evolving Skills & Agents via Dynamic Skill Lifecycles, Solusi Obsolete Memory & Peningkatan Akurasi RL Otonom

SkillForge (arXiv:2610.09832 / NeurIPS 2026): Co-Evolving Skills & Agents via Dynamic Skill Lifecycles, Solusi Obsolete Memory & Peningkatan Akurasi RL Otonom

Analisis mendalam riset frontier arXiv:2610.09832 (NeurIPS 2026, Yuyao Ge dkk.): Mengungkap arsitektur SkillForge yang memecahkan kebuntuan "Memory Pollution" pada reinforcement learning agen LLM. Ketika agen terus mengumpulkan skill baru tanpa evaluasi berkala, library memori membengkak dengan instruksi usang yang justru menyesatkan kebijakan (policy). SkillForge memperkenalkan siklus hidup dinamis 4-state (Trial, Active, Stable, Retired), pra-evaluasi rollouts untuk seeding SFT, dan mutasi skill terpandu LLM bersamaan dengan iterasi RL. Terbukti mencatatkan peningkatan performa relatif hingga +7.8% di atas baseline terkuat lintas benchmark interaktif (ALFWorld, WebShop, InterCode) sembari memangkas ukuran library memori hingga 64%.

Ilustrasi Arsitektur Teknis 16:9 AgentTracer (arXiv:2610.09935): Arsitektur Intent-Driven Execution Graph untuk Forensik Indirect Prompt Injection pada Autonomous AI Agents

AgentTracer (arXiv:2610.09935): Arsitektur Intent-Driven Execution Graph untuk Forensik Indirect Prompt Injection pada Autonomous AI Agents

Analisis mendalam riset frontier arXiv:2610.09935 (Sun Yat-sen University & Fudan University, 7 Oktober 2026): Mengungkap arsitektur forensik AgentTracer yang memecahkan kebuntuan pelacakan Indirect Prompt Injection (IPI) pada sistem AI agent enterprise. Alih-alih mengandalkan data-flow eksplisit yang mudah disamarkan penyerang, AgentTracer merekonstruksi implicit decision dependencies menjadi Intent-Driven Execution Graph, membatasi aksi agen dengan User Intent Authorization Space (UA-Scope), dan mengeksekusi backward tracing berpresisi tinggi. Terbukti mencapai 94.17% injection-point accuracy dan 93.56% path precision di tengah 9.000 background tool calls, melompati akurasi metode konvensional hingga +54%.