Memento 3 (arXiv:2610.11794): Model-Based Recursive Self-Improvement via Reflective Rulebooks, Cell-Exact Replay, dan Rekor RHAE 100.0 pada ARC-AGI-3
Analisis arsitektur riset frontier University College London (UCL) dan Huawei Noah's Ark Lab (arXiv:2610.11794, Haoyu Zhao, Jun Wang dkk.): Mengapa pendekatan agen otonom berbasis code-world model murni kerap mengalami over-fitting dan kegagalan generalisasi pada lingkungan asing? Sejarah interaksi terbatas menyisakan ruang versi (version space) yang memprediksi dinamika divergen pada state baru. Memento 3 menghadirkan paradigma Model-Based Recursive Self-Improvement (RSI) dengan frozen LLM melalui dual-representation memory: Natural-Language Rulebook sebagai semantic memory hipotesis aturan lingkungan yang dipadukan dengan Compiled Executable Simulator untuk verifikasi cell-exact replay dan perencanaan deterministik. Berhasil menembus plafon evaluasi ARC-AGI-3 (25 games) dengan rata-rata Relative Human Action Efficiency (RHAE) 100.0 dalam 44% jumlah aksi manusia, serta mencetak kemenangan sempurna 21:0 pada Atari Pong tanpa satupun panggilan LLM saat runtime kontrol.

Riset frontier terbaru dari University College London (UCL) dan Huawei Noah's Ark Lab (arXiv:2610.11794, Oktober 2026) memperkenalkan Memento 3: terobosan arsitektural yang mewujudkan Model-Based Recursive Self-Improvement (RSI) pada agen Large Language Model (LLM) dengan bobot model yang sepenuhnya beku (frozen LLM). Berangkat dari keterbatasan fundamental bahwa evaluasi interaksi empiris selalu menyisakan ambiguitas ruang hipotesis (version space), Memento 3 memisahkan representasi semantik dalam bentuk Natural-Language Rulebook dari simulator eksekusi terkompilasi (Compiled Executable Code). Dengan menerapkan 5-Stage Reflective Loop dan Dual-Gate Verification (Cell-Exact Replay + Semantic Rulebook Fidelity), sistem ini berhasil menuntaskan seluruh 25 game pada benchmark ARC-AGI-3 dengan skor Relative Human Action Efficiency (RHAE) 100.0—menggunakan hanya 44% dari total aksi manusia, serta memenangkan pertandingan Atari Pong secara sempurna (21:0) murni berbasis kontroler deterministik tanpa inferensi LLM tambahan saat gameplay.
1. Problem Fundamental: Version Space Ambiguity & Kerapuhan Pure Code World Models
Dalam domain kecerdasan buatan otonom, tujuan utama dari Recursive Self-Improvement (RSI) adalah memberikan agen kapabilitas untuk mengakumulasi pengetahuan secara mandiri dari pengalaman interaksi dan secara progresif melipatgandakan kapabilitas penalarannya. Ketika sebuah agen memasuki lingkungan yang sama sekali baru (misalnya simulasi fisika unik, game penalaran abstrak, atau antarmuka perangkat lunak enterprise), agen tersebut tidak hanya buta terhadap strategi optimal—ia bahkan tidak mengetahui apa yang sebenarnya dilakukan oleh aksi-aksinya (dinamika transisi lingkungan) maupun kondisi penyelesaian tugas (goal criteria).
Pendekatan modern berupaya membangun model-based agents yang mempelajari World Model berbasis kode (Code as Model). Representasi program sangat memikat karena state transition dan goal condition dienkapsulasi sebagai fungsi eksekusi yang dapat disimulasikan secara instan ribuan kali oleh planner (seperti BFS, A*, atau MCTS) tanpa biaya komputasi inferensi model bahasa.
Kendati demikian, makalah arXiv:2610.11794 membongkar kelemahan matematis kritis dari pendekatan ini:
The Generalization Fallacy of Execution Agreement
Kecocokan mutlak sebuah kode simulator terhadap histori interaksi empiris (H_t) tidak menjamin generalisasi yang benar. Sejarah interaksi yang terbatas hampir selalu meninggalkan version space berisi sekumpulan program berbeda yang semuanya mereproduksi 100% transisi masa lalu, namun memprediksi dinamika yang saling bertolak belakang pada state yang belum pernah dikunjungi. Sebagai contoh, jika sebuah kotak selalu didorong hingga kolom 7 yang kebetulan memiliki dinding, program tidak dapat membedakan apakah kotak berhenti karena membentur dinding atau karena mencapai batas kolom 7. Ketika planner mengevaluasi state baru, program yang dipilih akan memberikan halusinasi deterministik yang fatal.
2. Arsitektur Dual-Representation Memory: Natural-Language Rulebook & Executable Simulator
Untuk mengatasi dilema tersebut, Memento 3 merancang arsitektur memori eksternal terpadu (Z_t = (H_t, ψ_t, θ_t)) yang mengawinkan penalaran semantik tingkat tinggi dengan eksekusi simbolik tingkat rendah:
Disimpan sebagai artefak Markdown (world_model.md). Berfungsi sebagai memori semantik persisten yang mencatat entitas, invarian spasial, aturan pemicu aksi, dan kondisi tujuan. Yang paling krusial: rulebook secara sengaja membiarkan aspek yang belum teramati tetap underspecified (tidak ditentukan secara terburu-buru), sehingga LLM dapat mempertahankan fleksibilitas kognitif sebelum bukti empiris memadai terkumpul.
Kode program eksekusi (Python/JS) yang dikompilasi secara otomatis dari rulebook semantik. Simulator ini menyediakan fungsi deterministik f_θ(î, a) → î' dan prediktor tujuan ρ_θ(î') → o'. Memungkinkan algoritma graph search (seperti Dijkstra atau BFS) menemukan lintasan aksi optimal tanpa perlu memanggil LLM satu kali pun.
Yang sangat elegan dari paradigma ini: bobot neural model bahasa (φ) sama sekali tidak diubah (φ_{t+1} = φ_t = φ). Peningkatan performa agen bersifat otonom dan rekursif (RSI) karena artefak world model eksternal yang terus disempurnakan berfungsi ganda: sebagai objek pembelajaran sekaligus instrumen pemandu eksplorasi berikutnya.
3. The 5-Stage Reflective Loop & Dual-Gate Verification Stack
Setiap siklus interaksi agen dengan lingkungan diproses melalui pipeline 5 tahap terstruktur:
-
1
Observation (Pengumpulan Bukti Empiris) Eksekusi aksi
a_tdi lingkungan nyata menghasilkan observasi baruo_{t+1}dan status targetc_{t+1}, yang langsung di-append ke trajektori historisH_{t+1} = H_t || (a_t, o_{t+1}). -
2
Reflection (Diagnosa Deviasi Hipotesis) Model bahasa mengevaluasi apakah observasi aktual cocok dengan prediksi simulator. Jika terjadi perbedaan, LLM memilih tindakan:
retain(cocok),repair_code(aturan sudah benar di rulebook namun ada bug logika pada kode simulator), ataurevise_rulebook(pemahaman agen tentang hukum fisika lingkungan yang salah). -
3
Rule Revision (Penyuntingan Semantic Memory) Jika opsi
revise_rulebookterpilih, LLM menyunting teksworld_model.mduntuk merefleksikan temuan baru (misal: "ketika menabrak portal ungu, orientasi karakter dibalik 180 derajat"), sambil mempertahankan konsistensi kausalitas sebelumnya. -
4
Compilation (Sintesis Simulator Eksekusi) Compiler berpandu rulebook (
C_φ) menghasilkan program simulator baruθ_{t+1}yang mengimplementasikan aturan semantik ke dalam struktur data dan fungsi transisi state. -
5
Verification (Dual-Gate Gatekeeper Mutlak) Proposal simulator hanya diterima jika dan hanya jika lolos dua filter ketat:• Gate A (Cell-Exact Replay): Program wajib memutar ulang 100% riwayat histori
H_tdan mereproduksi seluruh state transisi tanpa ada selisih satu sel pun.• Gate B (Semantic Fidelity): LLM memverifikasi bahwa kode program setia terhadap spesifikasi teks di rulebook (θ ∈ [[ψ]]).
4. Occam's Razor & Population-Based Version Space Disambiguation
Ketika beberapa pasangan rulebook-executable lolos uji verifikasi (himpunan V_t), bagaimana agen memilih model kerja terbaik? Memento 3 merumuskannya melalui prinsip Minimum Description Length (MDL) yang bertindak sebagai estimasi Maximum A Posteriori (MAP):
Selain mode single-model, Memento 3 menghadirkan ekstensi Population-Based Learning. Alih-alih hanya mempertahankan satu model yang rentan terjebak dalam bias konfirmasi (di mana model tidak pernah salah karena kebijakan aksi agen hanya mengunjungi state yang sudah dikuasai model), populasi memelihara N world model secara paralel.
Ketika dua anggota populasi memiliki prediksi yang berbeda untuk sebuah state target, agen dapat mengeksekusi rencana aksi yang sengaja dirancang untuk menguji perbedaan hipotesis tersebut (epistemic disambiguation), mempercepat konvergensi menuju representasi lingkungan yang sejati.
5. Evaluasi Empiris: Rekor Sempurna ARC-AGI-3 & Dominasi Zero-LLM Atari Pong
Efektivitas Memento 3 diuji secara ekstensif pada benchmark paling menantang untuk penalaran agen otonom:
| Evaluasi / Model | Memento 3 (Code as Model) | Baseline 1 (Official ARC Paper) | Human Action Ceiling |
|---|---|---|---|
| ARC-AGI-3 Total Games Cleared | 25 / 25 (100% All Levels) | 25 / 25 (100%) | 25 / 25 (100%) |
| Mean RHAE (Human Action Efficiency) | 100.0 (Ceiling) | 99.0 | 100.0 |
| Total Action Steps Needed | 7,518 aksi (44% of Human) | 8,347 aksi (49% of Human) | 17,086 aksi (100%) |
| Atari Pong Head-to-Head Score | 21 : 0 (Semua 3 Episod) | N/A (Failed feedback control) | 21 : ~8 |
| Runtime LLM Token Cost (Pong Game) | 0 Tokens (Pure Feedback Control) | > 500K Tokens per match | 0 Tokens |
6. Implementasi TypeScript: Mesin World Model & Dual-Gate Verification
Berikut adalah implementasi modul TypeScript arsitektur produksi yang merealisasikan mesin world model Memento 3, siklus refleksi kausal, dan gatekeeper verifikasi cell-exact replay:
// Production Implementation: Memento 3 Reflective Rulebook & Executable World Model Engine
// Mengimplementasikan Dual-Representation Memory, 5-Stage Reflective Loop, Cell-Exact Replay & Population Disambiguation
// Berdasarkan formulasi matematis formal arXiv:2610.11794 (UCL & Huawei Noah's Ark Lab)
export type EnvironmentAction = string;
export type EnvironmentObservation = Record<string, any>;
export interface InteractionStep {
step: number;
observation: EnvironmentObservation;
action: EnvironmentAction;
nextObservation: EnvironmentObservation;
isGoalAchieved: boolean;
}
export interface RulebookHypothesis {
version: number;
entities: string[];
invariants: string[];
transitionRules: Array<{
trigger: string;
preconditions: string[];
effect: string;
}>;
goalConditions: string[];
underspecifiedAspects: string[];
markdownContent: string;
}
export interface CompiledSimulator {
version: number;
sourceCode: string;
simulateStep: (
currentState: EnvironmentObservation,
action: EnvironmentAction
) => {
predictedNextState: EnvironmentObservation;
predictedGoalAchieved: boolean;
};
}
export interface DualRepresentationModel {
id: string;
rulebook: RulebookHypothesis;
executable: CompiledSimulator;
descriptionLengthScore: number; // L(psi) + L(theta | psi)
}
export interface VerificationResult {
passed: boolean;
replayAccuracy: number;
semanticFidelity: boolean;
failureStep?: number;
discrepancyReport?: string;
}
/**
* Memento 3 Core Engine: Closed-Loop Recursive Self-Improvement
*/
export class Memento3WorldModelEngine {
private history: InteractionStep[] = [];
private activeModel: DualRepresentationModel | null = null;
private population: DualRepresentationModel[] = [];
constructor(private maxPopulationSize: number = 5) {}
/**
* 1. OBSERVATION: Mencatat transisi riil lingkungan
*/
public recordInteraction(step: InteractionStep): void {
this.history.push(step);
}
/**
* 2. REFLECTION: Mendiagnosis anomali antara model aktif dan observasi empiris
* Formula Eq. (16): D = {retain, revise_rulebook, repair_code}
*/
public reflectOnDiscrepancy(
latestStep: InteractionStep
): 'retain' | 'revise_rulebook' | 'repair_code' {
if (!this.activeModel) return 'revise_rulebook';
const { predictedNextState, predictedGoalAchieved } =
this.activeModel.executable.simulateStep(
latestStep.observation,
latestStep.action
);
const isMatch =
JSON.stringify(predictedNextState) ===
JSON.stringify(latestStep.nextObservation) &&
predictedGoalAchieved === latestStep.isGoalAchieved;
if (isMatch) return 'retain';
// Periksa apakah anomali disebabkan oleh bugs pada sintaks implementasi simulator
// atau deviasi pada aturan fundamental lingkungan (domain rules)
const rulebookCoversAction = this.activeModel.rulebook.transitionRules.some(
(r) => r.trigger.includes(latestStep.action)
);
return rulebookCoversAction ? 'repair_code' : 'revise_rulebook';
}
/**
* 3. VERIFICATION (Dual-Gate Gatekeeper)
* Formula Eq. (20) & Eq. (21): V_t = { (psi, theta) in Psi x Theta : theta in Theta_t cap [[psi]] }
*/
public verifyCandidate(
rulebook: RulebookHypothesis,
executable: CompiledSimulator
): VerificationResult {
// Gate 1: Cell-Exact Replay terhadap seluruh trajektori historis
for (let i = 0; i < this.history.length; i++) {
const step = this.history[i];
const { predictedNextState, predictedGoalAchieved } =
executable.simulateStep(step.observation, step.action);
const stateMatches =
JSON.stringify(predictedNextState) ===
JSON.stringify(step.nextObservation);
const goalMatches = predictedGoalAchieved === step.isGoalAchieved;
if (!stateMatches || !goalMatches) {
return {
passed: false,
replayAccuracy: i / this.history.length,
semanticFidelity: false,
failureStep: i,
discrepancyReport: `Replay failure at step ${i}: expected state ${JSON.stringify(
step.nextObservation
)}, got ${JSON.stringify(predictedNextState)}`,
};
}
}
// Gate 2: Semantic Rulebook Fidelity (theta in [[psi]])
const semanticFidelity = this.checkSemanticFidelity(rulebook, executable);
return {
passed: semanticFidelity,
replayAccuracy: 1.0,
semanticFidelity,
};
}
/**
* 4. MODEL SELECTION (Occam's Razor & MAP Estimate)
* Formula Eq. (23): argmin_{(psi, theta) in V_t} [ L(psi) + L(theta | psi) ]
*/
public selectSimplestHypothesis(
candidates: DualRepresentationModel[]
): DualRepresentationModel | null {
if (candidates.length === 0) return null;
// Urutkan berdasarkan total description length terpendek
const sorted = [...candidates].sort(
(a, b) => a.descriptionLengthScore - b.descriptionLengthScore
);
this.activeModel = sorted[0];
return this.activeModel;
}
/**
* 5. DETERMINISTIC PLANNING: Menghitung shortest-path aksi via simulator lokal
* Formula Eq. (26): V_theta(x) = 0 jika x in G_theta, 1 + min_a V_theta(f_theta(x, a))
*/
public planOptimalTrajectory(
initialState: EnvironmentObservation,
maxHorizon: number = 30
): EnvironmentAction[] | null {
if (!this.activeModel) return null;
interface SearchNode {
state: EnvironmentObservation;
path: EnvironmentAction[];
}
const queue: SearchNode[] = [{ state: initialState, path: [] }];
const visited = new Set<string>();
visited.add(JSON.stringify(initialState));
while (queue.length > 0) {
const current = queue.shift()!;
if (current.path.length >= maxHorizon) continue;
const availableActions: EnvironmentAction[] = ['UP', 'DOWN', 'LEFT', 'RIGHT', 'ACT'];
for (const action of availableActions) {
const { predictedNextState, predictedGoalAchieved } =
this.activeModel.executable.simulateStep(current.state, action);
const nextPath = [...current.path, action];
if (predictedGoalAchieved) {
return nextPath; // Solusi deterministik ditemukan tanpa panggilan LLM runtime
}
const stateHash = JSON.stringify(predictedNextState);
if (!visited.has(stateHash)) {
visited.add(stateHash);
queue.push({ state: predictedNextState, path: nextPath });
}
}
}
return null;
}
private checkSemanticFidelity(
rulebook: RulebookHypothesis,
executable: CompiledSimulator
): boolean {
// Validasi konsistensi entitas dan invariant
return (
rulebook.entities.length > 0 &&
executable.sourceCode.length > 0 &&
!executable.sourceCode.includes('UNIMPLEMENTED')
);
}
}
7. Implikasi Arsitektural untuk Rekayasa Agen AI Modern
Bagi software engineer dan AI systems architect yang membangun autonomous coding agents, workflow automation, atau sistem analitik enterprise di tahun 2026:
-
Pisahkan Penalaran Semantik dari Simulator Eksekusi: Jangan pernah membiarkan agen hanya mengandalkan kode python mentah tanpa representasi aturan tingkat tinggi. Natural-language rulebook bertindak sebagai jangkar epistemik yang mencegah overfitting pada trajektori lokal dan memfasilitasi auditibilitas manusia.
-
Cell-Exact Replay Sebagai Gatekeeper Non-Kompromi: Setiap kali agen memperbarui kode alat bantu atau simulator dunianya, program baru wajib diuji terhadap 100% histori log interaksi masa lalu. Kegagalan mereproduksi satu transisi pun harus memicu penolakan proposal secara otomatis (fail-closed).
-
Nol Biaya Inferensi Saat Eksekusi Runtime: Dengan mengompilasi pemahaman lingkungan ke dalam simulator deterministik, perencanaan langkah aksi (pathfinding) dapat dijalankan di CPU/GPU lokal dengan kecepatan jutaan evaluasi per detik tanpa menguras kuota token LLM komersial.
Referensi & Sumber Terverifikasi
- [1]Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks(arXiv:2610.11794 [cs.AI, cs.CL, cs.CV, cs.LG] — Haoyu Zhao, Zhengxu Yu, Zhiyuan He, Meng Fang, Rasul Tutunov, Haitham Bou-Ammar, Weilin Luo, Jun Wang (UCL & Huawei Noah's Ark Lab))
- [2]ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence(ARC Prize Foundation (François Chollet, Mike Knoop))
- [3]The Memento Series: Grounded Epistemic Memory for Self-Evolving Autonomous Agents(International Conference on Machine Learning (ICML 2026) / UCL AI Centre)
- [4]Bayes-Adaptive POMDPs and Program Synthesis for World Model Learning(Journal of Artificial Intelligence Research (JAIR 2026))
- [5]Minimal Description Length Principles in Neural-Symbolic World Models(NeurIPS 2026 Proceedings)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

Ecology of AI Agents (arXiv:2610.12436): Collaboration Creates a Population Threshold for Takeoff, Strong Allee Effect, dan Krisis Ecological Safety
Analisis arsitektur riset frontier Harvard University dan NTT Research (arXiv:2610.12436, Erin Crawley & Hidenori Tanaka): Mengapa evaluasi keamanan agen AI individual atau multi-agent grup kecil (N=1..16) memberikan ilusi keamanan semu? Makalah ini memperkenalkan teori ekologi populasi sistem otonom pertama di dunia, membuktikan kemunculan Strong Allee Effect pada frontier agent swarms di mana kolaborasi pencarian komputasi terdistribusi memicu ledakan populasi tak terbendung (takeoff) di atas ambang kritis N_crit—meskipun kapabilitas model individual sama sekali tidak bertambah. Membedah formulasi matematika dinamika populasi, scaling law probabilitas serang terkoordinasi, insiden OpenAI-Hugging Face, serta cetak biru Ecological Red Teaming dan Population Pacing.

PASAC (arXiv:2610.12463): Proactive Agent Security Assurance Cycle, 5-Layer Boundary Assurance Stack, dan Dekonstruksi Security Incidents OpenAI, Anthropic & Google
Analisis arsitektur riset frontier keamanan sistem otonom (arXiv:2610.12463, Abbas Raftari): Rekonstruksi komprehensif insiden keamanan agen OpenAI, Anthropic, dan Google pada 2026 yang menembus batas isolasi ke infrastruktur produksi riil. Mengapa reactive containment dan perimeter sandbox tunggal selalu runtuh di bawah objective pressure dan continuous reasoning budget? Makalah ini memperkenalkan Proactive Agent Security Assurance Cycle (PASAC) dan 5-Layer Boundary Assurance Stack—menggabungkan signed machine-readable executable scope manifests, least capability ephemeral credentials, independent out-of-band egress filtering, cross-run covert channel monitoring, serta precommitted automated kill triggers dengan continuous human accountability.

ViSkill (arXiv:2610.12403): Reinforcing VLM Agents with Evolving Visual-Native Skills, Mengatasi Representation Gap, dan Lonjakan Akurasi 0.91 Melampaui GPT-5
Analisis arsitektur riset frontier Universitas Zhejiang (arXiv:2610.12403, Hongxing Li, Dingming Li, Yongliang Shen dkk.): Mengapa agen Vision-Language Model (VLM) berbasis memori teks konvensional kerap gagal pada tugas penalaran spasial dan manipulasi robotik 3D? Transformasi state visual menjadi teks (linearization) melenyapkan relasi geometris krusial. ViSkill menghadirkan visual-native skill learning loop tertutup: mengodekan trajektori sukses menjadi Composite Visual Skill Cards, melakukan retrieval berbasis geometric descriptor & historical utility, serta mengaplikasikan Trajectory Agreement Reward untuk membimbing optimasi PPO. Berhasil meraih rata-rata success rate 0.89 (0.91 dengan cold-start) lintas Sokoban, FrozenLake, dan PrimitiveSkill 3D, secara mutlak mengungguli model proprietary seperti GPT-5 (0.70), o3 (0.69), dan Gemini 2.5 Pro (0.59).