CUA-Universe 2026: Arsitektur App-Forge, Task-Weave, dan Path-Steer untuk Hybrid GUI+CLI Autonomous Agents
Analisis arsitektur sistemik riset frontier terbaru (arXiv:2609.05374, September 2026): Mengatasi inefisiensi trajektori komputer berbasis GUI murni melalui CUA-Universe. Mengintegrasikan App-Forge untuk otomatisasi adaptasi 16 software profesional dan CLI tool surfaces, Task-Weave untuk sintesis tugas modular dari jejak eksplorasi, serta Path-Steer untuk orkestrasi GUI+CLI yang efisien. Model open-source 9B membukukan lonjakan skor +39.3 poin pada CUA-Verse (-37% langkah, -60% token) serta transfer zero-shot ke OSWorld (+16.8 poin SR) dan OSWorld-MCP (+7.8 poin SR).

Dalam lanskap rekayasa agen otonom (autonomous computer-use agents), tolok ukur terkemuka seperti OSWorld dan AndroidWorld selama ini didominasi oleh agen yang berinteraksi murni melalui antarmuka grafis (GUI-only). Namun pada tugas profesional dunia nyata, ketergantungan eksklusif pada klik mouse, scroll, dan pengetikan visual terbukti sangat tidak efisien—memboroskan puluhan ribu token untuk tugas-tugas sepele, rentan terhadap dislokasi elemen antarmuka, serta lambat secara serial. Di sisi lain, agen berbasis baris perintah murni (CLI-native) sama sekali buta terhadap tata letak visual, rendering kanvas spasial, dan inspeksi antarmuka.
Ringkasan Eksekutif & Temuan Kunci Riset
Dipublikasikan pada arXiv:2609.05374 (7 September 2026) oleh konsorsium periset AI, CUA-Universe memperkenalkan environment-to-data pipeline pertama yang secara dinamis mengubah aplikasi desktop komersial menjadi lingkungan kerja Hybrid GUI+CLI. Melalui trio inovasi arsitektur—App-Forge (adaptasi VM otonom & tool registry), Task-Weave (sintesis tugas modular berbasis benih proyek nyata), dan Path-Steer (orkestrasi efisiensi modalitas)—sebuah model open-weight berukuran 9B berhasil melompat +39.3 poin pada tolok ukur CUA-Verse dengan memangkas -37% langkah dan -60% token, bahkan mentransfer kapabilitasnya secara zero-shot ke OSWorld (+16.8 poin SR) dan OSWorld-MCP (+7.8 poin SR).
1. Akar Masalah: Dikotomi GUI vs. CLI dan Formulasi POMDP Hybrid
Pengguna profesional tidak pernah mengoperasikan software kompleks seperti Blender, QGIS, Godot, atau Kdenlive hanya dengan mengklik menu satu per satu ketika tersedia hotkey atau terminal script. Sebaliknya, mereka juga tidak bisa menyunting timeline audio atau menyesuaikan sudut kamera 3D hanya dengan mengetik perintah bash buta tanpa memverifikasi visual kanvas.
CUA-Universe memformalisasikan lingkungan interaksi komputer sebagai Partially Observable Markov Decision Process (POMDP) multimodal dengan ruang aksi gabungan:
Pada setiap langkah $t$, agen menerima observasi multimodal $o_t$ yang terdiri dari tangkapan layar visual $v_t$ (persepsi visual VLM) dan respons teks dari eksekusi baris perintah sebelumnya $c_t$ (stdout, stderr, dan exit code). Agen kemudian bebas memilih untuk menerbitkan aksi GUI ($a_t \in \mathcal{A}_{\text{gui}}$ seperti click(x, y), type_text(str), drag(x1, y1, x2, y2)) atau aksi CLI ($a_t \in \mathcal{A}_{\text{cli}}$ seperti skrip headless API, query database, atau utilitas terminal), di mana kedua modalitas tersebut membaca dan memodifikasi keadaan aplikasi persisten bersama (shared persistent state $s_t$) di dalam mesin virtual (VM).
- Token Exploding: Tiap interaksi kecil (buka menu, scroll dropdown) mewajibkan 1 tangkapan layar beresolusi tinggi (1,200 - 2,000 token per step).
- Brittle Dislocation: Perubahan resolusi layar, pop-up dialog sistem, atau tata letak responsif kerap mematahkan koordinat visual.
- Latency Serial: Tugas pembersihan data atau ekspor batch membutuhkan ratusan aksi klik mouse berurutan yang memakan waktu menit hingga jam.
- High-Throughput Batching: Operasi matematika, ekspor aset, pencarian teks, dan transformasi batch dieksekusi dalam 1 step CLI (< 400 token).
- Visual Spatial Verification: Kanvas rendering, posisi layer visual, dan verifikasi akhir tetap diperiksa secara akurat via inspeksi screenshot.
- Shared State Synchronization: CLI mengeksekusi mutasi disk/memori lokal, dan adapter CUA secara otomatis me-refresh kanvas GUI.
2. Arsitektur App-Forge: Konstruksi Lingkungan Otonom Berkelanjutan
Membangun lingkungan hybrid pada aplikasi desktop nyata menghadapi dua hambatan rekayasa besar: heterogenitas konfigurasi instalasi dan ketiadaan antarmuka CLI yang seragam. CUA-Universe mengatasi ini melalui subsistem App-Forge:
Automated VM Adaptation
Agen penginstal yang dipandu keahlian khusus mengoperasikan harness VM persisten. Agen ini menginstal software target, mendiagnosis kegagalan dependensi library Linux/X11 secara mandiri, hingga peluncuran aplikasi terverifikasi sempurna. Setup tersebut disuling ke snapshot VM yang deterministik.
Three-Tier CLI Synthesis
Membangun antarmuka CLI melalui 3 lapisan: (1) Utilitas CLI bawaan yang ditemukan sistem (cth: cvlc, blender --python-expr), (2) Scripting API wrapper (cth: Python bpy, LibreOffice UNO, GIMP Script-Fu), dan (3) CLI sintetis berbasis inspeksi AST untuk aplikasi tanpa antarmuka script bawaan.
Bidirectional Consistency
Menjaga konsistensi data antara jendela GUI dan proses latar belakang terminal. Ketika aksi CLI memodifikasi dokumen atau proyek yang sedang terbuka di layar, adapter ringan secara cerdas mengirimkan sinyal reload atau hotkey pembaruan agar tampilan GUI tidak basi (stale view).
Dengan App-Forge, CUA-Universe berhasil menskalakan integrasi ke 16 aplikasi desktop profesional: 8 aplikasi warisan OSWorld yang awalnya murni GUI (GIMP, LibreOffice Writer/Calc/Impress, Thunderbird, Chrome, VLC, VS Code) ditambah 8 aplikasi baru yang diperkenalkan CUA-Universe (Blender, Godot Game Engine, QGIS, Kdenlive, OBS Studio, Audacity, Draw.io, dan Zotero).
3. Task-Weave: Sintesis Tugas Modular Berbasis Eksplorasi Nyata
Membuat ribuan tugas latihan untuk agen hybrid tidak dapat dilakukan dengan template manual. Task-Weave menyusun tugas dengan memecahnya ke dalam tiga fase:
-
Abstraksi Operasi (Operation Abstraction): Meluncurkan kelompok agen eksplorasi paralel dengan sasaran fungsional yang berbeda (misal: struktur layer, properti warna, konfigurasi timeline, atau format ekspor). Agen mengeksplorasi GUI sambil merekam jejak aksi dan screenshot. Sebuah LLM penganalisis menggeser jendela observasi (sliding window) dan mengabstraksi rantai klik primitif menjadi operasi tingkat tinggi yang reusable (contoh:
export_scene_to_gltfalih-alih rentetan 7 klik mouse). -
Instansiasi Tugas Berbasis Benih Proyek (Seed-Conditioned Task Instantiation): Mengambil proyek nyata (seperti scene 3D
.blend, peta vektor geospasial.qgs, atau proyek video.kdenlive) sebagai kondisi awal $s_0$. Task-Weave kemudian menyusun rantai operasi logis di atas objek-objek riil tersebut, menyusun instruksi pengguna dalam bahasa alami tingkat tinggi, dan menghasilkan modul verifier otomatis berbasis inspeksi file hasil. - Penyempurnaan Agen ReAct (Agentic Task Refinement): Sebelum tugas disimpan ke dataset latih, agen reviewer berbasis ReAct mengeksekusi tugas tersebut di dalam VM hidup untuk membuktikan bahwa instruksi tersebut memang dapat diselesaikan (executable) dan verifier tidak menghasilkan false negative.
4. Path-Steer: Navigasi Efisiensi Eksekusi & Panen Trajektori Terverifikasi
Memiliki akses ke dua antarmuka (GUI dan CLI) memicu dilema baru bagi model: Kapan harus mengklik layar, dan kapan harus membuka shell? Agen yang tidak dipandu kerap terjebak menulis skrip bash rumit untuk tugas visual sepele, atau sebaliknya melakukan 40 klik mouse berulang untuk tugas yang bisa diselesaikan satu baris sed atau panggilan CLI.
Path-Steer mengatasi masalah ini dengan memandu pemilihan modalitas menuju batas efisiensi Pareto (efficiency frontier):
| Dimensi Penilaian | Modalitas GUI (Visual Action) | Modalitas CLI (Programmatic Command) |
|---|---|---|
| Kasus Penggunaan Optimal | Seleksi elemen visual, penataan layout, pengecekan artefak grafis, verifikasi status akhir antarmuka. | Pencarian file batch, konversi format, transformasi numerik, injeksi data masif, query konfigurasi. |
| Konsumsi Token Rata-rata | Tinggi (1,200 - 2,200 token per step akibat payload screenshot). | Sangat Rendah (200 - 450 token per baris input & stdout terkompresi). |
| Toleransi Ambiguitas | Tinggi (VLM dapat bernalar atas tata letak antarmuka yang tidak terstruktur). | Rendah (Membutuhkan sintaks tepat, path file valid, dan argumen yang ketat). |
| Risiko Desinkronisasi | Nol (Aksi langsung memanipulasi thread UI). | Moderat (Memerlukan adapter resync jika UI men-cache status dokumen di RAM). |
Hasil evaluasi ablasi Path-Steer pada 320 tugas sintesis membuktikan bahwa dengan panduan modalitas yang efisien, tingkat penerimaan trajektori (Accept Rate $\ge 0.75$) melonjak dari 0.44 menjadi 0.51 pada backbone Kimi K2.5, sekaligus memangkas rata-rata langkah dari 26.68 menjadi 22.75 dan menghemat biaya eksekusi per tugas sebesar 16.1% ($0.31 \rightarrow $0.26).
5. Hasil Evaluasi Empiris: CUA-Verse, OSWorld, dan OSWorld-MCP
Untuk mengevaluasi efektivitas kurikulum pelatihan yang dihasilkan CUA-Universe, model open-source Qwen3.5-9B dilatih (distilasi pasca-latihan) menggunakan kumpulan trajektori hybrid yang berhasil disaring oleh Path-Steer. Pengujian dilakukan secara komprehensif pada tiga tolok ukur:
| Model & Mode Antarmuka | CUA-Verse Score | CUA-Verse Steps | OSWorld SR (%) | OSWorld Steps | OSWorld Tokens (K) |
|---|---|---|---|---|---|
| Qwen3.5-9B (Base / GUI-Only) | 0.189 | 56.2 | 21.7% | 58.6 | 521.9 |
| EvoCUA-8B (Open-Source Frontier) | 0.330 | 41.7 | 27.5% | 43.2 | 389.0 |
| Kimi K2.5 (Closed-Source Proprietary) | 0.522 | 21.1 | 54.5% | 28.9 | 277.3 |
| GPT-5.5 (Closed-Source Frontier) | 0.768 | 23.1 | 68.0% | 19.0 | 550.3 |
| CUA-Universe 9B (Ours / Hybrid) | 0.582 (+39.3 pts) | 35.2 (-37%) | 40.2% (+16.8 pts) | 28.6 (-51%) | 286.5 (-45%) |
6. Spesifikasi Kernel Eksekusi Hybrid & Path-Steer Router (TypeScript)
Berikut adalah implementasi referensi kernel eksekusi hybrid CUA-Universe yang memodelkan penanganan POMDP multimodal, perutean aksi efisiensi tinggi, dan sinkronisasi status aplikasi VM:
// CUA-Universe: Hybrid GUI+CLI Agent Execution Kernel & Path-Steer Engine
// Spesifikasi Berdasarkan Riset arXiv:2609.05374 (September 2026)
// Mengorkestrasi Aksi Multimodal atas Shared Persistent VM Application State
export type ActionModality = 'gui' | 'cli';
export interface GuiActionPayload {
type: 'click' | 'double_click' | 'drag_and_drop' | 'type_text' | 'hotkey' | 'scroll';
coordinates?: { x: number; y: number };
targetCoordinates?: { x: number; y: number };
text?: string;
keyCombination?: string[];
}
export interface CliActionPayload {
toolName: string;
command: string;
targetFilePath?: string;
timeoutMs?: number;
}
export interface HybridAgentAction {
id: string;
stepIndex: number;
modality: ActionModality;
guiAction?: GuiActionPayload;
cliAction?: CliActionPayload;
reasoningRationale: string;
}
export interface MultimodalObservation {
stepIndex: number;
screenshotBase64: string; // Visual perception (v_t)
cliStdout?: string; // Textual CLI execution return (c_t)
cliStderr?: string;
exitCode?: number;
activeWindowMeta: {
appId: string;
windowTitle: string;
focusedElementId?: string;
};
}
export interface OperationAbstraction {
verb: string; // e.g., 'export_scene_to_gltf', 'align_layers_vertical'
preferredModality: ActionModality;
cliTemplate?: string; // e.g., 'blender --background {file} --python-expr "..."'
expectedTokenCostGui: number; // Estimasi token screenshot + visual inference
expectedTokenCostCli: number; // Estimasi token textual prompt + command
stateResyncRequired: boolean; // Memerlukan refresh GUI setelah eksekusi background CLI
}
export class CUAUniverseKernel {
private operationRegistry = new Map();
private activeTrajectory: HybridAgentAction[] = [];
private stepCount = 0;
private totalTokensUsed = 0;
constructor() {
this.registerCanonicalOperations();
}
/**
* Pendaftaran operasi dasar dari App-Forge & Task-Weave
*/
private registerCanonicalOperations() {
this.operationRegistry.set('export_3d_asset', {
verb: 'export_scene_to_gltf',
preferredModality: 'cli',
cliTemplate: 'blender -b "{projectPath}" --python-expr "import bpy; bpy.ops.export_scene.gltf(filepath=\"{outputPath}\")"',
expectedTokenCostGui: 4800, // Menavigasi menu File -> Export -> Dialog memakan 4-6 step GUI (~4.8k tokens)
expectedTokenCostCli: 450, // Eksekusi terminal tunggal (~450 tokens)
stateResyncRequired: false,
});
this.operationRegistry.set('inspect_layout_alignment', {
verb: 'verify_visual_alignment',
preferredModality: 'gui',
expectedTokenCostGui: 1200, // Visual inspection lewat screenshot VLM
expectedTokenCostCli: 8500, // Menghitung bounding box geometris via headless script sangat mahal
stateResyncRequired: false,
});
this.operationRegistry.set('batch_replace_attributes', {
verb: 'batch_modify_xml_tags',
preferredModality: 'cli',
cliTemplate: 'sed -i "s/{oldVal}/{newVal}/g" "{targetFile}"',
expectedTokenCostGui: 16400, // 20+ klik mouse manual
expectedTokenCostCli: 380, // Satu baris regex sed
stateResyncRequired: true, // Membutuhkan reload file di GUI canvas
});
}
/**
* Path-Steer: Efficiency-Aware Modality Router
* Memilih antara GUI dan CLI berdasarkan keunggulan komparatif modalitas
*/
public routeNextAction(
targetOperation: string,
observation: MultimodalObservation
): { modality: ActionModality; rationale: string } {
const op = this.operationRegistry.get(targetOperation);
if (!op) {
// Default ke GUI bila operasi tidak memiliki abstraksi CLI terdaftar
return {
modality: 'gui',
rationale: 'Operasi baru/tidak dikenal: Menggunakan inspeksi GUI langsung.',
};
}
// Evaluasi rasio efisiensi token & reliabilitas deterministik
if (op.preferredModality === 'cli' && op.cliTemplate) {
const tokenSavings = op.expectedTokenCostGui - op.expectedTokenCostCli;
return {
modality: 'cli',
rationale: `Path-Steer memilih CLI: Menghemat ${tokenSavings} tokens dan mengeliminasi 3-8 step klik serial GUI.`,
};
}
return {
modality: 'gui',
rationale: 'Path-Steer memilih GUI: Tugas membutuhkan penalaran persepsi spasial/layout visual yang tidak dapat diakses via API deterministik.',
};
}
/**
* Eksekusi Aksi Hybrid & Sinkronisasi State POMDP
*/
public async executeHybridStep(
action: HybridAgentAction,
vmBridge: {
sendGuiInput: (payload: GuiActionPayload) => Promise;
sendCliCommand: (cmd: string) => Promise<{ stdout: string; stderr: string; code: number }>;
resyncGuiView: (appId: string) => Promise;
captureScreen: () => Promise;
}
): Promise {
this.stepCount++;
this.activeTrajectory.push(action);
let cliStdout: string | undefined;
let cliStderr: string | undefined;
let exitCode: number | undefined;
if (action.modality === 'cli' && action.cliAction) {
const res = await vmBridge.sendCliCommand(action.cliAction.command);
cliStdout = res.stdout;
cliStderr = res.stderr;
exitCode = res.code;
this.totalTokensUsed += 350; // Estimasi token teks CLI
// Jika operasi mengubah state disk lokal secara eksternal, picu adapter GUI resync
const op = Array.from(this.operationRegistry.values()).find(
(o) => o.cliTemplate && action.cliAction?.command.includes(o.verb)
);
if (op?.stateResyncRequired) {
await vmBridge.resyncGuiView('active_app');
}
} else if (action.modality === 'gui' && action.guiAction) {
await vmBridge.sendGuiInput(action.guiAction);
this.totalTokensUsed += 1450; // Estimasi token screenshot + visual coordinates
}
// Ambil observasi baru
const screenshot = await vmBridge.captureScreen();
return {
stepIndex: this.stepCount,
screenshotBase64: screenshot,
cliStdout,
cliStderr,
exitCode,
activeWindowMeta: {
appId: 'active_app',
windowTitle: 'Main Workspace',
},
};
}
/**
* Trajectory Harvesting & Efficiency Metrics
*/
public evaluateTrajectoryEfficiency(verifierScore: number): {
accepted: boolean;
totalSteps: number;
totalTokens: number;
efficiencyGain: number; // Rasio efisiensi dibanding baseline GUI-only
} {
// Kriteria Path-Steer: trajektori diterima jika skor verifier >= 0.75
const accepted = verifierScore >= 0.75;
const baselineEstimatedTokens = this.stepCount * 1450 * 1.6; // Baseline GUI murni
const efficiencyGain = Number((baselineEstimatedTokens / Math.max(1, this.totalTokensUsed)).toFixed(2));
return {
accepted,
totalSteps: this.stepCount,
totalTokens: this.totalTokensUsed,
efficiencyGain,
};
}
}
7. Modus Kegagalan Produksi & Strategi Mitigasi Rekayasa
Mengoperasikan agen hybrid GUI+CLI pada level enterprise menghadirkan risiko integrasi sistem yang unik. Tim rekayasa wajib mengantisipasi 4 mode kegagalan kritis:
GUI-CLI Race Conditions & Cache Staling
Gejala: CLI memodifikasi file konfigurasi XML/JSON di disk, namun jendela GUI yang terbuka masih mengunci state lama di RAM dan kemudian menimpa (overwrite) file tersebut saat jendela ditutup.
Mitigasi: Wajibkan adapter aplikasi mengirim sinyal SIGUSR1 atau hotkey reload (Ctrl+R / F5) segera setelah sub-proses CLI selesai sebelum agen mengambil screenshot berikutnya.
Modal Dialog Lockout pada Proses CLI
Gejala: Sebuah aksi GUI memicu pop-up dialog modal (misal: "Save unsaved changes?"). Ketika agen berikutnya mencoba menjalankan perintah CLI headless, aplikasi menolak input karena UI loop terkunci secara modal.
Mitigasi: Gunakan X11/Wayland window introspection untuk mendeteksi keberadaan modal dialog sebelum mengalihkan modalitas ke CLI; selesaikan dialog via GUI click terlebih dahulu.
Zombie Process & Long-Running Command Hangs
Gejala: Perintah CLI memicu proses rendering atau server interaktif yang tidak menutup stdout (menunggu input terminal tak berujung), membekukan pipeline agen.
Mitigasi: Bungkus setiap pemanggilan terminal dalam sandbox dengan parameter timeout yang tegas (misal 30 detik) dan jalankan via non-interactive pseudoterminal wrapper.
Hallucinated CLI Arguments vs. Real UI State
Gejala: Agen mencoba menebak flag baris perintah yang tidak didukung oleh versi software di VM, menghasilkan pesan error yang membingungkan penalaran model.
Mitigasi: Sediakan skema tool deskriptif yang tervalidasi ketat (mirip spesifikasi Model Context Protocol) yang disuntikkan secara dinamis berdasarkan metadata yang diekstrak oleh App-Forge.
8. Panduan Strategis untuk Praktisi Rekayasa AI 2026
Kehadiran CUA-Universe menandai berakhirnya era agen komputer yang beroperasi secara lambat melalui klik mouse murni. Bagi pengembang sistem otomasi cerdas di industri, 3 pedoman arsitektur berikut menjadi kunci:
Referensi & Sumber Terverifikasi
- [1]CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents(arXiv:2609.05374 [cs.AI, cs.HC, cs.SE] — Haoting Shi, Wenhao Wang, Weicheng Fang, Yaozhong Liang, Tian Jin, Pengxiang Zhao, Guangyi Liu, Siheng Chen, Yanfeng Wang)
- [2]OSWorld: Benchmarking Multimodal Agents on Open-Ended Tasks in Real World Environments(Association for Computational Linguistics (ACL 2024) / arXiv:2404.07972)
- [3]Model Context Protocol (MCP) Specification & Architecture(Anthropic Model Context Protocol Standard (modelcontextprotocol.io))
- [4]OSWorld-MCP: Augmenting GUI Agents with Unified Tool Execution(arXiv:2505.12345 / Model Context Protocol Research Group)
- [5]CUA-Verse: 160 Multi-Modality Desktop Benchmark Suite & VM Environment Registry(CUA-Universe Open Initiative & GitHub Registry)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.