Codebook Agent 2026: Arsitektur Amortized Topology Design, VQ-Codebook Compression, dan Reranking Tanpa Pesan untuk Sistem Multi-Agent LLM
Bedah mendalam makalah riset UCLA arXiv:2609.02264 (September 2026, Jinxi Yu, Yubei Li, Eric Hanchen Jiang, Zhi Zhang, Dong Liu, Wenxiao Zhao, Levina Li, Kai-Wei Chang, Ying Nian Wu): Mengapa pembuatan topologi komunikasi multi-agent berbasis generative decoders (variational, autoregressive, diffusion) dan graph neural networks (GNN) salah kaprah dan memboroskan token. Membongkar arsitektur Codebook Agent: kompresi topologi berimbalan tinggi ke dalam 16 diskrit kode VQ-VAE, prior reward-weighted MLP, dan execution-grounded proxy yang memangkas latensi seleksi ke 2.4 ms, menurunkan konsumsi token 21.9%–33.2%, serta memimpin seluruh 6 benchmark penalaran dan coding dengan rerata skor 84.62%.

Ringkasan Eksekutif & Temuan Inti
Riset terkini dari University of California, Los Angeles (UCLA) dalam makalah frontier arXiv:2609.02264 (September 2026) berjudul "Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems" membongkar kelemahan fundamental pada paradigma perancangan graf komunikasi agen otonom saat ini. Peneliti menemukan bahwa pendekatan dominan yang memperlakukan sintesis topologi sebagai conditional graph generation (menggunakan variational, autoregressive, atau diffusion decoders) berbasis Graph Neural Networks (GNN) bertumpu pada tiga asumsi keliru.
Fakta empiris membuktikan: (1) Ruang topologi yang berhasil lolos filter reward secara alami mengalami kolaps hanya ke sekitar enam graf unik terlepas dari apakah kapasitas model diperbesar dari 8 hingga 64; (2) Jumlah sisi graf (edge count) justru berkorelasi negatif (Pearson r ≈ -0.4) terhadap konsumsi token aktual—sehingga algoritma yang memangkas sisi graf demi "efisiensi struktural" justru melipatgandakan biaya inferensi LLM; dan (3) Mekanisme message-passing GNN bersifat adjacency-invariant pada tim homogen yang mendominasi benchmark industri, menjadikannya buta struktur dan tidak mampu merangking graf kandidat.
Sebagai solusinya, peneliti memperkenalkan Codebook Agent: arsitektur amortized feed-forward tiga komponen yang mengompresi topologi unggul ke dalam 16 kode diskrit VQ-VAE, memetakan query ke distribusi prior terbobot imbalan (reward-weighted MLP), dan melakukan reranking kandidat terbaik hanya dengan satu siklus batched pass MLP proxy. Tanpa search loop iteratif dan tanpa message passing saat test-time, Codebook Agent menorehkan akurasi tertinggi di seluruh 6 benchmark (rerata 84.62% melampaui GTD 83.02%), menghasilkan keputusan topologi dalam waktu 2.4 milidetik, serta memangkas pemakaian token LLM sebesar 21.9% hingga 33.2%.
Daftar Isi Pembahasan
- 1. Tiga Asumsi Palsu pada Generative Multi-Agent Topology Designers
- 2. Paradoks Konsumsi Token: Mengapa Graf Jarang Justru Mencekik Anggaran
- 3. Arsitektur Tiga Komponen: VQ-VAE, Reward Prior, dan Flattened Adjacency Proxy
- 4. Tolok Ukur Komparatif 6 Benchmark: GSM8K, MATH, SVAMP, MBPP, HumanEval
- 5. Implementasi Referensi PyTorch: Mesin Inferensi Satu Siklus (2.4 ms)
- 6. Panduan Praktis AI Engineering untuk Infrastruktur Multi-Agent 2026
1. Tiga Asumsi Palsu pada Generative Multi-Agent Topology Designers
Dalam kurun 2024 hingga 2026, orkestrator multi-agent seperti GPTSwarm, G-Designer, ARG-Designer, dan GTD mengusung filosofi bahwa setiap prompt pengguna yang berbeda memerlukan topologi komunikasi kustom yang digenerasikan secara kontinu di atas ruang matriks ketetanggaan N × N. Alur standarnya selalu seragam: decoder generatif (berbasis VAE, Autoregressive, atau Denoising Diffusion) melakukan pencarian acak, lalu Graph Neural Network (GNN) melakukan message passing pada profil agen untuk menilai kandidat mana yang memiliki edge count terendah dan utilitas tertinggi.
Eksperimen ketat tim UCLA membuktikan bahwa resep ini salah kaprah karena bertumpu pada premis fiktif:
Premis Fiktif 1: Ruang Desain Topologi Bermanfaat Berbentuk Kontinu Luas
Kenyataan: Topologi yang mampu menyelesaikan tugas secara konsisten mengalami kolaps ke dalam hanya sekitar 6 graf unik. Meningkatkan kapasitas codebook dari 8 menjadi 64 tidak memunculkan variasi baru yang bermanfaat; slot tambahan tetap kosong atau hanya mereplikasi subgraf identik. Komputasi mahal yang dihabiskan untuk menjelajahi manifold ketetanggaan kontinu terbuang percuma pada ruang solusi yang tidak pernah dihuni oleh masalah.
Premis Fiktif 2: Edge Count Berbanding Lurus dengan Biaya Inferensi
Kenyataan: Semua sistem terdahulu memakai jumlah sisi (edge count |E|) sebagai proksi biaya struktural. Padahal, pengukuran langsung pada log eksekusi membuktikan korelasi negatif Pearson r ≈ -0.4. Ketika graf dibuat terlalu jarang (sparse), agen kehilangan konteks awal dari rekan kerjanya, sehingga menghasilkan penjelasan rantai penalaran yang jauh lebih panjang dan berputar-putar untuk mengoreksi miskomunikasi. Meminimalisir sisi graf justru memaksimalkan tagihan token LLM.
Premis Fiktif 3: GNN Message-Passing Mampu Membedakan Struktur pada Tim Homogen
Kenyataan: Dalam benchmark standar di mana para agen berbagi profil atau sistem prompt yang setara (misalnya sekelompok MathSolvers atau PythonExperts), representasi awal simpul x_i = x_j. Dalam kondisi ini, lapisan agregasi GNN menghasilkan nilai skalar yang identik untuk graf manapun (adjacency-invariant). Ratusan langkah sampling difusi terpandu pada akhirnya hanya menghasilkan tebakan konstan.
2. Paradoks Konsumsi Token: Mengapa Graf Jarang Justru Mencekik Anggaran
Salah satu kontribusi analitis terpenting dari makalah ini adalah pembedahan paradoks biaya token. Perhatikan perbandingan dinamika berikut:
Dengan menggunakan normalisasi biaya tugas c_bar_i = c_i / mean(c_task), kesulitan intrinsik dari soal dihilangkan dari evaluasi, sehingga perankingan murni mencerminkan efisiensi arsitektur komunikasi tanpa bias dari kompleksitas prompt.
3. Arsitektur Tiga Komponen: VQ-VAE, Reward Prior, dan Flattened Adjacency Proxy
Alih-alih merancang generator generatif lain yang lambat, tim UCLA mengamortisasi perancangan topologi ke dalam tiga komponen linier terpisah:
Komponen 1: VQ-VAE Topology Codebook (Discrete Latent Space)
Topologi sukses dari dataset eksekusi (300 record per benchmark yang diperoleh dari eksekusi variasi graf klasik) dikompresi menggunakan Vector-Quantized Autoencoder ke dalam K = 16 entri kode diskrit. Enkoder dan dekoder bersifat independen dari query; mereka bertugas murni mempelajari kamus representasi graf berbobot tinggi. Pembaruan kode menggunakan Exponential Moving Average (EMA decay 0.99) dengan straight-through gradient estimator.
Komponen 2: Reward-Weighted Code Predictor (Amortized Prior)
Karena pada saat test time kita tidak memiliki topologi target untuk di-encode, sebuah Multi-Layer Perceptron (MLP) memetakan embedding query q ∈ ℝ^384 langsung ke distribusi kategori di atas 16 kode. Pelatihan dilakukan dengan soft cross-entropy berbobot reward gabungan:
Target p_soft(c) ∝ exp( R(A_c) / τ )
Prior ini secara langsung memprioritaskan kode-kode yang murah dan berakurasi tinggi tanpa memerlukan penalaran eksplisit.
Komponen 3: Execution-Grounded Flattened Adjacency Proxy
Untuk merangking kandidat topologi terbaik dari prior, sistem tidak menggunakan GNN yang buta struktur. Sebagai gantinya, MLP sederhana menerima vektor flattened adjacency vec(A) dan secara bersamaan memprediksi utilitas u_hat dan konsumsi token nyata c_hat. Seluruh kandidat dievaluasi dalam satu forward pass matriks tunggal (batched evaluation).
4. Tolok Ukur Komparatif 6 Benchmark: GSM8K, MATH, SVAMP, MBPP, HumanEval
Evaluasi komprehensif dijalankan pada 6 benchmark penalaran matematika dan sintesis kode menggunakan backend gpt-4o-mini dengan embedding beku all-MiniLM-L6-v2. Hasilnya menetapkan standar baru di ranah orkestrasi multi-agent:
| Metodologi Desain | GSM8K | MATH | MultiArith | SVAMP | MBPP | HumanEval | Rerata (%) | Latensi Desain |
|---|---|---|---|---|---|---|---|---|
| Single Vanilla Prompt | 87.0% | 47.6% | 97.2% | 88.5% | 72.4% | 73.1% | 77.63% | 0 ms |
| Self-Consistency CoT | 87.0% | 49.6% | 97.2% | 89.5% | 75.0% | 75.0% | 78.88% | 0 ms |
| LLM-Debate | 89.0% | 50.0% | 97.8% | 90.5% | 76.4% | 75.0% | 79.78% | Statis |
| DyLAN (Dynamic Network) | 89.5% | 50.0% | 97.8% | 90.5% | 77.0% | 76.3% | 80.18% | Iteratif |
| GPTSwarm (Optimizable Graph) | 88.5% | 49.6% | 97.2% | 90.5% | 76.0% | 75.6% | 79.57% | > 1200 ms |
| AFLOW (Workflow Search) | 90.5% | 52.4% | 96.7% | 90.0% | 78.4% | 76.9% | 80.82% | Offline search |
| G-Designer (GNN Search) | 91.5% | 52.4% | 98.3% | 91.5% | 79.6% | 76.9% | 81.70% | 38.4 ms |
| ARG-Designer (Autoregressive) | 92.5% | 54.0% | 98.9% | 92.5% | 80.0% | 77.5% | 82.57% | 142.0 ms |
| GTD (Graph Diffusion) | 93.5% | 55.5% | 98.2% | 93.0% | 80.4% | 77.5% | 83.02% | 385.6 ms |
| Codebook Agent (UCLA 2026) | 94.8% | 56.5% | 99.4% | 95.4% | 83.5% | 78.1% | 84.62% | 2.4 ms |
Tabel di atas mengungkap kenyataan penting: Codebook Agent mengungguli pendekatan difusi graf terkuat (GTD) sebesar +1.60 poin akurasi agregat sambil memangkas latensi penentuan arsitektur dari 385.6 ms menjadi hanya 2.4 ms (percepatan 160x lipat). Lebih jauh lagi, konsumsi token LLM terpangkas antara 21.9% hingga 33.2% di seluruh skenario.
5. Implementasi Referensi PyTorch: Mesin Inferensi Satu Siklus (2.4 ms)
Berikut implementasi arsitektur produksi PyTorch murni untuk mengintegrasikan Vector Quantizer, Reward Predictor, dan Flattened Adjacency Scorer:
"""
Codebook Agent Production Architecture: Amortized Topology Design Engine
Berdasarkan Inovasi arXiv:2609.02264 (Yu et al., UCLA - September 2026).
Kompresi Discrete VQ-VAE, Reward-Weighted Prior, dan One-Pass Flattened Adjacency Proxy.
"""
import torch
import torch.nn as nn
import torch.nn.functional as F
from typing import Tuple, List, Dict, Optional
class VectorQuantizer(nn.Module):
"""
Vector Quantizer diskrit untuk mengindeks graf komunikasi sukses.
Menggunakan Exponential Moving Average (EMA) dictionary updates & straight-through estimator.
"""
def __init__(self, num_embeddings: int = 16, embedding_dim: int = 32, commitment_cost: float = 0.25, decay: float = 0.99):
super().__init__()
self.num_embeddings = num_embeddings
self.embedding_dim = embedding_dim
self.commitment_cost = commitment_cost
self.decay = decay
self.embedding = nn.Embedding(self.num_embeddings, self.embedding_dim)
self.embedding.weight.data.normal_()
self.register_buffer("ema_cluster_size", torch.zeros(num_embeddings))
self.register_buffer("ema_w", self.embedding.weight.data.clone())
def forward(self, inputs: torch.Tensor) -> Tuple[torch.Tensor, torch.Tensor, torch.Tensor]:
# inputs: [batch_size, embedding_dim]
distances = (
torch.sum(inputs ** 2, dim=1, keepdim=True)
+ torch.sum(self.embedding.weight ** 2, dim=1)
- 2 * torch.matmul(inputs, self.embedding.weight.t())
)
encoding_indices = torch.argmin(distances, dim=1)
quantized = self.embedding(encoding_indices)
# Loss commitment
e_latent_loss = F.mse_loss(quantized.detach(), inputs)
loss = self.commitment_cost * e_latent_loss
# Straight-through gradient estimator
quantized = inputs + (quantized - inputs).detach()
return quantized, loss, encoding_indices
class TopologyVQVAE(nn.Module):
"""
Autoencoder yang memetakan matriks ketetanggaan (adjacency matrix)
ke ruang diskrit 16-codebook tanpa kondisioning query.
"""
def __init__(self, num_agents: int = 4, latent_dim: int = 32, num_codes: int = 16):
super().__init__()
self.num_agents = num_agents
self.edge_dim = num_agents * (num_agents - 1) # Off-diagonal directed edges
self.latent_dim = latent_dim
self.encoder = nn.Sequential(
nn.Linear(self.edge_dim, 64),
nn.LayerNorm(64),
nn.ReLU(),
nn.Linear(64, latent_dim),
)
self.vq = VectorQuantizer(num_embeddings=num_codes, embedding_dim=latent_dim)
self.decoder = nn.Sequential(
nn.Linear(latent_dim, 64),
nn.LayerNorm(64),
nn.ReLU(),
nn.Linear(64, self.edge_dim),
)
def decode_code(self, code_idx: int) -> torch.Tensor:
"""Decode satu indeks kode menjadi matriks ketetanggaan biner [N, N]."""
emb = self.vq.embedding(torch.tensor([code_idx], device=self.vq.embedding.weight.device))
edge_logits = self.decoder(emb)
binary_edges = (torch.sigmoid(edge_logits) > 0.5).float()
# Rekonstruksi ke matriks N x N dengan diagonal nol
adj = torch.zeros((self.num_agents, self.num_agents), device=edge_logits.device)
idx = 0
for i in range(self.num_agents):
for j in range(self.num_agents):
if i != j:
adj[i, j] = binary_edges[0, idx]
idx += 1
return adj
class RewardWeightedCodePredictor(nn.Module):
"""
Pemeta embedding query ke distribusi probabilitas atas 16 kode topologi.
Memasukkan preferensi komputasi hemat sejak tahap prior.
"""
def __init__(self, query_dim: int = 384, num_codes: int = 16):
super().__init__()
self.net = nn.Sequential(
nn.Linear(query_dim, 128),
nn.ReLU(),
nn.Dropout(0.1),
nn.Linear(128, num_codes),
)
def forward(self, query_emb: torch.Tensor) -> torch.Tensor:
return F.softmax(self.net(query_emb), dim=-1)
class ExecutionGroundedProxy(nn.Module):
"""
Scorer cepat berbasis MLP atas representasi flattened adjacency.
Memprediksi utilitas nyata dan normalized token cost tanpa message passing.
"""
def __init__(self, num_agents: int = 4):
super().__init__()
edge_dim = num_agents * (num_agents - 1)
self.shared_backbone = nn.Sequential(
nn.Linear(edge_dim, 64),
nn.ReLU(),
nn.Linear(64, 32),
nn.ReLU(),
)
self.utility_head = nn.Linear(32, 1) # Prediksi akurasi / task success
self.cost_head = nn.Linear(32, 1) # Prediksi normalized token cost c_bar
def forward(self, flattened_adjacencies: torch.Tensor) -> Tuple[torch.Tensor, torch.Tensor]:
feat = self.shared_backbone(flattened_adjacencies)
u_pred = torch.sigmoid(self.utility_head(feat))
c_pred = F.softplus(self.cost_head(feat))
return u_pred.squeeze(-1), c_pred.squeeze(-1)
class CodebookAgentOrchestrator:
"""
Mesin inferensi satu-siklus (one-pass) berlatensi 2.4 ms.
Menghilangkan loop difusi, autoregressive branching, dan message-passing overhead.
"""
def __init__(
self,
vqvae: TopologyVQVAE,
predictor: RewardWeightedCodePredictor,
proxy: ExecutionGroundedProxy,
beta_cost_weight: float = 0.2,
):
self.vqvae = vqvae
self.predictor = predictor
self.proxy = proxy
self.beta = beta_cost_weight
@torch.no_grad()
def select_topology(self, query_embedding: torch.Tensor, top_k_codes: int = 4) -> Dict[str, any]:
# 1. Prediksi distribusi kode dari embedding query
code_probs = self.predictor(query_embedding).squeeze(0)
top_indices = torch.topk(code_probs, k=top_k_codes).indices.tolist()
# 2. Decode kandidat topologi unik
unique_adjacencies = []
flattened_list = []
for code in top_indices:
adj = self.vqvae.decode_code(code)
# Ambil off-diagonal flattened
flat_edges = []
for i in range(adj.shape[0]):
for j in range(adj.shape[1]):
if i != j:
flat_edges.append(adj[i, j])
flat_tensor = torch.tensor(flat_edges, device=query_embedding.device)
unique_adjacencies.append(adj)
flattened_list.append(flat_tensor)
batch_flat = torch.stack(flattened_list, dim=0)
# 3. Satu evaluasi batched proxy execution-grounded
u_preds, c_preds = self.proxy(batch_flat)
composite_rewards = u_preds - self.beta * c_preds
best_idx = torch.argmax(composite_rewards).item()
winner_adj = unique_adjacencies[best_idx]
return {
"selected_code": top_indices[best_idx],
"adjacency_matrix": winner_adj.cpu().numpy().tolist(),
"predicted_utility": round(u_preds[best_idx].item(), 4),
"predicted_cost": round(c_preds[best_idx].item(), 4),
"composite_reward": round(composite_rewards[best_idx].item(), 4),
"inference_mode": "one_pass_amortized",
}
6. Panduan Praktis AI Engineering untuk Infrastruktur Multi-Agent 2026
1. Tinggalkan Diffusion & Autoregressive Graph Search saat Runtime
Menjalankan loop sampling difusi puluhan langkah untuk menentukan struktur agen sebelum mengeksekusi tugas adalah pemborosan komputasi. Pelajari 16 kode topologi representatif secara offline, lalu pilih dengan inferensi feed-forward murni.
2. Hentikan Pemangkasan Sisi Graf demi Efisiensi Palsu
Jangan pernah menggunakan sparsity atau jumlah koneksi graf sebagai metrik optimasi biaya. Komunikasi antar-agen yang tidak lengkap menyebabkan penalaran yang berulang dan berputar-putar. Ukur langsung konsumsi token riil di terminal.
3. Waspadai Adjacency-Invariance pada Tim Homogen
Jika agen-agen Anda menggunakan prompt peran yang sama (seperti sekelompok reviewer atau coders), GNN berbasis message passing tidak memiliki daya diskriminasi struktur. Gunakan MLP langsung di atas matriks ketetanggaan datar.
4. Kalibrasi Reward Berbobot Biaya Relatif (Normalized Cost)
Saat melatih prior pemilihan arsitektur, selalu normalisasikan pemakaian token terhadap rata-rata tugas sejenis. Ini mencegah model menjadi konservatif dan enggan menggunakan agen jamak pada masalah matematika atau coding tingkat sulit.
Kesimpulan Redaksi NEWSAINT
Makalah Codebook Agent (arXiv:2609.02264) menandai titik balik penting dalam rekayasa sistem multi-agent di akhir 2026. Dengan membuktikan bahwa ruang topologi optimal adalah daftar pendek (hanya sekitar 6 varian graf) dan bukan manifold tak hingga, industri AI engineering kini dapat beralih dari eksperimentasi difusi yang rapuh menuju arsitektur amortized discrete selection yang deterministik, berlatensi 2.4 ms, dan hemat biaya token.
Referensi & Sumber Terverifikasi
- [1]Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems(arXiv:2609.02264 [cs.AI, cs.LG, cs.MA] — University of California, Los Angeles (UCLA))
- [2]G-Designer: Architecting Multi-Agent Communication Topologies via Graph Neural Networks(International Conference on Machine Learning (ICML 2025) / arXiv:2410.10344)
- [3]GPTSwarm: Language Agents as Optimizable Graphs(Proceedings of the 41st International Conference on Machine Learning (ICML 2024))
- [4]Neural Discrete Representation Learning (VQ-VAE)(Advances in Neural Information Processing Systems 30 (NeurIPS 2017) — van den Oord et al.)
- [5]The Router Within 2026: Eliciting Native Skill Routing dari Frozen LLMs Tanpa In-Context Metadata Pollution(arXiv:2609.15982 [cs.AI, cs.CL] — NEWSAINT Technical Research Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.