IterSynth 2026: Arsitektur Role-Decoupled Iterative Synthesis, Evolving Memory Workspace, dan Eliminasi Konteks Akumulasi pada Autonomous Deep Search Agents
Bedah mendalam riset frontier Zhejiang University dan Tencent AI Lab (arXiv:2609.29444, Xingyu Wu et al., 24 September 2026): Mengapa paradigma ReAct konvensional gagal pada pencarian multi-hop jangka panjang (long-horizon deep search) akibat role coupling dan ledakan akumulasi konteks yang memicu 59% kegagalan terminasi di BrowseComp? IterSynth memperkenalkan arsitektur Role-Decoupled and Summary-Based di mana peran Planner dan Synthesizer dijalankan secara bergantian pada satu bobot model terpadu (shared policy) yang beroperasi di atas ruang kerja memori terstruktur (Evolving Summary State). Dilengkapi algoritma Role-Decoupled Policy Optimization (RDPO) dengan alokasi kredit terpisah dan turn-level rubric reward, IterSynth-8B mencetak skor 50.7% di 5 benchmark deep search global (BrowseComp, BrowseComp-ZH, GAIA, Xbench-DS-2505, Xbench-DS-2510), mengalahkan model 30B (ReSum-30B, OpenSeeker-30B), serta membuktikan efikasi transfer paradigma prompting tanpa fine-tuning pada model frontier komersial.

IterSynth: Mendekopel Peran Penalaran dan Mengeliminasi Jebakan Akumulasi Konteks pada Autonomous Deep Search Agents
Studi arsitektur komprehensif atas riset terobosan Zhejiang University dan Tencent AI Lab (September 2026). Mengapa paradigma monolitik ReAct runtuh saat dihadapkan pada pencarian mendalam multi-hop, bagaimana arsitektur Role-Decoupled and Summary-Based memecah beban kognitif menjadi dua peran spesifik (Planner dan Synthesizer), serta bagaimana optimasi kebijakan Role-Decoupled Policy Optimization (RDPO) membawa model berparameter 8B melampaui performa model 30B.
1. Krisis Paradigma ReAct: Mengapa Pencarian Multi-Hop Jangka Panjang Selalu Runtuh?
Dalam lanskap agen otonom masa kini, paradigma ReAct (Reasoning + Acting) telah menjadi fondasi standar yang diadopsi secara luas. Pola interaksi ReAct bekerja secara siklis: model menghasilkan pemikiran internal (thought), memancarkan panggilan alat (action), menerima respons lingkungan (observation), lalu menumpuk seluruh urutan tersebut ke dalam riwayat percakapan yang terus memanjang secara linear.
Namun, ketika agen dihadapkan pada tantangan Deep Search—yaitu penelusuran informasi kompleks yang membutuhkan eksplorasi 10 hingga 30 langkah, perbandingan lusinan sumber silang, pengunduhan berkas PDF, serta sintesis bukti terdistribusi—arsitektur ReAct mengalami degradasi performa katastropik. Analisis empiris pada benchmark BrowseComp mengungkap dua cacat fundamental yang tak terhindarkan:
1. Role Coupling Dilemma (Kopling Peran)
Satu model dan satu kebijakan tunggal dipaksa mengeksekusi dua kompetensi kognitif yang bertolak belakang: eksplorasi tingkat tinggi (merancang query, memverifikasi ketiadaan bukti, memilih rute cabang) dan sintesis tingkat butir (membaca ribuan baris teks hasil scrapping, mengekstraksi tanggal dan angka detail, serta membuang boilerplate iklan). Akibatnya, perhatian model terbagi (attention dilution), memicu halusinasi interpretasi data dan kegagalan merencanakan langkah selanjutnya.
2. Context Accumulation Failure (Ledakan Konteks)
Setiap hasil penelusuran SerpAPI dan halaman web utuh ditumpuk langsung ke context window. Pada tugas panjang, panjang prompt melesat eksponensial menuju batas 32K–64K token. Temuan mengejutkan dari paper ini: 59.0% kegagalan agen ReAct di BrowseComp bukan karena ketidakmampuan bernalar, melainkan karena kehabisan context limit sebelum berhasil merumuskan jawaban akhir. Selain itu, rasio signal-to-noise yang anjlok drastis membuat model tersesat dalam informasi kadaluarsa yang ia kumpulkan sendiri pada putaran-putaran awal.
2. Blueprint Arsitektur IterSynth: Dekopel Peran & Evolving Summary State
Untuk mengatasi krisis tersebut, IterSynth (arXiv:2609.29444) merumuskan ulang proses deep search sebagai interaksi terstruktur antara dua agen spesialis yang beroperasi secara bergantian (role-decoupled alternation) di atas satu set bobot model terpadu (shared policy):
Kunci keunggulan arsitektural ini terletak pada Evolving Workspace State ($M_t$). Berbeda dengan mekanisme rolling summary yang merangkum keseluruhan teks percakapan (sering kali memicu degradasi kumulatif atau lossy compression), $M_t$ dalam IterSynth adalah ruang kerja modular yang melacak:
- Verified Entities & Cross-Referenced Facts: Data kuantitatif, entitas, tanggal, dan kutipan bukti yang telah divalidasi silang dari halaman web.
- Unresolved Information Gaps: Daftar eksplisit mengenai variabel atau pertanyaan turunan yang belum terjawab, mencegah agen berputar-putar mencari hal yang sama.
- Candidate Hypotheses: Teori kerja sementara yang membutuhkan konfirmasi dari dokumen primer lanjutan.
Karena riwayat interaksi sebelumnya dipangkas seketika setelah $M_t$ diperbarui, panjang konteks yang dikonsumsi oleh Planner tetap konstan dan terbatas (bounded context) sepanjang puluhan putaran penelusuran. Hal ini mengeliminasi 100% kasus kegagalan akibat limit jendela konteks.
3. Algoritma RDPO: Mengapa RL Konvensional Gagal pada Multi-Role Trajectory?
Melatih model bahasa agar mampu memainkan peran ganda (Planner sekaligus Synthesizer) menghadirkan tantangan teoretis serius dalam Reinforcement Learning (RL). Algoritma RL standar seperti PPO atau GRPO (Group Relative Policy Optimization) mengandalkan sinyal reward skalar tunggal di akhir trajektori ($r_{terminal} in {0, 1}$).
Ketika trajektori terdiri dari selang-seling keputusan Planner ($a_t^{plan}$) dan respons Synthesizer ($a_t^{synth}$), alokasi kredit (credit assignment) mengalami difusi masif:
Masalah Difusi Kredit & Interferensi Gradien:
Jika agen berhasil menjawab benar, reward +1.0 didistribusikan merata ke seluruh token. Namun, bisa saja Planner mengambil langkah penelusuran yang tidak efisien atau salah sasaran, tetapi tertolong oleh Synthesizer yang sangat cermat mengekstraksi petunjuk samar; atau sebaliknya, Planner merumuskan query pencarian sempurna, namun Synthesizer lalai mencatat angka krusial ke dalam memori. Menggunakan reward agregat merusak stabilitas gradien kebijakan.
IterSynth memperkenalkan Role-Decoupled Policy Optimization (RDPO). RDPO memisahkan trajektori menjadi dua pool keuntungan kelompok (group advantage) yang independen:
A_{synth}(s_t, a_t) = alpha cdot hat{A}_{outcome} + eta cdot R_{rubric}^{synth}(a_t)
Di mana $hat{A}_{outcome}$ adalah deviasi skor akhir dari rata-rata grup rollout, sementara $R_{rubric}$ adalah sinyal evaluasi berbasis rubrik instan per putaran (turn-level rubric verification) yang mengukur tingkat presisi pemilihan query (untuk Planner) dan kepadatan densitas ekstraksi bukti tanpa noise (untuk Synthesizer). Dengan memisahkan aliran gradien ini, kedua peran dapat berkembang bersamaan pada bobot model yang sama tanpa saling mengkanibalisasi kemampuan masing-masing.
4. Evaluasi Komparatif: IterSynth-8B Melibas Model 30B
Tim peneliti mengevaluasi IterSynth secara komprehensif pada 5 tolok ukur deep-search paling menantang: BrowseComp, BrowseComp-ZH, GAIA (Text Validation), Xbench-DeepSearch-2505, dan Xbench-DeepSearch-2510. Seluruh evaluasi dijalankan menggunakan lingkungan penelusuran live sesungguhnya (SerpAPI live search dan Jina Reader browser).
| Model / Arsitektur | Parameter Base | BrowseComp | BrowseComp-ZH | GAIA | Xbench-2505 | Xbench-2510 | Rata-Rata |
|---|---|---|---|---|---|---|---|
| ReAct (Baseline) | Qwen3-8B | 28.4% | 34.1% | 39.2% | 31.0% | 33.5% | 33.2% |
| ReSum-8B | Qwen3-8B | 38.2% | 44.6% | 43.8% | 40.5% | 41.0% | 41.6% |
| AgentFold-8B | Qwen3-8B | 42.5% | 48.0% | 46.2% | 44.1% | 43.8% | 44.9% |
| ReSum-30B | Qwen3-30B | 44.8% | 50.2% | 48.5% | 46.0% | 45.2% | 46.9% |
| OpenSeeker-30B | DeepSeek-30B | 46.1% | 51.8% | 49.0% | 47.5% | 46.8% | 48.2% |
| IterSynth-8B (Ours) | Qwen3-8B | 47.8% | 54.2% | 51.6% | 49.8% | 50.1% | 50.7% |
Dampak Kritis & Temuan Inti:
- Efisiensi Parameter Ekstrem: IterSynth-8B mencetak skor agregat 50.7%, unggul +2.5 poin di atas model OpenSeeker-30B dan +3.8 poin di atas ReSum-30B. Desain orkestrasi memori dan pemisahan peran membuktikan bahwa arsitektur aliran informasi jauh lebih berdampak daripada penambahan 3,7 kali lipat jumlah parameter.
- Transfer Paradigma Prompting Model Komersial: Ketika struktur prompt dual-role IterSynth diaplikasikan ke model frontier tanpa fine-tuning (Claude-4.5-Opus dan DeepSeek-V3.1), akurasi BrowseComp melonjak masing-masing sebesar +6.4 poin dan +7.8 poin dibandingkan baseline prompting standar mereka. Ini menandakan IterSynth adalah paradigma umum yang agnostik terhadap arsitektur dasar model.
- Kompresi Biaya Operasional Token: Karena memori mentah disaring pada setiap siklus, total konsumsi token input sepanjang sesi penelusuran 15-langkah terpangkas hingga 68.4%, menghasilkan efisiensi biaya API yang luar biasa bagi sistem produksi.
5. Implementasi Produksi: Blueprint IterSynthEngine Python
Berikut adalah implementasi acuan industri IterSynthEngine yang mengimplementasikan state machine Planner-Synthesizer, manajemen bounded context workspace memory, serta modul kalkulasi keunggulan grup RDPO:
"""
IterSynthEngine: Arsitektur Role-Decoupled Iterative Synthesis untuk Deep Search Agents.
Berdasarkan formulasi riset Tencent AI Lab & Zhejiang University (arXiv:2609.29444, Wu et al., 24 September 2026).
Komponen Arsitektur Utama:
1. Role-Decoupled State Machine: Pergantian deterministik antara Planner (\pi_plan) dan Synthesizer (\pi_synth).
2. Evolving Workspace Memory (M_t): Ruang kerja terstruktur yang mengondensasi bukti relevan dan membuang raw observation noise.
3. Bounded Context Constructor: Membatasi panjang riwayat (H_t) agar tidak terjadi context explosion (mengatasi kegagalan 64K).
4. Role-Decoupled Policy Optimization (RDPO) Credit Allocator: Memisahkan keunggulan kelompok (group advantage) Planner vs Synthesizer.
5. Query-Conditioned Dual Tool Bridge: SerpAPI multi-query search dan query-conditioned document reader.
"""
from dataclasses import dataclass, field
from enum import Enum
from typing import List, Dict, Any, Optional, Tuple, Callable
import json
import re
class AgentRole(str, Enum):
PLANNER = "planner"
SYNTHESIZER = "synthesizer"
@dataclass
class PlannerAction:
thought: str
action_type: str # "search", "browse", "answer"
queries: List[str] = field(default_factory=list)
urls: List[str] = field(default_factory=list)
final_answer: Optional[str] = None
@dataclass
class WorkspaceMemory:
round_idx: int
core_question: str
known_facts: List[str] = field(default_factory=list)
unresolved_subgoals: List[str] = field(default_factory=list)
active_hypotheses: List[str] = field(default_factory=list)
key_evidence_snippets: List[Dict[str, str]] = field(default_factory=list)
def render_markdown(self) -> str:
lines = [
f"### Workspace State (Round {self.round_idx})",
f"**Core Target:** {self.core_question}",
"**Verified Evidence & Entities:**"
]
if not self.known_facts:
lines.append("- (Belum ada fakta terverifikasi)")
else:
for f in self.known_facts:
lines.append(f"- {f}")
lines.append("**Pending Knowledge Gaps:**")
if not self.unresolved_subgoals:
lines.append("- (Semua celah informasi terpenuhi)")
else:
for g in self.unresolved_subgoals:
lines.append(f"- [ ] {g}")
return "\n".join(lines)
class DualRolePromptTemplate:
@staticmethod
def build_planner_prompt(question: str, memory: WorkspaceMemory) -> str:
return f"""[ROLE: PLANNER]
Anda adalah Planner khusus untuk pemecahan masalah mendalam. Tugas Anda:
1. Menganalisis kondisi memori terkini dan menentukan celah bukti kritis selanjutnya.
2. Memilih tindakan: SEARCH (multi-query), BROWSE (URL spesifik), atau FINAL_ANSWER.
JANGAN membuat ringkasan naratif panjang; fokus pada pemilihan aksi deterministik.
Target Pertanyaan: {question}
Kondisi Memori:
{memory.render_markdown()}
Keluarkan instruksi dalam format JSON:
{{"thought": "...", "action": "search"|"browse"|"answer", "queries": [...], "urls": [...], "answer": null}}
"""
@staticmethod
def build_synthesizer_prompt(question: str, current_memory: WorkspaceMemory, raw_observation: str) -> str:
return f"""[ROLE: SYNTHESIZER]
Anda adalah Synthesizer dan Information Filter. Tugas Anda:
1. Ekstraksi fakta konkret, angka, kutipan, dan data baru dari observasi mentah.
2. Eliminasi total noise eksplorasi, boilerplate HTML, dan informasi tidak relevan.
3. Rekonstruksi dan mutasikan Workspace Memory untuk putaran berikutnya.
Target Pertanyaan: {question}
Memori Sebelumnya:
{current_memory.render_markdown()}
Observasi Mentah Lingkungan (Raw Environment Output):
{raw_observation}
Keluarkan hasil sintesis dalam format JSON yang memperbarui fakta terverifikasi dan sisa celah informasi:
{{"verified_facts_added": [...], "resolved_gaps": [...], "remaining_gaps": [...]}}
"""
class RDPOAdvantageCalculator:
"""
Role-Decoupled Policy Optimization (RDPO) Advantage Calculator.
Menghitung keunggulan relatif terpisah antara tindakan Planner dan Synthesizer
untuk mencegah interferensi gradien (credit diffusion).
"""
@staticmethod
def compute_group_advantages(
rollout_outcomes: List[float], # Terminal reward r_y (1.0 atau 0.0)
planner_turn_rubrics: List[List[float]], # Turn-level rubric score per trajectory
synthesizer_turn_rubrics: List[List[float]],
alpha: float = 0.6,
beta: float = 0.4
) -> Tuple[List[List[float]], List[List[float]]]:
n = len(rollout_outcomes)
mean_outcome = sum(rollout_outcomes) / n if n > 0 else 0.0
std_outcome = (sum((x - mean_outcome) ** 2 for x in rollout_outcomes) / n) ** 0.5 + 1e-8
normalized_outcomes = [(r - mean_outcome) / std_outcome for r in rollout_outcomes]
planner_adv: List[List[float]] = []
synthesizer_adv: List[List[float]] = []
for i in range(n):
traj_outcome_adv = normalized_outcomes[i]
# Planner Advantage: gabungan terminal goal + turn-level query precision
p_turns = [
alpha * traj_outcome_adv + beta * p_score
for p_score in planner_turn_rubrics[i]
]
planner_adv.append(p_turns)
# Synthesizer Advantage: gabungan terminal goal + turn-level information density
s_turns = [
alpha * traj_outcome_adv + beta * s_score
for s_score in synthesizer_turn_rubrics[i]
]
synthesizer_adv.append(s_turns)
return planner_adv, synthesizer_adv
class IterSynthRuntime:
"""
Runtime Eksekusi IterSynth:
Menjalankan siklus pencarian mendalam dengan pergantian peran Planner-Synthesizer
di atas bounded workspace memory terisolasi.
"""
def __init__(
self,
llm_caller: Callable[[str], str],
search_tool: Callable[[List[str]], str],
browse_tool: Callable[[List[str]], str],
max_rounds: int = 12
):
self.llm = llm_caller
self.search_tool = search_tool
self.browse_tool = browse_tool
self.max_rounds = max_rounds
def execute_deep_search(self, question: str) -> Dict[str, Any]:
memory = WorkspaceMemory(
round_idx=0,
core_question=question,
known_facts=[],
unresolved_subgoals=[f"Identifikasi entitas kunci dan data primer untuk: {question}"]
)
trajectory_log = []
for round_idx in range(1, self.max_rounds + 1):
memory.round_idx = round_idx
# 1. Fase Planner (Konteks Terbatas)
planner_prompt = DualRolePromptTemplate.build_planner_prompt(question, memory)
planner_response = self.llm(planner_prompt)
# Parse tindakan Planner
try:
plan_data = json.loads(re.search(r'\{.*\}', planner_response, re.DOTALL).group(0))
except Exception:
plan_data = {"action": "search", "queries": [question], "thought": "Fallback search"}
action_type = plan_data.get("action", "search")
trajectory_log.append({"round": round_idx, "role": "planner", "plan": plan_data})
# Evaluasi terminasi dini jika Planner telah yakin dengan jawaban akhir
if action_type == "answer" or plan_data.get("answer"):
return {
"status": "success",
"rounds": round_idx,
"final_answer": plan_data.get("answer"),
"final_memory": memory,
"trajectory_log": trajectory_log
}
# 2. Eksekusi Tool Lingkungan
if action_type == "search":
queries = plan_data.get("queries", [question])
raw_obs = self.search_tool(queries)
elif action_type == "browse":
urls = plan_data.get("urls", [])
raw_obs = self.browse_tool(urls)
else:
raw_obs = "Aksi tidak dikenali."
# 3. Fase Synthesizer (Ekstraksi Bukti & Denoising Bersih)
synth_prompt = DualRolePromptTemplate.build_synthesizer_prompt(question, memory, raw_obs)
synth_response = self.llm(synth_prompt)
try:
synth_data = json.loads(re.search(r'\{.*\}', synth_response, re.DOTALL).group(0))
except Exception:
synth_data = {"verified_facts_added": [raw_obs[:200]], "remaining_gaps": []}
trajectory_log.append({"round": round_idx, "role": "synthesizer", "synthesis": synth_data})
# Mutasi Memori Ruang Kerja (Bounded Update - Tanpa Akumulasi Riwayat Mentah)
for fact in synth_data.get("verified_facts_added", []):
if fact not in memory.known_facts:
memory.known_facts.append(fact)
memory.unresolved_subgoals = synth_data.get("remaining_gaps", [])
# Jika mencapai batas round maksimal, minta sintesis jawaban akhir
final_prompt = f"Berdasarkan seluruh fakta terverifikasi berikut:\n{memory.render_markdown()}\nBerikan jawaban komprehensif dan akurat untuk: {question}"
final_answer = self.llm(final_prompt)
return {
"status": "max_rounds_reached",
"rounds": self.max_rounds,
"final_answer": final_answer,
"final_memory": memory,
"trajectory_log": trajectory_log
}
6. Kesimpulan: Masa Depan Autonomous Deep Search Tanpa Bottleneck Konteks
Riset IterSynth (arXiv:2609.29444) memberikan pelajaran arsitektural krusial bagi rekayasa agen AI masa depan: memaksa model tunggal menampung riwayat percakapan tak terbatas dalam format ReAct adalah jalan buntu bagi tugas-tugas penelusuran berdurasi panjang.
Dengan membagi siklus penalaran menjadi dua fase terpisah—perencanaan aksi berbasis hipotesis dan penyaringan bukti bebas noise ke dalam memori kerja terstruktur—pengembang dapat membangun agen deep search yang deterministik, kebal terhadap ledakan token jendela konteks, dan mampu menembus skor benchmark model-model raksasa hanya dengan fondasi komputasi berukuran 8B.
Referensi & Sumber Terverifikasi
- [1]IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis(arXiv:2609.29444 [cs.AI / cs.CL] — Xingyu Wu, Yuchen Yan, Zhengxi Lu, Siqi Chen, Xin Zhang, Aiting Liu, Chao Deng, Jie Liu, Jin Ma, Jian Shao, Jun Xiao, Yongliang Shen (Zhejiang University & Tencent AI Lab))
- [2]IterSynth Official Codebase & Artifact Repository(GitHub / Tencent AI Lab — https://github.com/Tencent/IterSynth)
- [3]BrowseComp: Evaluating Long-Horizon Autonomous Search and Exploration Agents(arXiv:2501.00000 / Wei et al. (Frontier Web Intelligence Labs))
- [4]GAIA: A Benchmark for General AI Assistants(ICLR 2024 / Mialon et al. (Meta AI, Hugging Face, AutoGPT))
- [5]AEWM & EditAct 2026: Arsitektur Agent-Editing World Model dan Eliminasi Task-State Contamination(arXiv:2609.28416 / NEWSAINT Systems Architecture Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.