NS
NEWSAINT
ai-eng• 8 MIN READ•25 September 2026

IterSynth 2026: Arsitektur Role-Decoupled Iterative Synthesis, Evolving Memory Workspace, dan Eliminasi Konteks Akumulasi pada Autonomous Deep Search Agents

Bedah mendalam riset frontier Zhejiang University dan Tencent AI Lab (arXiv:2609.29444, Xingyu Wu et al., 24 September 2026): Mengapa paradigma ReAct konvensional gagal pada pencarian multi-hop jangka panjang (long-horizon deep search) akibat role coupling dan ledakan akumulasi konteks yang memicu 59% kegagalan terminasi di BrowseComp? IterSynth memperkenalkan arsitektur Role-Decoupled and Summary-Based di mana peran Planner dan Synthesizer dijalankan secara bergantian pada satu bobot model terpadu (shared policy) yang beroperasi di atas ruang kerja memori terstruktur (Evolving Summary State). Dilengkapi algoritma Role-Decoupled Policy Optimization (RDPO) dengan alokasi kredit terpisah dan turn-level rubric reward, IterSynth-8B mencetak skor 50.7% di 5 benchmark deep search global (BrowseComp, BrowseComp-ZH, GAIA, Xbench-DS-2505, Xbench-DS-2510), mengalahkan model 30B (ReSum-30B, OpenSeeker-30B), serta membuktikan efikasi transfer paradigma prompting tanpa fine-tuning pada model frontier komersial.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 IterSynth 2026: Arsitektur Role-Decoupled Iterative Synthesis, Evolving Memory Workspace, dan Eliminasi Konteks Akumulasi pada Autonomous Deep Search Agents
Frontier Research Architecture Review · arXiv:2609.29444

IterSynth: Mendekopel Peran Penalaran dan Mengeliminasi Jebakan Akumulasi Konteks pada Autonomous Deep Search Agents

Studi arsitektur komprehensif atas riset terobosan Zhejiang University dan Tencent AI Lab (September 2026). Mengapa paradigma monolitik ReAct runtuh saat dihadapkan pada pencarian mendalam multi-hop, bagaimana arsitektur Role-Decoupled and Summary-Based memecah beban kognitif menjadi dua peran spesifik (Planner dan Synthesizer), serta bagaimana optimasi kebijakan Role-Decoupled Policy Optimization (RDPO) membawa model berparameter 8B melampaui performa model 30B.

Paper ID: arXiv:2609.29444 Primary Subjects: cs.AI / cs.CL Tencent AI Lab & Zhejiang University Code: github.com/Tencent/IterSynth

Dalam lanskap agen otonom masa kini, paradigma ReAct (Reasoning + Acting) telah menjadi fondasi standar yang diadopsi secara luas. Pola interaksi ReAct bekerja secara siklis: model menghasilkan pemikiran internal (thought), memancarkan panggilan alat (action), menerima respons lingkungan (observation), lalu menumpuk seluruh urutan tersebut ke dalam riwayat percakapan yang terus memanjang secara linear.

Namun, ketika agen dihadapkan pada tantangan Deep Search—yaitu penelusuran informasi kompleks yang membutuhkan eksplorasi 10 hingga 30 langkah, perbandingan lusinan sumber silang, pengunduhan berkas PDF, serta sintesis bukti terdistribusi—arsitektur ReAct mengalami degradasi performa katastropik. Analisis empiris pada benchmark BrowseComp mengungkap dua cacat fundamental yang tak terhindarkan:

1. Role Coupling Dilemma (Kopling Peran)

Satu model dan satu kebijakan tunggal dipaksa mengeksekusi dua kompetensi kognitif yang bertolak belakang: eksplorasi tingkat tinggi (merancang query, memverifikasi ketiadaan bukti, memilih rute cabang) dan sintesis tingkat butir (membaca ribuan baris teks hasil scrapping, mengekstraksi tanggal dan angka detail, serta membuang boilerplate iklan). Akibatnya, perhatian model terbagi (attention dilution), memicu halusinasi interpretasi data dan kegagalan merencanakan langkah selanjutnya.

2. Context Accumulation Failure (Ledakan Konteks)

Setiap hasil penelusuran SerpAPI dan halaman web utuh ditumpuk langsung ke context window. Pada tugas panjang, panjang prompt melesat eksponensial menuju batas 32K–64K token. Temuan mengejutkan dari paper ini: 59.0% kegagalan agen ReAct di BrowseComp bukan karena ketidakmampuan bernalar, melainkan karena kehabisan context limit sebelum berhasil merumuskan jawaban akhir. Selain itu, rasio signal-to-noise yang anjlok drastis membuat model tersesat dalam informasi kadaluarsa yang ia kumpulkan sendiri pada putaran-putaran awal.

2. Blueprint Arsitektur IterSynth: Dekopel Peran & Evolving Summary State

Untuk mengatasi krisis tersebut, IterSynth (arXiv:2609.29444) merumuskan ulang proses deep search sebagai interaksi terstruktur antara dua agen spesialis yang beroperasi secara bergantian (role-decoupled alternation) di atas satu set bobot model terpadu (shared policy):

Alur Siklus Inferensi IterSynth (Role-Decoupled Loop)
[Pertanyaan Asli: Q] ───> Inisialisasi Evolving Workspace State M_0 (Fakta Bersih, Kesenjangan Informasi)
│
├──> Fase 1: Planner Policy (π_plan)
Input: Bounded Context {Q, M_{t-1}} (Riwayat mentah masa lalu DIBUANG)
Output: Keputusan Analitik {Panggilan Alat Multi-Query Search / Browse / Final Answer}
│
├──> Fase 2: Eksekusi Alat Lingkungan
Output: Raw Observation O_t (Teks situs, cuplikan dokumen, status HTTP)
│
└──> Fase 3: Synthesizer Policy (π_synth)
Input: {Q, M_{t-1}, O_t}
Tugas: Ekstraksi Fakta Valid, Denoising Informasi, & Rekonstruksi State M_t
Hasil: Mutasi M_{t-1} ──> M_t (Konteks kembali terkompresi dan bersih untuk putaran berikutnya)

Kunci keunggulan arsitektural ini terletak pada Evolving Workspace State ($M_t$). Berbeda dengan mekanisme rolling summary yang merangkum keseluruhan teks percakapan (sering kali memicu degradasi kumulatif atau lossy compression), $M_t$ dalam IterSynth adalah ruang kerja modular yang melacak:

  • Verified Entities & Cross-Referenced Facts: Data kuantitatif, entitas, tanggal, dan kutipan bukti yang telah divalidasi silang dari halaman web.
  • Unresolved Information Gaps: Daftar eksplisit mengenai variabel atau pertanyaan turunan yang belum terjawab, mencegah agen berputar-putar mencari hal yang sama.
  • Candidate Hypotheses: Teori kerja sementara yang membutuhkan konfirmasi dari dokumen primer lanjutan.

Karena riwayat interaksi sebelumnya dipangkas seketika setelah $M_t$ diperbarui, panjang konteks yang dikonsumsi oleh Planner tetap konstan dan terbatas (bounded context) sepanjang puluhan putaran penelusuran. Hal ini mengeliminasi 100% kasus kegagalan akibat limit jendela konteks.

3. Algoritma RDPO: Mengapa RL Konvensional Gagal pada Multi-Role Trajectory?

Melatih model bahasa agar mampu memainkan peran ganda (Planner sekaligus Synthesizer) menghadirkan tantangan teoretis serius dalam Reinforcement Learning (RL). Algoritma RL standar seperti PPO atau GRPO (Group Relative Policy Optimization) mengandalkan sinyal reward skalar tunggal di akhir trajektori ($r_{terminal} in {0, 1}$).

Ketika trajektori terdiri dari selang-seling keputusan Planner ($a_t^{plan}$) dan respons Synthesizer ($a_t^{synth}$), alokasi kredit (credit assignment) mengalami difusi masif:

Masalah Difusi Kredit & Interferensi Gradien:

Jika agen berhasil menjawab benar, reward +1.0 didistribusikan merata ke seluruh token. Namun, bisa saja Planner mengambil langkah penelusuran yang tidak efisien atau salah sasaran, tetapi tertolong oleh Synthesizer yang sangat cermat mengekstraksi petunjuk samar; atau sebaliknya, Planner merumuskan query pencarian sempurna, namun Synthesizer lalai mencatat angka krusial ke dalam memori. Menggunakan reward agregat merusak stabilitas gradien kebijakan.

IterSynth memperkenalkan Role-Decoupled Policy Optimization (RDPO). RDPO memisahkan trajektori menjadi dua pool keuntungan kelompok (group advantage) yang independen:

A_{plan}(s_t, a_t) = alpha cdot hat{A}_{outcome} + eta cdot R_{rubric}^{plan}(a_t)

A_{synth}(s_t, a_t) = alpha cdot hat{A}_{outcome} + eta cdot R_{rubric}^{synth}(a_t)

Di mana $hat{A}_{outcome}$ adalah deviasi skor akhir dari rata-rata grup rollout, sementara $R_{rubric}$ adalah sinyal evaluasi berbasis rubrik instan per putaran (turn-level rubric verification) yang mengukur tingkat presisi pemilihan query (untuk Planner) dan kepadatan densitas ekstraksi bukti tanpa noise (untuk Synthesizer). Dengan memisahkan aliran gradien ini, kedua peran dapat berkembang bersamaan pada bobot model yang sama tanpa saling mengkanibalisasi kemampuan masing-masing.

4. Evaluasi Komparatif: IterSynth-8B Melibas Model 30B

Tim peneliti mengevaluasi IterSynth secara komprehensif pada 5 tolok ukur deep-search paling menantang: BrowseComp, BrowseComp-ZH, GAIA (Text Validation), Xbench-DeepSearch-2505, dan Xbench-DeepSearch-2510. Seluruh evaluasi dijalankan menggunakan lingkungan penelusuran live sesungguhnya (SerpAPI live search dan Jina Reader browser).

Model / Arsitektur Parameter Base BrowseComp BrowseComp-ZH GAIA Xbench-2505 Xbench-2510 Rata-Rata
ReAct (Baseline) Qwen3-8B 28.4% 34.1% 39.2% 31.0% 33.5% 33.2%
ReSum-8B Qwen3-8B 38.2% 44.6% 43.8% 40.5% 41.0% 41.6%
AgentFold-8B Qwen3-8B 42.5% 48.0% 46.2% 44.1% 43.8% 44.9%
ReSum-30B Qwen3-30B 44.8% 50.2% 48.5% 46.0% 45.2% 46.9%
OpenSeeker-30B DeepSeek-30B 46.1% 51.8% 49.0% 47.5% 46.8% 48.2%
IterSynth-8B (Ours) Qwen3-8B 47.8% 54.2% 51.6% 49.8% 50.1% 50.7%

Dampak Kritis & Temuan Inti:

  • Efisiensi Parameter Ekstrem: IterSynth-8B mencetak skor agregat 50.7%, unggul +2.5 poin di atas model OpenSeeker-30B dan +3.8 poin di atas ReSum-30B. Desain orkestrasi memori dan pemisahan peran membuktikan bahwa arsitektur aliran informasi jauh lebih berdampak daripada penambahan 3,7 kali lipat jumlah parameter.
  • Transfer Paradigma Prompting Model Komersial: Ketika struktur prompt dual-role IterSynth diaplikasikan ke model frontier tanpa fine-tuning (Claude-4.5-Opus dan DeepSeek-V3.1), akurasi BrowseComp melonjak masing-masing sebesar +6.4 poin dan +7.8 poin dibandingkan baseline prompting standar mereka. Ini menandakan IterSynth adalah paradigma umum yang agnostik terhadap arsitektur dasar model.
  • Kompresi Biaya Operasional Token: Karena memori mentah disaring pada setiap siklus, total konsumsi token input sepanjang sesi penelusuran 15-langkah terpangkas hingga 68.4%, menghasilkan efisiensi biaya API yang luar biasa bagi sistem produksi.

5. Implementasi Produksi: Blueprint IterSynthEngine Python

Berikut adalah implementasi acuan industri IterSynthEngine yang mengimplementasikan state machine Planner-Synthesizer, manajemen bounded context workspace memory, serta modul kalkulasi keunggulan grup RDPO:

python / itersynth_deep_search_engine.py Reference Architecture
"""
IterSynthEngine: Arsitektur Role-Decoupled Iterative Synthesis untuk Deep Search Agents.
Berdasarkan formulasi riset Tencent AI Lab & Zhejiang University (arXiv:2609.29444, Wu et al., 24 September 2026).

Komponen Arsitektur Utama:
1. Role-Decoupled State Machine: Pergantian deterministik antara Planner (\pi_plan) dan Synthesizer (\pi_synth).
2. Evolving Workspace Memory (M_t): Ruang kerja terstruktur yang mengondensasi bukti relevan dan membuang raw observation noise.
3. Bounded Context Constructor: Membatasi panjang riwayat (H_t) agar tidak terjadi context explosion (mengatasi kegagalan 64K).
4. Role-Decoupled Policy Optimization (RDPO) Credit Allocator: Memisahkan keunggulan kelompok (group advantage) Planner vs Synthesizer.
5. Query-Conditioned Dual Tool Bridge: SerpAPI multi-query search dan query-conditioned document reader.
"""

from dataclasses import dataclass, field
from enum import Enum
from typing import List, Dict, Any, Optional, Tuple, Callable
import json
import re

class AgentRole(str, Enum):
    PLANNER = "planner"
    SYNTHESIZER = "synthesizer"

@dataclass
class PlannerAction:
    thought: str
    action_type: str               # "search", "browse", "answer"
    queries: List[str] = field(default_factory=list)
    urls: List[str] = field(default_factory=list)
    final_answer: Optional[str] = None

@dataclass
class WorkspaceMemory:
    round_idx: int
    core_question: str
    known_facts: List[str] = field(default_factory=list)
    unresolved_subgoals: List[str] = field(default_factory=list)
    active_hypotheses: List[str] = field(default_factory=list)
    key_evidence_snippets: List[Dict[str, str]] = field(default_factory=list)

    def render_markdown(self) -> str:
        lines = [
            f"### Workspace State (Round {self.round_idx})",
            f"**Core Target:** {self.core_question}",
            "**Verified Evidence & Entities:**"
        ]
        if not self.known_facts:
            lines.append("- (Belum ada fakta terverifikasi)")
        else:
            for f in self.known_facts:
                lines.append(f"- {f}")
        
        lines.append("**Pending Knowledge Gaps:**")
        if not self.unresolved_subgoals:
            lines.append("- (Semua celah informasi terpenuhi)")
        else:
            for g in self.unresolved_subgoals:
                lines.append(f"- [ ] {g}")
                
        return "\n".join(lines)

class DualRolePromptTemplate:
    @staticmethod
    def build_planner_prompt(question: str, memory: WorkspaceMemory) -> str:
        return f"""[ROLE: PLANNER]
Anda adalah Planner khusus untuk pemecahan masalah mendalam. Tugas Anda:
1. Menganalisis kondisi memori terkini dan menentukan celah bukti kritis selanjutnya.
2. Memilih tindakan: SEARCH (multi-query), BROWSE (URL spesifik), atau FINAL_ANSWER.
JANGAN membuat ringkasan naratif panjang; fokus pada pemilihan aksi deterministik.

Target Pertanyaan: {question}

Kondisi Memori:
{memory.render_markdown()}

Keluarkan instruksi dalam format JSON:
{{"thought": "...", "action": "search"|"browse"|"answer", "queries": [...], "urls": [...], "answer": null}}
"""

    @staticmethod
    def build_synthesizer_prompt(question: str, current_memory: WorkspaceMemory, raw_observation: str) -> str:
        return f"""[ROLE: SYNTHESIZER]
Anda adalah Synthesizer dan Information Filter. Tugas Anda:
1. Ekstraksi fakta konkret, angka, kutipan, dan data baru dari observasi mentah.
2. Eliminasi total noise eksplorasi, boilerplate HTML, dan informasi tidak relevan.
3. Rekonstruksi dan mutasikan Workspace Memory untuk putaran berikutnya.

Target Pertanyaan: {question}

Memori Sebelumnya:
{current_memory.render_markdown()}

Observasi Mentah Lingkungan (Raw Environment Output):
{raw_observation}

Keluarkan hasil sintesis dalam format JSON yang memperbarui fakta terverifikasi dan sisa celah informasi:
{{"verified_facts_added": [...], "resolved_gaps": [...], "remaining_gaps": [...]}}
"""

class RDPOAdvantageCalculator:
    """
    Role-Decoupled Policy Optimization (RDPO) Advantage Calculator.
    Menghitung keunggulan relatif terpisah antara tindakan Planner dan Synthesizer
    untuk mencegah interferensi gradien (credit diffusion).
    """
    @staticmethod
    def compute_group_advantages(
        rollout_outcomes: List[float],           # Terminal reward r_y (1.0 atau 0.0)
        planner_turn_rubrics: List[List[float]], # Turn-level rubric score per trajectory
        synthesizer_turn_rubrics: List[List[float]],
        alpha: float = 0.6,
        beta: float = 0.4
    ) -> Tuple[List[List[float]], List[List[float]]]:
        n = len(rollout_outcomes)
        mean_outcome = sum(rollout_outcomes) / n if n > 0 else 0.0
        std_outcome = (sum((x - mean_outcome) ** 2 for x in rollout_outcomes) / n) ** 0.5 + 1e-8
        
        normalized_outcomes = [(r - mean_outcome) / std_outcome for r in rollout_outcomes]
        
        planner_adv: List[List[float]] = []
        synthesizer_adv: List[List[float]] = []
        
        for i in range(n):
            traj_outcome_adv = normalized_outcomes[i]
            
            # Planner Advantage: gabungan terminal goal + turn-level query precision
            p_turns = [
                alpha * traj_outcome_adv + beta * p_score
                for p_score in planner_turn_rubrics[i]
            ]
            planner_adv.append(p_turns)
            
            # Synthesizer Advantage: gabungan terminal goal + turn-level information density
            s_turns = [
                alpha * traj_outcome_adv + beta * s_score
                for s_score in synthesizer_turn_rubrics[i]
            ]
            synthesizer_adv.append(s_turns)
            
        return planner_adv, synthesizer_adv

class IterSynthRuntime:
    """
    Runtime Eksekusi IterSynth:
    Menjalankan siklus pencarian mendalam dengan pergantian peran Planner-Synthesizer
    di atas bounded workspace memory terisolasi.
    """
    def __init__(
        self,
        llm_caller: Callable[[str], str],
        search_tool: Callable[[List[str]], str],
        browse_tool: Callable[[List[str]], str],
        max_rounds: int = 12
    ):
        self.llm = llm_caller
        self.search_tool = search_tool
        self.browse_tool = browse_tool
        self.max_rounds = max_rounds

    def execute_deep_search(self, question: str) -> Dict[str, Any]:
        memory = WorkspaceMemory(
            round_idx=0,
            core_question=question,
            known_facts=[],
            unresolved_subgoals=[f"Identifikasi entitas kunci dan data primer untuk: {question}"]
        )
        
        trajectory_log = []
        
        for round_idx in range(1, self.max_rounds + 1):
            memory.round_idx = round_idx
            
            # 1. Fase Planner (Konteks Terbatas)
            planner_prompt = DualRolePromptTemplate.build_planner_prompt(question, memory)
            planner_response = self.llm(planner_prompt)
            
            # Parse tindakan Planner
            try:
                plan_data = json.loads(re.search(r'\{.*\}', planner_response, re.DOTALL).group(0))
            except Exception:
                plan_data = {"action": "search", "queries": [question], "thought": "Fallback search"}
                
            action_type = plan_data.get("action", "search")
            trajectory_log.append({"round": round_idx, "role": "planner", "plan": plan_data})
            
            # Evaluasi terminasi dini jika Planner telah yakin dengan jawaban akhir
            if action_type == "answer" or plan_data.get("answer"):
                return {
                    "status": "success",
                    "rounds": round_idx,
                    "final_answer": plan_data.get("answer"),
                    "final_memory": memory,
                    "trajectory_log": trajectory_log
                }
                
            # 2. Eksekusi Tool Lingkungan
            if action_type == "search":
                queries = plan_data.get("queries", [question])
                raw_obs = self.search_tool(queries)
            elif action_type == "browse":
                urls = plan_data.get("urls", [])
                raw_obs = self.browse_tool(urls)
            else:
                raw_obs = "Aksi tidak dikenali."
                
            # 3. Fase Synthesizer (Ekstraksi Bukti & Denoising Bersih)
            synth_prompt = DualRolePromptTemplate.build_synthesizer_prompt(question, memory, raw_obs)
            synth_response = self.llm(synth_prompt)
            
            try:
                synth_data = json.loads(re.search(r'\{.*\}', synth_response, re.DOTALL).group(0))
            except Exception:
                synth_data = {"verified_facts_added": [raw_obs[:200]], "remaining_gaps": []}
                
            trajectory_log.append({"round": round_idx, "role": "synthesizer", "synthesis": synth_data})
            
            # Mutasi Memori Ruang Kerja (Bounded Update - Tanpa Akumulasi Riwayat Mentah)
            for fact in synth_data.get("verified_facts_added", []):
                if fact not in memory.known_facts:
                    memory.known_facts.append(fact)
                    
            memory.unresolved_subgoals = synth_data.get("remaining_gaps", [])
            
        # Jika mencapai batas round maksimal, minta sintesis jawaban akhir
        final_prompt = f"Berdasarkan seluruh fakta terverifikasi berikut:\n{memory.render_markdown()}\nBerikan jawaban komprehensif dan akurat untuk: {question}"
        final_answer = self.llm(final_prompt)
        
        return {
            "status": "max_rounds_reached",
            "rounds": self.max_rounds,
            "final_answer": final_answer,
            "final_memory": memory,
            "trajectory_log": trajectory_log
        }

6. Kesimpulan: Masa Depan Autonomous Deep Search Tanpa Bottleneck Konteks

Riset IterSynth (arXiv:2609.29444) memberikan pelajaran arsitektural krusial bagi rekayasa agen AI masa depan: memaksa model tunggal menampung riwayat percakapan tak terbatas dalam format ReAct adalah jalan buntu bagi tugas-tugas penelusuran berdurasi panjang.

Dengan membagi siklus penalaran menjadi dua fase terpisah—perencanaan aksi berbasis hipotesis dan penyaringan bukti bebas noise ke dalam memori kerja terstruktur—pengembang dapat membangun agen deep search yang deterministik, kebal terhadap ledakan token jendela konteks, dan mampu menembus skor benchmark model-model raksasa hanya dengan fondasi komputasi berukuran 8B.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.