NS
NEWSAINT
ai-eng• 8 MIN READ•14 September 2026

BeaconKV 2026: Arsitektur Kompresi KV Cache Berpemandu Beacon Queries, Thought Revisiting Tokens (TRT), dan Akselerasi Inferensi Large Reasoning Models Tanpa Retraining

Bedah arsitektur mendalam atas inovasi frontier arXiv:2609.04971 (September 2026, Janghyeon Kim, Minsoo Kim, Kyuhong Shim, Jungwook Choi - AIHA Lab & OpenReview bgAbffQCrL): Mengapa metode kompresi KV cache konvensional (H2O, SnapKV, StreamingLLM) runtuh ketika diterapkan pada Large Reasoning Models (LRMs) dengan rantai penalaran panjang (Chain-of-Thought). Penemuan empiris Thought Revisiting Tokens (TRT) membuktikan bahwa recent query bukanlah proksi reliabel untuk atensi masa depan karena model penalaran secara periodik menengok kembali rencana awal (early context). BeaconKV menghadirkan paradigma training-free berbasis Continual Furthest Point Sampling (FPS) pada pre-RoPE query space, dual attention scoring, dan group_max head aggregation untuk memangkas konsumsi VRAM hingga 5.8x, melejitkan throughput 4.3x+, seraya mempertahankan akurasi penalaran mendekati 100% pada benchmark AIME 2024, MATH, GPQA, dan LiveCodeBench.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 BeaconKV 2026: Arsitektur Kompresi KV Cache Berpemandu Beacon Queries, Thought Revisiting Tokens (TRT), dan Akselerasi Inferensi Large Reasoning Models Tanpa Retraining
Breakthrough Inovasi Inferensi AI · Large Reasoning Models (LRMs)

Makalah frontier AIHA Lab arXiv:2609.04971 (September 2026, Janghyeon Kim, Minsoo Kim, Kyuhong Shim, Jungwook Choi) memecahkan dinding memori inferensi penalaran panjang. Dengan membongkar fenomena Thought Revisiting Tokens (TRT), para peneliti membuktikan bahwa algoritma kompresi KV cache konvensional memicu amnesia struktural. Melalui BeaconKV, sistem inferensi mempertahankan beacon queries via Continual FPS, memangkas konsumsi VRAM GPU hingga 5.8x, mendongkrak throughput 4.3x+, tanpa memerlukan pelatihan ulang ataupun mengorbankan ketepatan penalaran matematika dan kode.

1. Ledakan Token Chain-of-Thought (CoT) dan Krisis OOM pada GPU Inferensi

Kelahiran generasi Large Reasoning Models (LRMs)—dipelopori oleh terobosan seperti OpenAI o1/o3, DeepSeek-R1, dan Qwen3 Thinking—telah mengubah paradigma inferensi kecerdasan buatan. Tidak seperti model autoregresif generasi teks standar yang memuntahkan respons instan dalam beberapa ratus token, model penalaran tingkat lanjut mengalokasikan test-time compute dalam skala masif. Model-model ini merumuskan hipotesis, menguji logika alternatif, mengevaluasi bukti secara rekursif, dan memperbaiki langkah kalkulasi yang salah melalui rantai penalaran Chain-of-Thought (CoT) yang kerap membentang melampaui 32.000 hingga 128.000 token per permintaan tunggal.

Secara teoretis, peningkatan panjang rantai berpikir ini menghasilkan lonjakan kemampuan pemecahan masalah matematika olimpiade, pembuktian teorema, dan sintesis kode berskala repositori. Namun, di lantai pusat data dan klaster komputasi produksi, fenomena ini menimbulkan bencana infrastruktur: bottleneck memori Key-Value (KV) Cache.

Formula Konsumsi VRAM KV Cache per Batched Sequence
Memori_KV = 2 × N_layers × N_kv_heads × D_head × S_seq × B_size × Bytes_per_element

Pada model 70B parameter dengan 64 layer, 8 head KV (Grouped-Query Attention), head dimension 128, dan presisi BF16 (2 byte per elemen), sebuah trace penalaran sepanjang 64K token membutuhkan lebih dari 16 GB VRAM murni hanya untuk menyimpan KV cache satu sesi pengguna. Ketika batch size dinaikkan ke 8 atau 16 untuk melayani concurrent requests, kebutuhan memori langsung melampaui kapasitas 80 GB GPU NVIDIA H100, memicu Out of Memory (OOM) atau menjatuhkan throughput sistem hingga ke titik beku.

2. Anatomi Cacat Asumsi: Mengapa H2O, SnapKV, dan StreamingLLM Runtuh pada LRMs

Sebelum kemunculan BeaconKV, komunitas rekayasa machine learning mengandalkan serangkaian teknik kompresi dan pemangkasan KV cache statis atau semi-dinamis, antara lain:

StreamingLLM / Sink Tokens

Attention Sinks + Local Window

Hanya mempertahankan 4 token awal pertama (attention sink) ditambah sliding window lokal beberapa ratus token terakhir. Seluruh token di tengah dibuang seketika tanpa analisis bobot.

Status LRM: Kegagalan Fatal (Akurasi AIME turun >80%)
H2O (Heavy Hitter Oracle)

Cumulative Attention Scores

Mengakumulasikan skor atensi masa lalu dari seluruh query decoding untuk menentukan token mana yang paling sering dilihat, lalu mengeliminasi token dengan skor akumulatif rendah.

Status LRM: Bias Resensi Buruk & Cache Thrashing
SnapKV / RoCo / PyramidKV

Observation Window Matching

Menggunakan segelintir query dari ujung jendela prefill untuk memilih klaster key yang penting, lalu membekukan pilihan tersebut selama proses generasi berjalan.

Status LRM: Tidak Mampu Menghadapi Pergeseran Topik Panjang

Mengapa pendekatan-pendekatan tersebut runtuh secara spektakuler ketika diterapkan pada model penalaran murni seperti DeepSeek-R1 atau Qwen3? Riset Kim et al. (2026) mengungkapkan akar masalahnya: seluruh algoritma terdahulu bersandar pada asumsi dasar bahwa "kueri terbaru (recent queries) adalah representasi proksi yang valid untuk kebutuhan atensi masa depan".

Pada tugas obrolan biasa (chat) atau ringkasan teks pendek, asumsi kelokalan temporal ini berlaku wajar. Namun, pada proses pemecahan masalah ilmiah tingkat tinggi, dinamika kognitif model bekerja dengan cara yang sangat berbeda.

3. Fenomena Thought Revisiting Tokens (TRT) dan Klasterisasi Embedding Space

Melalui investigasi empiris mendalam atas ribuan trace generasi reasoning pada dataset AIME dan GPQA, para peneliti BeaconKV menemukan eksistensi pola unik yang mereka namai: Thought Revisiting Tokens (TRT).

Dalam rantai berpikir otonom, model tidak bergerak linier. Ketika model menghadapi jalan buntu dalam kalkulasi aljabar atau menemukan kontradiksi pada langkah ke-12.000, model akan menghasilkan serangkaian token refleksi—seperti "Wait, let me double check the initial constraints..." atau "Alternatively, consider the lemma from step 2...". Pada momen decoding TRT tersebut, query attention secara mendadak mengalihkan fokus dari konteks lokal dan menembak langsung ke token-token awal di masa lalu yang sangat jauh (distant early context), khususnya:

  • Pernyataan batasan masalah dan definisi variabel awal yang dirumuskan di awal prompt.
  • Rencana aksi strategis (high-level plan) yang diputuskan di fase awal penalaran.
  • Hasil perhitungan intermediate krusial yang menjadi jangkar pembuktian selanjutnya.

• Wawasan Geometri Ruang Embedding (Embedding Space Clustering)

Jika model membutuhkan token masa lalu yang jauh, apakah kita harus menyimpan seluruh riwayat query masa lalu? Ternyata tidak. Analisis spektral dan visualisasi t-SNE menunjukkan bahwa kueri-kueri yang memicu Thought Revisiting Tokens (TRT) tidak tersebar acak, melainkan terkonsentrasi ke dalam sejumlah kecil klaster representatif di dalam ruang embedding sudut (angular cosine space).

Cluster(Q_TRT) ⊂ Sparse Manifold di R^(D_head) → Dapat diwakili oleh K titik mercusuar ("Beacon Queries").

4. Arsitektur Inti BeaconKV: Continual Furthest Point Sampling (Continual FPS)

Bertolak dari wawasan geometri tersebut, BeaconKV merumuskan mekanisme inferensi pintar yang sepenuhnya training-free (bebas fine-tuning) dan tidak mengubah bobot dasar model sama sekali. Alih-alih membiarkan KV cache membengkak tanpa batas atau memangkasnya secara buta, BeaconKV mempertahankan sejumlah kecil Beacon Queries ($Q_{beacon}$) yang berfungsi sebagai radar sensorik penunjuk token penting.

Sistem BeaconKV bekerja dalam siklus hidup tiga tahap:

1

Inisialisasi Prefill via Iterative Furthest Point Sampling

Pada saat fase prompt prefill selesai dievaluasi, matriks kueri dari prompt diekstraksi. Algoritma Furthest Point Sampling (FPS) dijalankan untuk memilih sejumlah $N_{beacon}$ kueri yang memiliki sudut kemiripan kosinus terjauh satu sama lain, mengunci cakupan representasi semantik awal.

2

Continual FPS Resampling pada Fase Decoding

Selama tahap token decoding berlanjut, setiap query baru disisipkan ke dalam buffer sementara (pre-RoPE query buffer). Ketika buffer kueri mencapai batas kapasitas maksimum ($N_{beacon} + N_{recent}$), BeaconKV mengeksekusi Continual FPS untuk meresampling ulang set beacon queries. Hal ini memastikan beacon senantiasa beradaptasi mengikuti evolusi topik penalaran yang dinamis tanpa membengkakkan memori.

3

Pre-RoPE Storage dengan Just-In-Time Positional Alignment

Kueri disimpan dalam bentuk asli sebelum Rotary Position Embedding (Pre-RoPE). Ketika kompresi KV hendak dieksekusi, RoPE diaplikasikan secara on-the-fly dengan menyelaraskan posisi virtual beacon queries ke posisi token saat ini. Hal ini menghilangkan degradasi jarak atensi akibat offset posisi yang basi.

5. Dual-Scoring Retention & Group Max Aggregation pada Grouped Query Attention (GQA)

Ketika panjang deret token melampaui batas anggaran KV yang ditetapkan (budget $B_{token}$), BeaconKV melakukan penilaian retensi secara elegan melalui formula Dual-Scoring Attention:

// Matriks Kueri Aktif Evaluasi:
Q_eval = Concatenate( ApplyRoPE(Q_beacon, pos_now), ApplyRoPE(Q_recent, pos_recent) )
// Skor Retensi Tiap Token Lampau (i ∈ [prefix_len, seq_len - recent_len]):
S_i = Max_{q ∈ Q_eval} [ HeadAggregation( AttnWeight(q, K_i) ) ]

Karakteristik kunci dari mekanisme eliminasi ini meliputi:

  • Perlindungan Tiga Zona: Struktur urutan KV cache selalu dipartisi menjadi 3 zona: [Prefix Masked, Top-K Preserved Candidates, Recent Sliding Window]. Prefix pertanyaan asli dan jendela token paling baru tidak pernah dibuang guna menjaga kelancaran sintaksis lokal.
  • Head Aggregation via Group Max: Untuk model-model modern yang mengadopsi Grouped Query Attention (GQA) di mana 1 head KV melayani 4 atau 8 query heads, BeaconKV menghitung skor maksimum pada dimensi grup head (group_max), memastikan head KV tidak tereliminasi jika ada salah satu head kueri pasangannya yang masih membutuhkannya.
  • Top-K Gather Selektif: Hanya kandidat token dengan skor $S_i$ tertinggi yang dipertahankan dalam tensor terkompresi menggunakan operasi PyTorch torch.gather berakselerasi CUDA.

6. Implementasi Referensi Produksi: BeaconKV Core Engine & PyTorch Patching

Berikut adalah modul arsitektur referensi lengkap yang menyematkan logika BeaconKV ke dalam inference runtime model transformer modern:

engine/beaconkv_compression.py PyTorch 2.4+ / CUDA 12.4+
"""
BeaconKV Production Core Engine: Continual FPS & Dual-Scoring KV Cache Compression
Berdasarkan Arsitektur Resmi arXiv:2609.04971 (Kim et al., AIHA Lab)
Mendukung FlashAttention-2, Group Max Aggregation, dan Pre-RoPE Continual Sampling.
"""

import torch
import torch.nn.functional as F
from typing import Optional, Tuple

class BeaconKVCacheCompressor:
    """
    Manajer kompresi KV Cache berpemandu Beacon Queries.
    Mempertahankan query perwakilan klaster embedding menggunakan Continual Furthest Point Sampling (FPS)
    dan mengeksekusi eviksi terarah pada KV cache tanpa membutuhkan training ulang.
    """
    def __init__(
        self,
        max_batch_size: int,
        max_input_len: int,
        decode_max_budget: int,
        decode_min_budget: int,
        num_recent_queries: int,
        num_beacon_queries: int,
        num_attention_heads: int,
        head_dim: int,
        device: torch.device,
        dtype: torch.dtype = torch.bfloat16,
    ):
        self.max_batch_size = max_batch_size
        self.max_input_len = max_input_len
        self.decode_max_budget = decode_max_budget
        self.decode_min_budget = decode_min_budget
        self.num_recent_queries = num_recent_queries
        self.num_beacon_queries = num_beacon_queries
        self.num_max_queries = num_recent_queries + num_beacon_queries
        self.num_attention_heads = num_attention_heads
        self.head_dim = head_dim
        self.device = device
        self.dtype = dtype

        # Pre-RoPE query buffer shape: [B, H, Q_max, D]
        query_cache_shape = (
            self.max_batch_size,
            self.num_attention_heads,
            self.num_max_queries,
            self.head_dim,
        )
        self.query_cache = torch.zeros(query_cache_shape, dtype=self.dtype, device=self.device)
        self.query_counter = 0

    def update_pre_rope_query(
        self,
        query_states: torch.Tensor,
        current_kv_len: int,
        is_prefill: bool,
        attention_mask: Optional[torch.Tensor] = None,
    ) -> None:
        """
        Memperbarui query cache pre-RoPE secara continual.
        Pada tahap prefill: inisialisasi beacon queries dari prompt.
        Pada tahap decode: akumulasi query recent dan continual resampling saat buffer penuh.
        """
        if is_prefill:
            # Inisialisasi beacon queries awal via FPS dari prompt prefill
            self.query_cache[:, :, :self.num_beacon_queries, :] = self._farthest_point_sampling(
                query_states, self.num_beacon_queries, attention_mask
            )
            self.query_counter = self.num_beacon_queries
            return

        # Fase decoding: periksa apakah buffer melebihi kapasitas
        if (current_kv_len - self.max_input_len) <= self.decode_max_budget:
            if self.query_counter == self.num_max_queries:
                # Refresh klaster beacon queries secara on-the-fly (Continual FPS)
                self.query_cache[:, :, :self.num_beacon_queries, :] = self._farthest_point_sampling(
                    self.query_cache[:, :, :self.query_counter, :],
                    self.num_beacon_queries,
                    attention_mask=None,
                )
                self.query_counter = self.num_beacon_queries

            # Sisipkan decode query terbaru ke slot recent
            self.query_cache[:, :, self.query_counter, :] = query_states.squeeze(2)
            self.query_counter += 1

    def _farthest_point_sampling(
        self,
        query_states: torch.Tensor,
        num_samples: int,
        attention_mask: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:
        """
        Continual Furthest Point Sampling (FPS) berbasis Cosine Similarity.
        Memilih titik representatif yang memaksimalkan jarak sudut antar vektor kueri.
        Kompleksitas: O(Q^2) dengan precomputed Gram Matrix.
        """
        batch_size, num_heads, num_queries, head_dim = query_states.shape
        if num_queries <= num_samples:
            return query_states

        num_groups = batch_size * num_heads
        q_flat = query_states.reshape(num_groups, num_queries, head_dim)
        q_norm = F.normalize(q_flat, p=2, dim=-1)

        # Hitung pairwise similarity matrix: [num_groups, Q, Q]
        sim_matrix = torch.bmm(q_norm, q_norm.transpose(-2, -1))
        
        # Cari titik awal: kueri dengan rata-rata kemiripan terendah terhadap kueri lainnya
        mean_sim = sim_matrix.mean(dim=2)
        start_idx = mean_sim.argmin(dim=-1)

        selected_indices = torch.empty(num_groups, num_samples, dtype=torch.long, device=self.device)
        selected_indices[:, 0] = start_idx

        # Inisialisasi pelacak kemiripan maksimum (similairest distance)
        g_idx = torch.arange(num_groups, device=self.device)
        max_sim = sim_matrix[g_idx, start_idx] # [num_groups, Q]

        for i in range(1, num_samples):
            # Titik berikutnya adalah titik yang memiliki kemiripan maksimum paling rendah (furthest point)
            next_idx = max_sim.argmin(dim=-1)
            selected_indices[:, i] = next_idx
            
            # Perbarui jarak batas
            curr_sim = sim_matrix[g_idx, next_idx]
            max_sim = torch.maximum(max_sim, curr_sim)

        # Kumpulkan tensor kueri terpilih
        gather_idx = selected_indices.unsqueeze(-1).expand(-1, -1, head_dim)
        sampled_q = torch.gather(q_flat, dim=1, index=gather_idx)
        return sampled_q.reshape(batch_size, num_heads, num_samples, head_dim)

    def compress_kv_cache(
        self,
        key_states: torch.Tensor,
        value_states: torch.Tensor,
        min_token_budget: int,
        kv_prefix_len: int,
        kv_recent_len: int,
        post_rope_beacon_and_recent_queries: torch.Tensor,
    ) -> Tuple[torch.Tensor, torch.Tensor]:
        """
        Menjalankan seleksi retensi KV cache:
        1. Menghitung matriks atensi antara queries (beacons + recent) dan key states.
        2. Menerapkan group_max head aggregation untuk mengakomodasi Grouped Query Attention (GQA).
        3. Menjaga prefix prompt asli dan local recent sliding window utuh.
        4. Mengeliminasi token intermediate yang tidak pernah dikunjungi kembali oleh beacon queries.
        """
        batch_size, num_kv_heads, seq_len, head_dim = key_states.shape
        remaining_budget = min_token_budget - (kv_prefix_len + kv_recent_len)
        
        if remaining_budget <= 0:
            return key_states, value_states

        # Hitung skor atensi teragregasi
        # [B, H_q, Q_active, S] @ [B, H_kv, S, D] -> skor perhatian
        scores = torch.einsum('bhqd,bksd->bhqs', post_rope_beacon_and_recent_queries, key_states)
        scores = scores / (head_dim ** 0.5)

        # Aggregasi Group Max untuk query groups pada GQA
        num_query_heads = post_rope_beacon_and_recent_queries.shape[1]
        group_size = num_query_heads // num_kv_heads
        scores = scores.view(batch_size, num_kv_heads, group_size, -1, seq_len)
        scores = scores.max(dim=2).values # Reduksi group_size
        scores = scores.max(dim=2).values # Reduksi kueri (beacon + recent max)

        # Ambil hanya area kompresi (antara prefix dan recent window)
        eviction_candidate_scores = scores[:, :, kv_prefix_len:seq_len - kv_recent_len]
        
        # Top-K pemilihan token esensial berdasarkan skor tertinggi
        topk_indices = eviction_candidate_scores.topk(remaining_budget, dim=-1, largest=True).indices
        sorted_topk_indices = topk_indices.sort(dim=-1).values + kv_prefix_len

        # Susun indeks gabungan: [Prefix, Top-K Preserved, Recent Window]
        prefix_idx = torch.arange(kv_prefix_len, device=self.device).expand(batch_size, num_kv_heads, -1)
        recent_idx = torch.arange(seq_len - kv_recent_len, seq_len, device=self.device).expand(batch_size, num_kv_heads, -1)
        final_indices = torch.cat([prefix_idx, sorted_topk_indices, recent_idx], dim=-1)

        # Ekstrak KV cache terkompresi
        gather_indices = final_indices.unsqueeze(-1).expand(-1, -1, -1, head_dim)
        compressed_k = torch.gather(key_states, dim=2, index=gather_indices)
        compressed_v = torch.gather(value_states, dim=2, index=gather_indices)

        return compressed_k, compressed_v

Integrasi ke model HuggingFace Transformers (seperti arsitektur Qwen2ForCausalLM atau LlamaForCausalLM) dilakukan dengan mem-patch method forward pada layer atensi, di mana cache_compressor.update_pre_rope_query() dipanggil sebelum aplikasi rotasi posisional RoPE, dan fungsi kompresi KV dijalankan saat token decode mencapai ambang batas batas budget.

7. Evaluasi Komprehensif: Benchmark AIME 2024, MATH, GPQA, dan LiveCodeBench

Tim peneliti mengevaluasi efektivitas BeaconKV pada empat model open-source mutakhir: DeepSeek-R1-Distill-Qwen-7B, DeepSeek-R1-Distill-Llama-8B, Qwen3-4B, dan Qwen3-14B. Evaluasi dilakukan lintas empat domain benchmark penalaran paling ketat di industri:

Metode Kompresi Kompresi Memori KV Throughput Decode AIME 2024 (Math) LiveCodeBench (Pass@1) GPQA Diamond
Full KV Cache (Baseline) 1.0x (100% VRAM) 1.0x (Baseline) 55.5% 65.2% 49.1%
StreamingLLM (Sink+Local) 5.8x 4.1x 9.3% (-46.2%) 18.4% (-46.8%) 22.0% (-27.1%)
H2O (Heavy Hitter) 5.0x 3.4x 38.2% (-17.3%) 49.7% (-15.5%) 39.5% (-9.6%)
SnapKV 5.2x 3.8x 41.0% (-14.5%) 51.2% (-14.0%) 41.8% (-7.3%)
BeaconKV (Ours) 5.8x Hemat VRAM 4.3x+ Speedup 54.8% (-0.7%) 64.6% (-0.6%) 48.9% (-0.2%)

Data empiris di atas membuktikan sebuah lompatan fundamental:

  • Preservasi Akurasi Hampir Sempurna: Pada kompresi ekstrim (anggaran budget cache hanya ~17% dari total panjang deret asli / hemat memori 5.8x), degradasi akurasi BeaconKV pada tugas matematika olimpiade AIME 2024 hanya sebesar 0.7 poin persentase, dan kurang dari 0.6 poin pada sintesis kode LiveCodeBench.
  • Kekebalan dari Kegagalan Katastrofik: Berbeda dengan StreamingLLM yang runtuh total (kehilangan lebih dari 80% kemampuan nalarnya) akibat membuang rencana awal, BeaconKV berhasil menjaga token jangkar berkat pemanduan beacon queries.
  • Peningkatan Throughput Riil 4.3x+: Penurunan ukuran KV cache yang drastis melonggarkan bandwidth memori GPU (memory bandwidth bound decoding), melipatgandakan kecepatan transfer data HBM ke compute core Tensor, dan memungkinkan batch size yang jauh lebih besar pada satu kartu akselerator yang sama.

8. Rekomendasi Deployment Produksi: Menghubungkan BeaconKV ke vLLM, SGLang, dan NVMe Tiering

Bagi tim AI Engineering dan penyedia platform inferensi model reasoning berskala besar, penerapan BeaconKV menawarkan strategi efisiensi biaya infrastruktur (TCO) yang sangat substansial. Berikut adalah panduan arsitektural untuk mengadopsi BeaconKV ke dalam ekosistem inferensi modern:

A Integrasi vLLM PagedAttention & Block Manager

Pada engine seperti vLLM, BeaconKV dapat diintegrasikan pada level Virtual Block Allocator. Alih-alih melakukan preemptive eviction atau swap seluruh sequence ke host RAM saat VRAM penuh, vLLM dapat memicu kompresi in-place: token yang tidak dipilih oleh beacon queries dilepaskan dari block tables secara instan, mengembalikan blok fisik VRAM ke shared memory pool tanpa jeda koneksi.

B Sinergi Tiering Eksternal NVMe SSD (py-kvcache)

Mengombinasikan BeaconKV dengan sistem external tiering seperti py-kvcache (arXiv:2609.11744) menciptakan arsitektur bertingkat yang optimal: token esensial dengan retensi tinggi tetap berada di VRAM GPU ultra-cepat, sementara blok token non-beacon di-stream ke NVMe SSD via asynchronous io_uring sebagai fallback jika terjadi penyelaman rute reasoning alternatif yang tidak terduga.

Kesimpulan Redaksi NEWSAINT

Di era Large Reasoning Models, tantangan utama inferensi telah bergeser dari sekadar optimasi latensi token pertama (TTFT) menjadi efisiensi eksekusi token jangka panjang (long-horizon decoding efficiency). Penemuan fenomena Thought Revisiting Tokens (TRT) oleh Kim et al. membuktikan bahwa model cerdas tidak berpikir secara sekuensial searah, melainkan membutuhkan jembatan memori non-lokal ke rencana masa lalu.

Dengan formula Beacon Queries + Continual Furthest Point Sampling, BeaconKV berhasil membuktikan bahwa kita tidak perlu mengorbankan ketajaman intelektual model demi menghemat memori. Arsitektur training-free ini menjadi standar baru yang wajib diperhatikan oleh setiap praktisi infrastruktur AI modern di tahun 2026.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.