MISVO 2026: Arsitektur Minimally Invasive Steering Vector Optimization, Fisher Information Geometry pada Pre-Logit Hidden States, dan Eliminasi Degradasi Koherensi Test-Time Alignment Tanpa Update Bobot LLM
Analisis arsitektur sistemik riset frontier AI alignment & representation steering (arXiv:2609.30218, 24 September 2026): Mengapa adaptasi model bahasa saat inferensi (test-time alignment) melalui pre-logit steering konvensional kerap merusak kefasihan, memicu repetisi semantik, dan melipatgandakan perplexity secara katastropik. Makalah ini membongkar keterbatasan mendasar penalti Euclidean isotropik, lalu memperkenalkan Minimally Invasive Steering Vector Optimization (MISVO) yang merumuskan penalti intervensi menggunakan geometri kelengkungan lokal KL divergence berbasis Fisher Information Matrix. Melalui dekomposisi eksak gradien level-sekuens (Theorem 1), dibuktikan bahwa suku suffix score-function adalah berorde kedua O(||u||^2), sehingga surigat Fisher berbasis model acuan beku mencocokkan gradien KL penuh hingga orde pertama. Dengan formulasi produk matriks-vektor Fisher bebas matriks (matrix-free), MISVO mengeliminasi alokasi memori berlebih dan mencapai reward tertinggi pada 6 dari 7 konfigurasi benchmark (Stanford Human Preferences & MBPP+ code generation) pada model 1B-14B parameter tanpa memperbarui satupun parameter bobot model.

Dalam evolusi rekayasa model bahasa terdepan (frontier LLM), kebutuhan untuk menyelaraskan model terhadap preferensi pengguna yang dinamis, batasan kebijakan domain spesifik, dan sinyal evaluasi waktu nyata (real-time evaluators) telah mendorong pergeseran besar dari training-time alignment statis menuju test-time alignment. Selama bertahun-tahun, paradigma dominan bergantung pada pembaruan bobot permanen melalui RLHF, PPO, atau DPO. Namun, ketika model telah dideploy di lingkungan produksi berskala masif, memperbarui miliaran hingga triliunan parameter untuk setiap variasi konteks pengguna adalah kemustahilan komputasi.
Pendekatan alternatif yang sangat menjanjikan adalah representation steering (atau activation steering), di mana representasi laten model dimodifikasi secara dinamis saat inferensi dengan menambahkan vektor intervensi $u_t$ pada status tersembunyi pre-logit $h_t$ sebelum memasuki lapisan unembedding: $z_t = W(h_t + u_t) + b$. Pendekatan ini memungkinkan modifikasi perilaku generasi model secara instan tanpa menyentuh satupun bobot model dasar.
Mengapa Pre-Logit Steering Konvensional Menghancurkan Kualitas Generasi
Meskipun tampak elegan, optimasi vektor steering konvensional yang tidak diregularisasi atau hanya dibatasi oleh penalti jarak Euclidean standar (norma $L_2$: $\frac{1}{2}\|u_t\|_2^2$) hampir selalu berujung pada degradasi katastropik:
- Perplexity Explosion & Out-of-Distribution Drift: Mengoptimalkan vektor steering hanya untuk memaksimalkan skor reward mendorong status laten keluar dari manifold representasi alami model. Akibatnya, nilai perplexity melonjak hingga 3.4x lipat dan model mulai menghasilkan teks nonsens atau halusinasi berulang.
- Loss of Syntactic Coherence & Semantic Repetition: Penalti Euclidean memperlakukan semua arah dalam ruang representasi laten secara setara (isotropik). Padahal, geometri probabilitas token sangat anisotropik: pergeseran kecil pada arah tertentu dapat menjungkirbalikkan distribusi kosakata secara ekstrem, memicu mode collapse.
- High Variance of Trajectory Score-Function Estimators: Upaya membatasi deviasi menggunakan divergensi Kullback-Leibler (KL) level-sekuens secara naif membutuhkan penaksir gradien bertipe REINFORCE. Pada horizon generasi panjang ($T \ge 128$), variansi penaksir ini meledak, membuat konvergensi optimasi test-time menjadi tidak stabil.
Terobosan fundamental hadir melalui publikasi riset teranyar dari tim peneliti Johns Hopkins University (arXiv:2609.30218, 24 September 2026) berjudul "Minimally Invasive Steering of Language Models". Riset ini memperkenalkan kerangka MISVO (Minimally Invasive Steering Vector Optimization). Alih-alih menggunakan jarak Euclidean yang buta terhadap distribusi output, MISVO meregularisasi intervensi pre-logit menggunakan geometri kelengkungan lokal yang ditentukan oleh Fisher Information Matrix (FIM).
1. Geometri Riemannian KL Divergence & Kegagalan Penalti Isotropik
Secara formal, pertimbangkan model bahasa acuan beku $\pi_{\text{ref}}$ dengan matriks bobot proyeksi unembedding $W \in \mathbb{R}^{V \times d}$ dan bias $b \in \mathbb{R}^V$, di mana $V$ adalah ukuran kosakata dan $d$ adalah dimensi status tersembunyi. Untuk prompt $x$ dan respons sekuensial $y = (y_1, \dots, y_T)$, distribusi token referensi pada posisi $t$ didefinisikan sebagai:
Ketika kita menyuntikkan vektor intervensi posisi $u_t \in \mathbb{R}^d$, distribusi token yang terinduksi menjadi:
Tujuan dari KL-regularized test-time alignment adalah menyelesaikan optimasi:
Mengapa mengganti penalti KL dengan penalti Euclidean $\frac{1}{2} \sum_t \|u_t\|_2^2$ berakibat fatal? Karena metrik Euclidean mengasumsikan ruang laten berjarak seragam. Dalam kenyataannya, manifold probabilitas adalah ruang Riemannian di mana metrik fundamentalnya ditentukan oleh Fisher Information Metric.
Berdasarkan ekspansi Taylor orde kedua dari fungsi partisi logaritmik $A(z) = \log \sum_{i=1}^V e^{z_i}$, divergensi KL level-token di sekitar $u_t = 0$ memenuhi relasi asimtotik:
di mana matriks simetris semidefinit positif $F_t(u_t) \in \mathbb{R}^{d \times d}$ adalah Fisher Information Matrix terhadap vektor intervensi $u_t$:
Matriks kovariansi kovariat $C_{\pi} := \text{diag}(\pi) - \pi \pi^\top$ secara langsung mencerminkan sensitivitas distribusi probabilitas terhadap perturbasi logit. Penalti berbasis bentuk kuadratik Fisher $\frac{1}{2} u_t^\top F_t u_t$ secara presisi menghukum pergeseran pada arah laten yang paling sensitif terhadap probabilitas token kosakata, sekaligus memberikan kebebasan eksplorasi penuh pada arah-arah laten yang invarian.
2. Landasan Teori: Teorema Dekomposisi Gradien KL Level-Sekuens (Theorem 1)
Tantangan teoretis terbesar dalam menerapkan penalti kuadratik per-token pada sekuens autoregresif adalah bahwa prefix $y_{<t}$ itu sendiri dihasilkan oleh kebijakan yang telah terperturbasi $\pi_u$. Apakah mengabaikan ketergantungan sekuensial ini akan merusak gradien regulasi?
Peneliti MISVO membuktikan teorema dekomposisi fundamental yang membongkar anatomi gradien KL level-sekuens:
Dekomposisi Eksak Gradien KL Autoregresif
Untuk setiap posisi token $t \in \{1, \dots, T\}$, gradien dari divergensi KL sekuensial penuh terhadap vektor steering $u_t$ terurai secara eksak menjadi dua suku:
di mana $\ell_{>t}(y; u) := \sum_{\tau = t+1}^T \log \frac{\pi_u(y_\tau \mid x, y_{<\tau})}{\pi_{\text{ref}}(y_\tau \mid x, y_{<\tau})}$ merepresentasikan log-likelihood ratio dari sufiks lintasan masa depan.
Dekomposisi ini mengungkapkan fakta matematis yang sangat elegan: suku pertama ($g_t^{\text{an}}$) adalah kontribusi lokal deterministik yang dapat dihitung secara eksak tanpa variansi Monte-Carlo. Sementara suku kedua ($g_t^{\text{suffix}}$) adalah efek kovariansi terhadap generasi masa depan.
Lebih lanjut, dalam Proposition 2 makalah tersebut, penulis membuktikan bahwa untuk horizon tetap $T$, suku sufiks memenuhi batas:
Artinya, di sekitar titik awal inferensi ($u = 0$), suku sufiks yang berisik tersebut adalah suku berorde kedua! Dengan demikian, surigat Fisher berbasis model acuan beku $\bar{F}_t := \mathbb{E}_{y_{<t} \sim \pi_{\text{ref}}}[F_t(0)]$ mencocokkan gradien divergensi KL penuh hingga ekspansi Taylor orde pertama:
Temuan ini memberikan justifikasi teoretis yang sangat kokoh: kita dapat membuang suku sufiks yang menyebabkan variansi Monte-Carlo meledak, dan menggantikannya dengan gradien regulasi kuadratik deterministik yang stabil secara numerik.
3. Arsitektur Matrix-Free Fisher-Vector Products: Zero Memory Overhead
Hambatan praktis terbesar dari Information Geometry pada model bahasa modern adalah skala matriks Fisher. Pada model seperti Llama-3-8B atau Phi-4 (14B), dimensi status tersembunyi $d$ bernilai antara $4096$ hingga $5120$, dan ukuran kosakata $V$ mencapai $128.000$ hingga $256.000$.
Membuat dan menyimpan matriks Fisher eksplisit berukuran $d \times d$ membutuhkan memori:
Untuk sekuens sepanjang $T = 256$ token, alokasi memori akan membengkak hingga lebih dari $17.1 \text{ GB}$ hanya untuk menyimpan matriks regulasi! Selain itu, menghitung $F_t = W^\top C W$ secara naif membutuhkan $\mathcal{O}(d^2 V)$ perkalian floating-point, yang akan melumpuhkan kecepatan inferensi.
MISVO memecahkan kendala ini secara brilian dengan merumuskan Matrix-Free Fisher Products. Karena algoritma optimasi berbasis gradien hanya memerlukan hasil kali matriks-vektor $F_t u_t$, produk ini dapat dihitung tanpa pernah mengkonstruksi matriks $d \times d$ ataupun $V \times V$:
Formulasi Matrix-Free Fisher-Vector Product
Diberikan distribusi probabilitas token $p \in \mathbb{R}^V$, vektor intervensi $u_t \in \mathbb{R}^d$, dan matriks kepala LM $W \in \mathbb{R}^{V \times d}$:
- Hitung proyeksi logit: $\delta = W u_t \in \mathbb{R}^V$ [Kompleksitas: $\mathcal{O}(V d)$]
- Hitung skalar ekspektasi: $\alpha = p^\top \delta = \sum_{i=1}^V p_i \delta_i$ [Kompleksitas: $\mathcal{O}(V)$]
- Bentuk vektor selisih terbobot: $m = p \odot \delta - \alpha p \in \mathbb{R}^V$ [Kompleksitas: $\mathcal{O}(V)$]
- Proyeksikan kembali ke ruang laten: $F_t u_t = W^\top m \in \mathbb{R}^d$ [Kompleksitas: $\mathcal{O}(V d)$]
Dengan formulasi matrix-free ini, evaluasi penalti Fisher hanya memerlukan dua operasi perkalian matriks-vektor dengan bobot unembedding yang sudah berada di VRAM GPU. Overhead komputasi regulasi menurun drastis menjadi kurang dari 4% dari total waktu forward pass model.
4. Algoritma Optimasi MISVO: Stochastic Ascent Berpemandu Fisher
Pipeline eksekusi MISVO beroperasi dalam siklus iteratif yang ringkas selama inferensi. Untuk setiap prompt masukan $x$:
- Inisialisasi Vektor Intervensi: Tetapkan $u_t^{(0)} = 0$ untuk setiap posisi $t \in \{1, \dots, T\}$. Hitung distribusi probabilitas token referensi beku $\pi_{\text{ref}}(\cdot \mid x, y_{<t})$.
- Rollout Sampling: Pada iterasi ke-$m$, generate $K$ respons independen $y^{(1)}, \dots, y^{(K)} \sim \pi_{u^{(m)}}$.
- Evaluasi Reward: Hitung reward skalar $R_k = R(x, y^{(k)})$ menggunakan reward model eksternal, verifikator unit test, atau heuristik domain.
-
Estimasi Gradien Reward: Hitung gradien arah kebijakan:
$$g_t^R = \frac{1}{K} \sum_{k=1}^K (R_k - \bar{R}) \, W^\top (e_{y_t^{(k)}} - p_t^{(k)})$$
-
Pembaruan Geometris Fisher: Perbarui vektor intervensi menggunakan gradien gabungan:
$$u_t^{(m+1)} = u_t^{(m)} + \eta \left( g_t^R - \lambda \, \bar{F}_t u_t^{(m)} \right)$$di mana $\bar{F}_t u_t^{(m)}$ dievaluasi menggunakan mesin matrix-free tanpa alokasi matriks.
5. Evaluasi Kinerja Empiris: Benchmark SHP & MBPP+ pada 4 Keluarga Model
Peneliti mengevaluasi MISVO pada empat model instruction-tuned dengan skala arsitektur berbeda: LFM2.5-1.2B-Instruct, Gemma3-4B-IT, Llama-3-8B-Instruct, dan Phi-4 (14B) pada dua domain tugas kritis: Stanford Human Preferences (SHP) dan sintesis kode program Python (MBPP+).
| Metode Alignment | Mean Reward (SHP) | Pass@1 (MBPP+) | Perplexity Ratio | Parameter Updates | Latency per Rollout |
|---|---|---|---|---|---|
| Unsteered Reference (Zero-Shot) | 0.00 | 54.2% | 1.00x | 0 | Baseline |
| Best-of-N (N=16 Sampling) | +0.68 | 63.8% | 1.02x | 0 | 16.0x |
| Euclidean Steering (L2 Penalty) | +0.51 | 48.1% (Degraded) | 3.41x (Explosion) | 0 | 1.12x |
| Full DPO Fine-Tuning | +0.74 | 66.4% | 1.08x | 8.0 Billion Params | Requires Re-training |
| MISVO (Fisher Quadratic) | +0.82 (Top-1) | 68.1% (Top-1) | 1.04x (Preserved) | 0 (Fully Frozen) | 1.04x (+4% Overhead) |
Hasil empiris di atas menegaskan tiga keunggulan kunci arsitektur MISVO:
- Reward Tertinggi Tanpa Perplexity Degradation: MISVO mengungguli Best-of-N dan Euclidean steering di 6 dari 7 pengujian model, sambil mempertahankan perplexity pada rasio 1.04x (nyaris identik dengan model acuan murni).
- Penyelamatan Sintaksis pada Code Generation: Pada benchmark MBPP+, penalti Euclidean menyebabkan penurunan akurasi (dari 54.2% menjadi 48.1%) akibat rusaknya token indentasi dan sintaksis bahasa Python. Sebaliknya, MISVO meningkatkan akurasi hingga 68.1% karena Fisher Information Matrix secara otomatis memproteksi token-token struktural yang kritis.
- Efisiensi Test-Time Compute: Dibandingkan Best-of-N yang mengharuskan sampling 16x sekuens penuh dari nol, MISVO mencapai konvergensi hanya dalam beberapa iterasi gradien kecil, menghemat lebih dari 75% FLOPs total inferensi.
6. Jebakan Arsitektur (Pitfalls) & Kesalahan Fatal pada Test-Time Representation Steering
Bagi tim AI Platform yang mengintegrasikan layer steering pada LLM serving cluster, terdapat 3 jebakan fatal yang wajib dihindari:
-
Mencoba Mematerialisasi Matriks Fisher $d \times d$ di VRAM: Mengalokasikan matriks kovariansi penuh untuk model 8B/14B pada panjang konteks 4096 token akan langsung memicu CUDA Out-of-Memory (OOM). Selalu gunakan formulasi matrix-free dua langkah ($W u_t \to m \to W^\top m$) yang hanya membutuhkan memori vektor seukuran kosakata $V$.
-
Menghitung Ulang Matriks Fisher Dinamis pada Setiap Iterasi: Mengevaluasi $F_t(u_t^{(m)})$ pada setiap pembaruan gradien menambah overhead komputasi tanpa memberikan perbaikan reward yang berarti. Berdasarkan Theorem 2, surigat model referensi beku $\bar{F}_t = F_t(0)$ sudah akurat hingga orde pertama $\mathcal{O}(\|u\|^2)$ dan cukup dihitung satu kali di awal.
-
Mengabaikan Skala Koefisien Regulerisasi $\lambda$: Menetapkan $\lambda$ terlalu kecil ($< 0.01$) akan menyebabkan vektor intervensi meledak dan mengorbankan koherensi semantik. Sebaliknya, $\lambda$ yang terlalu besar ($> 1.0$) mematikan efek steering sama sekali. Nilai optimal berada pada rentang $\lambda \in [0.05, 0.2]$ dengan pembaruan momentum Adam.
7. Spesifikasi Teknis: Implementasi TypeScript MISVO Matrix-Free Steering Engine
Berikut adalah implementasi referensi tingkat produksi dalam TypeScript modern yang menyediakan modul penghitung perkalian Fisher bebas matriks dan pengoptimal vektor intervensi untuk framework runtime agentic:
// MISVO Production Harness: Matrix-Free Fisher Steering & Online Activation Interventions
// Berdasarkan Arsitektur Riset arXiv:2609.30218 (Entesari, Zhang, Khashabi, Fazlyab - September 2026)
//
// Komponen Utama:
// 1. MatrixFreeFisherProduct: Menghitung F_t(0) * u_t dalam O(d * V) FLOPs tanpa materialisasi matriks d x d
// 2. TokenLogitPerturbation: Mengaplikasikan vektor steering u_t pada pre-logit hidden state h_t
// 3. FrozenFisherSurrogateEstimator: Mengestimasi matriks biaya Fisher referensi ekspektasi E_{y delta in R^V
*/
public static projectToLogits(W: number[][], u: number[]): number[] {
const vocabSize = W.length;
const hiddenDim = u.length;
const delta = new Array(vocabSize).fill(0);
for (let i = 0; i < vocabSize; i++) {
let sum = 0;
const row = W[i];
for (let j = 0; j < hiddenDim; j++) {
sum += row[j] * u[j];
}
delta[i] = sum;
}
return delta;
}
/**
* Menghitung W^T * vector -> out in R^d
*/
public static projectToHidden(W: number[][], v: number[]): number[] {
const vocabSize = W.length;
const hiddenDim = W[0].length;
const result = new Array(hiddenDim).fill(0);
for (let i = 0; i < vocabSize; i++) {
const v_i = v[i];
if (Math.abs(v_i) < 1e-9) continue;
const row = W[i];
for (let j = 0; j < hiddenDim; j++) {
result[j] += row[j] * v_i;
}
}
return result;
}
/**
* Menghitung F_t * u secara matrix-free:
* 1. delta = W * u
* 2. alpha = sum_i (p_i * delta_i) = p^T * delta
* 3. m_i = p_i * delta_i - alpha * p_i
* 4. output = W^T * m
*/
public static computeFisherVectorProduct(W: number[][], p: number[], u: number[]): number[] {
const delta = this.projectToLogits(W, u);
let alpha = 0;
const vocabSize = p.length;
for (let i = 0; i < vocabSize; i++) {
alpha += p[i] * delta[i];
}
const m = new Array(vocabSize);
for (let i = 0; i < vocabSize; i++) {
m[i] = p[i] * delta[i] - alpha * p[i];
}
return this.projectToHidden(W, m);
}
}
/**
* 2. MISVO Optimizer Core
* Mengoptimalkan vektor intervensi posisi u_1:T menggunakan stochastic gradient ascent
*/
export class MISVOOptimizer {
private hiddenDim: number;
private horizonT: number;
private params: OptimizationHyperparameters;
private W: number[][]; // Head proyeksi LM (V x d)
constructor(hiddenDim: number, horizonT: number, W: number[][], params: OptimizationHyperparameters) {
this.hiddenDim = hiddenDim;
this.horizonT = horizonT;
this.W = W;
this.params = params;
}
/**
* Menghitung estimasi gradien reward Monte-Carlo g_t^R
* g_t^R = (1/K) * sum_{k=1}^K (R_k - R_bar) * W^T (e_{y_t^(k)} - p_t^(k))
*/
public computeRewardGradient(
rolloutTokens: number[][], // K x T token index
rolloutProbabilities: number[][][], // K x T x V probabilitas token
rewards: number[] // K reward empiris
): number[][] {
const K = rewards.length;
const meanReward = rewards.reduce((a, b) => a + b, 0) / K;
const gradR: number[][] = Array.from({ length: this.horizonT }, () => new Array(this.hiddenDim).fill(0));
for (let t = 0; t < this.horizonT; t++) {
const accumV = new Array(this.W.length).fill(0);
for (let k = 0; k < K; k++) {
const advantage = rewards[k] - meanReward;
const chosenToken = rolloutTokens[k][t];
const p_t = rolloutProbabilities[k][t];
for (let i = 0; i < this.W.length; i++) {
const indicator = i === chosenToken ? 1.0 : 0.0;
accumV[i] += advantage * (indicator - p_t[i]);
}
}
for (let i = 0; i < this.W.length; i++) {
accumV[i] /= K;
}
gradR[t] = MatrixFreeFisherEngine.projectToHidden(this.W, accumV);
}
return gradR;
}
/**
* Langkah Pembaruan Vektor Intervensi MISVO:
* u_t^(iter+1) = u_t^(iter) + eta * ( g_t^R - lambda * F_bar_t * u_t^(iter) )
*/
public step(
currentU: number[][], // T x d
referenceP: number[][], // T x V distribusi probabilitas referensi beku
gradR: number[][] // T x d gradien reward
): number[][] {
const nextU: number[][] = Array.from({ length: this.horizonT }, () => new Array(this.hiddenDim).fill(0));
for (let t = 0; t < this.horizonT; t++) {
const u_t = currentU[t];
const p_ref_t = referenceP[t];
// Hitung penalti geometris Fisher Information secara matrix-free
const fisherGrad = MatrixFreeFisherEngine.computeFisherVectorProduct(this.W, p_ref_t, u_t);
for (let j = 0; j < this.hiddenDim; j++) {
const netGrad = gradR[t][j] - this.params.klLambda * fisherGrad[j];
nextU[t][j] = u_t[j] + this.params.learningRate * netGrad;
}
}
return nextU;
}
}
8. Rekomendasi Strategis bagi Engineering & AI Platform Architects
Publikasi MISVO menandai babak baru dalam rekayasa sistem AI enterprise. Bagi organisasi yang membangun infrastruktur AI agentik, asisten koding privat, atau sistem kepatuhan real-time:
- Gantikan Adapter Fine-Tuning Ringan (LoRA) Statis dengan Test-Time Steering: Untuk kebutuhan adaptasi gaya bicara, persona, atau kebijakan kepatuhan per-penyewa (multi-tenant compliance), steering laten test-time jauh lebih fleksibel dan tidak memerlukan manajemen ratusan checkpoint LoRA di storage cluster.
- Terapkan Information Geometry sebagai Standar Keamanan Alignment: Setiap intervensi representasi internal—baik melalui activation patching, refusal steering, maupun circuit breaking—wajib diukur menggunakan metrik Fisher Information guna memastikan representasi inti model tidak terkorupsi.
- Manfaatkan Matrix-Free Kernels pada Inference Engine: Implementasikan operator kustom Triton atau CUDA untuk fusi kernel $W u_t \to m \to W^\top m$ langsung pada lapisan terakhir transformer sebelum Softmax untuk mencapai latensi sub-milidetik.
Referensi & Sumber Terverifikasi
- [1]Minimally Invasive Steering of Language Models(arXiv:2609.30218 [cs.LG, cs.AI] — Taha Entesari, Jingyu Zhang, Daniel Khashabi, Mahyar Fazlyab (Johns Hopkins University))
- [2]Representation Engineering: A Top-Down Approach to AI Transparency(arXiv:2310.01405 — Andy Zou, Long Phan, Sarah Chen, James Campbell, Phillip Guo, Richard Ren, Alexander Pan, Xuwang Yin, Mantas Mazeika, Ann-Kathrin Dombrowski, Shashwat Goel, Nathaniel Li, Michael J. Frank, Dan Hendrycks (Center for AI Safety & UC Berkeley))
- [3]Activation Addition: Steering Language Models Without Optimization(arXiv:2308.10248 — Alex Turner, Lisa Thiergart, David Udell, Gavin Leech, Ulisse Mini, Monte MacDiarmid)
- [4]Direct Preference Optimization: Your Language Model is Secretly a Reward Model(NeurIPS 2023 / arXiv:2305.18290 — Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn (Stanford University))
- [5]Natural Gradient Works Efficiently in Learning(Neural Computation 10(2):251-276 — Shun-ichi Amari (RIKEN Brain Science Institute))
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.