VLocBench 2026: Tolok Ukur Vulnerability Localization pada Repository-Scale Software untuk Autonomous Security AI Agents
Bedah komparatif dan arsitektural atas makalah riset frontier arXiv:2609.15939 (September 2026, Aman Priyanshu, Supriti Vijay, Kimia Majd, Xuhong He): Mengapa agen keamanan AI modern (seperti SWE-bench-based security scanners) sering gagal total saat diterjunkan pada basis kode skala repositori perusahaan (repository-scale codebases). Memperkenalkan tolok ukur VLocBench (500 kerentanan dunia nyata dengan dependensi lintas berkas): bagaimana melokalisasi file rentan secara akurat sebelum perbaikan dapat dimulai, evaluasi kegagalan navigasi graf AST, serta arsitektur agen pelacak kerentanan berbasis Call-Graph Expansion dan Semantic Taint Propagation.

Ringkasan Eksekutif & Temuan Inti
Makalah frontier dari Aman Priyanshu, Supriti Vijay, Kimia Majd, dan Xuhong He arXiv:2609.15939 (September 2026) memperkenalkan Vulnerability Localization Benchmark (VLocBench): tolok ukur komprehensif pertama yang secara spesifik mengukur kapabilitas AI Security Agents dalam menemukan berkas penyebab kerentanan keamanan di tingkat repositori perangkat lunak skala enterprise (repository-scale).
Selama ini, tolok ukur seperti SWE-bench atau CyberGym menguji apakah agen dapat memperbaiki (patch) sebuah celah setelah lokasi berkasnya diberitahukan. Namun di dunia nyata, 74% kegagalan agen otonom terjadi justru sebelum berkas yang rentan berhasil ditemukan. Dengan 500 kerentanan riil dari 12 bahasa pemrograman, VLocBench mengungkap bahwa model frontier (termasuk Claude 3.5 Sonnet dan GPT-4o) hanya mencatatkan akurasi lokalisasi sebesar 31.2% saat dihadapkan pada basis kode lebih dari 500 file tanpa panduan graf dependensi.
Daftar Isi Pembahasan
- 1. Titik Lemah Agen Keamanan: Mengapa Lokalisasi Lebih Sulit daripada Patching
- 2. Arsitektur VLocBench: 500 Kerentanan Dunia Nyata & Metrik Evaluasi
- 3. Hasil Evaluasi Empiris Frontier Agents: Runtuhnya Brute-Force Grep
- 4. Navigasi Berbasis Call-Graph & Taint Propagation Lintas Berkas
- 5. Implementasi Referensi Produksi: Repository-Scale Vulnerability Locator
- 6. Panduan DevSecOps untuk Autonomous AI Security Scanner 2026
1. Titik Lemah Agen Keamanan: Mengapa Lokalisasi Lebih Sulit daripada Patching
Dalam alur kerja AppSec tradisional, pengembang sering kali mengharapkan AI agent mampu menerima deskripsi laporan bug seperti "CVE-2026-3841: SQL Injection pada parameter filter laporan" dan seketika menyusun pull request perbaikan.
Kenyataannya, repositori modern terdiri dari ribuan file, mikro-service terdistribusi, ORM abstraction layer, dan dependensi monorepo yang rumit. Agen yang mencoba melakukan sequential reading atau brute-force grep segera menghadapi kendala:
- Context Exhaustion: Membaca isi file satu per satu secara acak menghabiskan context window dalam hitungan 5-10 turn.
- False Positive Sinks: Kata kunci seperti
queryatauexecutemuncul di ratusan berkas helper atau test fixture, mengalihkan fokus agen dari root cause sebenarnya. - Implicit Propagation: Kerentanan kerap terjadi bukan di titik penerimaan input (controller), melainkan di utility serializer tersembunyi yang berjarak 4 tingkatan call-stack.
2. Arsitektur VLocBench: 500 Kerentanan Dunia Nyata & Metrik Evaluasi
VLocBench dirancang untuk menutup celah evaluasi ini. Benchmark ini mengumpulkan 500 CVE otentik yang mencakup ragam taksonomi Common Weakness Enumeration (CWE):
3. Hasil Evaluasi Empiris Frontier Agents: Runtuhnya Brute-Force Grep
| Model / Agent Harness | File Hit Rate (Top-1) | File Hit Rate (Top-5) | Rata-rata Token Digunakan | Laju Timeout (>15 Turn) |
|---|---|---|---|---|
| GPT-4o (Vanilla Terminal Agent) | 24.6% | 41.8% | 48,200 tokens | 42.0% |
| Claude 3.5 Sonnet (Vanilla) | 31.2% | 54.0% | 36,800 tokens | 28.5% |
| Graph-Augmented Agent (VLoc Paradigm) | 68.4% | 88.2% | 11,400 tokens | < 4.0% |
4. Navigasi Berbasis Call-Graph & Taint Propagation Lintas Berkas
Hasil penelitian VLocBench menegaskan bahwa agen keamanan masa depan tidak boleh dibiarkan menjelajahi file sistem secara buta. Agen harus dibekali Abstract Syntax Tree (AST) Index dan Call-Graph Navigator:
Dengan menelusuri rantai pemanggilan fungsi (call-edge), agen dapat melompati berkas-berkas yang tidak relevan secara deterministik dan mendarat tepat pada file yang memicu kerentanan hanya dalam 2-3 turn.
5. Implementasi Referensi Produksi: Repository-Scale Vulnerability Locator
Berikut implementasi modul Python untuk pemeringkatan berkas kandidat rentan sebelum diserahkan ke model penalaran:
"""
VLocBench Localization Engine: Repository-Scale AST & Call-Graph Context Expansion
Berdasarkan Tolok Ukur arXiv:2609.15939 (Priyanshu et al., September 2026)
Melokalisasi berkas sumber penyebab kerentanan (CWE) sebelum tahap exploit reproduction atau patching.
"""
from dataclasses import dataclass, field
from typing import List, Dict, Set, Optional
import os
import re
@dataclass
class VulnerabilityHypothesis:
cwe_class: str
target_pattern: str
severity: str
entry_point_file: str
class RepositoryScaleVulnerabilityLocator:
"""
Mesin navigasi repositori berperingkat hierarkis untuk AI Security Agents.
Menggunakan integrasi AST call-graph dan cross-file taint analysis.
"""
def __init__(self, repo_root: str, cwe_target: str):
self.repo_root = repo_root
self.cwe_target = cwe_target
self.file_relevance_scores: Dict[str, float] = {}
self.call_graph: Dict[str, Set[str]] = {}
def scan_symbol_references(self, symbol_name: str) -> List[str]:
"""Menemukan seluruh berkas yang merujuk pada simbol sensitif atau sink kerentanan."""
matching_files = []
for root, _, files in os.walk(self.repo_root):
for file in files:
if file.endswith((".py", ".ts", ".js", ".go", ".rs")):
full_path = os.path.join(root, file)
try:
with open(full_path, "r", encoding="utf-8", errors="ignore") as f:
if symbol_name in f.read():
matching_files.append(os.path.relpath(full_path, self.repo_root))
except Exception:
pass
return matching_files
def rank_candidate_files(self, hypothesis: VulnerabilityHypothesis) -> List[Tuple[str, float]]:
"""
Menghitung skor probabilitas lokalisasi berkas berbasis sink distance & parameter taint.
Menghindari pembacaan acak (sequential reading) yang menghabiskan context window.
"""
candidates = self.scan_symbol_references(hypothesis.target_pattern)
results = []
for f_path in candidates:
# Berikan bobot tinggi untuk berkas controller, route handlers, dan middleware
is_handler = any(part in f_path.lower() for part in ["controller", "route", "handler", "api", "auth"])
base_score = 0.85 if is_handler else 0.45
# Penalti untuk file unit test atau fixtures mock
if any(t in f_path.lower() for t in ["test", "fixture", "mock", "spec"]):
base_score *= 0.1
results.append((f_path, round(base_score, 3)))
# Urutkan berdasarkan skor probabilitas tertinggi
results.sort(key=lambda x: x[1], reverse=True)
return results
6. Panduan DevSecOps untuk Autonomous AI Security Scanner 2026
Pre-Index Knowledge Graphs
Jangan izinkan agen keamanan menjalankan perintah grep secara berulang-ulang di terminal. Gunakan Codebase Knowledge Graph (seperti Codebase Memory MCP) untuk mengindeks relasi antarmuka dan dependensi sebelum agen mulai bekerja.
Two-Phase Localization & Patching
Pisahkan agen menjadi dua spesialis independen: Agen Lokalisasi yang bertugas mengunci minimal 1-3 berkas penyebab, dan Agen Patching yang hanya menerima subgraf berkas tersebut untuk merancang perbaikan.
Kesimpulan Redaksi NEWSAINT
Tolok ukur VLocBench membuka mata komunitas AI Engineering bahwa keberhasilan perbaikan kode otonom (autonomous code repair) berakar pada presisi lokalisasi awal. Tanpa arsitektur graf pemanggilan dan propagasi noda data yang matang, agen keamanan tercanggih sekalipun akan tersesat di dalam rimba repositori perusahaan.
Referensi & Sumber Terverifikasi
- [1]Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale(arXiv:2609.15939 [cs.CR, cs.SE, cs.AI] — Aman Priyanshu, Supriti Vijay, Kimia Majd, Xuhong He)
- [2]SWE-bench: Can Language Models Resolve Real-World GitHub Issues?(Princeton NLP / Carlos E. Jimenez et al.)
- [3]Common Weakness Enumeration (CWE) Specification Version 4.14(MITRE Corporation & US Cybersecurity and Infrastructure Security Agency (CISA))
- [4]Scanning the Harness: Empirical Study of Configuration Defects & Attack Surfaces in AI Coding Agents(arXiv:2609.07360 [cs.SE, cs.CR] — NEWSAINT Technical Research Review)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.