Proactive Service Agents 2026: Arsitektur Partially Observable Sequential Decision, Intervention Gating, dan Recoverable Execution pada Autonomous AI
Analisis arsitektural komprehensif Proactive Service Agents (arXiv:2609.03727, September 2026): Menggeser inisiatif AI dari reactive instructions menuju Constrained POSDP, Intervention Advantage, Option Value of Waiting, dan Recoverable Execution.

Dalam evolusi kecerdasan buatan terapan, sebagian besar ekosistem agen cerdas saat ini masih terkunci dalam paradigma Reaktif (Reactive Assistance): model baru bergerak ketika pengguna mengetikkan instruksi secara eksplisit di kolom prompt. Namun, pada implementasi dunia nyata—seperti coding workspace terdistribusi, pemantauan sistem cloud, antarmuka streaming multimodal, dan pendampingan eksekutif—kebutuhan kritis sering kali muncul sebelum pengguna sempat merumuskannya dalam kata-kata. Proactive Service menggeser inisiatif keputusan ke hulu (moving decisions upstream): agen harus mampu menginferensi peluang intervensi dari sinyal lingkungan yang tidak lengkap, menimbang risiko interupsi, dan memilih momen yang tepat antara diam (silent), bertanya (ask), membimbing (assist), atau mengeksekusi mandiri (act).
Executive Architectural Summary & Terobosan Riset (arXiv:2609.03727)
Dipublikasikan pada awal September 2026 oleh tim riset UniCone & Tsinghua University, makalah "Proactive Service Agents: A Unified Decision Framework, Methods, and Evaluation" (arXiv:2609.03727) menetapkan fondasi teoretis dan standar evaluasi pertama yang menyatukan konsep proaktivitas AI. Riset ini membongkar mitos bahwa "proaktif berarti bertindak sesering mungkin". Menggunakan formulasi Constrained Partially Observable Markov Decision Process (CPOMDP/POSDP), penelitian ini membuktikan bahwa akurasi klasifikasi offline semata tidak berkorelasi dengan manfaat operasional di produksi. Layanan proaktif yang andal menuntut 4 pilar mutlak: Calibrated Incremental Intervention Value ($Delta_{\boldsymbol{\eta}}$), Option Value of Waiting, Verifiable Authorization Ledger ($ar{\kappa}$), dan Recoverable Execution.
1. Definisi Operasional: Mengapa Preset Automation Bukan Proaktif?
Banyak praktisi keliru menyamakan automated cron job atau reminder kalender sebagai sistem proaktif hanya karena sistem tersebut "berbicara lebih dulu". Riset arXiv:2609.03727 menarik garis demarkasi formal yang ketat:
| Paradigma Interaksi | Sumber Pemicu (Trigger) | Alternatif Saat Keputusan | Karakter Inisiatif |
|---|---|---|---|
| Reactive Agent | Instruksi eksplisit pengguna ($iota_t$) | Perencanaan & tool-call internal | Pasif: Menunggu perintah |
| Preset Automation | Jadwal / Rule statis sebelumnya | Eksekusi deterministik tanpa opsi diam | Kaku: Terikat rule pengguna |
| Mixed-Initiative UI | Kolaborasi manusia-mesin | Dialog, negosiasi, serah-terima kontrol | Dinamis: Berbagi inisiatif |
| Proactive Service Agent | Inferensi sinyal laten lingkungan | Pilihan online: Silent vs Ask vs Assist vs Act | Otonom: Transfer kontrol bernilai tambah |
Sebuah aksi non-silent $a_t$ pada waktu $t$ secara formal didefinisikan sebagai Proactive Service Intervention jika dan hanya jika:
- Sistem secara mandiri mengintroduksi peluang layanan (service opportunity), waktu pemicu, subgoal, atau komitmen aksi eksternal yang tidak tertulis dalam spesifikasi $iota_t$.
- Protokol mengizinkan sistem untuk tetap diam (silence) sebagai salah satu alternatif aksi yang valid.
- Keputusan dipilih berdasarkan keyakinan probabilitas (belief state) mengenai tujuan pengguna, kondisi lingkungan, dan konsekuensi risiko.
- Tujuan yang dikejar membawa manfaat nyata yang disetujui pengguna (user-endorsed benefit), bukan manipulasi perhatian.
2. Formulasi Matematis: Constrained POSDP & Intervention Advantage
Mengapa model AI tidak boleh langsung mengambil tindakan saat mendeteksi kebutuhan pengguna? Karena intensi pengguna tidak dapat diobservasi secara langsung, sementara tindakan yang salah memicu biaya interupsi (interruption cost) dan risiko kerusakan sistem. Oleh karena itu, masalah ini dimodelkan sebagai Constrained Partially Observable Markov Decision Process:
\mathcal{M} = \langle \mathcal{S}, \mathcal{O}, \mathcal{A}, T, Z, r, \mathbf{c}, \gamma, b_0 \rangle
Di mana State tersembunyi $s_t = \langle u_t, \omega_t, x_t, z_t \rangle$ merangkum tujuan laten pengguna ($u_t$), tingkat ketergangguan/beban kerja ($\omega_t$), kondisi lingkungan ($x_t$), dan internal state agen ($z_t$).
A. Struktur Aksi Multi-Modal
Ruang aksi $mathcal{A}$ tidak hanya berupa teks, melainkan tupel terstruktur:
- m_t ∈ {silent, ask, assist, act}: Moda inisiatif intervensi.
- τ_t: Waktu pelaksanaan (segera vs terjadwal pada jendela Goldilocks).
- z_t: Subgoal konten dan muatan teknis (clarification query / tool arguments).
- &ell_t: Kanal penyampaian (toast notification, inline diff, status badge, audio cue).
B. Intervention Advantage & The Option Value of Waiting
Kunci utama arsitektur ini adalah Intervention Advantage ($Delta_{oldsymbol{eta}}$). Agen hanya boleh menginterupsi jika nilai aksi aktif melampaui nilai opsi menunggu (option value of waiting):
\Delta_{\boldsymbol{\eta}}(b_t, \bar{\kappa}_t) = \max_{a \in \mathcal{A}_t^+} Q^*_{\boldsymbol{\eta}}(b_t, \bar{\kappa}_t, a) - Q^*_{\boldsymbol{\eta}}(b_t, \bar{\kappa}_t, \mathsf{silent})
Perhatikan bahwa $Q^*_{\boldsymbol{\eta}}(b_t, \bar{\kappa}_t, \mathsf{silent})$ bukanlah nol! Menunggu memiliki nilai ekonomi nyata: pengguna mungkin menyelesaikan masalahnya sendiri, atau observasi berikutnya akan menghasilkan resolusi ketidakpastian yang jauh lebih tinggi. Jika $Delta_{\boldsymbol{\eta}} le 0$, agen menerapkan conservative tie-breaking dan wajib tetap diam.
C. The Decisional Value of Information (VoI) untuk Pertanyaan
Kapan agen harus memilih mode ask (klarifikasi) alih-alih langsung mengeksekusi (act)? Mengajukan pertanyaan membebani kognisi pengguna ($C_Q(q)$). Nilai murni dari informasi (Pure Value of Information) diformulasikan sebagai:
Jika jawaban pengguna $y$ tidak mengubah keyakinan ($b$), tidak memperbarui hak otorisasi ($\bar{\kappa}$), dan tidak merubah keputusan aksi hilir, maka $\text{VoI}(q) \le 0$, sehingga pertanyaan tersebut dilarang diajukan.
3. Siklus 4-Tahap Arsitektur Proactive Service Engine
Untuk mengoperasikan sistem di lingkungan produksi, arsitektur dipecah menjadi 4 subsistem modular:
State & Need Estimation
Mengonversi streaming observasi (event layar GUI, terminal log, sensor workspace) menjadi belief state terkalibrasi $b_t$. Mengukur probabilitas kebutuhan $p = P(N=1 mid b)$, entropi ketidakpastian tugas, serta tingkat ketergangguan pengguna $omega_t$.
Intervention Gating
Menyaring aksi kandidat terhadap buku besar otorisasi kriptografis $ar{kappa}_t$. Menghitung Intervention Advantage $Delta_{oldsymbol{eta}}$ dengan penalti biaya interupsi dan privasi berbasis harga bayangan Lagrangian ($oldsymbol{eta}$).
Action Construction
Menyusun muatan spesifik sesuai moda terpilih: menghasilkan pertanyaan ringkas pada mode ask, menyiapkan scaffold/diff pada mode assist, atau mengompilasi parameter tool execution pada mode act.
Feedback & Recoverable Execution
Mencatat respons pengguna (diterima, diabaikan, ditolak, dikoreksi). Seluruh eksekusi moda act wajib memiliki transactional rollback semantics (checkpoint state) sehingga efek samping dapat dibatalkan seketika jika pengguna membatalkan inisiatif.
4. Implementasi Standar: Proactive Service POSDP Kernel
Berikut adalah implementasi TypeScript produksi yang memvalidasi pembatas otorisasi (admissibility barrier), menghitung nilai Lagrangian-relaxed, dan mengisolasi inisiatif intervensi:
// Proactive Service Agent POSDP Decision Engine & Intervention Gating Kernel
// Berdasarkan Formulasi Matematis Unified Decision Framework (arXiv:2609.03727, September 2026)
// Mengimplementasikan Constrained Partially Observable Sequential Decision Making
export type InterventionMode = 'silent' | 'ask' | 'assist' | 'act';
export interface UserBeliefState {
latentObjectiveId: string;
needProbability: number; // p = P(N = 1 | b)
userInterruptibility: number; // 0.0 (busy/focused) - 1.0 (receptive)
taskUncertaintyEntropy: number; // H(U | o)
contextTimestamp: number;
}
export interface AuthorizationLedger {
grantedPermissions: Set;
explicitDelegationTokens: string[];
maxIrreversibleActionTier: number; // 0: Read-only, 1: Idempotent Write, 2: Destructive/Monetary
}
export interface StructuredCandidateAction {
id: string;
mode: InterventionMode;
targetSubgoal: string;
payloadAction: string;
estimatedImmediateReward: number; // r(s, a)
interruptionCost: number; // c_interrupt
misunderstandingRiskCost: number; // c_risk
privacyDisclosureCost: number; // c_privacy
executionReversibilityCost: number; // c_undo
requiredPermission?: string;
requiredActionTier: number;
}
export interface GatingDecisionTelemetry {
selectedAction: StructuredCandidateAction;
interventionAdvantage: number; // Delta_eta(b, kappa)
optionValueOfWaiting: number; // Q*(b, kappa, silent)
decisionValueOfAsking?: number; // VoI(q)
gatePassed: boolean;
shadowPricePenalties: number;
}
export class ProactiveServiceKernel {
private readonly gammaDiscount: number;
private readonly shadowPrices: {
interruption: number; // eta_1
risk: number; // eta_2
privacy: number; // eta_3
};
constructor(
gamma: number = 0.95,
shadowPrices = { interruption: 1.4, risk: 2.5, privacy: 1.8 }
) {
this.gammaDiscount = gamma;
this.shadowPrices = shadowPrices;
}
/**
* 1. Evaluasi Hard Feasibility & Authorization Ledger Constraints
* Tindakan 'act' yang tidak memiliki token otorisasi eksplisit langsung didiskualifikasi (Admissibility Barrier).
*/
public filterAdmissibleActions(
candidates: StructuredCandidateAction[],
ledger: AuthorizationLedger
): StructuredCandidateAction[] {
return candidates.filter((action) => {
if (action.mode === 'silent') return true;
if (action.requiredActionTier > ledger.maxIrreversibleActionTier) return false;
if (action.requiredPermission && !ledger.grantedPermissions.has(action.requiredPermission)) {
return false;
}
return true;
});
}
/**
* 2. Hitung Lagrangian-Relaxed Expected Reward: r_eta(s, a)
*/
public computeRelaxedReward(action: StructuredCandidateAction, belief: UserBeliefState): number {
if (action.mode === 'silent') {
return 0.0; // Baseline netral
}
const softPenalty =
this.shadowPrices.interruption * (action.interruptionCost * (1.0 - belief.userInterruptibility)) +
this.shadowPrices.risk * (action.misunderstandingRiskCost * belief.taskUncertaintyEntropy) +
this.shadowPrices.privacy * action.privacyDisclosureCost;
// Expected value proporsional terhadap estimasi kebutuhan nyata user
const expectedGrossBenefit = action.estimatedImmediateReward * belief.needProbability;
return expectedGrossBenefit - softPenalty;
}
/**
* 3. Estimasi Option Value of Waiting vs Intervention Advantage
* Delta_eta(b, kappa) = max_{a != silent} Q*(b, kappa, a) - Q*(b, kappa, silent)
*/
public evaluateInterventionGating(
belief: UserBeliefState,
ledger: AuthorizationLedger,
candidates: StructuredCandidateAction[],
estimatedFutureSilentValue: number = 1.2
): GatingDecisionTelemetry {
const admissible = this.filterAdmissibleActions(candidates, ledger);
// Q*(b, kappa, silent) merefleksikan opsi menunggu datangnya observasi berikutnya yang lebih jelas
const qSilent = this.gammaDiscount * estimatedFutureSilentValue;
let bestNonSilentAction: StructuredCandidateAction | null = null;
let maxNonSilentQ = -Infinity;
for (const act of admissible) {
if (act.mode === 'silent') continue;
const immediateRelaxed = this.computeRelaxedReward(act, belief);
// Asumsi nilai masa depan setelah aksi (termasuk branching feedback user)
const qValue = immediateRelaxed + this.gammaDiscount * (act.mode === 'ask' ? 1.5 : 1.1);
if (qValue > maxNonSilentQ) {
maxNonSilentQ = qValue;
bestNonSilentAction = act;
}
}
// Conservative Tie-Breaking: Jika Delta_eta <= 0, agen WAJIB memilih silent
const deltaInterventionAdvantage = maxNonSilentQ - qSilent;
const shouldIntervene = deltaInterventionAdvantage > 0.0 && bestNonSilentAction !== null;
const chosenAction = shouldIntervene
? bestNonSilentAction!
: {
id: 'action-silent-wait',
mode: 'silent' as InterventionMode,
targetSubgoal: 'observe_stream',
payloadAction: 'maintain_passive_monitoring',
estimatedImmediateReward: 0,
interruptionCost: 0,
misunderstandingRiskCost: 0,
privacyDisclosureCost: 0,
executionReversibilityCost: 0,
requiredActionTier: 0,
};
return {
selectedAction: chosenAction,
interventionAdvantage: Number(deltaInterventionAdvantage.toFixed(4)),
optionValueOfWaiting: Number(qSilent.toFixed(4)),
gatePassed: shouldIntervene,
shadowPricePenalties: this.computeRelaxedReward(chosenAction, belief),
};
}
}
5. Metrik Evaluasi: Mengapa Metrik Klasifikasi Klasik Menyesatkan?
Salah satu temuan paling tajam dari survei arXiv:2609.03727 adalah kegagalan metrik akurasi tradisional. Pada stream dunia nyata di mana momen kebutuhan sangat jarang (sparse stream, misal hanya 2 intervensi per 8 jam kerja), sebuah model bodoh yang selalu diam (100% silent) bisa memperoleh akurasi 99.8%! Evaluasi standar industri 2026 mewajibkan kombinasi 3 metrik baru:
| Metrik Standar 2026 | Formulasi Matematis | Definisi & Fungsi Proteksi | Target Produksi |
|---|---|---|---|
| FAH (False Alarms / Hour) | \frac{\#\{\text{false interventions}\}}{\text{observed hours}} | Frekuensi alarm palsu per jam pengamatan; melindungi pengguna dari kejenuhan interupsi. | < 0.25 / jam |
| Timing F1 (F_{1, T}) | \frac{2 \cdot \text{Prec}_T \cdot \text{Rec}_T}{\text{Prec}_T + \text{Rec}_T} | Pencocokan bipartit maksimal prediksi intervensi ke dalam jendela waktu valid $[l_j, u_j]$. | > 84.5% |
| Net Policy Value (ΔV) | \mathbb{E}[Y^\pi - Y^{\pi_0}] - \boldsymbol{\lambda}^\top \mathbb{E}[\mathbf{C}^\pi - \mathbf{C}^{\pi_0}] | Nilai kebijakan kausal inkremental dibandingkan baseline reaktif, dievaluasi via PDIS off-policy. | ΔV > +18.2 |
6. Panduan Implementasi untuk Arsitektur AI Agent Modern
Bagi tim rekayasa yang mengintegrasikan kapabilitas proaktif ke dalam agen perusahaan (enterprise multi-agent harness), berikut adalah 3 rekomendasi arsitektural utama:
-
Pisahkan Otorisasi dari Inferensi Peluang (Authorization Ledger): Jangan pernah mempercayakan izin eksekusi kritis (seperti menghapus file, mengirim email publik, atau mutasi database) pada perkiraan probabilitas model. Otorisasi harus bersumber dari token kriptografis yang tercatat di ledger terverifikasi ($ar{kappa}_t$).
-
Muliakan Opsi Diam (Respect the Option to Wait): Agen yang hebat bukanlah agen yang paling berisik. Tetap diam saat kepastian rendah adalah keputusan optimal yang menjaga kepercayaan pengguna dan mempertahankan integritas sistem.
-
Wajibkan Atomic Undo & State Rollback: Setiap kali mode
actdipicu secara otonom, pastikan sistem menyertakan reversibilitas penuh (seperti Git ephemeral worktrees atau database shadow transactions). Kemampuan pemulihan instan mengubah aksi berisiko tinggi menjadi intervensi berbiaya rendah.
Referensi & Sumber Terverifikasi
- [1]Proactive Service Agents: A Unified Decision Framework, Methods, and Evaluation(arXiv:2609.03727 [cs.AI] — Tsinghua University & UniCone Team)
- [2]Principles of Mixed-Initiative User Interfaces & Decisional Value of Information(ACM Transactions on Computer-Human Interaction (TOCHI) / AAAI)
- [3]ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue & Tool-Calling Agents(GitHub / liutj9 / ProactiveEval)
Butuh Arsitektur Web & AI Berkualitas Tinggi?
Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.
Artikel Terkait Lainnya

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness
Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox
Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x
Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.