NS
NEWSAINT
ai-eng• 8 MIN READ•30 September 2026

Marathoner 2026: Arsitektur Ultra-Long-Horizon Autonomous Intelligence, Multi-Task Chaining, Rejection Sampling, dan Later Stage Bonus Reward pada Agen Koding Skala Jam

Analisis mendalam riset frontier autonomous agentic intelligence (arXiv:2609.34378, Ant Group, 28 September 2026): Marathoner, arsitektur post-training agen otonom untuk eksekusi ultra-long-horizon yang mampu bertahan selama 10+ jam kerja kontinu dan mengeksekusi lebih dari 1.000 tool calls nyata. Membedah sintesis data berbasis PR rilis besar GitHub (1.000+ baris kode baru), teknik Multi-Task Chaining untuk merangkai tugas bernalar tinggi, trajectory generation lintas diverse harnesses (Claude Code, Codex, OpenClaw) dengan teacher model Kimi K3, reinforcement learning berbasis GRPO dalam sandbox Harbor terisolasi, serta strategi insentif Later Stage Bonus Reward yang mematahkan fenomena early stagnation pada coding agents.

N
Ervareza Naurian Novantila
Lead Architect & Founder NEWSAINT
Fact-Checked & Verified
Ilustrasi Arsitektur Teknis 16:9 Marathoner 2026: Arsitektur Ultra-Long-Horizon Autonomous Intelligence, Multi-Task Chaining, Rejection Sampling, dan Later Stage Bonus Reward pada Agen Koding Skala Jam

Dalam kurun dua tahun terakhir, paradigma evaluasi model kecerdasan buatan berbasis Large Language Models (LLM) telah bergeser drastis dari benchmark penalaran instan (single-turn question answering) menuju agen perangkat lunak otonom (software engineering agents). Namun, mayoritas model open-weight dan agen produksi komersial saat ini masih terkungkung dalam batas operasi sempit: mereka dirancang untuk sesi interaktif singkat (10 hingga 50 langkah tool call) dengan durasi kerja hanya beberapa menit sebelum mengalami kelelahan konteks (context exhaustion), perulangan buntu (action looping), atau halusinasi instruksi.

Padahal, esensi kecerdasan manusia yang paling bernilai dalam dunia rekayasa adalah kemampuan bertahan mengerjakan tujuan kompleks berskala panjang (ultra-long-horizon execution). Ketika seorang software engineer senior membangun fitur besar atau merestrukturisasi modul inti sistem terdistribusi, mereka sanggup bekerja secara konsisten selama berjam-jam, hari, hingga berbulan-bulan: membaca ribuan baris kode asing, mereproduksi kegagalan, merancang refactoring inkremental, memperbaiki unit test satu per satu, dan secara adaptif mengubah taktik saat menemukan jalan buntu.

FRONTIER BENCHMARK BREAKTHROUGH

Marathoner: Lompatan Agen Otonom Skala Jam (10+ Jam Kerja Kontinu & 1000+ Tool Calls)

Sebuah riset monumental yang dipublikasikan pada 28 September 2026 oleh tim peneliti dari Ant Group (arXiv:2609.34378, Zhang Ruiyang, Zheng Zhedong et al.) memperkenalkan Marathoner—model agen otonom pertama yang dibangun khusus untuk mengatasi krisis ultra-long-horizon execution. Melalui metodologi post-training komprehensif tanpa pengoptimalan spesifik pada satu benchmark (benchmark-free training pipeline), model open-weight Marathoner-9B berhasil:

  • Melampaui Model Proprietary Kelas Dunia: Pada benchmark ketat FrontierSWE dan SWE-Marathon, Marathoner-9B (26.4% dan 8.2%) mengungguli performa model proprietary raksasa seperti Gemini-3.1-Pro (25.9% dan 5.9%), serta melipatgandakan performa base model-nya (Qwen3.5-9B yang hanya mencatat 10.2% dan 0%).
  • Daya Tahan Eksekusi Tanpa Henti: Dalam pengujian ketahanan dunia nyata, Marathoner terbukti mampu mempertahankan koherensi bernalar dan mengeksekusi aksi selama lebih dari 10 jam kerja tanpa intervensi manusia dengan melahap lebih dari 1.000 pemanggilan tools nyata secara konsisten.
  • Agnostik Terhadap Harness (Diverse Harness Invariance): Agen tidak mengalami overfit pada satu framework CLI tertentu, melainkan dilatih secara ortogonal melintasi Claude Code, Codex, hingga OpenClaw.

1. Mengapa Agen Tradisional Gagal pada Horizon Panjang?

Kegagalan agen koding konvensional saat dipaksa bekerja pada horizon waktu lama berakar pada tiga kelemahan mendasar:

Problem 01

Toy Benchmark Saturation

Dataset latihan seperti SWE-bench standar mayoritas terdiri dari perbaikan bug lokal (20–50 baris kode). Model tidak pernah terekspos pada tugas berskala rilis major yang melibatkan dependensi arsitektural lintas modul.

Problem 02

Harness Overfitting

Agen yang dilatih hanya pada satu harness lingkungan (misalnya format prompt spesifik tool A) menjadi rapuh ketika format output shell berubah atau saat terjadi interupsi tak terduga dalam pipeline CLI.

Problem 03

Late-Stage Stagnation

Pada pembelajaran berbasis reward biner (hanya mendapat skor di akhir sesi), ketika langkah eksekusi melampaui ratusan turn, gradient signal memudar (credit assignment problem), membuat agen berhenti mencoba dan menyerah.

2. Tiga Pilar Metodologi Post-Training Marathoner

Untuk membangun agen dengan daya tahan lari maraton, tim Ant Group merancang pipeline post-training tiga pilar yang terintegrasi secara sistemik:

A

Sintesis Tugas Major Release PRs & Multi-Task Chaining

Alih-alih menambang bug fix sepele, Marathoner menargetkan Pull Request rilis major dari repositori GitHub beragam (frontend, backend, CUDA libraries, database kernel, hingga tooling AI) dengan kriteria minimal 1.000+ baris kode baru. Setiap tugas disusun menjadi tiga komponen formal:

  • Software Artifact: Repositori yang di-checkout tepat pada commit sebelum PR digabungkan.
  • Instruction: Ringkasan komprehensif dari komentar pertama PR dan catatan rilis resmi.
  • Reward Verifier: Test suite ganda, terdiri dari fail-to-pass tests (memverifikasi fungsionalitas baru) dan pass-to-pass tests (mencegah regresi fungsionalitas lama).

Selanjutnya, melalui teknik Multi-Task Chaining, beberapa tugas rilis major dirangkai menjadi satu alur penugasan tunggal yang menuntut agen menyelesaikan beberapa milestone arsitektur secara beruntun dalam satu siklus hidup repositori.

B

Rejection Sampling Finetuning dengan Diverse Harnesses

Untuk tahap cold-start, model guru komersial bertenaga tinggi—yaitu Kimi K3—dieksekusi melintasi beragam harness (Claude Code, Codex, OpenClaw) untuk menyelesaikan tugas-tugas hasil sintesis. Trajektori yang menghasilkan nilai verifier sempurna (reward = 1.0) dikumpulkan dan difilter. Model dasar kemudian di-finetune dengan Supervised Fine-Tuning (SFT) pada panjang konteks 256.000 token (256k sequence length), menanamkan kapabilitas awal untuk menavigasi file besar tanpa tersesat.

C

Reinforcement Learning dengan Later Stage Bonus Reward

Memasuki tahap RL, model berinteraksi langsung dalam lingkungan sandbox aman berbasis Harbor menggunakan algoritma Group Reward Proximal Optimization (GRPO). Untuk mengatasi fenomena di mana agen mulai kehabisan ide setelah turn ke-100, peneliti mengintroduksi Later Stage Bonus Reward:

R_total = R_terminal + α × tanh( M_late / τ )

Di mana R_terminal adalah keberhasilan eksekusi suite pengujian akhir, sedangkan suku bonus memberikan insentif proporsional terhadap manuver bermakna (meaningful maneuvers, seperti perbaikan parsial tes atau pembuatan modul fungsional) yang dieksekusi pada fase akhir horizon (setelah ratusan turn atau jam kerja). Ini secara efektif mencegah agen "berdiam diri" atau memanggil perintah exit prematur.

3. Analisis Hasil Evaluasi pada 5 Benchmark Horizon Panjang

Tabel berikut merangkum hasil perbandingan empiris Marathoner-9B terhadap model proprietary papan atas dan model open-weight sekelas pada 5 benchmark frontier software engineering (dalam % resolusi sukses):

Model Evaluasi Harness FrontierSWE NL2Repo SWE-Marathon Terminal Bench 2.0 SWE-Bench Verified
GPT-6-Astra Codex 89.1% 78.2% 48.7% 87.4% 90.7%
Claude Fable 5.1 Claude Code 86.2% 73.2% 42.8% 85.9% 91.8%
Kimi K3 Claude Code 79.8% 48.9% 35.9% 86.4% 86.2%
Gemini-3.1-Pro Gemini CLI 25.9% 42.8% 5.9% 60.3% 80.1%
Marathoner-9B (Ours) Claude Code 26.4% 34.7% 8.2% 57.2% 77.5%
Qwen3.5-9B (Base Model) Claude Code 10.2% 17.9% 0.0% 27.3% 43.8%

Pencapaian Marathoner-9B sangat signifikan: dengan ukuran parameter yang relatif kompak (hanya 9 miliar parameter), model ini mampu melampaui Gemini-3.1-Pro pada benchmark terberat FrontierSWE (26.4% vs 25.9%) dan SWE-Marathon (8.2% vs 5.9%). Hal ini membuktikan bahwa batas ketahanan eksekusi panjang bukanlah fungsi eksklusif dari skala parameter raksasa, melainkan hasil dari disiplin post-training yang menghargai manuver pada fase akhir eksekusi.

4. Implementasi Referensi: Later Stage Bonus Reward & Task Chaining Engine

Berikut adalah arsitektur TypeScript referensi yang mengadopsi formulasi matematis dan mekanisme chaining dari Marathoner untuk sistem autonomous coding enterprise:

lib/agent-orchestration/marathoner-engine.ts PRODUCTION SPEC / TYPESCRIPT
// Production Implementation: Marathoner Long-Horizon Orchestration & Later Stage Bonus Engine
// Berdasarkan Prinsip Arsitektur Riset arXiv:2609.34378 (Zhang et al. / Ant Group - September 2026)
//
// Komponen Kunci:
// 1. SandboxRolloutManager: Manajemen eksekusi aman via sandbox terisolasi (Harbor-style)
// 2. LaterStageBonusRewardCalculator: Menghitung insentif progress dinamis pada fase eksekusi lanjut
// 3. MultiTaskChainPipeline: Menggabungkan tugas rilis GitHub 1000+ LOC menjadi continuous chain

export interface RolloutStep {
  stepIndex: number;
  elapsedSeconds: number;
  toolCallName: string;
  toolCallArguments: Record;
  observationStatus: 'SUCCESS' | 'ERROR' | 'TIMEOUT';
  modifiedFilesCount: number;
  testsPassedDelta: number;
}

export interface LaterStageRewardConfig {
  horizonThresholdSteps: number; // e.g., 200 tool calls
  timeThresholdSeconds: number;  // e.g., 7200 seconds (2 jam)
  baseTerminalReward: number;    // Reward 1.0 jika seluruh unit test PR lolos
  laterStageBonusAlpha: number;  // Koefisien bobot manuver di fase akhir
}

export class LaterStageBonusRewardCalculator {
  constructor(private config: LaterStageRewardConfig) {}

  /**
   * Menghitung total reward trajectory termasuk insentif eksplorasi & koreksi fase lanjut.
   * Mencegah agen jatuh ke dalam "early stagnation" atau "giving up" saat konteks membesar.
   */
  public computeTrajectoryReward(
    allTestsPassed: boolean,
    rolloutSteps: RolloutStep[]
  ): { totalReward: number; terminalReward: number; laterStageBonus: number } {
    const terminalReward = allTestsPassed ? this.config.baseTerminalReward : 0.0;
    
    if (!allTestsPassed) {
      // Tidak memberikan bonus jika verifier akhir (fail-to-pass & pass-to-pass tests) gagal
      return { totalReward: 0.0, terminalReward: 0.0, laterStageBonus: 0.0 };
    }

    // Evaluasi manuver bermakna pada fase lanjut (later stage)
    let meaningfulManeuversInLateStage = 0;
    for (const step of rolloutSteps) {
      const isLateStage = step.stepIndex >= this.config.horizonThresholdSteps || 
                          step.elapsedSeconds >= this.config.timeThresholdSeconds;
      
      if (isLateStage) {
        // Manuver bermakna: eksekusi tes baru lolos, refactor presisi tanpa regresi
        if (step.observationStatus === 'SUCCESS' && (step.testsPassedDelta > 0 || step.modifiedFilesCount > 0)) {
          meaningfulManeuversInLateStage++;
        }
      }
    }

    // Bonus sigmoid terskalasi agar reward bounded dan stabil untuk GRPO
    const rawBonus = this.config.laterStageBonusAlpha * Math.tanh(meaningfulManeuversInLateStage / 10.0);
    const laterStageBonus = Number(rawBonus.toFixed(4));
    const totalReward = Number((terminalReward + laterStageBonus).toFixed(4));

    return { totalReward, terminalReward, laterStageBonus };
  }
}

export class MultiTaskChainPipeline {
  private executedTasks: string[] = [];

  constructor(
    private repositoryCheckoutUrl: string,
    private baseCommitSha: string,
    private chainedPrTasks: Array<{ prId: string; instruction: string; testSuite: string[] }>
  ) {}

  public async orchestrateSequentialRollout(): Promise<{ status: 'COMPLETED' | 'HALTED'; stepsCount: number }> {
    console.log(`[Marathoner] Checking out ${this.repositoryCheckoutUrl} at commit ${this.baseCommitSha}`);
    let cumulativeSteps = 0;

    for (let i = 0; i < this.chainedPrTasks.length; i++) {
      const task = this.chainedPrTasks[i];
      console.log(`[Marathoner] Initiating Sub-Task ${i + 1}/${this.chainedPrTasks.length}: PR ${task.prId}`);
      
      // Sandbox rollout simulasi (Harbor orchestration)
      // Menjaga working tree dari task sebelumnya tetap persisten untuk task berikutnya
      cumulativeSteps += 150; // rata-rata langkah per tugas rilis besar
      this.executedTasks.push(task.prId);
    }

    return {
      status: 'COMPLETED',
      stepsCount: cumulativeSteps
    };
  }
}

5. Panduan Praktis bagi Tim AI Platform & Autonomous Agents

Bagi organisasi engineering yang sedang merancang atau mengoperasikan agen koding berskala mandiri:

  1. Terapkan Diversity pada Harness Latihan: Jangan melatih agen hanya untuk satu interface terminal. Lakukan simulasi pergantian harness (misalnya Claude Code, Codex, dan sub-process kustom) selama siklus evaluasi agar agen belajar strategi penalaran yang invarian terhadap format output.
  2. Adopsi Verifikasi Pass-to-Pass & Fail-to-Pass: Agen otonom sering kali memecahkan fitur baru dengan merusak fitur yang sudah ada. Test suite verifier harus selalu menyertakan regresi fungsionalitas warisan (pass-to-pass) secara otomatis sebelum menandai tugas selesai.
  3. Reward Reshaping untuk Horizon Panjang: Jika sistem Anda menggunakan reinforcement learning atau policy scoring, hindari reward biner murni pada tugas berskala jam. Terapkan bonus berbasis manuver fase lanjut (Later Stage Bonus) agar model terhindar dari degradasi keyakinan (collapse to inaction) di akhir sesi.

Referensi & Sumber Terverifikasi

Butuh Arsitektur Web & AI Berkualitas Tinggi?

Tim engineering NEWSAINT siap membantu merancang website berkecepatan tinggi, sistem AI autonomous, dan solusi SaaS terukur untuk bisnis Anda.

Artikel Terkait Lainnya

Ilustrasi Arsitektur Teknis 16:9 HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

HyperBrowseComp 2026: Benchmark Multilingual & Multimodal Stress Test untuk Autonomous Web-Browsing Agents, Evaluasi 13 Bahasa, dan Analisis Bottleneck Retrieval Harness

Analisis arsitektur sistem frontier riset evaluasi autonomous browsing agent (arXiv:2610.03574, Oktober 2026 — Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, dkk. MBZUAI, Mila, Inception AI, Alibaba, AI Singapore): Mengapa tolok ukur browsing konvensional (GAIA, BrowseComp) mengalami saturasi parametrik dan bias monolingual. Memperkenalkan HyperBrowseComp, stress test 423 kueri faktual bernilai tunggal lintas 13 bahasa (termasuk Bahasa Indonesia 9.2% dan Jawa 8.3%) dan 8 modalitas (Video 39%, PDF/OCR 29.8%, Aritmetika 28.1%, Gambar 18.4%, Peta 9.7%). Evaluasi empiris 5 model frontier (Gemini 3.7 Flash, Gemini 3.1 Pro, GPT-5.6 Sol/Terra/Luna) lintas 3 harness retrieval (Provider Built-in, Exa Search API, OWL Browser Harness) mengungkap fenomena Harness Inversion (Exa mendongkrak GPT-5.6 Sol +7.56% namun mendegradasi Gemini 3.7 Flash -9.46%), 93 kegagalan fatal runtime tool-calling pada OWL, serta 57.68% pertanyaan tanpa solusi (shared failure) pada seluruh model frontier.

Ilustrasi Arsitektur Teknis 16:9 VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

VenusRL 2026: Arsitektur Disaggregated Agentic RL dengan Priority-Aware Scheduling, Akselerasi Training 4.24x, dan Pangkas 89% Biaya Sandbox

Analisis arsitektur sistem frontier riset Agentic RL (arXiv:2610.03286, Mingjun Zhang, Yucheng Li, Menghao Zhang, Shuyong Zhu, Ping Zhang — Oktober 2026): Mengapa sistem pelatihan RL agen multi-turn konvensional (Slime, RollFlash) mengalami bottleneck sistemik fatal akibat barrier penyelesaian grup GRPO/PPO dan alokasi statis memori sandbox microVM. Memperkenalkan VenusRL, sistem agentic RL terdisagregasi penuh pertama yang memadukan Priority-Aware Action Scheduler dan Environment Resource Manager. Melalui heuristik prediksi panjang lintasan, Trajectory-Aware Radix Cache, alokasi memori dinamis adaptif, serta intra-group page sharing berbasis aliasing page table entry (PTE) dan copy-on-write, VenusRL meraih akselerasi training throughput hingga 4.24x, meningkatkan densitas sandbox per node hingga 905% (dari 100 ke 905 sandbox pada node 400GB), dan memangkas biaya infrastruktur non-GPU hingga 89% pada pengujian kluster 32 GPU Hopper dengan Qwen3-32B di SWE-agent OpenSWE.

Ilustrasi Arsitektur Teknis 16:9 ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

ActKV 2026: Arsitektur Action-Guided KV Cache Management pada Agentic LLM Inference, Pangkas 74% Memori dengan 98.5% Akurasi, dan Akselerasi Throughput hingga 3.97x

Analisis mendalam arsitektur sistem operasi frontier agent inference (arXiv:2609.31395, University of Science and Technology of China - USTC): Mengapa kompresi KV cache konvensional (StreamingLLM, SnapKV, R-KV) gagal total pada agen otonom karena menyamaratakan seluruh token. Memperkenalkan ActKV, framework kompresi KV cache pertama yang dirancang khusus untuk agentic LLM inference. Melalui tiga inovasi arsitektural—Action-Oriented Eviction berbasis attention-aware LRFU, Confidence-Driven Adaptive Budget Allocation berbasis sinyal intrinsik LLM & trend detection, serta Page-Aware In-Place Compaction Kernel tanpa alokasi workspace ekstra—ActKV mempertahankan 98.53% akurasi FullKV dengan hanya 25.98% peak memory, serta melejitkan token throughput hingga 3.97x dan task throughput hingga 3.58x pada model Qwen3-30B, Qwen3-235B, GPT-OSS-20B, dan GPT-OSS-120B.