Agent (ActorCritic) belajar lewat coba-coba (PPO, reward/penalty) menempatkan rule firewall di jaringan — coverage, kapasitas per-kelas, posisi-prioritas ditegakkan lewat action mask; resiliency (jumlah node aktif minimum) lewat fase tambahan di akhir episode. Semua data di halaman ini diambil langsung dari summary.json / per_seed.csv / rule_placement.csv real di Google Drive — link lengkap ada di bagian bawah.
| Topologi | Node aktif / target | Biaya — seed terbaik | Biaya — rata-rata 5 seed (±std) | Konsistensi |
|---|---|---|---|---|
| NSFNET | 11/11 (5/5 valid) | 3550.6 | 5114.4 (±2078.2) | ⚠️ varians tinggi |
| ABVT | 18/18 (4/5 valid) | 10334.3 | 12008.9 (±1193.8) | ⚠️ varians tinggi |
| Geant2001 | 15/15 (5/5 valid) | 11121.0 | 19094.4 (±4639.8) | ⚠️ varians tinggi |
| BICS | 22/22 (5/5 valid) | 11504.2 | 16179.0 (±2337.4) | ⚠️ 4/5 seed mandek pola serupa |
| Surfnet | 39/39 (5/5 valid) | 17842.9 | 17843.7 (±0.4) | ✅ konsisten |
13 langkah yang sama persis dengan tabel di dokumen framework — cuma dijelaskan pakai bahasa sehari-hari. Beda utama dari solver matematika: di sini ada "agent" yang belajar lewat coba-coba berulang kali (Langkah 8), bukan langsung dihitung sekali jadi.