Internet of drones (iod) sering menghadapi tantangan instabilitas konektivitas akibat mobilitas node yang ekstrem dan potensi kegagalan infrastruktur. standar ieee 802.11ah (wi-fi halow) menawarkan jangkauan komunikasi yang jauh, namun mekanisme perutean konvensionalnya rentan terhadap fluktuasi kanal dan kerusakan node. penelitian ini mengembangkan algoritma pemilihan node relay cerdas berbasis deep reinforcement learning (drl) untuk mengoptimalkan jaringan iod (16 drone dinamis dan 4 node relay statis). lingkungan simulasi dibangun menggunakan ns-3 dengan mekanisme restricted access window (raw) dan model mobilitas gauss-markov 3d, yang diintegrasikan dengan agen drl (proximal policy optimization dan recurrentppo) melalui komunikasi soket tcp. untuk menjamin signifikansi statistik, evaluasi dilakukan menggunakan rata-rata dari 5 seed acak independen dengan masa pelatihan 20.000 step, pada skenario ekstrem di mana relay mengalami malfungsi secara bergilir. hasil eksperimen menunjukkan bahwa kedua agen drl berhasil mendeteksi kegagalan relay dan merutekan ulang trafik secara otonom, mengungguli metode baseline konvensional pada seluruh metrik quality of service (qos). recurrentppo mencapai kinerja terbaik dengan packet delivery ratio (pdr) sebesar 82,6%, mengungguli ppo (78,0%), random (75,8%), dan static (75,2%). selain itu, recurrentppo juga mencatatkan throughput tertinggi (0,030 mbps) dan latensi end-to-end terendah (257,0 ms). dari sisi komputasi, ppo terbukti 5,8% lebih efisien untuk dilatih (21.102 detik berbanding 22.404 detik pada recurrentppo) karena tidak memiliki beban komputasi backpropagation-through-time (bptt).
Electronic Theses and Dissertation
Universitas Syiah Kuala
THESES
PEMILIHAN NODE RELAY ADAPTIF BERBASIS DEEP REINFORCEMENT LEARNING PADA INTERNET OF DRONES MELALUI JARINGAN IEEE 802.11AH. Banda Aceh Prog. Magister Teknik Elektro Unsyiah,2026
Baca Juga : EVALUASI KINERJA JARINGAN MULTIHOP RELAY WIMAX (Dhara Monica Aqsa, 2024)
Abstract
The Internet of Drones (IoD) suffers from connectivity instability caused by extreme node mobility and potential infrastructure failures. This paper proposes an adaptive relay-node-selection scheme based on Deep Reinforcement Learning (DRL) for a two-hop IoD network comprising 16 dynamic drones and 4 static relay nodes over an IEEE 802.11ah network. The simulation environment couples Network Simulator 3 (NS-3), configured with the Restricted Access Window (RAW) mechanism and a 3D Gauss-Markov mobility model, with two DRL agents—Proximal Policy Optimization (PPO) and Recurrent PPO (an LSTM-augmented variant)—via a TCP-socket bridge. To ensure statistical robustness and eliminate random-seed bias, all evaluations are averaged over 5 independent runs across a 20,000-step training window under a rotating relay-failure scenario. Experimental results show that both PPO and RecurrentPPO successfully detect relay failures and re-route traffic autonomously, consistently outperforming the non-learning baselines across all quality-of-service metrics evaluated. RecurrentPPO achieves the highest Packet Delivery Ratio (PDR) of 82.6%, ahead of PPO (78.0%), the RANDOM baseline (75.8%), and the Static round-robin baseline (75.2%). RecurrentPPO also attains the highest final cumulative reward (0.56, versus 0.52 for PPO, 0.42 for RANDOM, and 0.39 for Static), the highest final throughput (0.030 Mbps), and the lowest end-to-end latency (257.0 ms, versus 288.5 ms for PPO, 369.2 ms for RANDOM, and 393.0 ms for Static). In terms of computational cost, PPO remains the more efficient agent to train, requiring 21,102 s versus 22,404 s for RecurrentPPO — a 5.8% saving attributable to the absence of Backpropagation-Through-Time overhead in its feed-forward architecture.
Baca Juga : DETEKSI ANOMALI JARINGAN MENGGUNAKAN SURICATA DAN DEEP REINFORCEMENT LEEARNING DENGAN ANTARMUKA BOT TELEGRAM (TAUFIQUR RAHMAN, 2025)