DOI: 10.3390/en19194594 ISSN: 1996-1073

Deep Learning Benchmarks for Multi-Step Photovoltaic Power Forecasting: Comparative Assessment of GRU, LSTM, and BiLSTM Architectures

Islam Nacer Eddine El Ghoul, Antar Beddar, Farid Hadjrioua, Abdelbasset Azzouz, Jun-Jiat Tiang

Accurate photovoltaic (PV) power forecasting is essential for renewable energy integration, dynamic reserve allocation, and generation scheduling. Unpredicted generation ramps induce substantial voltage and frequency deviations on grid-connected distribution networks. This paper provides an objective benchmark among three deep learning architectures: Gated Recurrent Unit (GRU), Long Short-Term Memory (LSTM), and Bidirectional LSTM (BiLSTM). Telemetry spanning one year from an operational 175 kW plant in Reggane, Algeria, is evaluated across 72 h horizons (H=288 steps at 15 min resolution) using a Direct Multi-Input Multi-Output framework under strict chronological splitting. The models are systematically evaluated across 1848 rolling 72 h forecast windows using a controlled benchmark protocol under daylight-only conditions (GHI>5 W/m2) against a Diurnal Smart Persistence baseline. Accuracy is assessed via daylight capacity-normalized MAE (nMAE), nRMSE, Diebold–Mariano tests (h=72 lags), and ramp metrics across 34,840 events. The results demonstrate that deep architectures significantly outperform persistence (p<0.001). BiLSTM achieves superior overall accuracy (nMAE=2.84%, nRMSE=3.60%, R2=0.985, skill score = 79.37%) and the highest ramp fidelity (F1-Ramp = 0.965, RME=6.97 kW, yielding 54.95% ramp error reduction). Standard LSTM demonstrates competitive performance (nMAE=3.19%, skill score = 77.95%), whereas GRU exhibits higher deviations (nMAE=5.05%, skill score = 66.91%). Measured sub-millisecond latencies (0.07–0.11 ms/sample) confirm that computational overhead is negligible for 15 min dispatch, establishing BiLSTM as optimal for operational dispatch.