Remote Recovery¶
Zdalne odzyskiwanie ma działać wtedy, gdy system operacyjny, główny worker albo podstawowe łącze nie działa. Dlatego ścieżka recovery jest oddzielona od Execution Fabric.
Drabina odzyskiwania¶
- restart pojedynczej usługi;
- drain i kontrolowany restart runtime;
- restart systemu operacyjnego;
- Wake-on-LAN;
- ATX soft power/reset przez KVM;
- KVM-over-IP: BIOS/UEFI, boot menu, wirtualny nośnik;
- kontrolowany power-cycle PDU/smart plug;
- fizyczna wizyta i wymiana części.
Każdy krok jest wykonywany najwyżej zgodnie z retry budget. Brak poprawy przesuwa procedurę wyżej; nie powtarza w nieskończoność tego samego restartu.
flowchart TD
H["Brak heartbeat"] --> D["Diagnoza z N0/N15"]
D --> S["Restart usługi"]
S -->|"FAIL"| O["Restart OS"]
O -->|"FAIL"| W["WOL / ATX"]
W -->|"FAIL"| K["KVM BIOS / virtual media"]
K -->|"FAIL"| P["Awaryjny power-cycle"]
P -->|"FAIL"| V["Wizyta serwisowa"]
S -->|"PASS"| R["Attestation + canary"]
O -->|"PASS"| R
W -->|"PASS"| R
K -->|"PASS"| R
Zasada powrotu¶
Uruchomienie systemu nie oznacza powrotu do produkcji. Węzeł przechodzi sprawdzenie dysku, czasu, konfiguracji, sterownika, temperatur, audytu i canary job. Dopiero receipt recovery.accepted przywraca kolejkę.