Przejdź do treści

Remote Recovery

Zdalne odzyskiwanie ma działać wtedy, gdy system operacyjny, główny worker albo podstawowe łącze nie działa. Dlatego ścieżka recovery jest oddzielona od Execution Fabric.

Drabina odzyskiwania

  1. restart pojedynczej usługi;
  2. drain i kontrolowany restart runtime;
  3. restart systemu operacyjnego;
  4. Wake-on-LAN;
  5. ATX soft power/reset przez KVM;
  6. KVM-over-IP: BIOS/UEFI, boot menu, wirtualny nośnik;
  7. kontrolowany power-cycle PDU/smart plug;
  8. fizyczna wizyta i wymiana części.

Każdy krok jest wykonywany najwyżej zgodnie z retry budget. Brak poprawy przesuwa procedurę wyżej; nie powtarza w nieskończoność tego samego restartu.

flowchart TD
    H["Brak heartbeat"] --> D["Diagnoza z N0/N15"]
    D --> S["Restart usługi"]
    S -->|"FAIL"| O["Restart OS"]
    O -->|"FAIL"| W["WOL / ATX"]
    W -->|"FAIL"| K["KVM BIOS / virtual media"]
    K -->|"FAIL"| P["Awaryjny power-cycle"]
    P -->|"FAIL"| V["Wizyta serwisowa"]
    S -->|"PASS"| R["Attestation + canary"]
    O -->|"PASS"| R
    W -->|"PASS"| R
    K -->|"PASS"| R

Zasada powrotu

Uruchomienie systemu nie oznacza powrotu do produkcji. Węzeł przechodzi sprawdzenie dysku, czasu, konfiguracji, sterownika, temperatur, audytu i canary job. Dopiero receipt recovery.accepted przywraca kolejkę.

Nawigacja