Przejdź do treści

Zdalne odzyskiwanie i ciągłość działania

Cel

Recovery Plane ma umożliwić przywrócenie NORBI po zawieszeniu systemu, uszkodzeniu aktualizacji, utracie sieci, awarii dysku, zasilania albo głównego workera. Jest fizycznie i logicznie oddzielony od codziennego Execution Plane. Agent nie ma dostępu do KVM, ATX ani awaryjnego smart plug jako zwykłych narzędzi.

Elementy

Management Node

Mały, energooszczędny, niezależny komputer działający stale. Utrzymuje overlay VPN, monitoring out-of-band, dokumentację recovery, kopie konfiguracji sieciowej, dostęp do KVM i UPS oraz ograniczony Recovery Console. Nie hostuje głównego modelu ani zwykłych worker jobs. Ma osobną tożsamość, zasilanie UPS i minimalny software.

KVM-over-IP

Zapewnia obraz HDMI/DisplayPort, emulację klawiatury/myszy i — jeśli wspierane — wirtualny nośnik. Pozwala wejść do BIOS/UEFI, zobaczyć boot, BitLocker prompt i naprawić sieć, gdy OS nie działa. Dostęp tylko przez management network/VPN, MFA, allowlistę urządzeń i audit. KVM nie jest eksponowany agentom.

Sterowanie ATX

Dedykowane wyjście KVM/BMC symuluje krótki lub długi przycisk power/reset. Krótkie naciśnięcie jest preferowane; długie odcięcie jest destrukcyjne dla stanu i wymaga wyższego progu decyzji. Receipt powinien odnotować fizyczne wyjście, ale rzeczywisty boot jest potwierdzany osobnym health checkiem.

Wake-on-LAN

WoL uruchamia poprawnie zasilony komputer z kompatybilną kartą i firmware. Magic packet idzie z Management Node w lokalnym VLAN, nie z internetu. WoL nie naprawi zawieszonego zasilacza, wyłączonej listwy ani nieprawidłowego BIOS. Po pakiecie system czeka na kolejne sygnały: link, ping management, agent health.

UPS

UPS chroni Control Plane, storage, Management Node, sieć i wybrane workery. Agent UPS dostarcza battery, load, runtime, input quality i self-test. Polityka ma progi: ograniczenie nowych jobs, checkpoint długich zadań, graceful shutdown, alarm i cold-start po stabilizacji. UPS nie jest zwykłym smart plugiem; koordynuje shutdown, zanim zabraknie energii.

Awaryjny smart plug

Jest ostatnim środkiem dla urządzenia, które nie odpowiada na KVM/ATX i nie ma BMC. Musi mieć odpowiedni prąd rozruchowy, lokalne sterowanie, stan po powrocie zasilania, ręczny przycisk i oddzielną sieć. Nie stosuje się go do urządzeń, których nagłe odcięcie grozi bezpieczeństwem lub korupcją storage. Sekwencja off/on ma minimalny czas rozładowania i jedną próbę, nie pętlę power-cycle.

Karta modułu Recovery Plane

Pole Kontrakt
Odpowiedzialności health out-of-band, power/console access, restore, boot validation, incident evidence i handback.
Wejścia alert braku heartbeat, UPS, KVM capture, backup catalog, runbook, human approval.
Wyjścia recovery actions, screenshots/logs, restored candidate, health report, incident timeline.
Zależności Management Node, KVM, UPS, ATX/WoL, backups, management VLAN/VPN, offline credentials.
Uprawnienia human break-glass; agent może proponować runbook, nie wykonywać fizycznego resetu samodzielnie.
Autonomia monitoring i bezpieczne graceful shutdown według twardej polityki; power-cycle wymaga człowieka.
Walidacja kwartalny recovery drill, test restore, boot chain, UPS runtime, KVM access i log integrity.
Awaria lokalna interwencja, fizyczny przycisk, zapasowy nośnik i udokumentowane RPO/RTO.

Topologia recovery

flowchart TB
    REM["Operator zdalny"] --> VPN["MFA + overlay VPN"]
    VPN --> MN["Management Node"]
    MN --> KVM["KVM-over-IP"]
    MN --> UPS["UPS / PDU telemetry"]
    MN --> WOL["Wake-on-LAN"]
    KVM --> ATX["ATX power/reset"]
    KVM --> HOST["Norbi host / worker"]
    WOL --> HOST
    UPS --> HOST
    UPS --> MN
    MN --> PLUG["Awaryjny smart plug<br/>ostatnia linia"]
    PLUG --> HOST

Drabina odzyskiwania

  1. Potwierdź problem. Sprawdź heartbeat Control Plane, worker, sieć, UPS i KVM. Nie resetuj z powodu jednego niespójnego alarmu.
  2. Zatrzymaj skutki. Revoke grants/sessions, pause dispatch, oznacz aktywne jobs i utrwal volatile evidence.
  3. Najłagodniejsza metoda. Recovery API lub graceful service restart — tylko jeśli OS i tożsamość są wiarygodne.
  4. WoL. Gdy host jest poprawnie wyłączony, ale zasilany.
  5. KVM. Odczytaj ekran, BIOS/boot, dyski i stan aktualizacji; wykonaj runbook pod kontrolą człowieka.
  6. Krótki ATX. Poproś OS o shutdown/power on; obserwuj KVM i UPS.
  7. Długi ATX/reset. Tylko przy całkowitym zawieszeniu i po ocenie ryzyka zapisu.
  8. Smart plug. Jednorazowe odcięcie jako ostatnia linia, po upewnieniu się, że storage nie jest współdzielony i nie ma bezpieczniejszej metody.
  9. Restore. Odtwórz bazę/konfigurację do izolacji, zweryfikuj, a dopiero potem przełącz.
  10. Handback. Health checks, reconciliation jobs, wznowienie najpierw read-only/canary, decyzja operatora.

Backup i RPO/RTO

Definiuje się osobno dla Control Plane DB, Artifact Store, konfiguracji, modeli i kodu. SQLite backup korzysta z właściwych mechanizmów online/checkpoint, obejmuje schema/version i jest okresowo odtwarzany w izolacji. Artifact Store stosuje manifesty i hashe; wielkie modele mogą być odzyskiwane z lokalnego źródła, jeśli nie opłaca się ich backupować. Kopia bez testu restore nie jest backupem operacyjnym.

Przykładowe cele: Management Node RTO 30 min, Control Plane RTO 2 h/RPO 15 min, Artifact metadata RPO 15 min, duże media według polityki projektu. Konkretne wartości wynikają z pakietu klienta i budżetu.

Scenariusze

Zawieszony GPU worker: Scheduler zatrzymuje nowe lease, job otrzymuje uncertain/checkpoint status. Control Plane działa. Operator przez KVM sprawdza ekran i temperatury. Restart dotyczy tylko workera; po powrocie reconciliation sprawdza artefakty.

Uszkodzona aktualizacja boot: KVM pokazuje recovery screen. Operator wybiera znany dobry boot entry lub nośnik recovery. Nie uruchamia agentów w środowisku naprawczym. Po boot system pozostaje read-only do integrity checks.

Długa awaria zasilania: UPS alarmuje, Scheduler nie zaczyna renderów, checkpointuje, storage flushuje, Control Plane i sieć kończą graceful shutdown według kolejności. Management Node działa najdłużej. Po powrocie czeka na stabilne zasilanie, uruchamia storage, Control Plane i workery, a jobs są rekoncyliowane.

Ryzyka i walidacja

Out-of-band management jest potężnym celem. Ryzyka: słabe hasło KVM, vendor cloud, wystawienie portu, wspólna sieć, smart plug loop, fałszywy alarm i nieprzetestowany UPS. Wymagane są unikatowe credentials offline, aktualizacje firmware w maintenance, wyłączenie zbędnej chmury, segmentacja, MFA, kwartalny test KVM/WoL/ATX, coroczny pełny restore i dokumentowana lokalna procedura.

Jeśli Management Node także nie działa, system wymaga lokalnej osoby z runbookiem, zapasowym kluczem i fizycznym dostępem. Architektura nie udaje, że zdalność eliminuje potrzebę interwencji fizycznej.