Zdalne odzyskiwanie i ciągłość działania¶
Cel¶
Recovery Plane ma umożliwić przywrócenie NORBI po zawieszeniu systemu, uszkodzeniu aktualizacji, utracie sieci, awarii dysku, zasilania albo głównego workera. Jest fizycznie i logicznie oddzielony od codziennego Execution Plane. Agent nie ma dostępu do KVM, ATX ani awaryjnego smart plug jako zwykłych narzędzi.
Elementy¶
Management Node¶
Mały, energooszczędny, niezależny komputer działający stale. Utrzymuje overlay VPN, monitoring out-of-band, dokumentację recovery, kopie konfiguracji sieciowej, dostęp do KVM i UPS oraz ograniczony Recovery Console. Nie hostuje głównego modelu ani zwykłych worker jobs. Ma osobną tożsamość, zasilanie UPS i minimalny software.
KVM-over-IP¶
Zapewnia obraz HDMI/DisplayPort, emulację klawiatury/myszy i — jeśli wspierane — wirtualny nośnik. Pozwala wejść do BIOS/UEFI, zobaczyć boot, BitLocker prompt i naprawić sieć, gdy OS nie działa. Dostęp tylko przez management network/VPN, MFA, allowlistę urządzeń i audit. KVM nie jest eksponowany agentom.
Sterowanie ATX¶
Dedykowane wyjście KVM/BMC symuluje krótki lub długi przycisk power/reset. Krótkie naciśnięcie jest preferowane; długie odcięcie jest destrukcyjne dla stanu i wymaga wyższego progu decyzji. Receipt powinien odnotować fizyczne wyjście, ale rzeczywisty boot jest potwierdzany osobnym health checkiem.
Wake-on-LAN¶
WoL uruchamia poprawnie zasilony komputer z kompatybilną kartą i firmware. Magic packet idzie z Management Node w lokalnym VLAN, nie z internetu. WoL nie naprawi zawieszonego zasilacza, wyłączonej listwy ani nieprawidłowego BIOS. Po pakiecie system czeka na kolejne sygnały: link, ping management, agent health.
UPS¶
UPS chroni Control Plane, storage, Management Node, sieć i wybrane workery. Agent UPS dostarcza battery, load, runtime, input quality i self-test. Polityka ma progi: ograniczenie nowych jobs, checkpoint długich zadań, graceful shutdown, alarm i cold-start po stabilizacji. UPS nie jest zwykłym smart plugiem; koordynuje shutdown, zanim zabraknie energii.
Awaryjny smart plug¶
Jest ostatnim środkiem dla urządzenia, które nie odpowiada na KVM/ATX i nie ma BMC. Musi mieć odpowiedni prąd rozruchowy, lokalne sterowanie, stan po powrocie zasilania, ręczny przycisk i oddzielną sieć. Nie stosuje się go do urządzeń, których nagłe odcięcie grozi bezpieczeństwem lub korupcją storage. Sekwencja off/on ma minimalny czas rozładowania i jedną próbę, nie pętlę power-cycle.
Karta modułu Recovery Plane¶
| Pole | Kontrakt |
|---|---|
| Odpowiedzialności | health out-of-band, power/console access, restore, boot validation, incident evidence i handback. |
| Wejścia | alert braku heartbeat, UPS, KVM capture, backup catalog, runbook, human approval. |
| Wyjścia | recovery actions, screenshots/logs, restored candidate, health report, incident timeline. |
| Zależności | Management Node, KVM, UPS, ATX/WoL, backups, management VLAN/VPN, offline credentials. |
| Uprawnienia | human break-glass; agent może proponować runbook, nie wykonywać fizycznego resetu samodzielnie. |
| Autonomia | monitoring i bezpieczne graceful shutdown według twardej polityki; power-cycle wymaga człowieka. |
| Walidacja | kwartalny recovery drill, test restore, boot chain, UPS runtime, KVM access i log integrity. |
| Awaria | lokalna interwencja, fizyczny przycisk, zapasowy nośnik i udokumentowane RPO/RTO. |
Topologia recovery¶
flowchart TB
REM["Operator zdalny"] --> VPN["MFA + overlay VPN"]
VPN --> MN["Management Node"]
MN --> KVM["KVM-over-IP"]
MN --> UPS["UPS / PDU telemetry"]
MN --> WOL["Wake-on-LAN"]
KVM --> ATX["ATX power/reset"]
KVM --> HOST["Norbi host / worker"]
WOL --> HOST
UPS --> HOST
UPS --> MN
MN --> PLUG["Awaryjny smart plug<br/>ostatnia linia"]
PLUG --> HOST
Drabina odzyskiwania¶
- Potwierdź problem. Sprawdź heartbeat Control Plane, worker, sieć, UPS i KVM. Nie resetuj z powodu jednego niespójnego alarmu.
- Zatrzymaj skutki. Revoke grants/sessions, pause dispatch, oznacz aktywne jobs i utrwal volatile evidence.
- Najłagodniejsza metoda. Recovery API lub graceful service restart — tylko jeśli OS i tożsamość są wiarygodne.
- WoL. Gdy host jest poprawnie wyłączony, ale zasilany.
- KVM. Odczytaj ekran, BIOS/boot, dyski i stan aktualizacji; wykonaj runbook pod kontrolą człowieka.
- Krótki ATX. Poproś OS o shutdown/power on; obserwuj KVM i UPS.
- Długi ATX/reset. Tylko przy całkowitym zawieszeniu i po ocenie ryzyka zapisu.
- Smart plug. Jednorazowe odcięcie jako ostatnia linia, po upewnieniu się, że storage nie jest współdzielony i nie ma bezpieczniejszej metody.
- Restore. Odtwórz bazę/konfigurację do izolacji, zweryfikuj, a dopiero potem przełącz.
- Handback. Health checks, reconciliation jobs, wznowienie najpierw read-only/canary, decyzja operatora.
Backup i RPO/RTO¶
Definiuje się osobno dla Control Plane DB, Artifact Store, konfiguracji, modeli i kodu. SQLite backup korzysta z właściwych mechanizmów online/checkpoint, obejmuje schema/version i jest okresowo odtwarzany w izolacji. Artifact Store stosuje manifesty i hashe; wielkie modele mogą być odzyskiwane z lokalnego źródła, jeśli nie opłaca się ich backupować. Kopia bez testu restore nie jest backupem operacyjnym.
Przykładowe cele: Management Node RTO 30 min, Control Plane RTO 2 h/RPO 15 min, Artifact metadata RPO 15 min, duże media według polityki projektu. Konkretne wartości wynikają z pakietu klienta i budżetu.
Scenariusze¶
Zawieszony GPU worker: Scheduler zatrzymuje nowe lease, job otrzymuje uncertain/checkpoint status. Control Plane działa. Operator przez KVM sprawdza ekran i temperatury. Restart dotyczy tylko workera; po powrocie reconciliation sprawdza artefakty.
Uszkodzona aktualizacja boot: KVM pokazuje recovery screen. Operator wybiera znany dobry boot entry lub nośnik recovery. Nie uruchamia agentów w środowisku naprawczym. Po boot system pozostaje read-only do integrity checks.
Długa awaria zasilania: UPS alarmuje, Scheduler nie zaczyna renderów, checkpointuje, storage flushuje, Control Plane i sieć kończą graceful shutdown według kolejności. Management Node działa najdłużej. Po powrocie czeka na stabilne zasilanie, uruchamia storage, Control Plane i workery, a jobs są rekoncyliowane.
Ryzyka i walidacja¶
Out-of-band management jest potężnym celem. Ryzyka: słabe hasło KVM, vendor cloud, wystawienie portu, wspólna sieć, smart plug loop, fałszywy alarm i nieprzetestowany UPS. Wymagane są unikatowe credentials offline, aktualizacje firmware w maintenance, wyłączenie zbędnej chmury, segmentacja, MFA, kwartalny test KVM/WoL/ATX, coroczny pełny restore i dokumentowana lokalna procedura.
Jeśli Management Node także nie działa, system wymaga lokalnej osoby z runbookiem, zapasowym kluczem i fizycznym dostępem. Architektura nie udaje, że zdalność eliminuje potrzebę interwencji fizycznej.