Przejdź do treści

Profile mocy i load shedding

Cel modułu

Zamienić stan sieci, UPS, baterii i obciążenia na deterministyczny plan ograniczeń. Moduł nie optymalizuje „na ślepo”; działa w zatwierdzonych progach.

Wejścia

  • napięcie i stan sieci;
  • SOC, SOH, temperatura i alarmy baterii;
  • realny pobór każdego obwodu/PDU;
  • aktywne joby, checkpoint time i krytyczność;
  • prognoza PV oraz minimalna rezerwa;
  • dostępność WAN, KVM i Management Node.

Wyjścia

Plan zawiera profile_id, kolejność odłączeń, deadline checkpointu, minimalny SOC, elementy nietykalne, wymagane approvals i warunek powrotu. Każde wykonanie generuje receipt.

Profile E0–E6

Profil Stan Dozwolone działania Cel
E0 Sentinel only wyłącznie health, recovery, audyt przetrwanie minimalne
E1 Management + WAN Control Plane i komunikacja możliwość decyzji zdalnej
E2 Small office N2 i minimum usług ciągłość biura
E3 One worker throttled jeden worker z power limit dokończenie krytycznego joba
E4 Max workstation shutdown checkpoint i stop N9/N13 ochrona danych i sprzętu
E5 Island mode lokalne security i usługi praca obiektu bez WAN/grid
E6 Rack continuity jedna replika + core kontrolowana degradacja DC

Przykładowe polecenia

  • „Po utracie sieci zatrzymaj nowe rendery, pozwól N8 zapisać checkpoint przez 8 minut, potem go wyłącz.”
  • „Przy SOC poniżej 35% przejdź z E3 do E1 i zachowaj działanie KVM.”
  • „Po powrocie prądu odczekaj 10 minut stabilności i uruchamiaj workery pojedynczo.”

Pełny przebieg

Detektor potwierdza awarię przez UPS i licznik. Policy Engine oblicza konserwatywny runtime, zamraża nowe joby, prosi workery o checkpoint, sprawdza receipt, następnie odłącza klasy według priorytetu. N0/N15 nadal rejestruje stan. Powrót zasilania uruchamia histerezę, ładuje baterię do progu i wykonuje start etapowy z attestation.

Walidacja

Test musi użyć rzeczywistego obciążenia. Sprawdza się: czas detekcji, brak utraty Control Plane, poprawność checkpointu, kolejność shutdown, zachowanie przy braku telemetrii, start po zaniku i brak jednoczesnego prądu rozruchowego wszystkich workerów.

Błędy i fallback

Brak SOC oznacza przyjęcie najgorszego z bezpiecznych scenariuszy. Niespójne liczniki blokują utrzymanie GPU. Brak receipt checkpointu nie wydłuża pracy bez końca: po deadline następuje bezpieczny shutdown OS, a twarde odcięcie tylko przy krytycznie niskim napięciu. Ręczny przełącznik i interlock elektryczny pozostają nadrzędne.