Profile mocy i load shedding¶
Cel modułu¶
Zamienić stan sieci, UPS, baterii i obciążenia na deterministyczny plan ograniczeń. Moduł nie optymalizuje „na ślepo”; działa w zatwierdzonych progach.
Wejścia¶
- napięcie i stan sieci;
- SOC, SOH, temperatura i alarmy baterii;
- realny pobór każdego obwodu/PDU;
- aktywne joby, checkpoint time i krytyczność;
- prognoza PV oraz minimalna rezerwa;
- dostępność WAN, KVM i Management Node.
Wyjścia¶
Plan zawiera profile_id, kolejność odłączeń, deadline checkpointu, minimalny SOC, elementy nietykalne, wymagane approvals i warunek powrotu. Każde wykonanie generuje receipt.
Profile E0–E6¶
| Profil | Stan | Dozwolone działania | Cel |
|---|---|---|---|
| E0 | Sentinel only | wyłącznie health, recovery, audyt | przetrwanie minimalne |
| E1 | Management + WAN | Control Plane i komunikacja | możliwość decyzji zdalnej |
| E2 | Small office | N2 i minimum usług | ciągłość biura |
| E3 | One worker throttled | jeden worker z power limit | dokończenie krytycznego joba |
| E4 | Max workstation shutdown | checkpoint i stop N9/N13 | ochrona danych i sprzętu |
| E5 | Island mode | lokalne security i usługi | praca obiektu bez WAN/grid |
| E6 | Rack continuity | jedna replika + core | kontrolowana degradacja DC |
Przykładowe polecenia¶
- „Po utracie sieci zatrzymaj nowe rendery, pozwól N8 zapisać checkpoint przez 8 minut, potem go wyłącz.”
- „Przy SOC poniżej 35% przejdź z E3 do E1 i zachowaj działanie KVM.”
- „Po powrocie prądu odczekaj 10 minut stabilności i uruchamiaj workery pojedynczo.”
Pełny przebieg¶
Detektor potwierdza awarię przez UPS i licznik. Policy Engine oblicza konserwatywny runtime, zamraża nowe joby, prosi workery o checkpoint, sprawdza receipt, następnie odłącza klasy według priorytetu. N0/N15 nadal rejestruje stan. Powrót zasilania uruchamia histerezę, ładuje baterię do progu i wykonuje start etapowy z attestation.
Walidacja¶
Test musi użyć rzeczywistego obciążenia. Sprawdza się: czas detekcji, brak utraty Control Plane, poprawność checkpointu, kolejność shutdown, zachowanie przy braku telemetrii, start po zaniku i brak jednoczesnego prądu rozruchowego wszystkich workerów.
Błędy i fallback¶
Brak SOC oznacza przyjęcie najgorszego z bezpiecznych scenariuszy. Niespójne liczniki blokują utrzymanie GPU. Brak receipt checkpointu nie wydłuża pracy bez końca: po deadline następuje bezpieczny shutdown OS, a twarde odcięcie tylko przy krytycznie niskim napięciu. Ręczny przełącznik i interlock elektryczny pozostają nadrzędne.