Zasady architektury infrastruktury¶
Cel¶
Zasady mają sprawić, by dobór sprzętu nie rozmył architektury bezpieczeństwa. Wymienny model, karta GPU albo router nie może stać się ukrytym właścicielem procesu. Każdy element ma rolę, kontrakt, granice oraz ścieżkę odłączenia.
Zasady nadrzędne¶
| Zasada | Wymóg wykonawczy | Dowód odbioru |
|---|---|---|
| separacja władzy od mocy | przydział GPU nie zmienia capabilities | test polityki z tym samym zadaniem na dwóch węzłach |
| local-first | domyślna ścieżka danych nie opuszcza lokalizacji | mapa przepływu i test DNS/egress |
| fail closed | brak polityki, podpisu lub czasu oznacza brak skutku | test wygasłej zgody i zerwanego audytu |
| out-of-band | recovery nie zależy od systemu, który naprawia | wejście do BIOS/UEFI przy niesprawnym OS |
| degradacja kontrolowana | awaria odcina najpierw zadania niekrytyczne | dziennik kolejności load shedding |
| wymienialność | model i urządzenie są wybierane przez capability profile | podmiana adaptera bez zmiany kontraktu joba |
| obserwowalność | każda zmiana stanu ma zdarzenie i korelację | pełny ślad od alarmu do receipt |
| człowiek zwiększa władzę | agent nie wystawia sobie grantu ani approval | negatywny test self-grant |
Kontrakt każdego węzła¶
Każdy węzeł N0–N16 musi mieć:
- niezmienny
node_id, klasę i właściciela; - manifest sprzętu, wersję firmware, sterowników i runtime;
- capabilities, które można zawężać, ale których worker nie może rozszerzać;
- dozwolone źródła zadań i dozwolone miejsca zapisu;
- budżety CPU, GPU, RAM, energii, czasu i równoległości;
- heartbeat, miary temperatury, zasilania, pamięci, kolejki i błędów;
- procedurę
drain,quarantine,shutdown,recoverorazre-enroll; - klucz tożsamości urządzenia przechowywany oddzielnie od danych użytkownika;
- właściciela decyzji o ponownej aktywacji po incydencie.
Wejście¶
Węzeł przyjmuje wyłącznie podpisany envelope zadania: job_id, typ operacji, hash wejścia, scope, capability, limit zasobów, politykę egress, termin, poziom zatwierdzenia i wymagany walidator.
Wyjście¶
Węzeł zwraca rezultat jako artefakt plus receipt: hash wejścia i wyniku, wersje narzędzi, log kroków, zużyte zasoby, kod zakończenia, wynik walidacji i wskazanie, czy skutek zewnętrzny został tylko przygotowany, czy zatwierdzony i wykonany.
Błędy i scenariusz awaryjny¶
Przekroczenie temperatury, utrata audytu, błąd integralności, nieznane urządzenie lub rozbieżność konfiguracji powodują zatrzymanie nowych jobów i przejście do kwarantanny. Management Node może wykonać wcześniej zatwierdzone działania odzyskiwania, lecz nie może nadać węzłowi nowej klasy uprawnień. Przy niedostępności Management Node worker kończy bezpieczny krok, utrwala stan i przechodzi do lokalnego trybu ograniczonego.
Poziomy autonomii infrastruktury¶
| Poziom | Dozwolone zachowanie | Przykład | Niedozwolone |
|---|---|---|---|
| A0 | obserwacja i rekomendacja | wykrycie spadku baterii | zmiana konfiguracji |
| A1 | wykonanie po zgodzie związanej z zakresem | restart konkretnego workera | zgoda na przyszłe restarty wszystkich węzłów |
| A2 | automatyzacja odwracalna w oknie polityki | przeniesienie kolejki, ograniczenie mocy | flash firmware |
| A3 | autonomiczna praca operacyjna w stałym kontrakcie | failover WAN, drain, uruchomienie zapasowego workera | zmiana capabilities |
| A4 | autonomia środowiskowa z wieloma zabezpieczeniami | tryb wyspowy obiektu | obejście interlocków lub właściciela |
A4 nie oznacza „pełnej władzy”. Oznacza jedynie szerszy, wcześniej zaprojektowany kontrakt w zamkniętym środowisku.
Minimalny kontrakt między komponentami¶
sequenceDiagram
participant C as Control Plane
participant P as Policy Engine
participant B as Broker
participant W as Worker
participant V as Validator
participant A as Audit
C->>P: proposal + scope + identity
P-->>C: decision + required approval
C->>B: signed job envelope
B->>W: leased execution
W->>A: start + versions + resources
W->>V: candidate artifact
V-->>B: pass/fail + evidence
B-->>C: receipt + artifact reference
C->>A: final state
Kontrakt nie dopuszcza pola „trust me”. Każdy skutek ma zdefiniowane wejście, idempotency key, timeout, retry policy, walidator i ownera eskalacji.
Uprawnienia recovery¶
Management Node może mieć techniczne możliwości WOL, ATX i KVM, ale każde z nich jest osobnym capability. Smart plug jest wyłączony z rutynowej automatyzacji: twarde odcięcie prądu może uszkodzić dane, dlatego wymaga spełnienia warunków awaryjnych, udokumentowanej próby łagodnego zatrzymania i — poza jednoznacznie zdefiniowanym przypadkiem bezobsługowym — zgody człowieka.
Walidacja¶
Odbiór obejmuje test self-grant, test fałszywego receipt, utratę audytu, utratę WAN, odcięcie workera, awarię Management Node, zimny start, wejście do UEFI przez KVM, odzyskanie kopii oraz kontrolowane odłączenie baterii. Nieprzetestowana ścieżka recovery jest ryzykiem, a nie zabezpieczeniem.