Przejdź do treści

Zasady architektury infrastruktury

Cel

Zasady mają sprawić, by dobór sprzętu nie rozmył architektury bezpieczeństwa. Wymienny model, karta GPU albo router nie może stać się ukrytym właścicielem procesu. Każdy element ma rolę, kontrakt, granice oraz ścieżkę odłączenia.

Zasady nadrzędne

Zasada Wymóg wykonawczy Dowód odbioru
separacja władzy od mocy przydział GPU nie zmienia capabilities test polityki z tym samym zadaniem na dwóch węzłach
local-first domyślna ścieżka danych nie opuszcza lokalizacji mapa przepływu i test DNS/egress
fail closed brak polityki, podpisu lub czasu oznacza brak skutku test wygasłej zgody i zerwanego audytu
out-of-band recovery nie zależy od systemu, który naprawia wejście do BIOS/UEFI przy niesprawnym OS
degradacja kontrolowana awaria odcina najpierw zadania niekrytyczne dziennik kolejności load shedding
wymienialność model i urządzenie są wybierane przez capability profile podmiana adaptera bez zmiany kontraktu joba
obserwowalność każda zmiana stanu ma zdarzenie i korelację pełny ślad od alarmu do receipt
człowiek zwiększa władzę agent nie wystawia sobie grantu ani approval negatywny test self-grant

Kontrakt każdego węzła

Każdy węzeł N0–N16 musi mieć:

  • niezmienny node_id, klasę i właściciela;
  • manifest sprzętu, wersję firmware, sterowników i runtime;
  • capabilities, które można zawężać, ale których worker nie może rozszerzać;
  • dozwolone źródła zadań i dozwolone miejsca zapisu;
  • budżety CPU, GPU, RAM, energii, czasu i równoległości;
  • heartbeat, miary temperatury, zasilania, pamięci, kolejki i błędów;
  • procedurę drain, quarantine, shutdown, recover oraz re-enroll;
  • klucz tożsamości urządzenia przechowywany oddzielnie od danych użytkownika;
  • właściciela decyzji o ponownej aktywacji po incydencie.

Wejście

Węzeł przyjmuje wyłącznie podpisany envelope zadania: job_id, typ operacji, hash wejścia, scope, capability, limit zasobów, politykę egress, termin, poziom zatwierdzenia i wymagany walidator.

Wyjście

Węzeł zwraca rezultat jako artefakt plus receipt: hash wejścia i wyniku, wersje narzędzi, log kroków, zużyte zasoby, kod zakończenia, wynik walidacji i wskazanie, czy skutek zewnętrzny został tylko przygotowany, czy zatwierdzony i wykonany.

Błędy i scenariusz awaryjny

Przekroczenie temperatury, utrata audytu, błąd integralności, nieznane urządzenie lub rozbieżność konfiguracji powodują zatrzymanie nowych jobów i przejście do kwarantanny. Management Node może wykonać wcześniej zatwierdzone działania odzyskiwania, lecz nie może nadać węzłowi nowej klasy uprawnień. Przy niedostępności Management Node worker kończy bezpieczny krok, utrwala stan i przechodzi do lokalnego trybu ograniczonego.

Poziomy autonomii infrastruktury

Poziom Dozwolone zachowanie Przykład Niedozwolone
A0 obserwacja i rekomendacja wykrycie spadku baterii zmiana konfiguracji
A1 wykonanie po zgodzie związanej z zakresem restart konkretnego workera zgoda na przyszłe restarty wszystkich węzłów
A2 automatyzacja odwracalna w oknie polityki przeniesienie kolejki, ograniczenie mocy flash firmware
A3 autonomiczna praca operacyjna w stałym kontrakcie failover WAN, drain, uruchomienie zapasowego workera zmiana capabilities
A4 autonomia środowiskowa z wieloma zabezpieczeniami tryb wyspowy obiektu obejście interlocków lub właściciela

A4 nie oznacza „pełnej władzy”. Oznacza jedynie szerszy, wcześniej zaprojektowany kontrakt w zamkniętym środowisku.

Minimalny kontrakt między komponentami

sequenceDiagram
    participant C as Control Plane
    participant P as Policy Engine
    participant B as Broker
    participant W as Worker
    participant V as Validator
    participant A as Audit
    C->>P: proposal + scope + identity
    P-->>C: decision + required approval
    C->>B: signed job envelope
    B->>W: leased execution
    W->>A: start + versions + resources
    W->>V: candidate artifact
    V-->>B: pass/fail + evidence
    B-->>C: receipt + artifact reference
    C->>A: final state

Kontrakt nie dopuszcza pola „trust me”. Każdy skutek ma zdefiniowane wejście, idempotency key, timeout, retry policy, walidator i ownera eskalacji.

Uprawnienia recovery

Management Node może mieć techniczne możliwości WOL, ATX i KVM, ale każde z nich jest osobnym capability. Smart plug jest wyłączony z rutynowej automatyzacji: twarde odcięcie prądu może uszkodzić dane, dlatego wymaga spełnienia warunków awaryjnych, udokumentowanej próby łagodnego zatrzymania i — poza jednoznacznie zdefiniowanym przypadkiem bezobsługowym — zgody człowieka.

Walidacja

Odbiór obejmuje test self-grant, test fałszywego receipt, utratę audytu, utratę WAN, odcięcie workera, awarię Management Node, zimny start, wejście do UEFI przez KVM, odzyskanie kopii oraz kontrolowane odłączenie baterii. Nieprzetestowana ścieżka recovery jest ryzykiem, a nie zabezpieczeniem.