GPU konsumenckie — 8, 12, 16, 24 i 32GB¶
Cel¶
Karty GeForce dają najwięcej surowej wydajności za złotówkę, ale nie zapewniają całego kontraktu enterprise. Są właściwe dla prywatnego Norbiego, prototypów, odtwarzalnych zadań i wielu zastosowań SMB, jeśli wynik jest walidowany, a brak ECC oraz cykl produktu są zaakceptowane.
8GB — RTX 3050, 4060 i 5060¶
Odpowiedzialność. Małe modele językowe, embedding, OCR, transkrypcja, upscaling, pojedyncza kamera i lekkie media.
Wejścia/wyjścia. Zlecenie musi mieć profil pamięci. Worker zwraca użycie peak VRAM, liczbę przełączeń CPU/GPU i informację o offloadzie.
Kontrakt. Jeżeli model nie mieści się z 10–15% zapasu, job nie startuje. Nie wolno automatycznie redukować jakości bez odnotowania.
Autonomia. A3 może zmniejszyć batch w określonym zakresie. Zmiana modelu na inny profil jakości wymaga reguły albo zgody.
Ryzyko/fallback. OOM, mały kontekst, kopiowanie do RAM. Fallback: mniejszy model lub CPU; nieukryty cloud burst.
RTX 3050 i 4060 pozostają klasą legacy. Aktualny punkt detaliczny to MSI RTX 5060 Ventus 2X OC 8GB za 1 699 zł brutto w snapshotcie; ograniczenie 8GB jest ważniejsze niż atrakcyjna cena.
12GB — RTX 3060 i 5070¶
RTX 3060 12GB bywa wartościowa na rynku wtórnym, ale ma starszą architekturę. RTX 5070 daje wyższy throughput i nowe kodeki, lecz nadal 12GB. To klasa dla szybkich zadań, które na pewno mieszczą się w pamięci.
Pełny przebieg: scheduler sprawdza manifest pamięci, ładuje model, wykonuje warm-up, mierzy peak, ustala bezpieczny batch, wykonuje zadanie i porównuje jakość na próbce. Gdy peak przekracza budżet, job trafia na N6 16GB zamiast agresywnego swapu.
16GB — 4060 Ti, 5060 Ti, 5070 Ti i 5080¶
To najbardziej praktyczny próg początkowy dla lokalnego AI.
| GPU | TDP klasy | Rola | Mocna strona | Ograniczenie |
|---|---|---|---|---|
| 4060 Ti 16GB | 165 W | legacy value | energia i 16GB | starsza generacja/bandwidth |
| 5060 Ti 16GB | 180 W | value | najlepszy koszt/VRAM w aktualnym katalogu | consumer, brak ECC |
| 5070 Ti 16GB | 300 W | throughput | szybkie batch, media, 3D | ta sama pojemność co 5060 Ti |
| 5080 16GB | 360 W | premium creator | render i enkodowanie | cena nie zwiększa VRAM |
Wniosek: do modelu ograniczonego przez pamięć 5060 Ti 16GB może być rozsądniejsza niż szybsza 5070 12GB. Do renderowania i wielu krótkich zadań 5070 Ti/5080 mogą dać krótszy czas. Decyzję potwierdza benchmark własnego workloadu.
24GB — RTX 4090¶
RTX 4090 jest dojrzałym punktem odniesienia 24GB, lecz w nowym zakupie jej dostępność i cena są niestabilne. Wartość ma wtedy, gdy konkretny model, gwarancja i cena zostaną ponownie zweryfikowane. Projekt wymaga 1000W klasy PSU, dużej obudowy, wsparcia mechanicznego i kontroli złącza.
32GB — RTX 5090¶
Cel. Maksymalna pojemność i throughput konsumencki dla modeli lokalnych.
Zależności. PSU 1200W ATX 3.1 klasy premium, osobny obwód zależnie od reszty stanowiska, duża obudowa, airflow, aktualny BIOS, monitoring przewodu, UPS zdolny obsłużyć realny load.
Przebieg. Preflight weryfikuje model karty i connector, limit mocy, temperatury oraz wolne miejsce. Burn-in obejmuje godzinę zmiennego obciążenia i dłuższy test stały. Dopiero po PASS węzeł trafia do kolejki produkcyjnej.
Walidacja. Peak power, temperatura rdzenia i pamięci, błędy sterownika, hash wyników, resume po checkpoint i restart przez KVM.
Ryzyka. 575W klasy GPU, bardzo wysoka cena, brak ECC, ograniczona dostępność i duży koszt UPS. Fallback: power limit, RTX PRO 4500 dla ECC/200W lub RTX 6000 Ada dla 48GB.
Przykładowe polecenia¶
- „Porównaj latency tego modelu na N5 i N7 przy takim samym batchu.”
- „Wyznacz największy bezpieczny kontekst na N4 bez offloadu.”
- „Na N9 wykonaj benchmark w limicie 450W i 575W, bez zmiany sterownika.”
Walidacja wyniku¶
Wydajność bez jakości jest niewystarczająca. Każdy benchmark zapisuje wersję modelu, kwantyzację, prompt/testset, sterownik, runtime, batch, temperaturę, pobór i error rate. Wynik bez tych danych nie jest porównywalny.