Przejdź do treści

Akceleratory datacenter — L4, L40S, H100, H200, B200 i B300

Cel i granica

Ta klasa służy do usług wieloużytkownikowych, dużej inferencji i treningu. Nie jest listą kart, które można włożyć do dowolnego PC. Forma pasywna, SXM, NVLink, moc i chłodzenie wiążą akcelerator z kwalifikowanym serwerem albo całym rackiem.

L4 24GB

72W, low-profile, pasywne chłodzenie i 24GB ECC czynią L4 dobrym akceleratorem inference/video w gęstym serwerze. Wejście to model i profil latency; wyjście to endpoint oraz metryki. Zależnością jest wymuszony airflow. W obudowie desktopowej bez kanału powietrza karta może się przegrzać mimo niskiego TDP.

L40S 48GB

350W, 48GB ECC, dual-slot FHFL i chłodzenie pasywne. Łączy inferencję, grafikę i video, ale wymaga serwera. Polska oferta kanału Cisco widoczna w katalogu ma cenę 187 241,56 zł brutto i brak magazynu; to nie jest wiarygodny koszt „samej karty”, dlatego status to B2B_QUOTE_REQUIRED.

H100 80GB i H200 141GB

H100/H200 są elementami platform PCIe lub SXM. H200 zwiększa pamięć do 141GB HBM3e i jest szczególnie użyteczny dla dużych modeli. Wymagają fabric, sterowników data center, telemetrii ECC, schedulerów i infrastruktury serwisowej. Cena musi pochodzić z wyceny całego serwera z gwarancją.

B200 192GB i B300 288GB

B200/B300 są klasą rack-scale. Ich TDP modułu i wymagania chłodzenia wykluczają podejście workstation. B300 288GB jest rozpatrywany wtedy, gdy workload uzasadnia koszt facility, pamięci HBM, interconnect i obsługi. Dokument celowo nie przypisuje ceny detalicznej: właściwym artefaktem jest B2B quote z konfiguracją, SLA, dostawą, uruchomieniem i serwisem.

HGX, DGX i GB200 NVL72

HGX to platforma OEM, DGX — kompletna platforma NVIDIA, a GB200 NVL72 — system rack-scale z domeną NVLink. To program infrastrukturalny obejmujący:

  • projekt mocy i chłodzenia;
  • rack, PDU, redundancję i monitoring środowiska;
  • fabric InfiniBand/Ethernet oraz storage;
  • scheduler, izolację tenantów i kontrolę datasetów;
  • backup konfiguracji, części zapasowe i serwis producenta;
  • test awarii GPU, switcha, hosta i warstwy storage.

Kontrakt komponentu datacenter

Wejście: podpisany container, dataset z lineage, budget GPU-hours, polityka placement i checkpointu.

Wyjście: model candidate lub inference receipt, zużyte GPU-hours/kWh, błędy ECC, checkpointy i wynik testów.

Autonomia: A3 dla placement i restartu repliki; A1 dla sterownika/firmware i aktywacji nowego modelu; A0 dla zwiększenia dostępu do datasetu.

Walidacja: canary, benchmark referencyjny, fault injection, recovery checkpointu, saturacja fabric i restore scheduler state.

Fallback: mniejszy zatwierdzony model, druga strefa lub kolejka oczekująca. Cloud burst wymaga jawnej polityki danych i kosztu; nie jest ukrytym retry.

Ryzyka

Największe ryzyko to zakup akceleratora bez kwalifikowanego hosta, niedoszacowanie energii/chłodzenia, vendor lock-in na fabric, brak serwisu onsite, brak procedury aktualizacji firmware i mieszanie kosztu katalogowego z ceną realnie dostarczonego systemu.