Spis treści
Kolokacja nietypowych serwerów i pod infrastrukturę AI wymaga znacznie dokładniejszego przygotowania niż instalacja standardowych urządzeń tego typu. Wysoki pobór mocy, duża masa, nietypowe wymiary, zwiększone wydzielanie ciepła oraz rozbudowane okablowanie sprawiają, że sprzęt trzeba dopasować do warunków technicznych centrum danych jeszcze przed transportem. Dotyczy to zarówno pojedynczych serwerów GPU, jak i całych szaf o dużej gęstości obliczeniowej. Jeśli planujesz w tym zakresie współpracę z naszym polskim Data Center, w artykule wyjaśniamy jakie informacje zebrać oraz na co zwrócić uwagę przy projektowaniu zasilania, chłodzenia, sieci i samego montażu.
Zakres i założenia wdrożenia serwerów w kolokacji
Przygotowania warto rozpocząć od stworzenia kompletnej specyfikacji sprzętu. Operator centrum danych powinien znać nie tylko liczbę serwerów, ale również ich rzeczywiste wymagania energetyczne, sposób chłodzenia, wymiary, masę oraz wymagania dotyczące sieci. Jest to szczególnie istotne w przypadku infrastruktury AI. Wysokie zagęszczenie akceleratorów powoduje, że kilka urządzeń może generować obciążenie energetyczne i cieplne wielokrotnie większe niż typowa szafa serwerowa.
Przed rozpoczęciem wdrożenia należy więc ustalić m.in.:
- jakie urządzenia zostaną zamontowane i ile ich będzie,
- wymiary, masę oraz wymagania montażowe sprzętu,
- maksymalny i typowy pobór mocy przez serwery,
- sposób chłodzenia,
- liczbę i rodzaj połączeń sieciowych,
- wymagania dotyczące zasilania awaryjnego,
- planowaną rozbudowę w przyszłości.
Dobrze przygotowana specyfikacja pozwoli nam ocenić, czy dana szafa i jej wyposażenie mogą zostać bezpiecznie umieszczone w wybranej przestrzeni.
Zasilanie szafy o dużej mocy – o czym trzeba pamiętać?
W przypadku dużego zagęszczenia serwerów samo określenie, jaką moc trzeba dostarczyć do szafy to zdecydowanie za mało. Trzeba ustalić rzeczywisty profil poboru mocy, sposób zasilania poszczególnych urządzeń oraz wymagany poziom redundancji.
Przy projektowaniu należy uwzględnić zarówno moc znamionową urządzeń, jak i ich rzeczywiste zapotrzebowanie podczas pracy. W przypadku serwerów GPU istotne jest również to, że obciążenie może zmieniać się w zależności od wykonywanych zadań. Infrastruktura IT powinna więc mieć odpowiedni zapas, ale nie należy bezrefleksyjnie przyjmować maksymalnej wartości każdego zasilacza jako rzeczywistego poboru całej szafy.
Wysoka gęstość mocy musi być analizowana razem z chłodzeniem. Dla przykładu NVIDIA wskazuje w swoich wytycznych projektowych, że ograniczenia dotyczące mocy, chłodzenia i dostępnej przestrzeni są ze sobą bezpośrednio powiązane – ograniczenie jednego z tych zasobów może wymusić zmianę rozmieszczenia sprzętu lub zwiększenie liczby szaf.
PDU, złącza i redundancja zasilania – najważniejsze informacje
PDU, czyli listwa dystrybucji zasilania montowana w szafie, powinna być dobrana do obciążenia oraz rodzaju zastosowanych złączy. W przypadku nietypowego sprzętu nie należy zakładać, że standardowe gniazda dostępne w typowej szafie będą wystarczające.
Jeżeli urządzenia mają dwa niezależne zasilacze, warto wykorzystać niezależne tory zasilania – A i B. W takim układzie awaria jednego z nich nie powinna powodować wyłączenia urządzenia. Trzeba jednak sprawdzić, czy oba zasilacze rzeczywiście mogą pracować w konfiguracji redundantnej i czy każdy z nich jest podłączony do odpowiednio zabezpieczonego obwodu.
Przy dużym poborze mocy istotny jest również sposób rozłożenia obciążenia pomiędzy fazy. Nierównomierne może ograniczać dostępny zapas mocy i utrudniać prawidłową pracę instalacji. Dlatego schemat zasilania powinien być przygotowany jeszcze przed dostarczeniem sprzętu.
Chłodzenie i przepływ powietrza w szafach z serwerami pod AI
Każdy wat energii elektrycznej zużytej przez sprzęt IT jest w praktyce zamieniany na ciepło, które trzeba efektywnie odprowadzać. W przypadku zwykłego serwera nie stanowi to zwykle problemu dla standardowego systemu chłodzenia. Jednak przy dużej koncentracji GPU, typowej dla rozwiązań pod AI, sytuacja ta diametralnie się zmienia.
Nowoczesne systemy AI mogą generować bardzo wysokie obciążenie cieplne na niewielkiej powierzchni. Środowiska tego typu wymagają odpowiednio zaprojektowanego zasilania, chłodzenia i układu szaf, a przy dużej gęstości konieczne może być zastosowanie zaawansowanych metod chłodzenia.
Przed kolokacją trzeba więc ustalić, czy sprzęt jest chłodzony wyłącznie powietrzem, wyposażony w wymiennik ciepła na tylnej części szafy czy przygotowany do chłodzenia bezpośrednio cieczą. Co ważne, nie należy zasłaniać wlotów i wylotów powietrza innymi urządzeniami ani prowadzić przewodów w sposób utrudniający prawidłowy przepływ. Kierunek przepływu powietrza musi być zgodny z konstrukcją urządzeń.
Jeżeli sprzęt wykorzystuje chłodzenie cieczą, wymagania są jeszcze bardziej szczegółowe. Trzeba określić rodzaj cieczy, sposób jej doprowadzenia, wymagane przyłącza, przepływ oraz sposób zabezpieczenia instalacji przed wyciekiem.
Niestandardowa szafa serwerowa – dobór i integracja
Nie każda infrastruktura AI mieści się w typowej szafie serwerowej 19-calowej. Problemem może być zarówno większa głębokość urządzeń, jak i ich masa, wysokość, rozmieszczenie zasilaczy czy sposób prowadzenia przewodów.
Przed montażem trzeba więc sprawdzić:
- szerokość i głębokość urządzeń,
- wysokość w jednostkach U,
- maksymalną masę całej zabudowy,
- nośność szafy i podłogi,
- sposób mocowania urządzeń,
- dostęp do elementów wymagających serwisowania,
- położenie środka ciężkości całej konstrukcji.
To ostatnie zagadnienie jest szczególnie ważne przy wyjątkowo ciężkich serwerach GPU. Jeżeli większość masy znajduje się wysoko, po zapełnieniu szafy może zmienić się jej stabilność. Konstrukcja musi więc być odpowiednio dobrana do obciążenia i sposobu ustawienia. W przypadku niestandardowych rozwiązań warto przed dostawą przesłać operatorowi Data Center dokładny rysunek szafy wraz z rozmieszczeniem urządzeń, zasilaczy, przełączników i przewodów.
Uziemienie i organizacja kabli
Wysokiej klasy infrastruktura serwerowa wymaga prawidłowego uziemienia wszystkich elementów metalowych oraz zachowania zgodności z wymaganiami producentów urządzeń i instalacji elektrycznej. Przed montażem trzeba ustalić sposób połączenia szafy z systemem uziemiającym centrum danych.
Równie ważna jest organizacja przewodów. W dużej szafie AI może znajdować się kilkadziesiąt lub nawet setki przewodów zasilających, sieciowych i światłowodowych. Ich przypadkowe rozmieszczenie utrudnia serwis, zwiększa ryzyko pomyłki i może ograniczać przepływ powietrza. Kable powinny być prowadzone tak, aby nie blokowały wlotów i wylotów powietrza oraz nie utrudniały wysuwania urządzeń. Ważne jest też, aby były jednoznacznie opisane, miały odpowiedni zapas długości i nie były nadmiernie naprężone.
Przygotowania do kolokacji nietypowych serwerów – okablowanie i planowanie połączeń
Przed instalacją warto przygotować dokładny plan wszystkich połączeń. Powinien określać, które porty urządzeń są połączone ze sobą, do którego przełącznika trafiają poszczególne przewody oraz gdzie znajdują się połączenia zewnętrzne. W przypadku klastra AI szczególnie istotne jest rozdzielenie różnych rodzajów ruchu. Serwery mogą mieć osobne interfejsy dla komunikacji między akceleratorami, zarządzania, dostępu do pamięci masowej i zwykłej komunikacji sieciowej.
W dużych wdrożeniach długość przewodów może wpływać na sposób rozmieszczenia sprzętu. NVIDIA wskazuje w dokumentacji SuperPOD, że ograniczenia dotyczące długości połączeń muszą być uwzględnione już na etapie planowania układu urządzeń w centrum danych. Dlatego nie warto zostawiać doboru przewodów na dzień instalacji. Najpierw należy ustalić topologię, a dopiero potem zamówić odpowiednie przewody i elementy optyczne.
Sieć przygotowywana pod AI – przepustowość i konfiguracja
Infrastruktura AI często wymaga znacznie większej przepustowości między serwerami niż klasyczne środowiska do standardowych aplikacji. Podczas trenowania modeli GPU wymieniają między sobą mnóstwo danych, dlatego opóźnienia lub ograniczenia przepustowości sieci mogą powodować, że część mocy obliczeniowej pozostaje niewykorzystana. Dlatego infrastruktura AI powinna uwzględniać szybką komunikację między węzłami, niskie opóźnienia oraz dużą przepustowość dla synchronizacji parametrów, operacji kolektywnych i dzielenia modeli pomiędzy urządzenia.
Ważne jest również rozdzielenie warstwy zarządzającej od komunikacji wykorzystywanej przez obciążenia AI, jeśli wymaga tego projekt. Przy większej liczbie urządzeń szczególne znaczenie ma odpowiednia topologia i ograniczenie przeciążenia poszczególnych ścieżek.
Transport, montaż i odbiór w serwerowni
Jeśli interesuje Cię kolokacja serwerów, w której specjalizuje się nasza firma Sprint Data Center, ostatnim etapem przygotowania jest bezpieczne dostarczenie sprzętu do centrum danych. W przypadku ciężkich urządzeń z wieloma GPU może stanowić to spore wyzwanie logistyczne. Warto więc wcześniej ustalić z operatorem m.in.:
- termin i sposób dostawy,
- możliwość wjazdu pojazdu na teren obiektu,
- wymiary drzwi, wind i ciągów komunikacyjnych,
- dopuszczalne obciążenie podłogi,
- dostępność odpowiednich urządzeń transportowych na miejscu,
- sposób wniesienia i ustawienia szaf.
Po ustawieniu oraz zainstalowaniu sprzętu należy przeprowadzić odbiór techniczny. W pierwszej kolejności sprawdza się stabilność konstrukcji, uziemienie, zasilanie, poprawność połączeń i stan urządzeń po transporcie. Następnie można uruchomić systemy i wykonać testy obciążeniowe. W przypadku infrastruktury AI warto przeprowadzić test przy docelowym obciążeniu, a nie tylko sprawdzić, czy serwery się uruchamiają. Dopiero wtedy można zweryfikować rzeczywisty pobór mocy, temperatury, działanie chłodzenia, przepustowość sieci i stabilność całego środowiska.
Dobrze przygotowana kolokacja zaczyna się więc jeszcze na długo przed dostarczeniem sprzętu do Data Center. Operator powinien znać wymagania urządzeń, a właściciel infrastruktury powinien otrzymać potwierdzenie, że dostępne zasilanie, chłodzenie, przestrzeń, sieć i sposób montażu odpowiadają rzeczywistym potrzebom. Jeśli planujesz taką operację, skorzystaj z usług Sprint Data Center – zapewnimy Ci dostęp do profesjonalnej infrastruktury IT i zaoferujemy kompleksowe wsparcie w przeniesieniu do niego nawet bardzo nietypowych szaf serwerowych.
FAQ – odpowiedzi na często zadawane pytania
1. Czy każdy serwer GPU można umieścić w standardowej szafie 19-calowej?
Nie. Wiele serwerów ma standardową szerokość, ale mogą różnić się głębokością, wysokością, masą, wymaganiami dotyczącymi zasilania i chłodzenia. Przed instalacją trzeba sprawdzić dokumentację konkretnego modelu oraz parametry szafy.
2. Czy wysoki pobór mocy przez serwery oznacza konieczność zastosowania chłodzenia cieczą?
Nie w każdym przypadku. Zależy to od gęstości mocy, konstrukcji serwerów i możliwości konkretnego systemu chłodzenia. Przy bardzo dużych obciążeniach cieplnych chłodzenie cieczą może jednak być bardziej odpowiednie niż tradycyjne chłodzenie powietrzem.
3. Czy można dostarczyć gotową, niestandardową szafę do centrum danych?
Tak, ale przed transportem trzeba uzgodnić z operatorem jej wymiary, masę, sposób zasilania, wymagania dotyczące chłodzenia, sposób mocowania oraz trasę transportową. Przy ciężkich konstrukcjach znaczenie ma również nośność podłogi i możliwość wykorzystania windy lub urządzeń transportowych.
4. Czy przy kolokacji AI trzeba wykonywać testy po instalacji?
Tak. Samo uruchomienie serwerów nie potwierdza poprawności ich wdrożenia. Warto sprawdzić zasilanie, temperatury, chłodzenie, sieć, połączenia między serwerami oraz zachowanie urządzeń przy rzeczywistym obciążeniu. Pozwala to wykryć problemy, które nie występują podczas pracy jałowej.
