AI 데이터 센터란 무엇인가요?

AI 데이터 센터란 무엇일까요? [영상 및 퀴즈]

간단히 말해서, AI 데이터 센터는 단순히 GPU를 추가로 설치한 서버실이 아니라, 전력, 냉각, 네트워크 인프라, 스토리지 등이 모델 학습 및 서비스에 집중된 고밀도 시설입니다. 핵심은 칩 자체이며, 건물의 구조가 칩의 성능을 좌우합니다. 만약 데이터를 외부로 전송할 수 없다면, 소규모 데이터 센터를 추가로 구축하는 것이 좋지만, 대부분의 팀은 임대하는 것이 효율적입니다.

핵심 요약:

칩과 빌딩: 전력, 냉각, 패브릭 및 스토리지는 가속기의 작동 여부를 결정합니다.

궁전이 아닌 공간: 데이터가 외부로 유출될 수 없다면 랙 두 개만 개조하면 됩니다. 캠퍼스 전체를 사지 마세요.

평균 vs 중앙값: 8회 실행에서 중앙값은 재시작을 숨기므로 18시간 평균값을 사용하십시오.

오용 방지: 혼합 홀에서 두 개의 랙에 대한 PUE를 제시하지 마십시오.

예시 결과: 8회 실행은 작은 지도 크기이며, 50%의 생산 절감 효과를 가져오지는 않습니다.

이 글을 읽고 나서 읽어보시면 좋을 만한 글들:

🔗 AI는 믿을 만할까요? 영상과 퀴즈를
통해 AI의 신뢰성에 대해 알아보세요.

🔗 일상생활에서 AI 활용하기
AI가 일상적인 작업과 루틴을 간소화하는 실용적인 방법을 알아보세요.

🔗 직장에서 AI를 활용하는 방법:
업무 생산성을 높이기 위해 AI를 실용적으로 사용하는 방법을 알아보세요.

🔗 인공지능은 스스로 생각할 수 있을까요?
인공지능이 진정으로 독립적으로 생각하거나 추론할 수 있는지 알아보세요.

일반적인 데이터 센터와 어떻게 다른가

기존 서버실은 다양한 워크로드와 수많은 소규모 서비스의 가동 시간을 최적화하도록 설계되었습니다. 물론, 이중화와 PUE( 컴퓨팅 1와트를 제공하는 데 필요한 추가 에너지 소비량)하지만, 일반적으로 모든 복도를 마치 이동식 히터처럼 작동하는 랙을 중심으로 설계하지는 않습니다.

AI 사이트들은 비율을 뒤바꿔 놓습니다. 밀도가 높아지고, 네트워크는 학습 작업이 제대로 진행될 수 있도록 필수적인 구성 요소가 됩니다. 스토리지는 체크포인트를 지속적으로 처리해야 하며, 그렇지 않으면 가속기가 마치 교통 체증에 갇힌 경주마처럼 멈춰 서게 됩니다.

문화적 차이도 있습니다. 엔터프라이즈 운영은 티켓과 변경 기간을 중심으로 생각합니다. AI 운영은 작업 큐와 장기 실행 과정에서 노드가 다운될 때 느끼는 불안감을 생각합니다. 어쨌든 둘 다 "데이터 센터"라고 부를 수 있겠죠. 이름만 다를 뿐 내부 구조는 그대로 유지됩니다.

유형 이 제품은 무엇을 위해 만들어졌습니까? 뛰어난 하드웨어 전력/냉각 특성 누구에게 어울릴까요? 그것이 존재하는 이유
전통적인 기업 데이터 센터 혼합 IT 환경: 데이터베이스, 가상 머신, 이메일, 파일 CPU, 일반 서버, 익숙한 저장 장치 공기 주도형; 적당한 밀도; PUE를 주요 논의 사항으로 삼음 일상적인 시스템을 운영하는 회사들 비즈니스 앱을 계속 사용하세요
AI 학습 클러스터 장기간에 걸쳐 긴밀하게 연계된 교육 직무 고밀도 가속기 랙; GPU 인터커넥트 고밀도; 액체 냉각 또는 [후면 도어 열교환기](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) 연구실과 모델 제작자들이 작업 대기열에서 생활하고 있습니다 칩을 굶기지 않고 달리기를 끝내세요
AI 추론 기능 모델 기반 서비스; 실시간 및 배치 응답 가속기; 중요한 부하 분산기 여전히 뜨겁지만... 덜 극적일 뿐입니다. 무차별적인 밀도보다는 지연 시간이 더 중요합니다 지금 당장 답변해야 하는 제품들 모델을 사용자 가까이에 놓으세요
하이브리드 AI 홀 훈련과 복무를 한 지붕 아래에서; 뭐, 그런 셈이죠 혼합 선반; 울타리가 쳐진 수영장; 공용 원단 냉각 기능이 있는 두 사람이 한 기계실에 있으면 어색해지죠 두 개의 캠퍼스를 운영할 여력이 없는 팀 자본은 유한하고, 삶은 정돈되지 않다

도덕적 순위가 아닙니다. 다른 기계지만 같은 계열사입니다.

GPU, 가속기, 그리고 전력을 많이 잡아먹는 랙

일반적인 이중 바닥 구조물을 보면 랙들이 꽤 정중해 보이지만, AI 랙이 늘어선 곳을 보면 마치 건물을 통째로 삼켜버릴 듯한 모습입니다.

핵심 하드웨어는 뛰어난 CPU가 아닙니다. 바로 가속기 트레이, 즉 GPU나 다른 AI 칩들이 서버, 랙, 그리고 여러 줄로 배열되어 고대역폭 패브릭을 공유하는 구조입니다. GPU 인터커넥트는 여러 칩들을 연결하여 마치 하나의 거대한 가속기처럼 작동하게 합니다. 클러스터 패브릭도 이와 같은 역할을 행 단위로 수행합니다. 병렬 학습은 이러한 연결이 안정적이고 예측 가능한 상태를 유지할 때만 제대로 작동합니다. 이러한 연결이 끊어지면 "클러스터"는 단순히 비싼 워크스테이션들이 같은 지역을 공유하는 것에 불과하게 됩니다.

전력은 칩을 따라갑니다. 투박한 사무실용 PDU로는 해결되지 않습니다. 홀이 가득 차면 IT 부하가 메가와트 단위로 증가합니다. (숫자는 임의로 정하지 않겠습니다.) 핵심은 랙당 밀도입니다. 랙 개수가 적을수록 각 랙은 마치 작은 용광로처럼 뜨거워집니다. 제한 요소는 GPU 구매 목록이 아니라 변전소인 경우가 많습니다. 아시다시피, 구매 부서는 더 많은 가속기를 원하지만, 전력 회사는 긴 협상과 거액의 수표를 원합니다.

약간 우스꽝스러운 비유가 떠오르는데, 선반은 배고픈 동물과 같습니다. 더 빨리 자라는 선반을 만들 수는 있지만, 먹이를 줘야 하고 더위를 식혀줘야 합니다. 둘 중 하나라도 빼먹으면 값비싼 문진이 되어버리죠.

전력, 열, 그리고 냉각 문제

전기가 들어오고, 열이 나간다. 그것이 바로 이 종교의 전부다.

고밀도 적재대는 공기가 감당하기에는 너무 많은 열을 방출합니다. 후면 도어 열교환기, 더 뜨거운 통로, 정교한 밀폐 장치 등을 통해 공기를 더 강하게 밀어낼 수는 있지만, 어느 정도까지는 효과가 있습니다. 그러다가 액체가 문제가 됩니다.

  • 칩 직접 냉각

  • 냉각수 순환 시스템 때문에 기계실이 마치 화학 공장처럼 보입니다

  • 몇몇 디자인에 몰입해 보면, 물과 서버가 문장을 공유해서는 안 된다고 생각하는 사람들을 여전히 놀라게 합니다

이 모든 것은 전혀 화려하지 않습니다. 이 모든 것이 바로 제품의 본질입니다. 왜냐하면 가속 페달이 제 기능을 못하게 하는 것은 이미 돈을 주고 산 제품을 제대로 활용할 수 없게 만드는 것과 마찬가지이기 때문입니다.

PUE는 여전히 중요합니다. PUE는 비율일 뿐, 개인의 특성이 아닙니다. 운영자들이 PUE를 쫓는 이유는 팬과 펌프에 소모되는 모든 전력이 GPU로 전달되지 못하는 전력이기 때문입니다. "일반적인" 수치를 제시하지는 않겠습니다. 기후와 경계 설정 방식에 따라 수치는 달라지며, 인위적인 정확성은 없는 것보다 나쁩니다. 물도 중요한 요소입니다. 어떤 식물은 물을 조금씩 마시고, 어떤 식물은 벌컥벌컥 마십니다. 증발 냉각은 강물이 범람하거나 가뭄이 들기 전까지는 효율적입니다.

네트워킹: 칩만큼 패브릭이 중요한 이유

사람들은 GPU를 사진 찍잖아요. 스위치도 사진 찍어야죠.

학습은 일종의 대화입니다. 수천 개의 가속기가 긴밀하게 동기화된 상태에서 기울기, 매개변수, 모델 조각들을 주고받습니다. 네트워크 인프라에 문제가 생기면 전체 작업이 가장 느린 연결에서 멈춰버립니다. 이것이 바로 AI 연구실에서 고대역폭 네트워킹, 저지연, 그리고 링크 장애 발생 시에도 시스템이 중단되지 않는 토폴로지에 집착하는 이유입니다. 인피니밴드와 유사한 네트워크 인프라, 같은 역할을 하는 이더넷, GPU 인터커넥트 내장, 그리고 처음부터 완벽하게 설치되어야 하는 케이블링 등이 그 예입니다.

추론은 완전히 다른 이야기입니다. 모델 서빙은 평균 응답이 아닌, 가장 느린 응답인 테일 레이턴시에 중점을 둡니다. 배치 처리와 실시간 처리는 성격이 완전히 다릅니다. 학습 클러스터는 전체 클러스터 간의 빠르고 집단적인 데이터 전송을, 서빙 클러스터는 로드 밸런서에서 트래픽 정체가 발생하지 않도록 여러 개의 작은 요청을 격리하여 처리하는 것을 선호합니다.

제가 여기서 지적하고 싶은 점은, 사람들이 네트워크를 배관으로, 칩을 식당으로 생각한다는 것입니다. 이 건물에서는 배관이 곧 식당입니다. 이 점을 간과하면 배달 서비스를 받을 수 없는 주방을 사게 되는 꼴이 됩니다.

학습과 추론: 두 개의 건물, 때로는 말 그대로 건물과 같은 관계

훈련은 일종의 캠페인입니다. 클러스터를 구성하고, 데이터를 입력하고, 꼼꼼하게 체크포인트를 설정하고, 몇 시간 또는 몇 주 동안 실행하면서 네트워크에 문제가 발생하지 않기를 기도해야 합니다. 배치 처리량이 많고 대역폭을 많이 소모하는 작업이지만, 노드 하나가 고장 나면 전체 실행에 차질이 생깁니다. 긴밀하게 연결된 작업에서 가속기 하나가 고장 나면 전체 작업이 중단될 수 있습니다.

추론은 매장의 진열대와 같습니다. 이미 학습된 모델들이 질문에 답하고, 이미지를 분류하고, 텍스트를 생성하는 것이죠. 지연 시간은 중요합니다. 고객 가까이에 있는 약간 오래된 가속기가 대륙 건너편에 있는 최첨단 가속기보다 더 나은 성능을 보일 수도 있습니다.

그래서 두 가지 유형으로 나뉘게 됩니다. 교육 캠퍼스는 전력, 부지, 그리고 밀집도를 추구하고, 추론 사이트는 지연 시간과 물리적 존재감을 추구합니다. 자본이 무한하지 않기 때문에 하이브리드 시설도 존재합니다. 물론 항상 두 개의 건물로 구성되는 것은 아닙니다. 때로는 벨벳 로프로 출입을 제한하고 냉각 시스템을 두 개 갖춘 하나의 시설로 운영되기도 합니다.

바로 이 지점에서 코로케이션, 하이퍼스케일 캠퍼스, 온프레미스가 갈라집니다. 하이퍼스케일러는 다른 업체들이 마치 가구를 배치하는 것처럼 보일 정도로 엄청난 규모로 서버를 구축합니다. 코로케이션 업체는 랙 단위로 고밀도 스토리지를 판매합니다. 온프레미스는 데이터가 외부로 유출될 수 없을 때 여전히 사용됩니다.

스토리지 처리량, 체크포인트 및 고성능 칩

누구도 브로셔 표지에 병렬 파일 시스템을 싣지는 않습니다.

학습 데이터는 GPU가 과열되지 않도록 충분히 빠르게 도착해야 합니다. 체크포인트는 시스템 충돌로 인해 일주일 치 학습 데이터가 날아가지 않도록 제때 저장되어야 합니다. 모델 가중치는 서비스용 복제본이 활성화되기 전에 로드되어야 합니다. 스토리지 용량뿐 아니라 처리량 또한 중요한 병목 현상입니다. 고가의 가속기를 구입해 놓고 가상 머신용으로 설계된 스토리지 어레이를 사용하면 가속기의 성능을 제대로 활용하지 못할 수 있습니다.

익숙한 패턴입니다. 반짝이는 클러스터, 작업 큐, 그리고 마치 무례한 청구서처럼 노려보는 I/O 대기 시간. 데이터 경로를 클러스터링하지 않고 컴퓨팅만 클러스터링하면 매우 비싼 유휴 상태가 발생합니다. 칩에 지속적으로 데이터를 공급하거나, 조각품을 샀다는 사실을 인정하세요.

소프트웨어, 오케스트레이션, 그리고 화려함과는 거리가 먼 운영 계층

하드웨어가 스타이고, 스케줄러가 실제 작업을 담당합니다.

AI 데이터 센터는 작업이 GPU를 찾지 못하거나, 두 팀이 클러스터를 공유할 때 서로 다투게 되거나, 고장난 랭크를 대체할 수 없거나, 펌웨어가 지속적으로 불안정해져 패브릭이 서서히 고장나는 경우 무용지물입니다. 오케스트레이션, 관찰 가능성, 전력 제한 등은 화려하지는 않지만 중요한 운영 계층입니다.

저는 이 레이어에 애정이 있습니다. 그리고 잘못 설정된 NIC가 오후 내내 냉각 문제인 척하는 경우도 있죠... 그런 문제는 직접 겪어봐야 알 수 있습니다.

노드가 실행 도중에 다운될 경우

노드 하나가 다운됩니다. 변경 일정은 여전히 ​​사용자의 일정을 고려하지 않는 학습 실행과 충돌합니다. 대규모 작업은 일괄 예약하고, 추론 풀을 분리하고, "작업이 느려졌습니다"와 같은 단순한 오류부터 "작업이 완전히 중단되었습니다"와 같은 심각한 오류까지 대비한 런북을 작성해야 합니다. 전력, 냉각, 경로, 스토리지 등 중복성은 여전히 ​​중요하지만, 장애 발생 시 기존의 99.9% 가동 시간 보장 방식처럼 깔끔하게 처리하기는 어렵습니다. 추론은 복제본을 사용하고, 문제가 발생한 노드의 데이터를 삭제하고, 계속해서 응답을 처리합니다. 반면 학습은 낙관적인 예측보다는 체크포인트를 필요로 합니다.

위치, 물, 전력망, 그리고 이웃

경치를 감상하려고 이런 걸 오두막집 옆에 떨어뜨리는 건 아니죠.

전력망 연결은 종종 실제 부지 선정 과정에서 가장 중요한 요소입니다. 토지는 변전소나 다른 고객을 가진 전력 설비에 비하면 훨씬 쉽습니다. 냉방용수를 사용한다면, 비가 조금만 와도 이웃과의 문제가 발생합니다. 소음, 건물 외관의 부피, 경계 울타리의 열기 등도 문제입니다. 도시 계획 위원회는 건물이 들판이나 강변에 설치되어야 할 때가 되어서야 비로소 "클라우드"에 대한 다양한 의견을 접하게 됩니다.

지연 시간은 정반대의 상황을 만듭니다. 추론은 사용자와 상호 연결 장치 근처에 있는 것을 선호합니다. 반면 학습은 전력 가격이 저렴하고 기후가 서늘한 곳에서 수행될 수 있습니다. 업계에서는 마치 완벽한 사이트가 하나 있는 것처럼 이야기하지만, 그런 곳은 없습니다. 보도 자료를 통해 타협안이 제시될 뿐입니다.

남은 열기와 불청객처럼 나타난 난방기

홍보 책자에는 이런 문구가 아주 잘 쓰여 있습니다. "폐열을 파이프를 통해 집, 수영장, 온실로 보내세요." 정말 멋진 문장이죠. 때로는 지역 순환 시스템이 제대로 작동하는 경우도 있습니다. 하지만 때로는 캠퍼스 위치가 잘못되어 열이 여전히 공기 중으로 빠져나가는 경우도 있습니다. 저는 홍보 책자에 나오는 설명에는 회의적이지만, 물리적 원리 자체에는 의심의 여지가 없습니다.

누가 필요할까요? (그리고 누가 임대해야 할까요?)

대부분의 사람들은 이런 홀을 소유할 필요가 없습니다.

솔직한 목록:

  • 하이퍼스케일러는 제품 자체가 클라우드 플릿이기 때문입니다

  • 실험실에서 대기 시간이 병목 현상이 되거나 데이터가 전송되지 못하는 경우

  • 은행, 병원 그룹, 정부 또는 제조업체가 기밀 데이터 세트를 사내 저장소 또는 개인 코로케이션 시설에 보관하는 것은 번거롭더라도 합리적인 행동일 수 있습니다

다른 사람들은 모두 임대해야 합니다. AI에 최적화된 고밀도 코로케이션, 클라우드 예약, 관리형 클러스터. 발전소 운영자가 되지 않고도 가속기를 이용할 수 있습니다. 하지만 새벽 3시에 냉각수 순환 시스템 당직자가 누구냐고 누군가 묻는 순간, 그런 낭만적인 생각은 사라집니다.

솔직히 말하면 자존심 문제도 있어요. 클러스터를 소유한다는 건 예측 수단을 손에 넣었다는 기분이거든요. 그런데 전기 요금 고지서가 도착하면 그 자존심은 싹 사라지죠.

이 건물의 용도는 무엇인가

그렇다면 AI 데이터 센터란 무엇일까요? AI 데이터 센터는 가속기, 전력, 냉각, 네트워크 인프라, 스토리지 등이 모델 학습 및 서비스에 특화된 고밀도 공간입니다. 단순히 GPU 하나를 놓아둔 일반적인 IT 시설이 아닙니다. 겉보기에는 창고처럼 보이지만, 마치 연산 작업을 하는 발전소처럼 작동합니다.

다른 건 몰라도 이것 하나만은 기억하세요. 유명세는 칩이 독이 되지만, 변전소, 냉각 장치, 그리고 네트워크가 그 칩이 좋은 아이디어였는지 여부를 결정합니다. 학습과 추론은 같은 공간에 있을 수 있지만, 여전히 각기 다른 방식을 요구합니다. 대부분의 조직은 임대하는 것이 좋고, 일부는 직접 건물을 짓는 것이 좋습니다. 어느 쪽이든 이웃들은 알아챌 것입니다.

구름에는 항상 건물이 있었다. 요즘은 그 건물에 의견이 있다.

실제 사례: 이미지가 외부로 유출될 수 없는 2단 랙 훈련실

대본

토모스는 웨스트 미들랜즈에 위치한 직원 400명의 제조업체인 케스트렐 프리시전의 인프라 책임자입니다. 이 회사는 이미 소규모 사내 서버를 보유하고 있는데, ERP 시스템, 파일 공유, 가상 머신, 그리고 이 기사의 서두에서 언급된 것처럼 다양한 구성 요소들이 뒤섞여 있습니다. 공랭식 냉각 방식에 일반 이더넷, 그리고 사무용 디스크에 적합한 SAN이 구축되어 있습니다.

머신 비전 팀은 공장 증류기에 대한 검사 모델을 학습시켜야 합니다. 증류기는 공장 부지 밖으로 반출할 수 없습니다. 증류기에 저장된 공정 데이터는 회사가 클라우드 디스크, 심지어 개인용 디스크에도 저장하지 않을 것입니다. 조달 부서의 해결책은 듀얼 액셀러레이터 서버 4대와 "AI 데이터 센터"라는 제목의 슬라이드였습니다. 서버는 기존 랙 두 개에 설치했는데, 공간이 충분했고, 공간이 제약 조건으로 느껴졌기 때문입니다.

그렇지 않습니다. 2주도 안 되어 GPU가 바쁘게 작동하기 시작하더니 조용히 속도가 느려집니다. SAN에 체크포인트가 발생하면 작업 속도가 현저히 느려집니다. 11시간째에 노드 하나가 고장 나면서 실행은 그냥… 멈춰버립니다. 토모스는 칩 구매에 실패한 것이 아닙니다. 그는 같은 우편번호를 공유하는 고가의 워크스테이션들을 잔뜩 사들였습니다. 그 건물은 여전히 ​​기업용 홀이었습니다.

캠퍼스나 새로운 변전소, 강이 필요한 게 아닙니다. AI 데이터 센터를 축소한 듯한 소형 셀이 필요합니다. 랙이 감당할 수 있는 전력, 칩을 과열시키지 않고 열을 방출하는 시스템, 학습 작업이 통신할 수 있는 패브릭, 체크포인트를 저장할 수 있는 스토리지, 그리고 노드 장애 발생 시를 대비한 런북이 필요합니다. 이미지는 외부로 반출할 수 없기 때문에 40분 거리에 있는 코로케이션 케이지를 임대하는 것은 해결책이 아닙니다. 랙 두 개를 개조하는 것이 정답입니다.

세포에 필요한 것

  • 해당 행의 전력 예산은 GPU 희망 목록이 아닌 PDU를 기준으로 측정됩니다. 여유 용량이 학습 부하 시 4개의 서버에 전력을 공급할 수 없다면, 논의는 거기서 끝나고 더 밀집된 코로케이션을 고려하게 될 것이며, 기적은 일어나지 않을 것입니다

  • 이러한 밀도에서 공기를 냉각하는 것은 애초에 요구되지 않았습니다. 홀에 설치 가능하다면 후면 도어 열교환기를 사용하거나, 소형 액체 냉각 루프를 사용하는 방안을 고려했지만, 둘 다 불가능할 경우 서버는 설치되지 않습니다

  • 4개 노드 간에는 사무실 이더넷이 아닌 전용 고대역폭 패브릭이 필요합니다. 만약 공급업체 카탈로그에 10Gb 스위치만 있다면, 그것은 클러스터 구성이 아닙니다

  • 체크포인트 및 학습 샤드를 위한 로컬 고속 스토리지(VM SAN이 아님)

  • 스케줄러, 체크포인트 간격, 그리고 작성된 재시작 경로. 하드웨어가 주인공이고, 이 계층이 바로 그 역할을 담당합니다

  • 공장 생산 라인을 위한 울타리로 둘러싸인 추론 상자는 훈련 과정의 잡음과 분리되어야 합니다. 왜냐하면 서비스는 집단적인 환경이 아닌 꼬리 지연 시간과 격리를 원하기 때문입니다

  • 전력 소비, GPU 클럭, 스로틀링 이벤트 및 작업 진행 시간을 기록할 수 있는 권한이 필요합니다. 이러한 정보를 직접 확인할 수 없다면 GPU 사진만 찍게 되어 스위치 작동 여부를 놓칠 수 있습니다

예시 지침

토모스는 시설 개요서에서 이를 일반적인 언어로 설명합니다

이곳을 AI 캠퍼스라고 부르지 마십시오. 기존 건물에 듀얼 액셀러레이터 서버 4대를 위한 2랙 규모의 학습 셀을 구축하십시오. 팩토리 이미지는 현장에 그대로 두십시오. 성공의 기준은 다음과 같습니다. 4개의 노드가 열 스로틀링 없이 12 에포크 검사 학습 레시피를 완료하고, 체크포인트를 수십 분이 아닌 몇 분 안에 생성하며, 의도적으로 랭크를 중단했을 때 해당 체크포인트에서 학습을 재개할 수 있어야 합니다. 냉각 시스템은 GPU가 학습 클럭 속도를 유지하도록 해야 합니다. 네트워킹은 사무실 스택을 통과하는 경로가 아니라 4개의 서버가 공유하는 패브릭이어야 합니다. 스토리지는 칩에 필요한 데이터를 공급해야 합니다. 후면 도어 열교환기가 설치될 공간이 없다면 명확히 밝히고 작업을 중단하십시오. 혼합된 공간이 있는 2랙 규모의 서버에 대한 PUE(전력 사용 효율)를 제시하지 마십시오. 그 수치는 보여주기식일 뿐입니다.

그러고 나서 그는 이 내용을 교육 직무 자체에 넣습니다:

30분마다 지역 고속 풀로 이동하여 체크포인트를 확인하세요. 랭크가 떨어지면 마지막으로 완료된 체크포인트부터 다시 시작하세요. SAN을 기다리지 마세요. 열기로 인해 시간이 줄어들면 훈련을 계속하지 마세요. 문제가 발생하면 기록하고 훈련을 중단하여 저희가 상황을 파악할 수 있도록 해주세요.

정상적인 한 시간은 이런 모습입니다. 8개의 GPU 모두 학습 클럭으로 작동하고, 체크포인트 파일이 전송되었으며, 작업은 여전히 ​​동기화된 상태로 진행됩니다. 반면, 최악의 한 시간은 이런 모습입니다. 팬은 최대 속도로 돌아가고, 클럭은 떨어지고, 10분이 지나도 체크포인트는 2%밖에 기록되지 않았으며, 사무실에서 누군가가 "클러스터가 가동 중입니다"라고 말하는 상황입니다. 가동 중이라는 말은 학습이 진행되고 있다는 뜻이 아닙니다.

테스트 방법

그들은 개조 작업 전에 테스트를 작성하는데, 이것이 바로 데모를 신뢰하지 않는 이유의 핵심입니다.

  • 동일한 12단계 제조법, 동일한 12만 개의 검사 증류기, 8번의 생산 과정

  • 소요 시간은 재시작 시간을 포함하여 레시피가 완료될 때까지의 실제 소요 시간이며, 작업 제출 시점부터 12번째 에포크의 마지막 체크포인트까지 측정됩니다

  • 발열 테스트 통과: GPU 클럭이 실행 동안 목표 클럭을 유지합니다. 스로틀링 이벤트가 발생하면 작업이 최종적으로 완료되더라도 실패로 간주됩니다

  • 저장 공간 분석: 작업 로그에서 확인한 체크포인트 쓰기 시간(중앙값 및 최악값)

  • 원단에 대한 검토: 직급이 건전한 상태라고 해서 일이 집단적으로 대기하는 것은 아닙니다. 만약 그들이 그 대기 상태를 인지하지 못한다면, 계측 작업은 완료되지 않은 것입니다

  • 8번의 실행 중 2번은 재시작 경로를 테스트하기 위해 의도적으로 특정 단계에서 랭크가 하락하는 현상이 발생했습니다

  • 추론은 공장 생산 라인에서 울타리로 둘러싸인 배식 상자까지 200개의 이미지를 사용하는 별도의 테스트입니다. 학습 성공은 배식 성공으로 간주되지 않습니다

  • 그들은 PDU에서 랙 전력을 15분 간격으로 기록하므로 누구도 메가와트라는 단위를 만들어낼 필요가 없습니다

셀을 "AI 준비 완료"로 판정하기 위한 조건: 8개 레시피 중 8개 모두 완료; 8개 중 0개에서 열 스로틀링 발생; 중단된 두 실행 모두 재개; 체크포인트는 분 단위로 유지됨. 만약 이 조건을 충족하지 못하더라도, 그들에게는 여전히 고급 그래픽 카드가 있는 서버실이 있습니다.

결과

이 결과는 케스트렐에서 발표한 공식 수치가 아니라, 임의로 설정한 8회 테스트 결과를 예시로 보여주는 것입니다.

가정 사항: 2개의 랙에 4개의 듀얼 가속기 서버; 1개의 검사 모델; 120,000개의 스틸 이미지; 고정된 12 에포크 레시피를 8회 실행; 실제 소요 시간에는 레시피 완료까지의 재시작 시간이 포함됨; 스로틀링은 학습 시간에서 로그된 감소를 의미함; 체크포인트 시간은 기록 시간이며, 희망 시간이 아님; 랙 전력은 캠퍼스 PUE가 아닌 PDU 샘플 수임.

개조 전, 사무실 이더넷과 VM SAN에 연결된 일반 공랭식 랙의 GPU는 다음과 같았습니다

  • 8번의 시도 중 5번이 첫 시도에 성공했습니다. 이 5번의 시도에서 소요된 시간의 중앙값은 14시간입니다

  • 8개 중 3개는 약 11시간 만에 중단되어 다시 시작해야 했습니다(2개는 오래된 체크포인트로 인해 노드가 다운된 후, 1개는 체크포인트가 SAN을 가득 채운 후). 즉시 재시도하여 밤새 기다리지 않고 작업을 완료했습니다. 11시간을 허비한 데다 두 번째 시도에 14시간이 더해져, 이 세 가지 작업을 완료하는 데 총 25시간이 걸렸습니다

  • 재시작 횟수를 포함한 8가지 레시피를 모두 완성하는 데 걸린 평균 시간은 18시간입니다. (14시간인 레시피가 5개, 25시간인 레시피가 3개입니다. 8개 레시피의 중앙값은 여전히 ​​14시간이므로, 중앙값을 사용하면 재시작 횟수가 포함되지 않습니다. 따라서 평균값을 기준선으로 사용했습니다.)

  • 8번의 시도 중 7번에서 열 스로틀링이 기록되었습니다. 클럭 속도가 감소된 상태로 작동한 시간의 중앙값은 14시간 시도 중 3시간이었습니다

  • 체크포인트 쓰기: 중앙값 22분

  • 랭크킬은 그들이 통과할 수 있는 시험이 아니었다. 그들에게는 작전 지침서조차 없었다. 두 건의 사고사가 발견된 것이었다

  • 훈련 중 두 랙에 걸린 최대 IT 부하는 약 18kW였습니다. 해당 랙은 전력은 충분했지만, 냉각 시스템이나 소재가 부족했습니다

두 랙의 후면 도어 열 교환기, 4개 노드 간의 전용 패브릭, 체크포인트용 소규모 NVMe 풀, 30분 간격 체크포인트 및 재시작 실행 설명서가 포함되어 있습니다

  • 8개 중 8개를 첫 시도에 완료했습니다. 소요 시간 중앙값: 9시간

  • 열 스로틀: 0/8

  • 체크포인트 작성: 중간값 90초. 최악 기록: 3분

  • 의도적인 랭크킬 두 건 모두 마지막 30분 체크포인트에서 재개되었습니다. 진단 시간을 포함하여 해당 두 번의 실행에 추가로 소요된 시간은 각각 약 40분이었으므로 총 소요 시간은 약 9시간 40분이었습니다. 8번의 정지 라운드 평균은 9시간이었습니다

  • 최대 IT 부하량은 여전히 ​​약 18kW입니다. 동일한 칩을 사용하지만 건물별 작동 방식이 다릅니다

이 표본 전체에서 레시피 완성까지 걸리는 평균 시간은 18시간에서 9시간으로, 즉 8번의 시도에 걸쳐 9시간씩, 총 72시간으로 단축되었습니다. 첫 시도에 성공한 비율은 8번 중 5번에서 8번 중 8번으로 증가했습니다. 스로틀 조작은 8번 중 7번에서 8번 중 0번으로 감소했습니다. 마지막 수치는 가속제를 구입했는지 아니면 쓸모없는 물건을 샀는지 여부를 보여줍니다. 그들은 이러한 시간 단축을 생산성 50% 절감이라고 부르지는 않을 것입니다. 8번의 시도는 작고 간단한 표본이기 때문입니다.

이 수치들은 명시된 테스트, 소규모 샘플, 하나의 모델, 그리고 하나의 혼합 시설을 기반으로 한 예시적인 추정치일 뿐입니다. 이는 전력 사용 효율(PUE)이나 캠퍼스 메가와트가 아니며, 케스트렐이 야외에 훈련 시설을 건설해야 한다는 증거도 아닙니다. 로그 검토는 9시간 이내에 이루어졌으며, 그들은 이를 숨기지 않았습니다. 18kW라는 수치는 반올림된 PDU 측정값일 뿐, 전기 요금 청구서의 실제 수치가 아닙니다. 그들은 72시간을 비용으로 환산하지 않았는데, 공장의 혼합 전기 요금을 적용하면 허위 사업 타당성 분석이 될 수 있기 때문입니다.

서빙 체크는 별도로 진행되었으며 규모도 더 작았습니다. 울타리로 둘러싸인 상자 안으로 200개의 라인 이미지를 전송하는 방식이었는데, 모두 현장에서 이루어졌습니다. 이는 추론이지 훈련이 아닙니다. 이 두 가지를 혼합하는 것은 하이브리드 홀에서 발생했던 실수를 축소판으로 보여주는 것과 같습니다.

무슨 문제가 생길 수 있을까?

  • 구매 부서는 네 대의 서버를 계속해서 "AI 데이터 센터"라고 부릅니다. 그 명칭 뒤에는 복잡한 내부 구조가 숨겨져 있고, 다음 구매는 똑같은 엉망인 구역에 놓을 GPU를 더 사는 것일 겁니다

  • 뒷문 열교환기가 설치되는데 아무도 온수 쪽은 점검하지 않는다. 팬은 여전히 ​​시끄럽게 돌아가고, 시계는 여전히 시간이 떨어진다

  • 해당 네트워크 구성은 예비 경로가 없는 단일 스위치입니다. 링크 하나라도 실패하면 "클러스터"는 다시 4개의 워크스테이션으로 축소됩니다

  • 체크포인트는 NVMe 풀이 "2단계"였기 때문에 SAN에 남아 있습니다. 2단계는 다음 장애 노드가 발생하기 전에 완료되지 않습니다

  • 그들은 혼합 홀에서 두 개의 랙에 대한 PUE를 제시합니다. 하지만 기후, 경계 조건, 그리고 나머지 ERP 시스템들을 고려하면 그 비율은 허구에 불과합니다

  • 훈련과 봉사는 공통된 기반을 공유합니다. 체크포인트 과부하로 공장 생산 라인이 멈춰섭니다. 여기서 중요한 것은 밀도가 아니라 테일 지연 시간입니다

  • 노드 하나가 다운되었는데, 누군가 체크포인트 재시작 대신 가동 중단 티켓으로 처리해 버립니다. 엔터프라이즈 운영팀과 AI 운영팀은 오후 내내 서로 소통하지 못합니다

  • 그들은 새장을 빌릴 수도 있었겠지만, 이미지는 밖으로 나갈 수 없었다. 그 제약을 잊어버리자 그들은 풀어내야 할 클라우드 대화 속으로 빠져들게 된다

실질적인 교훈

이러한 형태의 AI 데이터 센터란 단순히 창고도 아니고 GPU 청구서도 아닙니다. AI 데이터 센터는 가속기가 작업을 완료할 수 있도록 하는 핵심 공간입니다. 즉, 가속기가 감당할 수 있는 전력, 배출되는 열, 네트워크 인프라, 점검 지점, 그리고 가속기 고장 시 책임지고 문제를 해결할 사람이 있는 곳입니다. 케스트렐은 캠퍼스 규모의 공간이 필요 없었습니다. 그들에게는 단지 두 개의 랙만 있으면 충분했습니다. 대부분의 팀은 이러한 공간을 임대하는 것이 적절합니다. 하지만 기밀 데이터셋과 열 관리를 감당할 수 있는 시설을 갖춘 소수의 팀만이 자체적으로 데이터 센터를 구축하고, 기존 시스템을 그대로 유지하는 것을 고수해야 합니다.

자주 묻는 질문

AI 데이터 센터란 무엇인가요?

고밀도 컴퓨팅 사이트는 일반적인 서버들이 가지런히 늘어선 모습이 아니라, 병렬 학습과 모델 서빙에 맞춰 전력, 냉각, 네트워킹, 스토리지가 최적화된 곳입니다. 수많은 가속기가 과부하, 네트워크 지연, 디스크 대기 없이 모델을 학습하고 서빙할 수 있도록 설계되었습니다. 일반적인 기업 서버실은 다양한 장비가 뒤섞인 공간이지만, AI 서버실은 GPU나 TPU 계열 칩과 같은 가속기가 핵심 가치 단위인 단일 생태계와 같습니다. 겉보기에는 창고 같지만, 마치 수학 연산을 수행하는 발전소처럼 작동합니다.

AI 데이터센터는 일반 데이터센터와 어떻게 다른가요?

기존 데이터 센터는 다양한 워크로드와 수많은 소규모 서비스의 가동 시간을 최적화합니다. 반면 AI 사이트는 그 비율을 뒤집습니다. 밀도가 높아지고, 네트워크는 학습 작업이 원활하게 진행되기 위한 필수적인 요소가 되며, 스토리지는 체크포인트를 지속적으로 처리해야 합니다. 그렇지 않으면 가속기가 유휴 상태로 남게 됩니다. 엔터프라이즈 운영은 티켓과 변경 기간을 기준으로 생각하지만, AI 운영은 작업 큐와 장기 실행 과정에서 노드가 다운될 때 느끼는 불안감을 기준으로 생각합니다. 둘 다 데이터 센터라고 부를 수 있지만, 명칭은 내부 구조를 숨길 뿐입니다.

AI 데이터 센터는 왜 그렇게 많은 전력을 소비할까요?

핵심 하드웨어는 뛰어난 CPU가 아닙니다. 바로 가속기 트레이, 즉 GPU나 다른 AI 칩들이 서버, 랙, 그리고 고대역폭 패브릭을 공유하는 여러 줄에 빼곡히 들어차 있습니다. 핵심은 랙당 밀도입니다. 랙 수가 적을수록 각 랙은 마치 작은 용광로처럼 강력해집니다. 서버실이 가득 차면 엄청난 IT 부하가 발생하지만, 일반적인 수치를 산출하는 것은 무의미합니다. 실제로 병목 현상을 일으키는 것은 GPU 사양이 아니라 변전소인 경우가 많습니다.

AI 데이터 센터는 어떻게 냉각되나요?

고밀도 랙은 공기로는 감당하기 어려운 방식으로 열을 방출합니다. 후면 도어 열교환기, 더 뜨거운 통로, 그리고 정교한 밀폐 방식을 통해 공기를 더 강력하게 순환시킬 수 있습니다. 그러다 액체 냉각이 등장합니다. 칩 직접 냉각, 냉각수 루프, 그리고 일부 설계에서는 침수 방식까지 사용됩니다. 성능 저하를 일으키는 가속기는 이미 구매한 제품을 제대로 활용할 수 없게 만듭니다. PUE(전력 사용 효율)는 여전히 중요합니다. 팬과 펌프에 소모되는 모든 전력은 GPU로 전달되지 못하는 전력이기 때문입니다. 물 또한 이 이야기에서 중요한 역할을 합니다. 어떤 식물은 물을 조금씩 흡수하고, 어떤 식물은 물을 들이마십니다.

네트워킹이 GPU만큼 중요한 이유는 무엇일까요?

학습은 대화와 같습니다. 수천 개의 가속기가 긴밀하게 동기화된 상태에서 기울기, 매개변수, 모델 조각을 주고받습니다. 네트워크에 문제가 생기면 전체 작업이 가장 느린 연결에서 대기하게 됩니다. 이것이 바로 AI 연구실에서 고대역폭 네트워크, 저지연, InfiniBand와 유사한 네트워크 또는 이더넷과 같은 네트워크 구성, 그리고 링크 장애 발생 시에도 시스템이 중단되지 않는 토폴로지에 집착하는 이유입니다. 추론은 꼬리 지연 시간, 여러 개의 작은 요청, 그리고 격리에 중점을 둡니다. 이 건물에서 배관은 식당과 같습니다.

AI 데이터 센터는 학습용으로 사용되나요, 아니면 추론용으로 사용되나요?

훈련은 일종의 캠페인입니다. 클러스터를 구성하고, 데이터를 입력하고, 꼼꼼하게 체크포인트를 설정하고, 몇 시간 또는 몇 주 동안 실행합니다. 추론은 매장의 진열대와 같습니다. 이미 훈련된 모델이 중요한 지연 시간 내에 응답하는 단계입니다. 훈련 시설은 전력, 부지, 그리고 높은 밀도를 추구합니다. 추론 시설은 지연 시간과 현장 접근성을 추구합니다. 자본이 무한하지 않기 때문에 하이브리드 시설이 존재하며, 때로는 하나의 시설에 두 개의 냉각 루프를 사용하는 경우도 있습니다. 고객 근처에 있는 약간 오래된 가속기가 대륙 건너편에 있는 최첨단 가속기보다 더 나은 성능을 발휘할 수도 있습니다.

AI 데이터 센터에서 스토리지가 중요한 이유는 무엇일까요?

학습 데이터는 GPU가 과열되지 않도록 충분히 빠르게 도착해야 합니다. 체크포인트는 시스템 충돌로 인해 일주일 치 학습 데이터가 날아가지 않도록 제때 저장되어야 합니다. 모델 가중치는 서비스용 복제본이 활성화되기 전에 로드되어야 합니다. 스토리지 용량뿐 아니라 처리량 또한 중요한 병목 현상입니다. 고가의 가속기를 구입해 놓고 가상 머신용으로 설계된 스토리지 어레이를 사용하면 가속기의 성능을 제대로 활용하지 못할 수 있습니다.

노드가 실행 도중에 다운되면 어떻게 되나요?

긴밀하게 연결된 학습 작업에서 가속기 하나가 고장 나면 전체 코러스가 멈출 수 있습니다. 학습에는 낙관론이 아니라 체크포인트가 필요합니다. 추론은 고장 난 노드의 리소스를 소모하고, 복제본이 응답하도록 유지하며, 시스템이 계속 작동하도록 합니다. 변경 일정은 여전히 ​​사용자의 일정에 상관없이 실행되는 학습과 충돌합니다. 전력, 냉각, 경로 및 스토리지 측면에서 이중화는 여전히 중요하지만, 장애 발생 시 복구 방식은 기존의 99.99% 가동 시간 보장 방식보다 훨씬 복잡합니다.

AI 데이터센터가 전력망, 용수 공급, 그리고 인근 주민들에게 미치는 영향은 무엇일까요?

전력망 연결은 종종 실제 부지 선정 과정에서 가장 중요한 요소입니다. 토지 선정은 변전소나 다른 고객을 보유한 전력 회사에 비하면 훨씬 쉽습니다. 냉각수를 사용하는 경우, 비가 오기 시작하면 이웃과의 마찰 문제가 발생할 수 있으며, 소음, 건물 외관의 부피, 경계 울타리의 열기 문제도 있습니다. 훈련 시설은 전력 가격이 저렴한 지역이나 기후가 서늘한 곳에 설치할 수 있습니다. 추론 시스템은 사용자 근처에 있는 것을 선호합니다. 완벽한 부지는 없습니다. 결국 절충안이 마련되는 것입니다.

AI 데이터센터를 소유해야 할까요, 아니면 임대해야 할까요?

대부분의 사람들은 이러한 서버를 소유할 필요가 없습니다. 하이퍼스케일러는 전체 서버망 자체가 제품이기 때문에 구축합니다. 랩은 대기 시간이 병목 현상을 일으키거나 데이터가 유출되지 못할 때 구축합니다. 은행, 병원, 정부 기관 또는 기밀 데이터 세트를 보유한 제조업체는 온프레미스 서버나 전용 코로케이션 케이지를 사용하는 것이 합리적일 수 있습니다. 그 외의 모든 사람들은 AI 지원 코로케이션, 클라우드 예약 ​​또는 관리형 클러스터와 같은 서비스를 임대해야 합니다. 발전소 운영자가 되지 않고도 가속기를 이용할 수 있습니다.

참고 자료

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. 그린 그리드 - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. 업타임 연구소 - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. 구글 클라우드 - docs.cloud.google.com

최신 AI 기술을 공식 AI 어시스턴트 스토어에서 만나보세요

회사 소개

놀리다
1. 기사에 따르면 AI 데이터 센터란 무엇인가요?

2. 궁전이 아닌 장소에서 작업하는 경우, Kestrel과 같은 팀은 팩토리 이미지가 사이트를 벗어날 수 없을 때 어떻게 해야 할까요?

3. 이 기사에서는 개조 전 기준선으로 14시간 중앙값이 아닌 18시간 평균값을 사용하는 이유는 무엇입니까?

4. 예시로 제시된 8회 실행 테스트에서 2개 랙 개조 후 무엇이 변경되었습니까?

5. 이 기사에서는 2랙 셀의 PUE 인용에 대해 무엇이라고 언급하고 있습니까?


블로그로 돌아가기