
엘리스 그룹, 나의 AI 선생님의 이야기
엘리스그룹의 설립 배경과 AI 교육 플랫폼, 클라우드, 테스트 서비스 등을 소개했습니다. 성수 엘리스 랩과 최근 수상 소식, 채용 정보도 함께 다뤘습니다.

엘리스그룹의 설립 배경과 AI 교육 플랫폼, 클라우드, 테스트 서비스 등을 소개했습니다. 성수 엘리스 랩과 최근 수상 소식, 채용 정보도 함께 다뤘습니다.

스노우 AI 서비스의 GPU 서버 인프라를 Kubernetes 클러스터로 이전한 사례를 공유했습니다.\nGPU 자원 스케줄링과 운영 개선 관점을 함께 살펴볼 수 있습니다.


그래픽스의 Affine 변환을 내적과 매트릭스 연산으로 설명했습니다. 내적의 의미를 이해하면 Transformer와 다차원 공간을 더 쉽게 볼 수 있다고 강조했습니다.


HBM의 구조와 원리를 통해 왜 AI 산업에서 고대역폭 메모리가 중요한지 설명했습니다. DRAM과 비교하며 속도, 대역폭, 용량 측면의 장점을 정리했습니다.
고성능 GPU 클러스터에서 발생하는 통신 비용과 병목 구간을 하드웨어 관점에서 정리했습니다. 스토리지, 서버 내 GPU, 서버 간 통신에 맞춰 NVMe SSD, NVLink, NVSwitch, InfiniBand 선택을 제안했습니다.

GPU의 기본 개념과 CPU와의 차이, AI에서 중요한 이유를 정리한 글입니다. GPU 서버를 효율적으로 쓰는 서버호스팅과 코로케이션 서비스도 함께 소개했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


내적을 벡터의 유사도와 투영으로 설명하며 딥러닝 이해의 기초 개념으로 풀어냈습니다. 코사인 값과 그림자 비유를 통해 Transformer와 GPU 연산의 직관을 제시했습니다.
토스증권이 투자 분석용 LLM을 위해 자체 고성능 GPU 클러스터를 도입한 배경을 설명했습니다. 개인정보 보호, 비용 효율, 실시간성 제약과 GPU 운용상의 유의점을 함께 짚었습니다.


대규모 머신러닝 학습에서 데이터 병렬성과 동기/비동기 업데이트 방식을 설명했습니다. 또한 Ring-AllReduce로 통신 병목과 상태 불일치 문제를 완화하는 방법을 소개했습니다.


컬리의 MLOps 구축 초기에 GPU 노드 자동화와 Karpenter 도입 과정을 소개했습니다. NVDP, affinity, consolidation 이슈까지 포함해 운영 포인트를 정리했습니다.
.png)

온프레미스 쿠버네티스에서 NAS와 GPU를 함께 쓰는 구성을 다뤘습니다. RKE2, NFS, gpu-operator를 활용한 클러스터 구축 맥락을 소개했습니다.