
AI infra
AI-Ready Infrastructure를 물리 인프라, 데이터, 조직 준비도의 세 층위로 구분해 정리했습니다. 국내는 물리 인프라에 치우쳐 있어 GPU 운영 서비스화와 인력 전환이 차별화 포인트라고 제시했습니다.

AI-Ready Infrastructure를 물리 인프라, 데이터, 조직 준비도의 세 층위로 구분해 정리했습니다. 국내는 물리 인프라에 치우쳐 있어 GPU 운영 서비스화와 인력 전환이 차별화 포인트라고 제시했습니다.

AI 데이터센터와 클라우드 운영 전략을 다룬 뉴스레터였습니다. 전력, 냉각, 네트워크, 플랫폼 고도화와 사례를 폭넓게 소개했습니다.

사용자와 AI가 만든 코드를 운영 서버에서 안전하게 실행하기 위해 별도 Kernel 계층을 설계했습니다. 기존 서비스와 실행 환경을 분리하고 인증정보와 세션 상태를 밖으로 빼는 방향을 정리했습니다.

Grafana Mimir에 Kafka 기반 ingest-storage architecture를 도입한 경험과 운영상의 함정을 정리했습니다. partition과 ingester ordinal의 1:1 결합, backlog replay, scale-in 절차가 핵심 포인트였습니다.


Showcase가 자기 자신을 배포 대상으로 삼는 구조에서 발생하는 정합성 문제를 상태 머신과 이벤트 분할로 해결했습니다. 재기동 후 버전 검증과 멱등 발행, GID 기반 식별로 분산 배포의 일관성을 확보했습니다.


KubeEdge 엣지 노드에서 자주 발생하는 3가지 장애와 대응 방법을 정리했습니다. EdgeStream, 디스크 사용량, DNS 상태를 먼저 확인하는 흐름을 제시했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

EKS 비용 최적화를 위해 AWS Graviton 도입 방법을 정리했습니다. 멀티 아키텍처 이미지를 준비한 뒤 카나리로 점진 전환하는 흐름을 소개했습니다.

공공 클라우드를 위한 kt cloud PLATFORM의 운영 구조와 주요 장점을 소개했습니다. 멀티 리전, 보안 체계, AI 인프라 확장성을 통해 안정성과 확장성을 함께 강조했습니다.


인프라 접근 권한을 코드로 관리하는 Access as Code 개념과 판단 기준을 정리했습니다. Teleport로 SSH, Kubernetes, DB, 앱 권한을 하나의 role과 Git 흐름으로 운영하는 방법을 설명했습니다.

쿠버네티스 전환으로 커진 VictoriaMetrics 리소스 문제를 조회·저장·수집 세 레이어로 나눠 최적화했습니다. 쿼리 분할, 보관 기간 축소, 수집 대상 축소로 장비 증설 없이 안정화했습니다.

물리 서버 환경에서 Cluster API와 BYOH Provider로 In-place Upgrade를 구현하고 검증했습니다. Rolling Upgrade와 병행해 인프라 제약에 맞는 업그레이드 전략을 확보했습니다.


LGU+의 대규모 AWS 마이그레이션에서 Kiro와 Harness Engineering으로 전환 작업을 표준화했습니다. 설정 자동화와 지식 자산화를 통해 개발자 편차를 줄이고 재사용성을 높였습니다.