

올리브영 QA는 Datadog을 어떻게 활용하고 있을까?
올리브영 QA가 Datadog을 이용해 배포 전후 이슈를 감지하고 로그, RUM, Synthetics로 품질을 관리한 사례를 소개했습니다. 추가로 Session Replay와 User Journeys 같은 기능의 활용 가능성도 살펴보았습니다.


올리브영 QA가 Datadog을 이용해 배포 전후 이슈를 감지하고 로그, RUM, Synthetics로 품질을 관리한 사례를 소개했습니다. 추가로 Session Replay와 User Journeys 같은 기능의 활용 가능성도 살펴보았습니다.

LINE VOOM 실시간 추천을 위해 Go 채널 대신 Redis Streams 기반 큐잉 구조를 도입한 과정을 소개했습니다. 클러스터 메모리 집중 문제를 쿠폰 수집가 문제로 풀고, 운영 스위치와 모니터링 API까지 마련했습니다.

입사 2개월차 백엔드 인턴이 프로젝트 개발과 장애 대응을 통해 배운 점을 공유했습니다. 테크 스펙, 테스트, 모니터링, 회고가 성장과 안정성에 중요했다고 정리했습니다.

당근이 Vertex AI Pipelines와 TFX로 서버리스 ML 훈련 인프라를 구축한 사례를 공유했습니다. 공통 컴포넌트, 모니터링, 알림, EoS 관리로 운영 효율을 높였습니다.

차량 주행 소리를 AI로 분석해 도로 노면 상태를 검지하는 ARHIS를 소개했습니다. 4단계 처리와 음향 전처리, 이중 AI 모델로 높은 검지 성능과 운영 장점을 설명했습니다.

AWS re:Invent 2023에서 관심 세션을 중심으로 Cost Optimization과 Observability를 소개한 글입니다. 행사 참여 경험과 느낀 점을 함께 공유했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


올리브영은 인시던트 선언부터 대응, 보고, 재발 방지까지의 체계를 정리해 운영하고 있습니다.\n전체 Usecase와 CSP, 레벨 기준을 바탕으로 빠른 전파와 사후 리뷰를 강화했습니다.

중앙집중식 syslog를 어떻게 관리하고 모니터링하는지 소개했습니다. 알람을 어떤 기준으로 분류하는지도 함께 설명했습니다.


외부셀러의 동기식 API 구조를 비동기 이벤트 기반으로 분리해 내부 시스템 보호 방안을 소개했습니다. AWS MSK와 partition key, retry 로직으로 스파이크 트래픽 대응과 순서 보장을 다뤘습니다.

서비스 전반의 모니터링과 별개로, 사이트 신뢰성을 위한 서비스 레벨 지표와 목표 범위를 고민한 글입니다. SRE 관점에서 Request 기준의 신뢰성 측정 체계를 구성하려는 방향을 다뤘습니다.


빠르게 변하는 환경에서 모니터링 코드가 비즈니스 코드에 섞이지 않도록 Domain-Oriented Observability를 도입한 사례입니다. 마틴 파울러 블로그의 개념을 바탕으로 코드 오염을 줄이는 방향을 다뤘습니다.


후기 서비스의 조회 병목을 해결하기 위해 AWS Opensearch를 도입한 사례를 정리했습니다. CQRS와 이벤트 기반 구조로 전환하고 성능 테스트와 모니터링까지 함께 적용했습니다.