필터 1
올리브영의 실시간 캠페인 타겟팅을 위한 CDC 전환기
올리브영
데브옵스

올리브영의 실시간 캠페인 타겟팅을 위한 CDC 전환기

ODI 배치 기반 캠페인 동기화를 OGG와 Kafka 기반 CDC로 전환한 사례를 다뤘습니다. 메시지 순서 문제는 Retry, DLT, 복구 배치로 보완했고 실시간 정합성과 운영 모니터링을 강화했습니다.

#CDC#Kafka
113005분
딜라이트룸
데브옵스

배포가 두렵지 않은 팀 만들기: Argo Rollouts로 카나리 배포 자동화하기

쿠버네티스 기본 배포의 한계를 줄이기 위해 Argo Rollouts로 카나리 배포를 자동화했습니다. Nginx Ingress와 Datadog 연동으로 점진적 전환과 무인 롤백 구조를 구축했습니다.

#Argo Rollouts#Kubernetes
75005분
요기요
AI

AI 서버 모니터링 자동화: 반복적인 업무를 줄이고, 놓치던 인사이트를 얻다.

Datadog 모니터링 분석을 Gemini로 자동화해 주간 작업 시간을 1시간에서 5분으로 줄였습니다. 다만 이미지 분석과 비즈니스 맥락 부족으로 인한 한계는 API 데이터와 검증 과정으로 보완했습니다.

#모니터링#Gemini
128005분
메시징 시스템 QA, 정합성을 지켜낸 올리브영의 이야기
올리브영
백엔드

메시징 시스템 QA, 정합성을 지켜낸 올리브영의 이야기

실시간 메시지 기반 환경에서 데이터 정합성을 API 자동화 테스트로 검증한 사례를 소개했습니다. 정기 실행과 모니터링까지 연결해 리소스를 줄이고 운영 안정성을 높였습니다.

#API#Postman
87005분
빅뱅 배포, QA는 어떻게 살아 남았나: GMS 프로젝트 테스트 전략 백서
올리브영
기타

빅뱅 배포, QA는 어떻게 살아 남았나: GMS 프로젝트 테스트 전략 백서

빅뱅 배포 기반 GMS 구축에서 QA가 기능, 동시성, E2E, UAT를 단계적으로 설계한 사례를 다뤘습니다. 운영 이후에는 Datadog 모니터링으로 조용한 실패까지 감시하며 안정성을 높였습니다.

#빅뱅 배포#QA
22005분
서비스의 건강을 수치화 할 수 있을까? — SLI/SLO
무신사
백엔드

서비스의 건강을 수치화 할 수 있을까? — SLI/SLO

서비스의 건강을 수치로 보기 위해 SLI와 SLO를 정의하고 운영하는 방법을 소개했습니다. 29CM 사례를 통해 지표 설계, 모니터링, 지속 개선 체계를 설명했습니다.

#SRE#모니터링
87005분
올리브영 물류 시스템의 진화 - 고객 경험의 시작과 끝을 함께하다
올리브영
아키텍처

올리브영 물류 시스템의 진화 - 고객 경험의 시작과 끝을 함께하다

올리브영이 재고, 주문, WMS, 배송, 발주 시스템을 단계적으로 고도화한 과정을 소개했습니다. 실시간 연동과 내재화로 고객 경험과 운영 효율을 함께 개선했습니다.

#AWS#Kafka
105005분
올리브영 물류 시스템의 진화 - 고객 경험의 시작과 끝을 함께하다
올리브영
백엔드

올리브영 물류 시스템의 진화 - 고객 경험의 시작과 끝을 함께하다

올리브영 물류 시스템의 전반적 구성과 개선 과정을 정리한 글입니다. 실시간 재고, OMS, WMS, 배송최적화, 자동발주로 고객 경험과 운영 효율을 높였습니다.

#AWS#Kafka
156005분
전국 3,500대 POS 실시간 모니터링 구축기
올리브영
데브옵스

전국 3,500대 POS 실시간 모니터링 구축기

Datadog을 POS 환경에 적용해 전국 3,500대 장비의 로그와 장애를 실시간으로 모니터링하도록 구축했습니다. 장애 탐지 시간은 4분 30초에서 59초로 줄어들고, 사전 대응 체계도 마련했습니다.

#Datadog#모니터링
205005분
10년 된 레거시를 현대화하다 - Part.3: 대고객 서비스로의 확장
올리브영
백엔드

10년 된 레거시를 현대화하다 - Part.3: 대고객 서비스로의 확장

매장 도메인을 온·오프라인 대고객 서비스로 확장한 과정과 API 분리 전략을 소개했습니다. 또한 ECS, TeamCity, Datadog 기반의 배포·모니터링 구성까지 정리했습니다.

#DDD#REST API
126005분
데브시스터즈
데브옵스

데브시스터즈의 장애 대응 원칙과 방법

장애 대응의 목표를 서비스 정상화에 두고, 에스컬레이션과 기록, 종료 공유, 포스트모템까지의 절차를 체계화했습니다. FRT 기준 티어링과 역할 분담, 커뮤니케이션 중심 대응 원칙도 함께 제시했습니다.

#SRE#AWS
41005분