필터 1
SSG.COM
백엔드

돌아오지 않는 메모리를 찾아서

Kubernetes에서 메모리 사용률이 99%까지 오르던 원인을 heap 누수로 의심했지만, JVM committed heap과 로그 파일 page cache가 핵심 원인이었습니다. JVM 옵션 조정과 FILE Appender 제거로 사용률을 크게 낮추고 안정화했습니다.

#Kubernetes#JVM
79005분
올리브영
데브옵스

에러로그 하나에 깨던 새벽에서 벗어나기까지 — 상품 모니터링 진화기

상품 모니터링 체계를 Slack 알림 중심에서 DLQ 재처리, Workflow 자동 분석, 정합성 자동화로 진화시켰습니다. 사람이 개입할 일을 줄이고 장애 판단과 대응 속도를 높인 사례를 공유했습니다.

#Datadog#DLQ
141005분
아임웹
데브옵스

세 개의 플랫폼, 하나의 배포 관측

세 플랫폼에 흩어진 배포 이력을 APM 트레이스 기반 신호로 통합했습니다.\n장애 스레드에 직전 배포를 자동 첨부해 대응 속도를 높였습니다.

#EKS#ECS
13005분
AWS DevOps Agent와 Custom MCP 서버를 활용한 HYBE의 인시던트 자동 조사 체계 구축 사례
AWS
데브옵스

AWS DevOps Agent와 Custom MCP 서버를 활용한 HYBE의 인시던트 자동 조사 체계 구축 사례

HYBE는 AWS DevOps Agent와 Custom MCP 서버로 인시던트 조사와 Jira 생성을 자동화했습니다. 서비스 카탈로그와 Skill을 더해 분산된 도구와 이름 불일치 문제를 해결했습니다.

#AWS DevOps Agent#MCP
51005분
아임웹
프론트엔드

Datadog RUM 도입기: 비용을 90% 줄이기까지

Datadog RUM 도입 과정에서 세션 과금 구조를 분석하고 의미 있는 세션만 남기는 전략을 적용했습니다. 봇 필터링과 샘플링 최적화로 비용을 약 90% 줄이며 관측 품질도 높였습니다.

#Datadog#RUM
7005분
GS리테일의 AIOps Agent 기반 운영 자동화 혁신
AWS
AI

GS리테일의 AIOps Agent 기반 운영 자동화 혁신

GS리테일이 Amazon Bedrock과 MCP로 AIOps Agent를 구축해 인시던트 분석을 자동화했습니다. 평균 분석 시간을 약 30분에서 약 2분으로 줄이고 RCA 보고서와 Teams 알림까지 자동화했습니다.

#AIOps#Amazon Bedrock
71005분
Part2: 삼성계정 서비스의 Agentic AIOps, 운영환경에서 Multi-Agent 시스템으로 RCA 자동화 하기
AWS
AI

Part2: 삼성계정 서비스의 Agentic AIOps, 운영환경에서 Multi-Agent 시스템으로 RCA 자동화 하기

삼성계정 서비스의 장애 대응을 Multi-Agent 기반 Agentic AIOps로 자동화한 사례를 소개했습니다. 관측 데이터 수집, RCA, 조치 제안을 분리해 3분 47초 만에 분석을 완료했습니다.

#AIOps#LLM
38005분
요기요
AI

ChatGPT에서 요기요 배달 쓰기 — MCP + 위젯 연동 개발기

ChatGPT Apps SDK와 MCP로 요기요 배달 서비스를 연결한 개발 과정을 정리했습니다. 위젯, CSP, 배포 분리, 모니터링까지 실제 운영 관점의 설계가 담겼습니다.

#MCP#ChatGPT
64005분
아임웹
데브옵스

AI가 전사 알림을 두 번 죽이다

120일 동안 AI 에이전트 실수 15건을 guardrail로 바꾸며 인프라 방어선을 강화한 기록입니다.\nCLAUDE.md와 Memory를 겹쳐 세션 한계를 보완하고, 가용성을 99.981%까지 끌어올렸습니다.

#Claude Code#AWS
2005분
무신사
데브옵스

추측이 아닌 데이터로: 3개 서비스 27개 SLO와 54개 모니터를 설정하고 배포 자동화까지 구축한 2주의 집중 작업

3개 서비스에 맞는 SLO와 모니터를 데이터 기반으로 표준화하고, 배포 중 Error Budget이 소진되지 않도록 자동화했습니다. 오탐을 줄이고 실제 비즈니스 실패를 더 정확히 탐지하는 운영 체계를 구축했습니다.

#SRE#SLO
17005분
아임웹
AI

4개 파트가 하나의 AI 시스템을 공유하기

인프라팀이 CLAUDE.md와 정책 파일로 AI 에이전트의 행동 기준을 통일했습니다. 반복 작업을 정책화해 온보딩, 장애 대응, 자동화를 함께 개선했습니다.

#Claude Code#Slack API
4005분
팀을 위한 Claude Code 모니터링 방법 4가지
인포그랩
AI

팀을 위한 Claude Code 모니터링 방법 4가지

Claude Code의 사용 패턴과 비용, 성능을 팀 단위로 모니터링하는 4가지 방법을 정리했습니다. OpenTelemetry, SigNoz, Datadog, claude-code-otel로 ROI와 활용도를 확인할 수 있습니다.

#Claude Code#OpenTelemetry
157005분