콘텐츠로 바로가기

시리즈

Reliability, Observability & Technical Debt

8개 글

  1. 01

    SLO-SLA 및 Reliability Metrics의 정의, 범위, 선행 지식, 학습 주제, 참고 근거를 정리한 CS&E 학습 노드입니다.

  2. 02

    코드 배포 자동화(CI/CD)와 인프라의 코드화(IaC), 그리고 서비스 신뢰성을 공학적으로 관리하는 SRE 체계를 배우는 학습 노드입니다.

  3. 03

    1. **Stage 1: Fundamentals (Weight: 1)** * Maintenance Types and Software Evolution Laws. 2. **Stage 2: Quantification (Weight: 2)** * Tech Debt Me...

  4. 04

    분산 시스템의 내부 상태를 외부 출력을 통해 파악하는 가관측성의 원리와, 로그/메트릭/트레이스를 결합한 고차원 텔레메트리 연쇄 작용을 다루는 학습 노드입니다.

  5. 05

    서비스의 신뢰도를 수치적 지표(SLI)와 목표(SLO)로 정의하고, 허용 가능한 실패의 양인 에러 예산을 통해 혁신과 안정의 물리적 균형을 맞추는 SRE 핵심 물리학을 다룹니다.

  6. 06

    서비스 신뢰성을 수치로 정의하고 계약하는 SRE의 핵심 프레임워크. 남은 Error Budget이 있으면 새 기능 배포 가능. 소진되면 안정화 작업 우선. 개발팀과 SRE 팀의 공통 언어.

  7. 07

    소비자가 처리 가능한 속도보다 생산자가 빠를 때 소비자가 생산 속도를 제어하는 메커니즘. 버퍼 폭발과 OOM을 방지. 생산자 >> 소비자 속도 차이 → 무한 큐 성장 → 메모리 고갈 또는 지연 폭증. Java의 `Flow` API, Project Reactor, ...

  8. 08

    빠른 배포를 위해 더 나은 설계를 나중으로 미룬 결과 생기는 추가 작업 비용. Ward Cunningham이 금융 부채 비유로 도입. 신중한 의도적 부채만 전략적으로 수용 가능. 나머지는 최소화 대상.