PROJECT 01 / 2026.06.30 - 2026.08.26
AI 러닝 종합 플랫폼
DAI RUN
위치, 날씨·대기질, 러닝 기록과 사용자 선호를 이용해 당일 러닝 거리와 강도, 코스를 추천하는 AI 기반 러닝 플랫폼입니다. Docker 기반 서비스를 MSA와 Kubernetes 환경으로 전환하고, 온프레미스 운영 환경 안정화 후 AWS EKS 기반 아키텍처로 확장했습니다.
주요 역할
- 12개 MSA를 Kubernetes에 배포하고 Namespace와 노드 역할에 따라 워크로드를 분리했습니다.
- Calico, MetalLB, Istio Gateway를 연결해 외부 요청이 Gateway, Service, Pod로 전달되는 구조를 구성했습니다.
- Prometheus, Grafana, Loki, Tempo를 연결해 Metric, Log, Trace를 함께 확인하는 관측 환경을 구축했습니다.
- Argo CD 기반 GitOps와 Terraform 기반 AWS EKS 이전 아키텍처를 설계했습니다.
운영 관점
팀장과 DevOps·인프라 담당으로 배포 경로, 서비스 간 통신, 외부 트래픽 진입, 관측성, 장애 복구를 하나의 운영 흐름으로 연결하는 데 집중했습니다.
Kubernetes 기반 MSA 운영 환경
애플리케이션, 데이터베이스, Kafka, 검색 및 관측성 워크로드를 Namespace와 노드 역할에 따라 분리했습니다. PostgreSQL, Redis, MongoDB, Kafka 등 상태 저장 워크로드의 배치와 스토리지를 고려해 애플리케이션 계층과 데이터 계층을 구분했습니다.
Metric · Log · Trace 통합 관측
장애가 발생하면 단순히 Pod를 재시작하지 않고 Gateway, Service, Pod, DB 순서로 요청 경로를 확인해 문제 구간을 좁혔습니다. Kiali 토폴로지와 관측 데이터를 함께 사용해 외부 진입 경로와 내부 서비스 통신을 분리해서 점검했습니다.
ETCD 디스크 장애 대응
ETCD 디스크 장애로 kubectl 명령이 정상 동작하지 않았고, 마지막 Snapshot은 약 이틀 전 상태였습니다. 실행 중인 ETCD Endpoint에서 최신 Snapshot을 확보하고 정상 디스크를 사용하는 노드로 데이터를 이관해 최근 작업 손실 없이 클러스터를 복구했습니다.
자료


KubernetesAWS EKSTerraformArgo CDIstio AmbientPrometheusGrafanaLokiTempoKEDAKarpenterSNS/SQS