Files
service-catalog/.claude/pitfalls.md
T
wbsong111 3ee1c1ee23 카탈로그 앱 내장 bitnami postgresql → cnpg-cluster 전환 (1차 5개 차트)
이슈 #9에서 결정된 CloudNativePG 채택을 카탈로그 앱에 확장 적용한다.
airflow/lakekeeper/mlflow/superset/flowise 5개 차트가 내장하던 bitnami
postgresql 서브차트를 끄고 앱 전용 cnpg-cluster 인스턴스를 외부 DB로 쓰도록
전환했다. 5개 모두 dev 클러스터 격리 네임스페이스에서 배포 테스트로 실측 검증했다.

gitea/keycloak/dnsup 는 서브차트가 아니라 공유 postgresql-ha 를 외부 참조하며
paasup/dipup 레포 관리 대상이라 제외했다 — 인수인계 문서만 추가했다.

배포 구조:
- ArgoCD ApplicationSet 으로 DB(syncWave 0) → 앱(syncWave 1) 순서를 보장한다.
  기존 openmetadata/victoria-metrics 관례를 따랐다. cnpg-cluster 차트는 범용
  상태로 유지하고 앱별 값은 manifests/applicationset/<app>/ 에 둔다.

검증 중 발견해 함께 고친 문제:
- lakekeeper: cnpg 의 -ro 는 replica 전용이라 instances:1 에서 엔드포인트가
  0개다. 읽기 연결을 -r(전체 라운드로빈)로 교체했다.
- airflow/superset: ingressClassName 누락 + kong 애노테이션 잔존으로 이
  클러스터(apisix 전용)에서 ingress 접근이 아예 불가능했다. apisix + regex
  path 로 교체했다.
- 배포 테스트가 PV 만 지우고 Longhorn Volume CR 을 남겨 storageScheduled 가
  누적됐다(orphan 112개 ~1TB 로 배포 차단). 두 스크립트의 정리 로직을 고쳤다.

재사용 구조화:
- .claude/skills/chart-to-cnpg/ 신규. 남은 4개 차트(langflow-ide, langfuse,
  litellm, nemo)에 같은 절차를 재사용한다. flowise 에 실제 적용해 검증했다.
- 배포 테스트 공통 절차는 .claude/deploy-test-procedure.md, 환경 함정은
  .claude/pitfalls.md 로 단일화하고 앱별 README 는 참조만 남겼다.

관련: #9, #14

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-05 15:17:46 +09:00

5.0 KiB

이 환경에서 반복적으로 문제가 된 것들

security-catalog 프로젝트에서 CNPG/etcd 자체 빌드·배포 테스트 작업 중 실제로 겪은 함정을 포팅했다. CLAUDE.md 에서 분리했다 — 매 세션 필요한 내용이 아니라 해당 작업(자체 빌드 이미지, CNPG/etcd 배포 테스트)을 할 때만 참고한다.

스캐너 결과를 그대로 믿지 말 것

세 가지 실패 양상을 모두 겪었다. 게이트(scripts/pipeline/cve-gate.py)가 이것들을 잡도록 만들어져 있다.

양상 실측
벤더 하향 등급 NVD 9.8 을 Debian 이 LOW(CVE-2019-1010022), Ubuntu 가 MEDIUM(CVE-2026-8376) 으로 둠
데이터 커버리지 부재 Debian sid 기반 이미지가 149 패키지에 findings 0건 — 거짓 clean
벤더 미평가 은폐 Ubuntu 의 "Needs evaluation" CVE 는 보고되지 않음. --detection-priority comprehensive 로도 안 나옴

dip-catalog 의 scan-sbom.sh 는 두 번째 양상(데이터 커버리지 부재)을 구분하는 자가진단 (CoverageProbe)을 이식했다(2026-08-03) — doc/sbom-pipeline.md 참고.

이미지 태그의 베이스 OS 를 확인할 것

같은 앱 버전이라도 태그에 따라 베이스 OS 가 다르고 EOL 이 임박한 것이 섞여 있다. 오퍼레이터가 배포판 수명 테이블을 갖고 있으면 기동 로그에 남는다 (CNPG: internal/cmd/manager/instance/run/osdb.go).

kubectl get cluster 는 쓰면 안 된다

dev 클러스터에 clusters 단축명을 쓰는 CRD 가 3개 있다(CNPG 배포 테스트 대상 클러스터 기준).

  • clusters.postgresql.cnpg.io (CloudNativePG)
  • clusters.management.cattle.io (Rancher)
  • clusters.cluster.x-k8s.io (CAPI)

kubectl get cluster 는 CNPG 가 아닌 리소스를 조회해 빈 결과를 반환한다. 스크립트·런북에서는 항상 FQN 을 쓴다.

kubectl -n <ns> get clusters.postgresql.cnpg.io <name>

오퍼레이터 차트는 cluster-scoped 잔여물을 남긴다

helm uninstall 후에도 CRD 와 webhook 설정이 남는다. CNPG 는 webhook failurePolicy: Fail 이므로 오퍼레이터를 먼저 지우면 CR 을 삭제할 수 없게 된다. 정리 순서: CR → 오퍼레이터 → webhook 설정 → CRD.

선언적 리소스의 status 를 근거로 쓰지 말 것

CNPG Database CRD 는 spec generation 이 바뀔 때만 reconcile 한다. 확장이 DB 에서 사라져도 status.applied 는 계속 true 다. 검증은 항상 실제 DB 에 질의해서 한다 (security-catalog 프로젝트에서 실측 — 상세 배포 테스트 기록은 dip-catalog 에 아직 없음).

PV 를 지워도 Longhorn Volume 은 남는다

kubectl delete pv 로 k8s PersistentVolume 오브젝트를 지워도 Longhorn 자체의 volumes.longhorn.io 커스텀 리소스는 남는다. kubectl get pv 로는 "깨끗하다"고 보이지만 Longhorn 의 storageScheduled 는 계속 누적되고, 결국 디스크에 여유가 충분한데도 insufficient storage(ReplicaSchedulingFailure)로 새 볼륨 스케줄링이 막힌다.

실측: 반복된 배포 테스트가 남긴 orphan 볼륨 112 개(~1TB)가 쌓여 airflow 배포가 볼륨 attach 단계에서 멈췄다. PV 와 이름이 같은 Longhorn Volume 을 함께 지워야 한다.

kubectl -n longhorn-system delete volumes.longhorn.io <pv-name>

이미 삭제된 네임스페이스의 orphan 볼륨을 찾을 때는 .status.kubernetesStatus.namespace 가 현존하지 않는 네임스페이스를 가리키는 것만 골라낸다. 배포 테스트 스크립트 (deploy-test-app-with-cnpg.sh, deploy-test-cnpg-cluster.sh)에는 이 정리가 포함돼 있다.

배포 테스트의 ingress host 가 실제 배포와 충돌한다

카탈로그 custom-values.yaml 의 ingress host(<app>.example.org)를 그대로 쓰면, 같은 host 를 이미 쓰는 실제 배포가 있을 때 apisix 에 동일 host 라우트가 2 개 등록되어 운영 트래픽 라우팅과 충돌한다. 실측: defense-llm 네임스페이스에 이미 배포된 lakekeeper 와 lakekeeper.example.org 가 겹쳤다.

배포 테스트는 항상 host 를 <app>-access-test.example.org 처럼 별도 값으로 오버라이드한다 (각 앱 fixture 에 반영돼 있다). 배포 전 kubectl get ingress -A 로 host 중복을 먼저 확인한다.

ingress 는 ingressClassName 을 명시해야 한다

이 클러스터의 ingress controller 는 apisix 하나뿐이다(kong 은 없다). 그런데 일부 카탈로그 차트가 아직 kubernetes.io/ingress.class: kong 애노테이션 방식으로 남아 있었다 — 이 경우 Ingress 리소스는 만들어지지만 CLASS: <none> 으로 뜨고 어떤 컨트롤러도 처리하지 않아 접근 자체가 불가능하다(airflow·superset 에서 실측, 둘 다 수정함).

또한 path: / 는 정확히 / 만 매치되므로 앱이 /home 등으로 리다이렉트하면 전부 404 가 난다. path: /.* + k8s.apisix.apache.org/use-regex: "true" 를 함께 쓴다.