# 배포 테스트 절차 [CLAUDE.md](../CLAUDE.md) 에서 분리했다. 배포 테스트를 실제로 수행할 때만 참고한다. security-catalog 프로젝트에서 포팅했다. CVE 0건이어도 동작하지 않는 이미지는 카탈로그에 넣을 수 없다. 게이트 통과와 기능 검증은 둘 다 필수다. ## CNPG (`cnpg-postgresql` 이미지) — 자동화됨 `build-image.yml` 이 새 이미지로 카탈로그 PR 을 열면, 병합 전에 로컬 kubeconfig 로 `scripts/deploy-test/deploy-test-cnpg-cluster.sh` 를 실행해 "실제로 뜨는가"만 빠르게 확인한다(PR 본문에도 안내됨). ```sh IMAGE_NAME=docker.io/wbsong111/cnpg-postgresql:<태그> bash scripts/deploy-test/deploy-test-cnpg-cluster.sh /tmp/deploy-test-out ``` - **Operator(`cloudnative-pg`)는 상시 컴포넌트다** — release `cnpg`, namespace `cnpg-system` 에 1회만 설치되고 스크립트가 재사용한다. cloudnative-pg 차트의 웹훅 설정 이름이 릴리스와 무관하게 클러스터 전역 고정이라(`cnpg-validating-webhook-configuration` 등) 두 번째 설치가 원천적으로 불가능하다 — 그래서 상시 설치로 전환됐다. - 앱(`cnpg-cluster`)만 고정 네임스페이스(`pg-test-build`)에 매번 재생성되고, 검증은 차트 기본값 + `postgresql.imageName` override만으로 이루어진다(`custom-values.yaml` 안 씀). 확인 범위는 "psql 로 응답하는가" 수준의 스모크 테스트다. - 정리(uninstall + PVC/PV + 네임스페이스 삭제)는 성공/실패와 무관하게 항상 수행된다. Operator 는 정리 대상이 아니다. - CI(GitHub Actions) 통합은 아직 없다 — 러너에서 dev 클러스터로의 네트워크 경로가 없다. - 백업/PITR, pooler, 동기 복제 등 스모크 테스트 밖의 항목은 아래 수동 절차를 따른다. 스모크 테스트가 무엇을 덮는지는 `scripts/deploy-test/deploy-test-cnpg-cluster.sh` 가 단일 출처다 — 그 밖은 이 문서의 수동 절차를 따른다. ## etcd (`etcd` 이미지) — 스크립트 있음, 수동 실행 `cnpg` 와 달리 상시 오퍼레이터가 없다 — 단일 차트라 매 실행 테스트 네임스페이스 (`etcd-test-build`)에 설치하고 끝나면 지운다. ```sh IMAGE_NAME=quay.io/coreos/etcd:v3.7.1 bash scripts/deploy-test/deploy-test-etcd.sh /tmp/deploy-test-out ``` - 차트 기본값 + `image.*`/`initImage.*`/`replicas` override 만으로 검증한다 (`custom-values.yaml` 안 씀 — cnpg 원칙과 동일). - 확인 범위: StatefulSet 롤아웃, 컨테이너 실행 계정(uid 999 기대), 전 멤버 quorum health(`etcdctl endpoint health --cluster`), 쓰기/읽기 왕복(`etcdctl put`/`get`). - 정리(uninstall + PVC/PV + 네임스페이스 삭제)는 성공/실패와 무관하게 항상 수행된다. - TLS·백업 등 스모크 테스트 밖의 항목은 `manifests/helm/etcd/1.1.12/CUSTOM-README.md` 를 따른다. 스모크 테스트가 무엇을 덮는지는 `scripts/deploy-test/deploy-test-etcd.sh` 가 단일 출처다. ## 카탈로그 앱 → cnpg-cluster 전환 배포 테스트 (`deploy-test-app-with-cnpg.sh`) airflow/lakekeeper/mlflow/superset처럼 내장 bitnami postgresql 서브차트를 cnpg-cluster 전용 인스턴스로 전환한 앱은 이 공용 스크립트로 검증한다. 각 앱의 ApplicationSet 배포 구조· 사전조건은 `manifests/applicationset///README.md`에 있다 — 여기서는 배포 테스트 자체의 공통 절차만 다룬다. ```sh APP_CHART_DIR=manifests/helm// \ APP_RELEASE= \ DB_CUSTOM_VALUES=manifests/applicationset///-db-values.yaml \ DB_SECRET_USER= DB_SECRET_PASSWORD= \ TEST_NAMESPACE=-test-build \ APP_EXTRA_VALUES=scripts/deploy-test/fixtures/-deploy-test-overrides.yaml \ APP_POD_SELECTOR="" \ bash scripts/deploy-test/deploy-test-app-with-cnpg.sh /tmp/deploy-test- ``` - operator(`cloudnative-pg`)는 상시 컴포넌트로 재사용한다. DB(cnpg-cluster)를 먼저 띄워 healthy 대기 후 앱을 설치하고, 실제 DB 소비 파드가 Running+Ready 상태가 되고 로그에 DB 연결 실패 패턴이 없으면 PASS. 정리는 성공/실패와 무관하게 항상 수행한다. - `APP_POD_SELECTOR`는 반드시 지정한다 — 미지정 시 네임스페이스의 아무 파드나 Running이면 통과로 오판할 수 있다(DB와 무관한 다른 파드가 떠 있으면 실제 실패를 놓친다 — 실측). - `APP_EXTRA_VALUES`(fixture, `scripts/deploy-test/fixtures/-deploy-test-overrides.yaml`)는 DB 연결과 무관하지만 격리된 테스트 네임스페이스에서만 막히는 의존성을 끈다. 카탈로그의 실제 권장 설정(`custom-values.yaml`)은 건드리지 않는다. 앱별로 무엇을 왜 끄는지는 각 fixture 파일 자체의 주석에 있다 — 문서를 이중으로 유지하지 않는다. - PV뿐 아니라 **Longhorn Volume 커스텀 리소스**까지 지워야 한다 — PV만 지우면 Longhorn 쪽에 실제 디스크가 계속 쌓인다. 상세: [pitfalls.md](pitfalls.md). - ingress host 충돌 주의: [pitfalls.md](pitfalls.md) 참고. ## 그 외 차트 — 수동 절차 1. 전용 네임스페이스를 새로 만든다 (`pg-test-`). 기존 워크로드가 있는 NS 를 쓰지 않는다. 2. 오퍼레이터는 가능하면 권한을 축소해 설치한다 (CNPG 는 `config.clusterWide=false`). 3. 개발 환경 크기로 축소해 배포한다 (`--set storage.size=2Gi` 등). `custom-values.yaml` 자체를 개발용 값으로 바꾸지 않는다. 4. 검증 항목은 해당 차트의 `BUILD-README.md` "배포 검증" 절에 정의한다. 5. 결과는 실측값으로 기록한다(장소는 `MEMORY.md` 또는 PR 설명 — `doc/charts/` 관례는 dip-catalog 에 아직 없다). 통과 항목만 쓰지 말고 발견된 문제와 미검증 항목을 반드시 남긴다. 6. 정리한다. 정리 명령은 문서에 함께 기록한다. ## 같은 날 재빌드했다면 — `imagePullPolicy` 를 수동으로 건다 자체 빌드 태그에는 빌드일이 들어간다(`1.30.0-security-hardened-20260820`). **같은 날 두 번 빌드하면 태그가 겹치고**, 노드가 캐시한 옛 digest 가 그대로 쓰여(`IfNotPresent`) 고친 것이 반영되지 않은 채 "안 고쳐졌다" 로 보인다. 검증에서 이것을 실제로 밟았다. 검증 대상 워크로드에만 걸고, digest 로 실제 이미지를 확인한다. ``` sh kubectl set image ... # 태그가 같으므로 이미지 교체로는 아무 일도 일어나지 않는다 kubectl patch deployment -n --type=strategic -p \ '{"spec":{"template":{"spec":{"containers":[{"name":"","imagePullPolicy":"Always"}]}}}}' kubectl rollout restart deployment/ -n # 태그가 아니라 digest 를 본다 — 태그는 같으므로 아무것도 증명하지 못한다 kubectl get pod -n -o jsonpath='{range .items[*]}{.status.containerStatuses[*].imageID}{"\n"}{end}' ``` **카탈로그 values 에는 넣지 않는다.** `Always` 면 파드 시작마다 kubelet 이 레지스트리에서 digest 를 해석하므로, 레지스트리 장애·Docker Hub rate limit 이 파드 기동을 막는 경로가 생긴다(rate limit 은 이 레포에서 실측된 문제다 — `DOCKERHUB_USER`/`TOKEN` 을 쓰는 이유). 태그 겹침은 **검증 시점에만** 생기는 문제이므로 그 대가를 운영 내내 지불할 이유가 없다. 이것이 [#31](https://github.com/paasup/dip-catalog/issues/31) 의 결정이다 — 태그에 해시를 붙이거나 digest 로 참조하는 방안은 채택하지 않았다. 태그가 "무엇을 검증했는지의 기록" 이라는 성격을 유지한다.