1a747f61a8
images/·manifests/helm/·.claude/ 의 20개 파일이 doc/decisions·doc/analysis 등 **이 레포에 존재한 적 없는 경로 15종을 48곳에서** 인용하고 있었다. security-catalog 에서 포팅할 때 따라온 것인데, 그 레포는 개인 레포(github.com/wbsong111/security-catalog)라 팀 구성원은 접근조차 못 한다 — "security-catalog 에 있으나 이관되지 않았다" 는 안내가 아무 역할을 하지 못했다. 원문을 통째로 복사하지 않았다 ---------------------------- 원본 문서들이 서로를 근거로 인용한다. decisions/0001 하나만 봐도 analysis/cnpg-image-baseline.md · analysis/vendor-unassessed-data-sources.md 처럼 **인용 목록에 없던 또 다른 미이관 문서**를 가리킨다. 복사는 문제를 옮기는 것이지 없애는 게 아니다. 그리고 대부분은 애초에 dip-catalog 가 더 나은 것을 갖고 있다. 7곳에서 인용되던 analysis/sles-oval-measurement.md 는 원문 스스로 "이 문서는 결정하지 않는다. 재측정하면 갱신된다" 고 밝히는 스냅샷인데, dip-catalog 는 같은 측정을 CoverageProbe 로 매 스캔마다 자동으로 한다. 문서를 복사하는 것보다 게이트를 가리키는 것이 정확하다. 그래서 성격별로 나눴다 --------------------- 재측정으로 복원 안 되는 것 → doc/decisions/ 에 자립적 ADR 로 다시 씀 (4건) 이미 단일 출처가 있는 것 → 그쪽으로 인용 교체 (11종 경로) ADR 4건은 security-catalog 0001·0005·0006·0007 이 원본이고, 결론과 근거만 추려 dip-catalog 맥락으로 새로 썼다 — **레포 밖을 가리키는 링크가 0이다.** 번호는 이 레포에서 0001~0004 로 다시 붙였고 원본 대응은 각 문서와 README 에 적었다. 왜 안 가져온 것은 안 가져왔는지도 README 표에 남겼다. 인용 교체는 카테고리별로: analysis/*-cve.md, cnpg-image-vuln-comparison.md → 해당 ADR · images/<image>/README.md analysis/sles-oval-measurement.md → 게이트 CoverageProbe (doc/sbom-pipeline.md) cve-zero-pipeline.md, architecture/build-pipeline.md → doc/sbom-pipeline.md image-selection.md → .claude/image-authoring.md charts/*/deploy-test.md → scripts/deploy-test/*.sh + 절차 문서 찾은 오류 2건 ------------- - images/cloudnative-pg/source.build.env 가 인용한 decisions/0004-cloudnative-pg-operator-self-build.md 는 **번호 오기**다. 원본 0004 는 postgresql-chart-selection 이고 이 결정은 0005 다. - cnpg-cluster values.yaml·templates/database.yaml 이 인용한 doc/deploy-test-cnpg.md 는 **원본 레포에도 없다.** CREATE EXTENSION 함정 설명은 주석 자체에 이미 있어 인용만 뺐다. 검증 ---- 우리 파일의 깨진 doc/ 인용 0건 (전수 스캔) 새 문서·수정 문서의 로컬 링크 전부 실재 확인 helm template cnpg-cluster · etcd · cloudnative-pg 정상 렌더 남은 doc/health-checking.md(144곳)·doc/integration/*(2곳)은 업스트림 CRD·차트 안의 문자열로 우리가 쓴 인용이 아니다 — 건드리지 않았다. Closes #33 Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
6.0 KiB
6.0 KiB
배포 테스트 절차
CLAUDE.md 에서 분리했다. 배포 테스트를 실제로 수행할 때만 참고한다. security-catalog 프로젝트에서 포팅했다.
CVE 0건이어도 동작하지 않는 이미지는 카탈로그에 넣을 수 없다. 게이트 통과와 기능 검증은 둘 다 필수다.
CNPG (cnpg-postgresql 이미지) — 자동화됨
build-image.yml 이 새 이미지로 카탈로그 PR 을 열면, 병합 전에 로컬 kubeconfig 로
scripts/deploy-test/deploy-test-cnpg-cluster.sh 를 실행해 "실제로 뜨는가"만 빠르게 확인한다(PR 본문에도
안내됨).
IMAGE_NAME=docker.io/wbsong111/cnpg-postgresql:<태그> bash scripts/deploy-test/deploy-test-cnpg-cluster.sh /tmp/deploy-test-out
- Operator(
cloudnative-pg)는 상시 컴포넌트다 — releasecnpg, namespacecnpg-system에 1회만 설치되고 스크립트가 재사용한다. cloudnative-pg 차트의 웹훅 설정 이름이 릴리스와 무관하게 클러스터 전역 고정이라(cnpg-validating-webhook-configuration등) 두 번째 설치가 원천적으로 불가능하다 — 그래서 상시 설치로 전환됐다. - 앱(
cnpg-cluster)만 고정 네임스페이스(pg-test-build)에 매번 재생성되고, 검증은 차트 기본값 +postgresql.imageNameoverride만으로 이루어진다(custom-values.yaml안 씀). 확인 범위는 "psql 로 응답하는가" 수준의 스모크 테스트다. - 정리(uninstall + PVC/PV + 네임스페이스 삭제)는 성공/실패와 무관하게 항상 수행된다. Operator 는 정리 대상이 아니다.
- CI(GitHub Actions) 통합은 아직 없다 — 러너에서 dev 클러스터로의 네트워크 경로가 없다.
- 백업/PITR, pooler, 동기 복제 등 스모크 테스트 밖의 항목은 아래 수동 절차를 따른다.
스모크 테스트가 무엇을 덮는지는
scripts/deploy-test/deploy-test-cnpg-cluster.sh가 단일 출처다 — 그 밖은 이 문서의 수동 절차를 따른다.
etcd (etcd 이미지) — 스크립트 있음, 수동 실행
cnpg 와 달리 상시 오퍼레이터가 없다 — 단일 차트라 매 실행 테스트 네임스페이스
(etcd-test-build)에 설치하고 끝나면 지운다.
IMAGE_NAME=quay.io/coreos/etcd:v3.7.1 bash scripts/deploy-test/deploy-test-etcd.sh /tmp/deploy-test-out
- 차트 기본값 +
image.*/initImage.*/replicasoverride 만으로 검증한다 (custom-values.yaml안 씀 — cnpg 원칙과 동일). - 확인 범위: StatefulSet 롤아웃, 컨테이너 실행 계정(uid 999 기대), 전 멤버 quorum
health(
etcdctl endpoint health --cluster), 쓰기/읽기 왕복(etcdctl put/get). - 정리(uninstall + PVC/PV + 네임스페이스 삭제)는 성공/실패와 무관하게 항상 수행된다.
- TLS·백업 등 스모크 테스트 밖의 항목은
manifests/helm/etcd/1.1.12/CUSTOM-README.md를 따른다. 스모크 테스트가 무엇을 덮는지는scripts/deploy-test/deploy-test-etcd.sh가 단일 출처다.
카탈로그 앱 → cnpg-cluster 전환 배포 테스트 (deploy-test-app-with-cnpg.sh)
airflow/lakekeeper/mlflow/superset처럼 내장 bitnami postgresql 서브차트를 cnpg-cluster
전용 인스턴스로 전환한 앱은 이 공용 스크립트로 검증한다. 각 앱의 ApplicationSet 배포 구조·
사전조건은 manifests/applicationset/<app>/<version>/README.md에 있다 — 여기서는 배포
테스트 자체의 공통 절차만 다룬다.
APP_CHART_DIR=manifests/helm/<app>/<version> \
APP_RELEASE=<app> \
DB_CUSTOM_VALUES=manifests/applicationset/<app>/<version>/<app>-db-values.yaml \
DB_SECRET_USER=<user> DB_SECRET_PASSWORD=<password> \
TEST_NAMESPACE=<app>-test-build \
APP_EXTRA_VALUES=scripts/deploy-test/fixtures/<app>-deploy-test-overrides.yaml \
APP_POD_SELECTOR="<DB에 실제로 연결하는 파드의 label selector>" \
bash scripts/deploy-test/deploy-test-app-with-cnpg.sh /tmp/deploy-test-<app>
- operator(
cloudnative-pg)는 상시 컴포넌트로 재사용한다. DB(cnpg-cluster)를 먼저 띄워 healthy 대기 후 앱을 설치하고, 실제 DB 소비 파드가 Running+Ready 상태가 되고 로그에 DB 연결 실패 패턴이 없으면 PASS. 정리는 성공/실패와 무관하게 항상 수행한다. APP_POD_SELECTOR는 반드시 지정한다 — 미지정 시 네임스페이스의 아무 파드나 Running이면 통과로 오판할 수 있다(DB와 무관한 다른 파드가 떠 있으면 실제 실패를 놓친다 — 실측).APP_EXTRA_VALUES(fixture,scripts/deploy-test/fixtures/<app>-deploy-test-overrides.yaml)는 DB 연결과 무관하지만 격리된 테스트 네임스페이스에서만 막히는 의존성을 끈다. 카탈로그의 실제 권장 설정(custom-values.yaml)은 건드리지 않는다. 앱별로 무엇을 왜 끄는지는 각 fixture 파일 자체의 주석에 있다 — 문서를 이중으로 유지하지 않는다.- PV뿐 아니라 Longhorn Volume 커스텀 리소스까지 지워야 한다 — PV만 지우면 Longhorn 쪽에 실제 디스크가 계속 쌓인다. 상세: pitfalls.md.
- ingress host 충돌 주의: pitfalls.md 참고.
그 외 차트 — 수동 절차
- 전용 네임스페이스를 새로 만든다 (
pg-test-<name>). 기존 워크로드가 있는 NS 를 쓰지 않는다. - 오퍼레이터는 가능하면 권한을 축소해 설치한다 (CNPG 는
config.clusterWide=false). - 개발 환경 크기로 축소해 배포한다 (
--set storage.size=2Gi등).custom-values.yaml자체를 개발용 값으로 바꾸지 않는다. - 검증 항목은 해당 차트의
BUILD-README.md"배포 검증" 절에 정의한다. - 결과는 실측값으로 기록한다(장소는
MEMORY.md또는 PR 설명 —doc/charts/관례는 dip-catalog 에 아직 없다). 통과 항목만 쓰지 말고 발견된 문제와 미검증 항목을 반드시 남긴다. - 정리한다. 정리 명령은 문서에 함께 기록한다.