Files
service-catalog/.claude/pitfalls.md
T
wbsong111 7746570ec0 자체 빌드 이미지 프레임워크를 security-images 레포로 이관하고 카탈로그 쪽을 정리한다
images/·scripts/build/build-hardened-image.sh·suggest-go-upgrades.py·
build-image.yml·.claude/image-authoring.md·이미지 ADR(0001·0002·0004)을 삭제했다 —
전부 별도 public 레포 security-images 로 이미 이관됐다.

카탈로그 쪽에는 "무엇을 배포 중인가"를 아는 부분만 남긴다:
- catalog/image-map/<image>.env — 옛 catalog.env 의 카탈로그 레이아웃 정보만 뗀 것
- scripts/build/check-rebuild-needed.py — 드리프트 탐지(A 파트)만 남기고 핀 판단
  (B 파트: pin_changes/apply_changes/parse_module_specs)은 제거
- scripts/build/apply-published-tags.py(신규) — security-images 의 published.json
  을 읽어 카탈로그 values 를 패치
- .github/workflows/{self-build-drift-check,catalog-tag-update}.yml(신규) — 각각
  드리프트 스캔+트리거, 발행 태그 반영

effective_severity 를 cve-gate.py 로 옮겼다 — check-rebuild-needed.py 가 핀 도구를
거치지 않고 게이트를 직접 로드하게 하기 위한 선행 작업이다.

두 레포의 계약은 published.json 스키마 하나뿐이다 — security-images 는 이 카탈로그를
모른다(단방향 의존). 이관 배경·결합점 전체는
doc/migrations/self-build-images-to-security-images.md.

부수 수정: 자체 빌드 이미지를 참조하는 차트 values/README 의 죽은 링크(images/**,
doc/decisions/000{1,2,4}, .claude/image-authoring.md)를 security-images 레포를
가리키는 서술로 교체. deploy-test 스크립트·CUSTOM-README 의 개인 Docker Hub 계정
(docker.io/wbsong111) 을 docker.io/paasup 로 교체.

pitfalls.md 의 "스캐너 결과를 그대로 믿지 말 것" 절은 sbom-cve-gate skill 이 차트
축 설명에 실제로 참조하고 있어 남겼다 — "이미지 태그의 베이스 OS" 절만 제거했다
(다른 참조 없음, security-images 문서로 이관 완료).

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
2026-08-24 15:21:29 +09:00

86 lines
4.7 KiB
Markdown

# 이 환경에서 반복적으로 문제가 된 것들
security-catalog 프로젝트에서 CNPG/etcd 자체 빌드·배포 테스트 작업 중 실제로 겪은 함정을
포팅했다. [CLAUDE.md](../CLAUDE.md) 에서 분리했다 — 매 세션 필요한 내용이 아니라 해당
작업(자체 빌드 이미지, CNPG/etcd 배포 테스트)을 할 때만 참고한다.
## 스캐너 결과를 그대로 믿지 말 것
세 가지 실패 양상을 모두 겪었다. 게이트(`scripts/pipeline/cve-gate.py`)가 이것들을
잡도록 만들어져 있다.
| 양상 | 실측 |
| --- | --- |
| **벤더 하향 등급** | NVD 9.8 을 Debian 이 LOW(`CVE-2019-1010022`), Ubuntu 가 MEDIUM(`CVE-2026-8376`) 으로 둠 |
| **데이터 커버리지 부재** | Debian sid 기반 이미지가 149 패키지에 findings 0건 — 거짓 clean |
| **벤더 미평가 은폐** | Ubuntu 의 "Needs evaluation" CVE 는 보고되지 않음. `--detection-priority comprehensive` 로도 안 나옴 |
> dip-catalog 의 `scan-sbom.sh` 는 두 번째 양상(데이터 커버리지 부재)을 구분하는 자가진단
> (`CoverageProbe`)을 이식했다(2026-08-03) — `doc/sbom-pipeline.md` 참고.
## `kubectl get cluster` 는 쓰면 안 된다
dev 클러스터에 `clusters` 단축명을 쓰는 CRD 가 3개 있다(CNPG 배포 테스트 대상 클러스터
기준).
- `clusters.postgresql.cnpg.io` (CloudNativePG)
- `clusters.management.cattle.io` (Rancher)
- `clusters.cluster.x-k8s.io` (CAPI)
`kubectl get cluster` 는 CNPG 가 아닌 리소스를 조회해 **빈 결과를 반환한다.**
스크립트·런북에서는 항상 FQN 을 쓴다.
```sh
kubectl -n <ns> get clusters.postgresql.cnpg.io <name>
```
## 오퍼레이터 차트는 cluster-scoped 잔여물을 남긴다
`helm uninstall` 후에도 CRD 와 webhook 설정이 남는다. CNPG 는 webhook `failurePolicy: Fail`
이므로 **오퍼레이터를 먼저 지우면 CR 을 삭제할 수 없게 된다.**
정리 순서: CR → 오퍼레이터 → webhook 설정 → CRD.
## 선언적 리소스의 `status` 를 근거로 쓰지 말 것
CNPG `Database` CRD 는 spec generation 이 바뀔 때만 reconcile 한다. 확장이 DB 에서
사라져도 `status.applied` 는 계속 `true` 다. 검증은 항상 실제 DB 에 질의해서 한다
(security-catalog 프로젝트에서 실측 — 상세 배포 테스트 기록은 dip-catalog 에 아직 없음).
## PV 를 지워도 Longhorn Volume 은 남는다
`kubectl delete pv` 로 k8s PersistentVolume 오브젝트를 지워도 **Longhorn 자체의
`volumes.longhorn.io` 커스텀 리소스는 남는다.** `kubectl get pv` 로는 "깨끗하다"고 보이지만
Longhorn 의 `storageScheduled` 는 계속 누적되고, 결국 디스크에 여유가 충분한데도
`insufficient storage`(`ReplicaSchedulingFailure`)로 새 볼륨 스케줄링이 막힌다.
실측: 반복된 배포 테스트가 남긴 orphan 볼륨 112 개(~1TB)가 쌓여 airflow 배포가 볼륨
attach 단계에서 멈췄다. PV 와 이름이 같은 Longhorn Volume 을 함께 지워야 한다.
```sh
kubectl -n longhorn-system delete volumes.longhorn.io <pv-name>
```
이미 삭제된 네임스페이스의 orphan 볼륨을 찾을 때는 `.status.kubernetesStatus.namespace`
현존하지 않는 네임스페이스를 가리키는 것만 골라낸다. 배포 테스트 스크립트
(`deploy-test-app-with-cnpg.sh`, `deploy-test-cnpg-cluster.sh`)에는 이 정리가 포함돼 있다.
## 배포 테스트의 ingress host 가 실제 배포와 충돌한다
카탈로그 `custom-values.yaml` 의 ingress host(`<app>.example.org`)를 그대로 쓰면, 같은 host 를
이미 쓰는 실제 배포가 있을 때 **apisix 에 동일 host 라우트가 2 개 등록되어 운영 트래픽
라우팅과 충돌한다.** 실측: `defense-llm` 네임스페이스에 이미 배포된 lakekeeper 와
`lakekeeper.example.org` 가 겹쳤다.
배포 테스트는 항상 host 를 `<app>-access-test.example.org` 처럼 별도 값으로 오버라이드한다
(각 앱 fixture 에 반영돼 있다). 배포 전 `kubectl get ingress -A` 로 host 중복을 먼저 확인한다.
## ingress 는 `ingressClassName` 을 명시해야 한다
이 클러스터의 ingress controller 는 **apisix 하나뿐이다**(kong 은 없다). 그런데 일부 카탈로그
차트가 아직 `kubernetes.io/ingress.class: kong` 애노테이션 방식으로 남아 있었다 — 이 경우
Ingress 리소스는 만들어지지만 `CLASS: <none>` 으로 뜨고 어떤 컨트롤러도 처리하지 않아
접근 자체가 불가능하다(airflow·superset 에서 실측, 둘 다 수정함).
또한 `path: /` 는 정확히 `/` 만 매치되므로 앱이 `/home` 등으로 리다이렉트하면 전부 404 가
난다. `path: /.*` + `k8s.apisix.apache.org/use-regex: "true"` 를 함께 쓴다.