3.9 KiB
3.9 KiB
Milestone: 작업 복구와 관측성
위치
- Roadmap: ROADMAP.md
- Phase: PHASE.md
목표
장시간 분석·수정 작업이 프로세스 재시작이나 일시 장애 뒤에도 중복 실행 없이 회복되도록 한다. 운영자가 오류 수집부터 IOP 실행, 검증과 병합 요청까지 상관관계와 실패 원인을 추적할 수 있게 한다.
상태
[스케치]
승격 조건
- 자동 재시도 범위와 비용·횟수 한도를 확정한다.
- 실패 작업 보존과 운영자 재실행 정책을 확정한다.
- SDD 사용자 리뷰를 해결하고 gate를 통과한다.
- 작업 임대, 재개, 지표와 경보 기능 단위를 구현 가능한 수준으로 고정한다.
구현 잠금
- 상태: 잠금
- SDD: 필요
- SDD 문서: SDD.md
- SDD 사유: 지속 작업 lifecycle, 임대·재시도 멱등성, 비용과 실패 보존 정책 및 운영 지표를 다룬다.
- 잠금 해제 조건:
- SDD 잠금이 해제되어 있다.
- SDD 사용자 리뷰가 승인·해결되어 있다.
- Acceptance Scenario가 Milestone 기능 Task와 연결되어 있다.
- Evidence Map이 완료 시 검증 가능한 근거와 연결되어 있다.
- 결정 필요:
- [D01] 자동 재시도 한도·비용 보호와 최종 실패 작업의 보존·수동 재실행 정책
범위
- 지속 작업 조회·임대와 만료 후 안전한 회수
- 단계별 재시도 가능 여부, 지수 지연과 한도
- 재시작 뒤 IOP 이벤트 스트림 재개
- 상관관계 ID 기반 구조화 로그, 지표와 추적
- 실패 원인 단계·코드별 운영 조회와 경보
- 운영자 수동 재실행 및 취소 감사 기록
기능
Epic: [recovery] 지속 작업 복구
프로세스 장애와 일시 외부 장애에서 작업을 안전하게 이어 간다.
- [claim-work] 데이터베이스 기반 작업 임대와 소유권 갱신으로 같은 작업의 동시 실행을 막는다.
- [resume-work] 재시작 뒤 비종료 작업을 상태와 마지막 IOP 이벤트 순서에서 재개한다.
- [retry-policy] 실패 단계와 재시도 가능 여부에 따라 한도·지연·비용 보호 정책을 적용한다.
- [manual-action] 권한 있는 운영자의 재실행·취소를 멱등하게 처리하고 감사 기록을 남긴다.
Epic: [observability] 운영 관측
한 오류의 전체 처리 경로를 연결해 관찰한다.
- [correlation] 오류 입력, 수정 작업, IOP 실행, 검증과 병합 요청에 같은 상관관계 체계를 적용한다.
- [metrics-alerts] 대기 시간, 단계별 실패, 재시도, 처리량과 장기 정체 지표 및 경보 기준을 제공한다.
- [recovery-tests] 강제 프로세스 종료, 임대 만료, IOP 단절과 재시도 한도에서 중복 없이 복구되는지 검증한다. 검증: 장애 주입 통합 검사가 통과한다.
완료 리뷰
- 상태: 없음
- 요청일: 없음
- 완료 근거: 없음
- 검토 항목: SDD gate, 장애 주입, 중복 실행 방지와 비용 보호
- agent-ui 상태 반영: 해당 없음
- 리뷰 코멘트: 없음
범위 제외
- 별도 분산 작업 서비스로의 분리
- 자동 코드 병합
- 장기 분석 데이터 웨어하우스
작업 컨텍스트
- 관련 경로:
internal/domain/remediation/,internal/platform/database/,internal/platform/logging/ - 표준선: PostgreSQL을 초기 작업 원장으로 사용하고 실제 확장 문제가 확인되기 전 별도 큐를 도입하지 않는다.
- 선행 작업: IOP 분석 실행 연동
- 후속 작업: 운영 배포 준비
- 확인 필요: USER_REVIEW.md