ariadne/agent-roadmap/phase/service-operations/milestones/workflow-recovery-observability.md
2026-07-24 05:45:04 +09:00

3.9 KiB

Milestone: 작업 복구와 관측성

위치

목표

장시간 분석·수정 작업이 프로세스 재시작이나 일시 장애 뒤에도 중복 실행 없이 회복되도록 한다. 운영자가 오류 수집부터 IOP 실행, 검증과 병합 요청까지 상관관계와 실패 원인을 추적할 수 있게 한다.

상태

[스케치]

승격 조건

  • 자동 재시도 범위와 비용·횟수 한도를 확정한다.
  • 실패 작업 보존과 운영자 재실행 정책을 확정한다.
  • SDD 사용자 리뷰를 해결하고 gate를 통과한다.
  • 작업 임대, 재개, 지표와 경보 기능 단위를 구현 가능한 수준으로 고정한다.

구현 잠금

  • 상태: 잠금
  • SDD: 필요
  • SDD 문서: SDD.md
  • SDD 사유: 지속 작업 lifecycle, 임대·재시도 멱등성, 비용과 실패 보존 정책 및 운영 지표를 다룬다.
  • 잠금 해제 조건:
    • SDD 잠금이 해제되어 있다.
    • SDD 사용자 리뷰가 승인·해결되어 있다.
    • Acceptance Scenario가 Milestone 기능 Task와 연결되어 있다.
    • Evidence Map이 완료 시 검증 가능한 근거와 연결되어 있다.
  • 결정 필요:
    • [D01] 자동 재시도 한도·비용 보호와 최종 실패 작업의 보존·수동 재실행 정책

범위

  • 지속 작업 조회·임대와 만료 후 안전한 회수
  • 단계별 재시도 가능 여부, 지수 지연과 한도
  • 재시작 뒤 IOP 이벤트 스트림 재개
  • 상관관계 ID 기반 구조화 로그, 지표와 추적
  • 실패 원인 단계·코드별 운영 조회와 경보
  • 운영자 수동 재실행 및 취소 감사 기록

기능

Epic: [recovery] 지속 작업 복구

프로세스 장애와 일시 외부 장애에서 작업을 안전하게 이어 간다.

  • [claim-work] 데이터베이스 기반 작업 임대와 소유권 갱신으로 같은 작업의 동시 실행을 막는다.
  • [resume-work] 재시작 뒤 비종료 작업을 상태와 마지막 IOP 이벤트 순서에서 재개한다.
  • [retry-policy] 실패 단계와 재시도 가능 여부에 따라 한도·지연·비용 보호 정책을 적용한다.
  • [manual-action] 권한 있는 운영자의 재실행·취소를 멱등하게 처리하고 감사 기록을 남긴다.

Epic: [observability] 운영 관측

한 오류의 전체 처리 경로를 연결해 관찰한다.

  • [correlation] 오류 입력, 수정 작업, IOP 실행, 검증과 병합 요청에 같은 상관관계 체계를 적용한다.
  • [metrics-alerts] 대기 시간, 단계별 실패, 재시도, 처리량과 장기 정체 지표 및 경보 기준을 제공한다.
  • [recovery-tests] 강제 프로세스 종료, 임대 만료, IOP 단절과 재시도 한도에서 중복 없이 복구되는지 검증한다. 검증: 장애 주입 통합 검사가 통과한다.

완료 리뷰

  • 상태: 없음
  • 요청일: 없음
  • 완료 근거: 없음
  • 검토 항목: SDD gate, 장애 주입, 중복 실행 방지와 비용 보호
  • agent-ui 상태 반영: 해당 없음
  • 리뷰 코멘트: 없음

범위 제외

  • 별도 분산 작업 서비스로의 분리
  • 자동 코드 병합
  • 장기 분석 데이터 웨어하우스

작업 컨텍스트

  • 관련 경로: internal/domain/remediation/, internal/platform/database/, internal/platform/logging/
  • 표준선: PostgreSQL을 초기 작업 원장으로 사용하고 실제 확장 문제가 확인되기 전 별도 큐를 도입하지 않는다.
  • 선행 작업: IOP 분석 실행 연동
  • 후속 작업: 운영 배포 준비
  • 확인 필요: USER_REVIEW.md