3.6 KiB
3.6 KiB
Milestone: LoRA와 QLoRA 실행
위치
- Roadmap: ROADMAP.md
- Phase: PHASE.md
목표
검증된 training dataset release와 versioned recipe로 LoRA/QLoRA job을 실행하고, 결과 adapter artifact를 평가 뒤 승격할 수 있게 한다. ML framework와 compute 환경은 executor capability 뒤에 둔다.
상태
[스케치]
승격 조건
- 지원할 첫 base model·framework·artifact 포맷의 최소 호환 범위를 정의한다.
- GPU·quantization capability와 scheduler 책임 경계를 정의한다.
- 학습 비용·시간 한도와 cancel·checkpoint 정책을 정의한다.
- adaptation 결과 evaluation과 promotion 기준을 정의한다.
- executor·artifact·비용과 promotion lifecycle을 다루는 SDD 필요성을 확정하고 초안을 작성했다.
구현 잠금
- 상태: 잠금
- SDD: 필요
- SDD 문서: SDD.md
- SDD 사유: capability preflight, 장시간 training 상태, checkpoint·cancel, artifact와 promotion 계약을 정의한다.
- 잠금 해제 조건:
- SDD 잠금이 해제되어 있다.
- SDD 사용자 리뷰가 승인/해결되었다.
- Acceptance Scenario가 Milestone 기능 Task와 연결되어 있다.
- Evidence Map이 완료 시 Roadmap Completion과 최종 검증 evidence로 검증 가능하게 연결되어 있다.
- 모든 승격 조건이 해소되고 Milestone 상태가
[계획]이다.
- 결정 필요:
- 첫 지원 base model family와 배포 대상의 우선순위
범위
- Python executor adaptation capability와 preflight
- LoRA·QLoRA versioned recipe와 deterministic seed
- checkpoint, progress, cancel와 retry-safe artifact
- adapter artifact manifest와 base model compatibility
- baseline evaluation, candidate promotion과 rollback
기능
Epic: [training] Adaptation 실행
compute와 framework 차이를 capability-aware executor 뒤에 둔다.
- [preflight-capability] base model, precision, quantization, memory와 library capability를 job 수락 전에 검증한다.
- [training-job] versioned dataset·recipe로 LoRA 또는 QLoRA를 실행하고 progress와 usage를 보고한다.
- [checkpoint-cancel] checkpoint, graceful cancel과 terminal failure artifact를 명시적으로 처리한다.
Epic: [model-release] Adapter Artifact 승격
학습 완료가 곧 production 사용을 의미하지 않게 평가와 release를 분리한다.
- [adapter-manifest] base model identity, dataset, recipe, library version과 content hash를 manifest에 남긴다.
- [adaptation-evaluation] baseline과 candidate adapter를 같은 evaluation suite로 비교한다.
- [adapter-promotion] 통과한 adapter만 명시적으로 승격하고 이전 adapter로 rollback할 수 있게 한다.
완료 리뷰
- 상태: 없음
- 요청일: 없음
- 완료 근거: 스케치 단계이며
[계획]승격 뒤 기록한다. - 검토 항목: 승격 조건과 후속 SDD gate
- agent-ui 상태 반영: 해당 없음
- 리뷰 코멘트: 없음
범위 제외
- base model full fine-tuning
- 실시간 online learning
- GPU scheduler와 model registry 제품 자체 구현
작업 컨텍스트
- 관련 경로:
packages/python/,api/proto/,packages/go/workflow/,packages/go/controlplane/ - 표준선(선택): optional adaptation, capability preflight, evaluation-before-promotion
- 선행 작업: 훈련 Dataset 정제, 내구성 있는 Workflow Runtime
- 후속 작업: 없음
- 확인 필요:
구현 잠금 > 결정 필요