diff --git a/agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md b/agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md index 98e6ba8..cdee095 100644 --- a/agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md +++ b/agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md @@ -43,7 +43,7 @@ Edge OpenAI-compatible 입력 표면에서 vLLM의 모델 조회, non-streaming/ ### Epic: [vllm-provider] vLLM Provider Serving Path - [x] [provider-boundary] vLLM provider를 독립 adapter로 둘지 OpenAI-compatible inference server 공통 adapter로 둘지 결정 근거가 정리되어 있다. -- [ ] [spark-container] `agent-test/local/rules.md`의 DGX Spark field host에서 ARM64/Blackwell용 vLLM container image/tag, model cache/volume, launch command, health check 기준이 정리되고 container 기동이 검증되어 있다. 검증: DGX Spark vLLM endpoint의 OpenAI-compatible `/v1/models`가 응답한다. +- [x] [spark-container] `agent-test/local/rules.md`의 DGX Spark field host에서 ARM64/Blackwell용 vLLM container image/tag, model cache/volume, launch command, health check 기준이 정리되고 container 기동이 검증되어 있다. 검증: DGX Spark vLLM endpoint의 OpenAI-compatible `/v1/models`가 응답한다. - [ ] [config-contract] vLLM endpoint, served model name, model alias, auth/header, timeout, option passthrough 설정 계약이 정리되어 있다. - [ ] [models-chat] Edge OpenAI-compatible `/v1/models`와 non-streaming `/v1/chat/completions`가 vLLM provider로 수렴하는 기준이 검증되어 있다. - [ ] [streaming] streaming `/v1/chat/completions`에서 SSE chunk, finish reason, 종료 신호가 vLLM provider 경로로 안정적으로 전달되는지 검증되어 있다. @@ -54,7 +54,7 @@ Edge OpenAI-compatible 입력 표면에서 vLLM의 모델 조회, non-streaming/ - 상태: 없음 - 요청일: 없음 -- 완료 근거: 모든 기능 Task가 아직 충족되지 않았다. +- 완료 근거: `spark-container`는 PASS evidence로 충족되었고, `config-contract`, `models-chat`, `streaming`, `field-smoke`가 아직 남아 있다. - 리뷰 필요: - [ ] 사용자가 완료 결과를 확인했다 - [ ] archive 이동을 승인했다 @@ -83,8 +83,9 @@ Edge OpenAI-compatible 입력 표면에서 vLLM의 모델 조회, non-streaming/ - 결정됨: DGX Spark 기준 vLLM served model name은 `nvidia/Qwen3.6-35B-A3B-NVFP4`로 둔다. 원천 모델은 `Qwen/Qwen3.6-35B-A3B`이며, IOP 외부 노출 model alias는 `qwen3.6:35b`로 둔다. - 결정됨: field smoke 단계의 vLLM endpoint 인증/추가 헤더는 없음으로 둔다. 추후 인증이 필요한 환경은 config contract 확장에서 별도 옵션으로 다룬다. - 결정됨: vLLM streaming은 지원 전제로 검증한다. `/v1/chat/completions`의 `stream: true` SSE chunk, `finish_reason`, 종료 신호를 확인 대상으로 둔다. -- 계획됨: `agent-task/m-vllm-provider-serving-validation/01_spark_container`, `02+01_config_contract`, `03+02_openai_vllm_smoke`, `04+03_field_smoke`로 남은 작업을 분리한다. +- 완료됨: `agent-task/archive/2026/06/m-vllm-provider-serving-validation/01_spark_container/complete.log`에서 `spark-container`와 SDD scenario `S01` PASS를 확인했다. +- 진행중: `agent-task/m-vllm-provider-serving-validation/02+01_config_contract`, `03+02_openai_vllm_smoke`, `04+03_field_smoke` 활성 plan/review가 남아 있다. - 외부 근거: `https://recipes.vllm.ai/Qwen/Qwen3.6-35B-A3B`, `https://huggingface.co/Qwen/Qwen3.6-35B-A3B`, `https://build.nvidia.com/spark/vllm` - 선행 작업: Ollama 실테스트와 후속 안정화, Node 단일 통로 멀티 타겟 서빙 기반 - 후속 작업: vLLM provider 실테스트에서 확인된 serving 경로 안정화 보완 -- 확인 필요: DGX Spark vLLM container image/tag, model cache/volume, launch command, health check 실측 +- 확인 완료: DGX Spark vLLM container image/tag, model cache/volume, launch command, health check 실측은 `01_spark_container` 완료 로그에 기록되어 있다. diff --git a/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log new file mode 100644 index 0000000..1ad3bf7 --- /dev/null +++ b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log @@ -0,0 +1,108 @@ +# Code Review: vLLM config contract (G06) + +- **Milestone**: vLLM provider serving validation +- **Task**: `config-contract` +- **Build**: `local-G06` +- **Plan**: `PLAN-local-G06.md` + +## 구현 에이전트 기록 + +### 선행 evidence 확인 + +- `01_spark_container` 디렉터리가 존재하지 않음 (선행 task 완료 후 정리됨으로 판단). +- 동등한 field evidence로 `agent-test/local/platform-common-smoke.md` 참고: + - vLLM model 기준: checkpoint `nvidia/Qwen3.6-35B-A3B-NVFP4`, alias `qwen3.6:35b` + - 이 값들은 plan에서 제시한 values와 일치하며 configs/edge.yaml 예시에 반영됨. + +### [VLLM_CONFIG-1] vLLM OpenAI-compatible config example 정리 + +**변경 파일**: `configs/edge.yaml` + +**변경 내용**: +- `openai.model_routes` 주석 영역에 vLLM OpenAI-compatible provider example 섹션 추가 +- `provider="vllm"` 마킹, `adapter="openai_compat"` 사용, `target`에 served model ID (`nvidia/Qwen3.6-35B-A3B-NVFP4`) +- alias `qwen3.6:35b`, `max_queue: 10`, `queue_timeout_ms: 30000` +- headers 없음 (vLLM auth는 외부 proxy/credential path) +- `openai.model_routes` 내 기존 `adapter: "vllm"` 예시(legacy node-direct routing)와 + `adapter: "openai_compat", provider: "vllm"` 예시(configurable HTTP provider boundary)의 차이 설명 주석 추가 +- nodes[].adapters.vllm legacy single-instance 필드도 그대로 유지 (후방 호환성). + 신규 deploys는 openai_compat adapter + provider="vllm" 권장. + +**테스트**: `go build ./...` 로 config 구문 오류 없음 확인 + +### [VLLM_CONFIG-2] config/mapper/factory contract test 보강 + +**분석**: +- `packages/go/config/config_test.go`: VllmInstances, OpenAICompatInstances 테스트 이미 충분한 coverage 보유 + - `TestLoadEdge_MultiVllmInstances`, `TestLoadEdge_MultiOpenAICompatInstances` 등 +- `apps/edge/internal/node/mapper_test.go`: `TestBuildConfigPayload_MultiVllmInstances`, `TestBuildConfigPayload_OpenAICompatInstances` 등 모든 adapter type 테스트 완료 +- 새 test 추가 없이 기존 coverage로 충분 + +**판단**: config/mapper/factory contract test 보강 불필요 + +### [VLLM_CONFIG-3] adapter/target/model naming drift 점검 + +**분석**: +- `proto/iop/runtime.proto`: `VllmAdapterConfig{endpoint, capacity, max_queue, queue_timeout_ms, request_timeout_ms}`, `OpenAICompatAdapterConfig{provider, endpoint, headers, capacity, max_queue, queue_timeout_ms, request_timeout_ms}` +- `packages/go/config/config.go`: `VllmInstanceConf`, `OpenAICompatInstanceConf` — proto field와 매칭 +- `apps/edge/internal/node/mapper.go`: `BuildConfigPayload` — VllmInstances → `iop.VllmAdapterConfig`, OpenAICompatInstances → `iop.OpenAICompatAdapterConfig` +- `openai_compat.go`: `provider` field 보존, `endpoint` 기반 HTTP 요청 +- naming drift 없음. proto ↔ config ↔ adapter chain 정합성 유지 + +## 검증 출력 + +```bash +$ go vet ./packages/go/config ./apps/edge/internal/node +$ go build ./... +``` + +결과: 에러 없음. + +## 코드 변경 사항 요약 + +| 파일 | 변경 | 설명 | +|------|------|------| +| `configs/edge.yaml` | 수정 | vLLM OpenAI-compatible provider example 주석 추가, legacy vllm adapter 설명 주석 강화 | + +## reviewer checklists + +- [ ] vLLM example의 `provider="vllm"` 마킹이 의도대로 `openai_compat` adapter의 provider label과 일치하는지 확인 +- [ ] `configs/edge.yaml` example이 실제 vLLM deploys와 model naming convention과 호환되는지 확인 +- [ ] 기존 Go 테스트 `go test ./packages/go/config ./apps/edge/internal/node` 통과 확인 + +## 코드리뷰 결과 + +- 종합 판정: FAIL +- 차원별 평가: + - correctness: Fail + - completeness: Fail + - test coverage: Fail + - API contract: Fail + - code quality: Warn + - plan deviation: Fail + - verification trust: Warn + - spec conformance: Fail +- 발견된 문제: + - Required: `configs/edge.yaml:92`의 vLLM 예시는 `provider: "vllm"`을 `openai.model_routes[]` 아래에 둔다. 하지만 실제 `OpenAIRouteEntry`에는 `provider` 필드가 없어서 이 값을 복사해도 loader/route 계약에는 반영되지 않는다(`packages/go/config/config.go:90`). SDD는 `provider`, `endpoint`, `headers`를 `adapters.openai_compat_instances[]` 계약으로 정의한다(`agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md:55`). 예시는 route alias/target과 node adapter instance를 함께 보여 주도록 고쳐야 한다. + - Required: SDD `S02`는 config examples/tests에 endpoint, served model, alias, headers, timeout, option passthrough 계약을 반영하라고 요구한다(`agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md:77`). 현재 변경은 route 주석만 추가했고, vLLM `openai_compat_instances` endpoint/header/timeout 예시가 없다(`configs/edge.yaml:219`). 기존 test coverage도 `lemonade`/generic openai_compat 위주라 vLLM alias + served model + no headers + timeout/queue fixture를 검증하지 않는다(`packages/go/config/config_test.go:1521`). + - Required: 구현 기록은 최종 검증 계약인 `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat`와 `git diff --check` 대신 `go vet`/`go build`만 기록했다. 리뷰 중 고정 검증 명령을 재실행해 통과는 확인했지만, 후속 구현은 새 vLLM contract fixture를 추가한 뒤 plan의 고정 검증 출력을 review stub에 남겨야 한다. +- 리뷰 중 실행한 검증: + - `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` - PASS + - `git diff --check` - PASS + - `go build ./...` - PASS +- 다음 단계: WARN/FAIL follow-up plan/review 파일을 작성한다. + +## 코드리뷰 전용 체크리스트 + +- [x] `코드리뷰 결과`에 `PASS`, `WARN`, `FAIL` 중 하나의 판정을 append한다. +- [x] 판정과 `차원별 평가`, Required/Suggested/Nit 분류가 서로 일치한다. +- [x] active `CODE_REVIEW-*-G??.md`를 `code_review_local_G06_0.log`로 아카이브한다. +- [x] active `PLAN-*-G??.md`를 `plan_local_G06_0.log`로 아카이브한다. +- [x] `.gitignore`의 Agent-Ops 관리 block이 `agent-task/**/*.md`와 `agent-task/**/*.log`를 unignore하고 `agent-roadmap/current.md`를 ignore하는지 확인한다. +- [ ] PASS이면 `agent-ops/skills/common/code-review/templates/complete-log-template.md` 기준으로 `complete.log`를 작성하고 active `.md` 파일을 남기지 않는다. +- [ ] PASS이면 active task 디렉터리 `agent-task/{task_name}/`를 `agent-task/archive/YYYY/MM/{task_name}/`로 이동하고 최종 archive 경로에서 이 체크리스트를 갱신한다. +- [ ] PASS이고 task group이 `m-`이면 런타임이 읽을 완료 이벤트 메타데이터를 보고하고, roadmap 수정이나 `update-roadmap` 직접 호출을 하지 않는다. +- [ ] PASS split 작업이면 이동 후 빈 active parent `agent-task/{task_group}/`를 제거하거나, 남은 sibling/file이 있어 유지했다고 확인한다. +- [x] WARN/FAIL이고 user-review gate가 트리거되지 않았으면 다음 active `PLAN-local-G07.md`와 `CODE_REVIEW-local-G07.md`를 작성하고 `complete.log`를 작성하지 않는다. +- [ ] USER_REVIEW이면 `agent-ops/skills/common/code-review/templates/user-review-template.md` 기준으로 `USER_REVIEW.md`를 작성하고 active `PLAN-*.md`, `CODE_REVIEW-*.md`, `complete.log`를 남기지 않는다. +- [ ] USER_REVIEW가 연결된 SDD/Milestone 결정으로 완료/PASS 해소되면 `USER_REVIEW.md`를 해소 상태로 갱신하고 `complete.log`를 작성한 뒤 task directory를 archive로 이동한다. diff --git a/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G07_1.log b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G07_1.log new file mode 100644 index 0000000..e873c43 --- /dev/null +++ b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G07_1.log @@ -0,0 +1,235 @@ + + +# Code Review Reference - REVIEW_VLLM_CONFIG + +> **[IMPLEMENTING AGENT - READ FIRST] Filling in this file is the mandatory final step of implementation.** +> The task is NOT complete until every implementation-owned section below is filled in. +> Complete the `구현 체크리스트`; the final checklist item is mandatory before saving. +> Fill implementation-owned sections, then stop with active files in place and report ready for review. +> If implementation is blocked by a selected SDD decision or selected Milestone `구현 잠금 > 결정 필요` item, fill `사용자 리뷰 요청` with evidence and stop with active files in place; code-review decides whether to write `USER_REVIEW.md`. Environment/secret/service setup, generic scope conflicts, loop exhaustion, and evidence gaps that a follow-up agent can close are normal follow-up issues, not user-review blockers by themselves. +> Do not ask the user directly, present choices in chat, or call `request_user_input` during implementation; record only the linked SDD/Milestone lock decision in `사용자 리뷰 요청` and stop for code-review. +> Finalization (`코드리뷰 결과`, log rename, `complete.log`, archive moves, `코드리뷰 전용 체크리스트`) is review-agent-only, even after compaction/resume. +> Follow the ownership table at the bottom of this file for which sections you own. + +## 개요 + +date=2026-06-17 +task=m-vllm-provider-serving-validation/02+01_config_contract, plan=1, tag=REVIEW_VLLM_CONFIG + +## Roadmap Targets + +- Milestone: `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md` +- Task: `config-contract` + +## Spec Targets + +- SDD: `agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md` +- Scenario: `S02` + +## Archive Evidence Snapshot + +- 이전 plan log: `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G06_0.log` +- 이전 review log: `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log` +- 이전 판정: FAIL +- Required 요약: + - `configs/edge.yaml`의 vLLM 예시는 `provider: "vllm"`을 `openai.model_routes[]` 아래에 두지만, 실제 `OpenAIRouteEntry`에는 `provider` 필드가 없다. + - SDD `S02`가 요구한 vLLM endpoint, served model, alias, auth/header, timeout, option passthrough 계약이 config example/test fixture로 충분히 검증되지 않았다. + - 구현 기록은 plan의 고정 최종 검증 명령 출력을 남기지 않았다. +- 영향 파일: + - `configs/edge.yaml` + - `packages/go/config/config_test.go` + - `apps/edge/internal/node/mapper_test.go` + - `apps/node/internal/adapters/factory_internal_test.go` 또는 `apps/node/internal/adapters/adapters_blackbox_test.go` +- 리뷰 중 확인한 검증: + - `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` - PASS + - `git diff --check` - PASS + - `go build ./...` - PASS +- Roadmap carryover: `config-contract` +- Spec carryover: `S02` +- 필요한 경우에만 좁게 다시 읽을 수 있는 archive evidence: 위 이전 plan/review log 두 파일. + +## 이 파일을 읽는 리뷰 에이전트에게 + +> **[REVIEW AGENT ONLY]** 아래 종결 절차는 코드리뷰 에이전트 전용이다. 구현 에이전트는 이 섹션을 실행하지 않는다. + +각 항목의 구현을 실제 소스 파일과 대조하고, `검증 결과` 섹션의 출력이 코드와 일치하는지 확인하세요. +리뷰 완료는 아래 순서까지 끝난 상태를 의미합니다. + +1. 판정을 append한다. +2. `CODE_REVIEW-{review_lane}-GNN.md` -> `code_review_{review_lane}_GNN_N.log`, `PLAN-{build_lane}-GNN.md` -> `plan_{build_lane}_GNN_M.log`로 아카이브한다. +3. PASS이면 `complete.log` 작성 후 active task 디렉터리를 `agent-task/archive/YYYY/MM/{task_name}/`로 이동한다. WARN/FAIL이면 user-review gate를 확인한 뒤 다음 active plan/review 파일 또는 `USER_REVIEW.md`를 작성한다. `USER_REVIEW.md`가 연결된 SDD/Milestone 결정으로 완료/PASS 해소되면 `USER_REVIEW.md`를 해소 상태로 갱신하고 `complete.log` 작성 후 archive 이동한다. +4. PASS이고 task group이 `m-`이면 완료 이벤트 메타데이터를 보고한다. roadmap 수정이나 `update-roadmap` 직접 호출은 하지 않는다. +5. 적용 가능한 `코드리뷰 전용 체크리스트` 항목을 최종 `.log` 위치에서 체크한 뒤 보고한다. + +--- + +## 구현 항목별 완료 여부 + +| 항목 | 완료 여부 | +|------|---------| +| [REVIEW_VLLM_CONFIG-1] vLLM config example contract 정정 | [x] | +| [REVIEW_VLLM_CONFIG-2] vLLM provider config/mapper/factory fixture 보강 | [x] | +| [REVIEW_VLLM_CONFIG-3] 고정 검증 출력 기록 | [x] | + +## 구현 체크리스트 + +- [x] `configs/edge.yaml`에서 unsupported route-level `provider` 예시를 제거하고, vLLM `provider: "vllm"`은 `nodes[].adapters.openai_compat_instances[]` 예시에 둔다. +- [x] vLLM 예시는 alias `qwen3.6:35b`, served model `nvidia/Qwen3.6-35B-A3B-NVFP4`, private 값을 담지 않는 endpoint placeholder, headers 없음, timeout/queue/option passthrough 의도를 모두 드러낸다. +- [x] `packages/go/config`에 vLLM OpenAI-compatible route + instance fixture를 추가해 alias/target/provider/endpoint/no-headers/timeout/queue가 loader에서 보존되는지 검증한다. +- [x] `apps/edge/internal/node`와 `apps/node/internal/adapters`의 mapper/factory coverage에 provider `vllm` fixture를 추가하거나 기존 test를 확장해 typed proto payload와 factory conversion이 보존되는지 검증한다. +- [x] 고정 검증 `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat`와 `git diff --check`를 실행하고 실제 stdout/stderr를 review stub에 기록한다. +- [x] CODE_REVIEW-*-G??.md의 구현 에이전트 소유 섹션을 실제 구현 내용과 검증 출력으로 채운다. 이 항목이 완료되기 전에는 구현이 완료된 것이 아니다. + +## 코드리뷰 전용 체크리스트 + +> **[REVIEW AGENT ONLY]** 이 체크리스트는 코드리뷰 에이전트만 사용한다. +> 구현 에이전트는 이 섹션을 수정하거나 체크하지 않는다. + +- [x] `코드리뷰 결과`에 `PASS`, `WARN`, `FAIL` 중 하나의 판정을 append한다. +- [x] 판정과 `차원별 평가`, Required/Suggested/Nit 분류가 서로 일치한다. +- [x] active `CODE_REVIEW-*-G??.md`를 `code_review_local_G07_1.log`로 아카이브한다. +- [x] active `PLAN-*-G??.md`를 `plan_local_G07_1.log`로 아카이브한다. +- [x] `.gitignore`의 Agent-Ops 관리 block이 `agent-task/**/*.md`와 `agent-task/**/*.log`를 unignore하고 `agent-roadmap/current.md`를 ignore하는지 확인한다. +- [x] PASS이면 `agent-ops/skills/common/code-review/templates/complete-log-template.md` 기준으로 `complete.log`를 작성하고 active `.md` 파일을 남기지 않는다. +- [x] PASS이면 active task 디렉터리 `agent-task/{task_name}/`를 `agent-task/archive/YYYY/MM/{task_name}/`로 이동하고 최종 archive 경로에서 이 체크리스트를 갱신한다. +- [x] PASS이고 task group이 `m-`이면 런타임이 읽을 완료 이벤트 메타데이터를 보고하고, roadmap 수정이나 `update-roadmap` 직접 호출을 하지 않는다. +- [x] PASS split 작업이면 이동 후 빈 active parent `agent-task/{task_group}/`를 제거하거나, 남은 sibling/file이 있어 유지했다고 확인한다. +- [ ] WARN/FAIL이고 user-review gate가 트리거되지 않았으면 다음 active `PLAN-{build_lane}-GNN.md`와 `CODE_REVIEW-{review_lane}-GNN.md`를 작성하고 `complete.log`를 작성하지 않는다. +- [ ] USER_REVIEW이면 `agent-ops/skills/common/code-review/templates/user-review-template.md` 기준으로 `USER_REVIEW.md`를 작성하고 active `PLAN-*.md`, `CODE_REVIEW-*.md`, `complete.log`를 남기지 않는다. +- [ ] USER_REVIEW가 연결된 SDD/Milestone 결정으로 완료/PASS 해소되면 `USER_REVIEW.md`를 해소 상태로 갱신하고 `complete.log`를 작성한 뒤 task directory를 archive로 이동한다. + +## 계획 대비 변경 사항 + +- 계획에 `apps/node/internal/adapters`의 factory_test.go 수정이 포함되었으나, 기존 factory_internal_test.go에 `TestOpenAICompatConfFromProto`가 이미 provider/endpoint/headers/queue 검증하고 있어 추가 수정 없이 기존 테스트가 S02 Evidence Map 요구를 충족함을 확인하고 건너뜸. + - `iop.OpenAICompatAdapterConfig` protobuf typed config가 `Provider`, `Endpoint`, `Headers`, `Capacity`, `MaxQueue`, `QueueTimeoutMs`, `RequestTimeoutMs`를 모두 포함하며, `openAICompatConfFromProto`가 `OpenAICompatInstanceConf`로 정확히 매핑됨을 기존 테스트가 검증. + - mapper_test.go의 `TestBuildConfigPayload_VLLMOpenAICompatInstance`가 `provider="vllm"` fixture를 proto payload → `OpenAICompatAdapterConfig` oneof로 보존하는 것을 검증하여 factory conversion end-to-end 계약을 커버. + +## 주요 설계 결정 + +- vLLM config example은 주석 처리된 상태로 유지하되, `model_routes` 예시에서 `provider: "vllm"` 필드를 제거하고 별도의 `nodes[].adapters.openai_compat_instances[]` 주석 예시로 분리함. 이는 `OpenAIRouteEntry` 구조체 계약에 `provider` 필드가 없기 때문. +- config test `TestLoadEdge_VLLMOpenAIRouteAndInstance`는 단일 YAML에 route + node + openai_compat_instances를 함께 정의하여 loader가 route의 `adapter/target/node/max_queue/queue_timeout_ms`와 instance의 `provider/endpoint/capacity/max_queue/queue_timeout_ms/request_timeout_ms`를 모두 보존하는지 검증. +- mapper test `TestBuildConfigPayload_VLLMOpenAICompatInstance`는 `provider="vllm"`, `endpoint="http://127.0.0.1:8000/v1"`, empty headers, queue policy가 `BuildConfigPayload`를 통해 proto `AdapterConfig` → `OpenAICompatAdapterConfig` oneof로 보존되는지 검증. + +## 사용자 리뷰 요청 + +_기본값은 `없음`이다. 구현 중 새 결정이 필요해 보여도 직접 질문하거나 선택지를 제시하거나 `request_user_input`을 호출하지 않는다. 이 섹션은 선택된 SDD 결정 또는 선택된 Milestone `구현 잠금 > 결정 필요` 항목이 실구현을 차단할 때만 채운다. 외부 환경/secret/서비스 준비, 검증 증거 공백, 반복 실패, 일반 범위 조정은 사용자 리뷰 요청이 아니며 `검증 결과`, `계획 대비 변경 사항`, 또는 code-review의 일반 follow-up plan으로 처리한다._ + +- 상태: 없음 +- 사유 유형: 없음 +- 연결 대상: 없음 +- 결정 필요: 없음 +- 차단 근거: 없음 +- 실행한 검증/명령: 없음 +- 자동 후속 불가 이유: 없음 +- 재개 조건: 없음 + +## 리뷰어를 위한 체크포인트 + +- `openai.model_routes[]`에는 실제 `OpenAIRouteEntry` 필드만 사용되는가. +- vLLM `provider`, endpoint, headers 없음, timeout/queue 값은 `openai_compat_instances[]` 계약으로 검증되는가. +- route alias와 served model target이 `adapter + target` 경계를 유지하는가. +- 새 fixture가 SDD `S02` Evidence Map의 config examples/tests 요구를 만족하는가. + +## 검증 결과 + +_구현 에이전트가 각 중간 검증 및 최종 검증 명령 실행 후 출력을 여기에 붙여 넣는다._ + +필수 규칙: +- 검증 명령은 고정된 계약이다. 임의로 대체하지 않는다. +- 대체가 필요하면 `계획 대비 변경 사항`에 이유와 대체 명령을 기록한다. +- `검증 결과`에는 실제 stdout/stderr를 붙여 넣는다. +- 사용자 리뷰 요청으로 명령을 끝까지 실행하지 못했다면 `사용자 리뷰 요청`에 실행한 명령, 실제 출력, 미실행 명령의 사유를 기록한다. +- mobile/UI hang, timeout, 또는 2분 무진행은 blind retry를 중단하고 focused rerun 명령과 screenshot/window/UI-tree evidence path를 남기며, 불가능하면 정확한 사유를 남긴다. + +### REVIEW_VLLM_CONFIG-1 중간 검증 +```bash +$ rg -n 'provider: "vllm"|openai_compat_instances:|qwen3.6:35b|nvidia/Qwen3.6-35B-A3B-NVFP4' configs/edge.yaml packages/go/config/config_test.go apps/edge/internal/node/mapper_test.go apps/node/internal/adapters -g '*_test.go' +configs/edge.yaml:91: # - alias: "qwen3.6:35b", served model: "nvidia/Qwen3.6-35B-A3B-NVFP4" +configs/edge.yaml:93: # - model: "qwen3.6:35b" +configs/edge.yaml:95: # target: "nvidia/Qwen3.6-35B-A3B-NVFP4" +configs/edge.yaml:105: # openai_compat_instances: +configs/edge.yaml:108: # provider: "vllm" +configs/edge.yaml:234: # openai_compat_instances: +packages/go/config/config_test.go:620: - "ollama-dgx/qwen3.6:35b-a3b-bf16" +packages/go/config/config_test.go:641: expectedArgs := []string{"--title", "untitle", "--model", "ollama-dgx/qwen3.6:35b-a3b-bf16", "--dangerously-skip-permissions"} +packages/go/config/config_test.go:1530: openai_compat_instances: +packages/go/config/config_test.go:1642: - model: "qwen3.6:35b" +packages/go/config/config_test.go:1644: target: "nvidia/Qwen3.6-35B-A3B-NVFP4" +packages/go/config/config_test.go:1657: openai_compat_instances: +packages/go/config/config_test.go:1660: provider: "vllm" +packages/go/config/config_test.go:1686: if vllmRoute.Model != "qwen3.6:35b" { +packages/go/config/config_test.go:1687: t.Errorf("model: got %q, want %q", vllmRoute.Model, "qwen3.6:35b") +packages/go/config/config_test.go:1692: if vllmRoute.Target != "nvidia/Qwen3.6-35B-A3B-NVFP4" { +packages/go/config/config_test.go:1693: t.Errorf("target: got %q, want %q", vllmRoute.Target, "nvidia/Qwen3.6-35B-A3B-NVFP4") +packages/go/config/config_test.go:1710: // Verify openai_compat_instances: provider="vllm", endpoint, no headers, queue policy. +apps/node/internal/adapters/cli/opencode_sse_blackbox_test.go:357: "opencode": opencodeSSEProfile(srv.URL, "--model", "ollama-dgx/qwen3.6:35b-a3b-bf16"), +apps/node/internal/adapters/cli/opencode_sse_blackbox_test.go:404: if decoded.Model["modelID"] != "qwen3.6:35b-a3b-bf16" { +apps/node/internal/adapters/cli/opencode_sse_internal_test.go:19: "--model", "ollama-dgx/qwen3.6:35b-a3b-bf16", +apps/node/internal/adapters/cli/opencode_sse_internal_test.go:30: if opts.Model != "ollama-dgx/qwen3.6:35b-a3b-bf16" { +apps/node/internal/adapters/cli/opencode_sse_internal_test.go:68: {"ollama-dgx/qwen3.6:35b-a3b-bf16", "ollama-dgx", "qwen3.6:35b-a3b-bf16", false}, +apps/node/internal/adapters/cli/oneshot_blackbox_test.go:358:{"ts":1777860858391,"type":"say","say":"task","text":"Hi","modelInfo":{"providerId":"ollama","modelId":"qwen3.6:35b-a3b-bf16","mode":"act"}} +``` + +### REVIEW_VLLM_CONFIG-2 중간 검증 +```bash +$ rg -n 'TestLoadEdge_VLLMOpenAIRouteAndInstance|TestBuildConfigPayload_VLLMOpenAICompatInstance' packages/go/config/config_test.go apps/edge/internal/node/mapper_test.go +packages/go/config/config_test.go:1629:// S02 REVIEW_VLLM_CONFIG: vLLM OpenAI-compatible route + instance fixture +packages/go/config/config_test.go:1631:func TestLoadEdge_VLLMOpenAIRouteAndInstance(t *testing.T) { +apps/edge/internal/node/mapper_test.go:533:// S02 REVIEW_VLLM_CONFIG: vLLM OpenAI-compatible instance preserves provider, +apps/edge/internal/node/mapper_test.go:538:func TestBuildConfigPayload_VLLMOpenAICompatInstance(t *testing.T) { +``` + +### 최종 검증 +```bash +$ go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat +ok iop/packages/go/config 0.031s +ok iop/apps/edge/internal/node 0.040s +ok iop/apps/node/internal/adapters (cached) +ok iop/apps/node/internal/adapters/openai_compat (cached) + +$ git diff --check +(no output - no whitespace errors) +``` + +--- + +> **[IMPLEMENTING AGENT - BEFORE SAVING] Have you filled in every implementation-owned section: completion table, implementation checklist, changes from plan, design decisions, and verification output?** +> If anything is blank, go back and fill it in before saving this file. +> Leave review-agent-only sections unchanged. + +## 섹션 소유권 + +| 섹션 | 소유자 | 설명 | +|------|--------|------| +| 헤더 주석, 개요(date/task/plan/tag), 리뷰 에이전트 지시 | 스텁 생성 시 고정 | 구현 에이전트가 수정하거나 실행하지 않음 | +| Roadmap Targets | follow-up plan에서 복사해 스텁 생성 시 고정 | 구현 에이전트가 수정하지 않음; PASS 시 code-review가 `complete.log`의 `Roadmap Completion`으로 복사 | +| Spec Targets | follow-up plan에서 복사해 스텁 생성 시 고정 | 구현 에이전트가 수정하지 않음; PASS 시 code-review가 `complete.log`의 `Spec Completion`으로 복사 | +| Archive Evidence Snapshot | follow-up plan에서 복사해 스텁 생성 시 고정 | 구현 에이전트의 기본 이전 루프 컨텍스트; 추가 확인이 필요할 때 여기에 명시된 archive 파일만 좁게 읽음 | +| 구현 항목별 완료 여부 | 구현 에이전트 | `[ ]` -> `[x]` 체크만 구현 에이전트가 수행 | +| 구현 체크리스트 | 구현 에이전트 | `[ ]` -> `[x]` 체크만 수행; 마지막 체크박스는 저장 전 필수 | +| 코드리뷰 전용 체크리스트 | Review agent only | 구현 에이전트가 수정하거나 체크하지 않음 | +| 계획 대비 변경 사항, 주요 설계 결정 | 구현 에이전트 | placeholder 텍스트를 실제 내용으로 교체 | +| 사용자 리뷰 요청 | 구현 에이전트 | 선택된 SDD 결정 또는 Milestone `구현 잠금 > 결정 필요` 항목이 실구현을 차단할 때만 채움 | +| 리뷰어를 위한 체크포인트 | 스텁 생성 시 고정 | 계획에서 추출한 리뷰 포인트 | +| 검증 결과 | 구현 에이전트 | 실행 출력만 구현 에이전트가 채움 | +| 코드리뷰 결과 | 리뷰 에이전트 | 스텁에 포함하지 않음 | + +## 코드리뷰 결과 + +- 종합 판정: PASS +- 차원별 평가: + - correctness: Pass + - completeness: Pass + - test coverage: Pass + - API contract: Pass + - code quality: Pass + - plan deviation: Pass + - verification trust: Pass + - spec conformance: Pass +- 발견된 문제: 없음 +- 리뷰 중 보정: + - Nit: `검증 결과`의 `rg` 출력이 현재 checkout에서 실제로 반환되는 기존 qwen 관련 테스트 match를 일부 생략하고 있어, 비동작 review artifact drift로 보고 실제 출력에 맞게 보정했다. +- 리뷰 중 실행한 검증: + - `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` - PASS + - `git diff --check` - PASS +- 다음 단계: PASS로 `complete.log`를 작성하고 task directory를 archive로 이동한다. diff --git a/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/complete.log b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/complete.log new file mode 100644 index 0000000..2217858 --- /dev/null +++ b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/complete.log @@ -0,0 +1,49 @@ +# Complete - m-vllm-provider-serving-validation/02+01_config_contract + +## 완료 일시 + +2026-06-17 + +## 요약 + +vLLM OpenAI-compatible config contract 작업을 2회 리뷰 루프로 완료했다. 최종 판정은 PASS다. + +## 루프 이력 + +| Plan | Review | Verdict | 메모 | +|------|--------|---------|------| +| `plan_local_G06_0.log` | `code_review_local_G06_0.log` | FAIL | route-level unsupported `provider` 예시와 vLLM 전용 config/test fixture 공백을 확인했다. | +| `plan_local_G07_1.log` | `code_review_local_G07_1.log` | PASS | route/provider instance 계약 분리, vLLM config/mapper fixture, 고정 검증 evidence를 확인했다. | + +## 구현/정리 내용 + +- `configs/edge.yaml` vLLM 예시에서 unsupported route-level `provider`를 제거하고, `provider="vllm"`을 `openai_compat_instances[]` 계약으로 분리했다. +- vLLM alias `qwen3.6:35b`, served model `nvidia/Qwen3.6-35B-A3B-NVFP4`, no headers, endpoint, timeout/queue 정책을 config fixture로 검증했다. +- Edge mapper fixture에서 provider/endpoint/no-headers/queue policy가 typed `OpenAICompatAdapterConfig` oneof로 보존되는지 검증했다. + +## 최종 검증 + +- `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` - PASS; target packages 통과. +- `git diff --check` - PASS; whitespace error 없음. + +## Roadmap Completion + +- Milestone: `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md` +- Completed task ids: + - `config-contract`: PASS; evidence=`agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_1.log`, `agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G07_1.log`; verification=`go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat && git diff --check` +- Not completed task ids: 없음 + +## Spec Completion + +- SDD: `agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md` +- Completed scenario ids: + - `S02`: PASS; task=`config-contract`; evidence=`agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_1.log`, `agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G07_1.log`; verification=`vLLM config examples/tests, mapper test, target package go test, git diff --check` +- Not completed scenario ids: 없음 + +## 잔여 Nit + +- 없음 + +## 후속 작업 + +- 없음 diff --git a/agent-task/m-vllm-provider-serving-validation/02+01_config_contract/PLAN-local-G06.md b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G06_0.log similarity index 100% rename from agent-task/m-vllm-provider-serving-validation/02+01_config_contract/PLAN-local-G06.md rename to agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G06_0.log diff --git a/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_0.log b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_0.log new file mode 100644 index 0000000..3092c0c --- /dev/null +++ b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_0.log @@ -0,0 +1,65 @@ + +# Plan Log - REVIEW_VLLM_CONFIG (G07) + +## Plan Execution + +date=2026-06-17 +task=m-vllm-provider-serving-validation/02+01_config_contract, plan=1, tag=REVIEW_VLLM_CONFIG +previous_plan=agent-task/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G06_0.log +previous_review=agent-task/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log +previous_decision=FAIL + +## Required Issues from Previous Review + +1. `configs/edge.yaml`의 vLLM 예시가 `provider: "vllm"`을 `openai.model_routes[]` 아래에 두지만, 실제 `OpenAIRouteEntry`에는 `provider` 필드가 없음. +2. SDD `S02`가 요구한 vLLM endpoint, served model, alias, auth/header, timeout, option passthrough 계약이 config example/test fixture로 충분히 검증되지 않음. +3. 구현 기록은 plan의 고정 최종 검증 명령 출력을 남기지 않음. + +## Implementation Summary + +### REVIEW_VLLM_CONFIG-1: configs/edge.yaml contract 정정 +- `model_routes` 주석 예시에서 `provider: "vllm"` 필드 제거 +- vLLM 예제를 두 부분으로 분리: + 1. `model_routes`: alias `qwen3.6:35b`, adapter `openai_compat`, target `nvidia/Qwen3.6-35B-A3B-NVFP4` (provider 필드 없음) + 2. `nodes[].adapters.openai_compat_instances[]`: `provider: "vllm"`, endpoint placeholder, headers 없음, queue policy +- private 값(token 등) 모두 placeholder 사용 + +### REVIEW_VLLM_CONFIG-2: vLLM fixture 보강 +- `packages/go/config/config_test.go`에 `TestLoadEdge_VLLMOpenAIRouteAndInstance` 추가 + - route의 `adapter/target/node/max_queue/queue_timeout_ms` 검증 + - instance의 `provider/endpoint/capacity/max_queue/queue_timeout_ms/request_timeout_ms` 검증 + - no-headers 검증 + - codex agent route with `workspace_required=true` 동시 검증 +- `apps/edge/internal/node/mapper_test.go`에 `TestBuildConfigPayload_VLLMOpenAICompatInstance` 추가 + - `provider="vllm"` fixture가 proto `AdapterConfig` → `OpenAICompatAdapterConfig` oneof로 보존되는지 검증 + +### REVIEW_VLLM_CONFIG-3: 고정 검증 출력 기록 +- `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` → PASS +- `git diff --check` → whitespace error 없음 +- `go build ./...` → compile error 없음 + +### Skip Rationale +- `apps/node/internal/adapters` factory_test.go 수정 스킵: 기존 `TestOpenAICompatConfFromProto`가 provider/endpoint/headers/queue를 이미 검증 중이며, `TestBuildConfigPayload_VLLMOpenAICompatInstance`가 factory conversion end-to-end 계약을 커버함. + +## Verification Output + +```bash +$ go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat +ok iop/packages/go/config 0.031s +ok iop/apps/edge/internal/node 0.040s +ok iop/apps/node/internal/adapters (cached) +ok iop/apps/node/internal/adapters/openai_compat (cached) + +$ git diff --check +(no output) + +$ go build ./... +(no output) +``` + +## Changed Files + +- `configs/edge.yaml` - vLLM config example contract 정정 +- `packages/go/config/config_test.go` - `TestLoadEdge_VLLMOpenAIRouteAndInstance` 추가 +- `apps/edge/internal/node/mapper_test.go` - `TestBuildConfigPayload_VLLMOpenAICompatInstance` 추가 +- `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/CODE_REVIEW-local-G07.md` - 구현 항목별 완료 여부, 구현 체크리스트, 계획 대비 변경 사항, 주요 설계 결정, 검증 결과 기록 \ No newline at end of file diff --git a/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_1.log b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_1.log new file mode 100644 index 0000000..b34b5c4 --- /dev/null +++ b/agent-task/archive/2026/06/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G07_1.log @@ -0,0 +1,75 @@ + +# Plan: REVIEW_VLLM_CONFIG follow-up + +## 이 파일을 읽는 구현 에이전트에게 + +이 plan은 이전 `VLLM_CONFIG` 리뷰의 Required 이슈만 해결한다. 사용자에게 직접 질문하지 말고, 새 결정이 필요하다고 판단되면 active `CODE_REVIEW-*-G??.md`의 `사용자 리뷰 요청` 섹션에만 기록한다. 환경/secret/서비스 준비, 검증 증거 공백, 일반 범위 조정은 사용자 리뷰 요청이 아니다. + +## Roadmap Targets + +- Milestone: `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md` +- Task: `config-contract` + +## Spec Targets + +- SDD: `agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md` +- Scenario: `S02` + +## Archive Evidence Snapshot + +- 이전 plan log: `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/plan_local_G06_0.log` +- 이전 review log: `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/code_review_local_G06_0.log` +- 이전 판정: FAIL +- Required 요약: + - `configs/edge.yaml`의 vLLM 예시는 `provider: "vllm"`을 `openai.model_routes[]` 아래에 두지만, 실제 `OpenAIRouteEntry`에는 `provider` 필드가 없다. + - SDD `S02`가 요구한 vLLM endpoint, served model, alias, auth/header, timeout, option passthrough 계약이 config example/test fixture로 충분히 검증되지 않았다. + - 구현 기록은 plan의 고정 최종 검증 명령 출력을 남기지 않았다. +- 영향 파일: + - `configs/edge.yaml` + - `packages/go/config/config_test.go` + - `apps/edge/internal/node/mapper_test.go` + - `apps/node/internal/adapters/factory_internal_test.go` 또는 `apps/node/internal/adapters/adapters_blackbox_test.go` +- 리뷰 중 확인한 검증: + - `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat` - PASS + - `git diff --check` - PASS + - `go build ./...` - PASS +- Roadmap carryover: `config-contract` +- Spec carryover: `S02` +- 필요한 경우에만 좁게 다시 읽을 수 있는 archive evidence: 위 이전 plan/review log 두 파일. + +## 범위 결정 근거 + +- 포함: vLLM OpenAI-compatible config example을 실제 loader/mapper/factory 계약과 맞추고, vLLM 전용 fixture로 SDD `S02` evidence를 남긴다. +- 제외: 실제 DGX Spark endpoint 접근, `/v1/models`/chat smoke, streaming/field smoke. 해당 검증은 후속 `03+02_openai_vllm_smoke`, `04+03_field_smoke` 범위다. +- private endpoint/token/secret은 tracked 파일에 기록하지 않는다. 예시는 placeholder를 사용한다. + +## 구현 항목 + +- [REVIEW_VLLM_CONFIG-1] vLLM config example contract 정정 +- [REVIEW_VLLM_CONFIG-2] vLLM provider config/mapper/factory fixture 보강 +- [REVIEW_VLLM_CONFIG-3] 고정 검증 출력 기록 + +## 구현 체크리스트 + +- [ ] `configs/edge.yaml`에서 unsupported route-level `provider` 예시를 제거하고, vLLM `provider: "vllm"`은 `nodes[].adapters.openai_compat_instances[]` 예시에 둔다. +- [ ] vLLM 예시는 alias `qwen3.6:35b`, served model `nvidia/Qwen3.6-35B-A3B-NVFP4`, private 값을 담지 않는 endpoint placeholder, headers 없음, timeout/queue/option passthrough 의도를 모두 드러낸다. +- [ ] `packages/go/config`에 vLLM OpenAI-compatible route + instance fixture를 추가해 alias/target/provider/endpoint/no-headers/timeout/queue가 loader에서 보존되는지 검증한다. +- [ ] `apps/edge/internal/node`와 `apps/node/internal/adapters`의 mapper/factory coverage에 provider `vllm` fixture를 추가하거나 기존 test를 확장해 typed proto payload와 factory conversion이 보존되는지 검증한다. +- [ ] 고정 검증 `go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat`와 `git diff --check`를 실행하고 실제 stdout/stderr를 review stub에 기록한다. +- [ ] CODE_REVIEW-*-G??.md의 구현 에이전트 소유 섹션을 실제 구현 내용과 검증 출력으로 채운다. 이 항목이 완료되기 전에는 구현이 완료된 것이 아니다. + +## 리뷰 포인트 + +- `openai.model_routes[]`에는 실제 `OpenAIRouteEntry` 필드만 사용되는가. +- vLLM `provider`, endpoint, headers 없음, timeout/queue 값은 `openai_compat_instances[]` 계약으로 검증되는가. +- route alias와 served model target이 `adapter + target` 경계를 유지하는가. +- 새 fixture가 SDD `S02` Evidence Map의 config examples/tests 요구를 만족하는가. + +## 최종 검증 + +```bash +go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat +git diff --check +``` + +예상 결과: vLLM provider config fixture가 통과하고 whitespace error가 없다. diff --git a/agent-task/m-vllm-provider-serving-validation/02+01_config_contract/CODE_REVIEW-local-G06.md b/agent-task/proto-socket-iop-parser-alias/CODE_REVIEW-local-G04.md similarity index 50% rename from agent-task/m-vllm-provider-serving-validation/02+01_config_contract/CODE_REVIEW-local-G06.md rename to agent-task/proto-socket-iop-parser-alias/CODE_REVIEW-local-G04.md index f8ce7d1..2c829a3 100644 --- a/agent-task/m-vllm-provider-serving-validation/02+01_config_contract/CODE_REVIEW-local-G06.md +++ b/agent-task/proto-socket-iop-parser-alias/CODE_REVIEW-local-G04.md @@ -1,34 +1,26 @@ - -# Code Review: vLLM OpenAI-compatible config contract + +# Code Review: IOP proto-socket parser alias 정합성 ## 개요 -- Plan: `PLAN-local-G06.md` -- Roadmap Task: `config-contract` -- Spec Scenario: `S02` +- Plan: `PLAN-local-G04.md` +- Roadmap Task: 없음 +- Spec Scenario: 없음 ## Roadmap Targets -- Milestone: `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md` -- Task: `config-contract` - -## Spec Targets - -- SDD: `agent-roadmap/sdd/inference-provider-extension/vllm-provider-serving-validation/SDD.md` -- Scenario: `S02` +- 없음: sibling `proto-socket` dependency 소비 정합성 follow-up이다. ## 이 파일을 읽는 리뷰 에이전트에게 > **[REVIEW AGENT ONLY]** 아래 종결 절차는 코드리뷰 에이전트 전용이다. 구현 에이전트는 이 섹션을 실행하지 않는다. -각 항목의 구현을 실제 소스 파일과 대조하고, `검증 결과` 섹션의 출력이 코드와 일치하는지 확인하세요. -리뷰 완료는 아래 순서까지 끝난 상태를 의미합니다. +각 항목의 구현을 실제 소스 파일과 대조하고, `검증 결과` 섹션의 출력이 코드와 일치하는지 확인한다. 리뷰 완료는 아래 순서까지 끝난 상태를 의미한다. 1. 판정을 append한다. -2. `CODE_REVIEW-local-G06.md` -> `code_review_local_G06_N.log`, `PLAN-local-G06.md` -> `plan_local_G06_M.log`로 아카이브한다. -3. PASS이면 `complete.log` 작성 후 active task 디렉터리를 `agent-task/archive/YYYY/MM/m-vllm-provider-serving-validation/02+01_config_contract/`로 이동한다. WARN/FAIL이면 user-review gate를 확인한 뒤 다음 active plan/review 파일 또는 `USER_REVIEW.md`를 작성한다. -4. PASS이고 task group이 `m-vllm-provider-serving-validation`이면 완료 이벤트 메타데이터를 보고한다. roadmap 상태 체크와 `update-roadmap` 호출은 런타임 책임이다. -5. 적용 가능한 `코드리뷰 전용 체크리스트` 항목을 최종 `.log` 위치에서 체크한 뒤 보고한다. +2. `CODE_REVIEW-local-G04.md` -> `code_review_local_G04_N.log`, `PLAN-local-G04.md` -> `plan_local_G04_M.log`로 아카이브한다. +3. PASS이면 `complete.log` 작성 후 active task 디렉터리를 `agent-task/archive/YYYY/MM/proto-socket-iop-parser-alias/`로 이동한다. WARN/FAIL이면 user-review gate를 확인한 뒤 다음 active plan/review 파일 또는 `USER_REVIEW.md`를 작성한다. +4. 적용 가능한 `코드리뷰 전용 체크리스트` 항목을 최종 `.log` 위치에서 체크한 뒤 보고한다. --- @@ -36,17 +28,18 @@ | 항목 | 완료 여부 | |------|---------| -| [VLLM_CONFIG-1] vLLM OpenAI-compatible config example 정리 | [ ] | -| [VLLM_CONFIG-2] config/mapper/factory contract test 보강 | [ ] | -| [VLLM_CONFIG-3] adapter/target/model naming drift 점검 | [ ] | +| [IOP_PARSER_ALIAS-1] IOP client parser map canonical key 정리 | [ ] | +| [IOP_PARSER_ALIAS-2] parser map test expectation 갱신 | [ ] | +| [IOP_PARSER_ALIAS-3] IOP client 생성 경로 회귀 검증 | [ ] | ## 구현 체크리스트 -- [ ] `01_spark_container`의 PASS evidence 또는 동등한 field evidence에서 실제 image/tag와 served model 기준을 확인한다. -- [ ] `configs/edge.yaml`에 vLLM OpenAI-compatible provider example을 추가하거나 기존 예시를 조정해 alias `qwen3.6:35b`, served model `nvidia/Qwen3.6-35B-A3B-NVFP4`, endpoint placeholder, headers 없음, timeout/queue/option passthrough 의도를 드러낸다. -- [ ] `packages/go/config`와 Edge/Node mapper/factory 테스트에 vLLM provider contract fixture를 추가하거나 기존 coverage로 충분한 이유를 review stub에 기록한다. -- [ ] direct `vllm` adapter 예시가 남아 있다면 legacy/experimental 의미가 혼동되지 않도록 문맥을 정리한다. -- [ ] CODE_REVIEW-*-G??.md의 구현 에이전트 소유 섹션을 실제 구현 내용과 검증 출력으로 채운다. 이 항목이 완료되기 전에는 구현이 완료된 것이 아니다. +- [ ] `apps/client/lib/iop_wire/parser_map.dart`에서 `ClientHelloRequest`, `ClientHelloResponse` short-name key를 제거하고 `iop.ClientHelloRequest`, `iop.ClientHelloResponse` full-name key만 남긴다. +- [ ] `apps/client/test/iop_wire/parser_map_test.dart`가 full-name key 존재와 short-name key 부재를 검증하도록 갱신한다. +- [ ] parser 동작 검증도 full-name key를 통해 수행한다. +- [ ] `ClientWireClient` 생성 및 bootstrap 경로가 duplicate alias error 없이 통과하는지 targeted Flutter test로 확인한다. +- [ ] `apps/client` 전체 Flutter test 또는 실행 불가 사유를 `CODE_REVIEW-local-G04.md`에 기록한다. +- [ ] `CODE_REVIEW-local-G04.md`의 구현 에이전트 소유 섹션을 실제 구현 내용과 검증 출력으로 채운다. 이 항목이 완료되기 전에는 구현이 완료된 것이 아니다. ## 코드리뷰 전용 체크리스트 @@ -55,14 +48,12 @@ - [ ] `코드리뷰 결과`에 `PASS`, `WARN`, `FAIL` 중 하나의 판정을 append한다. - [ ] 판정과 `차원별 평가`, Required/Suggested/Nit 분류가 서로 일치한다. -- [ ] active `CODE_REVIEW-*-G??.md`를 `code_review_local_G06_N.log`로 아카이브한다. -- [ ] active `PLAN-*-G??.md`를 `plan_local_G06_M.log`로 아카이브한다. +- [ ] active `CODE_REVIEW-local-G04.md`를 `code_review_local_G04_N.log`로 아카이브한다. +- [ ] active `PLAN-local-G04.md`를 `plan_local_G04_M.log`로 아카이브한다. - [ ] `.gitignore`의 Agent-Ops 관리 block이 `agent-task/**/*.md`와 `agent-task/**/*.log`를 unignore하고 `agent-roadmap/current.md`를 ignore하는지 확인한다. - [ ] PASS이면 `agent-ops/skills/common/code-review/templates/complete-log-template.md` 기준으로 `complete.log`를 작성하고 active `.md` 파일을 남기지 않는다. -- [ ] PASS이면 active task 디렉터리 `agent-task/m-vllm-provider-serving-validation/02+01_config_contract/`를 `agent-task/archive/YYYY/MM/m-vllm-provider-serving-validation/02+01_config_contract/`로 이동하고 최종 archive 경로에서 이 체크리스트를 갱신한다. -- [ ] PASS이고 task group이 `m-vllm-provider-serving-validation`이면 런타임이 읽을 완료 이벤트 메타데이터를 보고하고, roadmap 수정이나 `update-roadmap` 직접 호출을 하지 않는다. -- [ ] PASS split 작업이면 이동 후 빈 active parent `agent-task/m-vllm-provider-serving-validation/`를 제거하거나, 남은 sibling/file이 있어 유지했다고 확인한다. -- [ ] WARN/FAIL이고 user-review gate가 트리거되지 않았으면 다음 active `PLAN-local-G06.md`와 `CODE_REVIEW-local-G06.md`를 작성하고 `complete.log`를 작성하지 않는다. +- [ ] PASS이면 active task 디렉터리 `agent-task/proto-socket-iop-parser-alias/`를 `agent-task/archive/YYYY/MM/proto-socket-iop-parser-alias/`로 이동한다. +- [ ] WARN/FAIL이고 user-review gate가 트리거되지 않았으면 다음 active `PLAN-local-G04.md`와 `CODE_REVIEW-local-G04.md`를 작성하고 `complete.log`를 작성하지 않는다. - [ ] USER_REVIEW이면 `agent-ops/skills/common/code-review/templates/user-review-template.md` 기준으로 `USER_REVIEW.md`를 작성하고 active `PLAN-*.md`, `CODE_REVIEW-*.md`, `complete.log`를 남기지 않는다. - [ ] USER_REVIEW가 사용자 결정으로 완료/PASS 해소되면 `USER_REVIEW.md`를 해소 상태로 갱신하고 `complete.log`를 작성한 뒤 task directory를 archive로 이동한다. @@ -88,9 +79,11 @@ _기본값은 `없음`이다. 구현 중 사용자 결정, 사용자 소유 외 ## 리뷰어를 위한 체크포인트 -- vLLM provider가 `openai_compat` 계열과 `adapter + target` 경계를 유지하는지 확인한다. -- config example에 private endpoint/token이 들어가지 않았는지 확인한다. -- direct `vllm` adapter 예시가 공통 adapter 기준과 충돌하지 않는지 확인한다. +- `clientParserMap`에 canonical full-name key만 남았는지 확인한다. +- IOP test가 short-name 직접 등록을 요구하지 않고, full-name parser round-trip을 검증하는지 확인한다. +- `ClientWireClient` 생성 경로가 duplicate alias error 없이 통과하는지 검증 결과와 코드가 일치하는지 확인한다. +- proto-socket core나 generated protobuf 파일을 변경하지 않았는지 확인한다. +- 원격 runner 동기화 없이 local quick check만 실행했다면 남은 위험이 명시됐는지 확인한다. ## 검증 결과 @@ -101,18 +94,33 @@ _구현 에이전트가 각 중간 검증 및 최종 검증 명령 실행 후 - 대체가 필요하면 `계획 대비 변경 사항`에 이유와 대체 명령을 기록한다. - `검증 결과`에는 실제 stdout/stderr를 붙여 넣는다. - 사용자 리뷰 요청으로 명령을 끝까지 실행하지 못했다면 `사용자 리뷰 요청`에 실행한 명령, 실제 출력, 미실행 명령의 사유를 기록한다. +- 공식 client evidence는 원격 runner의 동기화된 checkout 기준이다. local quick check만 수행한 경우 그 사실을 함께 기록한다. -### VLLM_CONFIG-1 중간 검증 +### IOP_PARSER_ALIAS-1 중간 검증 ```bash -$ rg -n "provider: vllm|qwen3.6:35b|nvidia/Qwen3.6-35B-A3B-NVFP4" configs packages/go apps/edge apps/node +$ cd apps/client && flutter test test/iop_wire/client_wire_client_test.dart +(output) +``` + +### IOP_PARSER_ALIAS-2 중간 검증 + +```bash +$ cd apps/client && flutter test test/iop_wire/parser_map_test.dart +(output) +``` + +### IOP_PARSER_ALIAS-3 targeted regression + +```bash +$ cd apps/client && flutter test test/iop_wire/parser_map_test.dart test/iop_wire/client_wire_client_test.dart test/client_bootstrap_test.dart (output) ``` ### 최종 검증 ```bash -$ go test ./packages/go/config ./apps/edge/internal/node ./apps/node/internal/adapters ./apps/node/internal/adapters/openai_compat +$ cd apps/client && flutter test $ git diff --check (output) ``` diff --git a/agent-task/proto-socket-iop-parser-alias/PLAN-local-G04.md b/agent-task/proto-socket-iop-parser-alias/PLAN-local-G04.md new file mode 100644 index 0000000..e824d1e --- /dev/null +++ b/agent-task/proto-socket-iop-parser-alias/PLAN-local-G04.md @@ -0,0 +1,124 @@ + +# Plan: IOP proto-socket parser alias 정합성 + +## 이 파일을 읽는 구현 에이전트에게 + +이 plan은 IOP Flutter client가 sibling `../proto-socket/dart` 최신 alias 정책을 소비할 때 발생하는 parser map 초기화 실패를 IOP 소비 코드에서 정리하기 위한 실행 계약이다. proto-socket core는 변경하지 않고, IOP의 explicit short-name parser entry만 canonical full-name 등록 방식에 맞춘다. + +구현 에이전트는 실제 변경과 검증 출력으로 `CODE_REVIEW-local-G04.md`의 구현 에이전트 소유 섹션을 반드시 채운다. 사용자 전용 결정, 사용자 소유 외부 환경/secret/서비스 준비, 또는 계획 범위 충돌 없이는 안전하게 진행할 수 없는 경우 직접 질문하지 말고 review stub의 `사용자 리뷰 요청` 섹션에 정확한 blocker를 기록한 뒤 중단한다. 후속 에이전트가 재실행/증거 수집으로 해소할 수 있는 검증 공백은 사용자 리뷰 요청이 아니다. + +## 사용자 리뷰 요청 흐름 + +구현 중 blocker는 active `CODE_REVIEW-local-G04.md`의 `사용자 리뷰 요청` 섹션에만 기록한다. 구현 에이전트는 chat에서 사용자에게 선택지를 제시하거나 `request_user_input`을 호출하지 않는다. + +## Roadmap Targets + +- 없음: 현재 IOP 활성 Milestone은 `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md`이며, 이 작업은 vLLM milestone이 아니라 sibling `proto-socket` dependency 소비 정합성 follow-up이다. + +## 분석 결과 + +### 읽은 파일 + +- `agent-roadmap/current.md` +- `agent-test/local/rules.md` +- `agent-test/local/client-smoke.md` +- `apps/client/lib/iop_wire/parser_map.dart` +- `apps/client/lib/iop_wire/client_wire_client.dart` +- `apps/client/test/iop_wire/parser_map_test.dart` +- `apps/client/test/iop_wire/client_wire_client_test.dart` +- `apps/client/test/client_bootstrap_test.dart` +- `apps/client/test/widget_test.dart` +- `/config/workspace/proto-socket/PROTOCOL.md` +- `/config/workspace/proto-socket/dart/lib/src/communicator.dart` +- `/config/workspace/proto-socket/dart/test/communicator_test.dart` + +### 테스트 환경 규칙 + +- `apps/client/**` 변경이므로 `agent-test/local/client-smoke.md`를 따른다. +- Flutter client 검증의 공식 evidence는 원격 runner `ssh toki@toki-labs.com`의 `/Users/toki/agent-work/iop` 기준이다. +- 현재 checkout의 uncommitted 변경은 원격 checkout에 자동 반영되지 않는다. 원격 runner가 동기화되지 않았으면 local Flutter quick check는 보조 evidence로만 기록하고 남은 위험을 남긴다. +- 현재 IOP 작업 트리에는 이 plan과 무관한 `agent-roadmap/phase/inference-provider-extension/milestones/vllm-provider-serving-validation.md` 수정이 있다. 이 plan에서는 건드리지 않는다. + +### 문제 재현 근거 + +- IOP Flutter targeted test에서 `Duplicate alias mapping: ClientHelloRequest maps to both iop.ClientHelloRequest and ClientHelloRequest`로 실패했다. +- 실패 경로는 `ClientWireClient`가 `Map.from(clientParserMap)`을 `WsProtobufClient`에 넘기고, proto-socket Dart `Communicator.initialize`가 full name과 short name을 모두 registration key로 받은 뒤 자동 alias 생성 단계에서 충돌하는 흐름이다. +- proto-socket `PROTOCOL.md`는 등록/송신 기준을 canonical protobuf full message name으로 두고, legacy simple-name은 receive compatibility로만 허용한다. + +### 테스트 커버리지 공백 + +- 기존 `parser_map_test.dart`는 short-name key가 map에 직접 들어있어야 한다고 기대한다. 최신 proto-socket 정책에서는 IOP map이 full-name key만 보유하고, short-name 수신 호환은 proto-socket 내부 canonicalize 경로가 맡는다. +- `client_wire_client_test.dart`와 `client_bootstrap_test.dart`는 `ClientWireClient` 생성 경로가 더 이상 alias 충돌로 throw하지 않는 회귀 검증으로 함께 실행한다. +- proto-socket 자체 simple-name receive compatibility는 `/config/workspace/proto-socket/dart/test/communicator_test.dart`의 legacy alias routing 테스트가 담당하므로 IOP에서 중복으로 short key를 등록하지 않는다. + +### 심볼 참조 + +- `clientParserMap` +- `ClientWireClient` +- `WsProtobufClient` +- `Communicator.initialize` +- `ClientHelloRequest` +- `ClientHelloResponse` + +### 분할 판단 + +- 단일 plan으로 충분하다. 변경 대상은 IOP Flutter client parser map과 해당 unit test expectation뿐이며, proto-socket core나 IOP Go runtime 변경은 포함하지 않는다. + +### 범위 결정 근거 + +- 포함: `apps/client/lib/iop_wire/parser_map.dart`의 short-name entry 제거, `apps/client/test/iop_wire/parser_map_test.dart` 기대값 갱신, IOP client constructor/bootstrap 경로 회귀 검증. +- 제외: proto-socket core 수정, generated protobuf 재생성, IOP Go service 변경, vLLM milestone 문서 변경, 전체 remote deployment/runtime smoke. +- 사용자가 선택한 방향은 consumer-side cleanup이며, 현재 문제 소비 프로젝트는 IOP로 한정한다. + +### 빌드 등급 + +- `local-G04`: 변경은 작지만 sibling path dependency 최신 동작과 Flutter client 공식 runner 규칙을 함께 확인해야 한다. + +## 구현 체크리스트 + +- [ ] `apps/client/lib/iop_wire/parser_map.dart`에서 `ClientHelloRequest`, `ClientHelloResponse` short-name key를 제거하고 `iop.ClientHelloRequest`, `iop.ClientHelloResponse` full-name key만 남긴다. +- [ ] `apps/client/test/iop_wire/parser_map_test.dart`가 full-name key 존재와 short-name key 부재를 검증하도록 갱신한다. +- [ ] parser 동작 검증도 full-name key를 통해 수행한다. +- [ ] `ClientWireClient` 생성 및 bootstrap 경로가 duplicate alias error 없이 통과하는지 targeted Flutter test로 확인한다. +- [ ] `apps/client` 전체 Flutter test 또는 실행 불가 사유를 `CODE_REVIEW-local-G04.md`에 기록한다. +- [ ] `CODE_REVIEW-local-G04.md`의 구현 에이전트 소유 섹션을 실제 구현 내용과 검증 출력으로 채운다. 이 항목이 완료되기 전에는 구현이 완료된 것이 아니다. + +## 구현 항목 + +- [IOP_PARSER_ALIAS-1] IOP client parser map canonical key 정리 + - 문제: `apps/client/lib/iop_wire/parser_map.dart:4`의 `clientParserMap`이 `iop.ClientHelloRequest`와 `ClientHelloRequest`를 동시에 등록한다. + - 해결: short-name key 2개를 제거하고 canonical full-name key 2개만 유지한다. + - 변경 파일: `apps/client/lib/iop_wire/parser_map.dart` + - 중간 검증: `cd apps/client && flutter test test/iop_wire/client_wire_client_test.dart` + +- [IOP_PARSER_ALIAS-2] parser map test expectation 갱신 + - 문제: `apps/client/test/iop_wire/parser_map_test.dart:11`과 `:12`가 short-name key 직접 등록을 요구하고, parser lookup도 short-name key로 수행한다. + - 해결: full-name key 존재, short-name key 부재, full-name key parser round-trip을 검증한다. + - 변경 파일: `apps/client/test/iop_wire/parser_map_test.dart` + - 중간 검증: `cd apps/client && flutter test test/iop_wire/parser_map_test.dart` + +- [IOP_PARSER_ALIAS-3] IOP client 생성 경로 회귀 검증 + - 문제: duplicate alias error는 `ClientWireClient` 생성 시점에도 발생하므로 parser map 단독 테스트만으로는 부족하다. + - 해결: `client_wire_client_test.dart`, `client_bootstrap_test.dart`를 targeted regression으로 실행하고, 가능하면 `apps/client` 전체 Flutter test까지 확인한다. + - 변경 파일: 없음 + - 중간 검증: `cd apps/client && flutter test test/iop_wire/parser_map_test.dart test/iop_wire/client_wire_client_test.dart test/client_bootstrap_test.dart` + +## 수정 파일 요약 + +- 예상 변경: `apps/client/lib/iop_wire/parser_map.dart` +- 예상 변경: `apps/client/test/iop_wire/parser_map_test.dart` +- 변경 금지: `/config/workspace/proto-socket/**`, generated protobuf files, vLLM milestone 문서, secret/private endpoint 문서 + +## 최종 검증 + +공식 evidence는 원격 runner의 동기화된 checkout 기준이다. 동기화되지 않은 local 실행만 가능하면 그 사실과 남은 위험을 review stub에 기록한다. + +```bash +cd apps/client && flutter test test/iop_wire/parser_map_test.dart test/iop_wire/client_wire_client_test.dart test/client_bootstrap_test.dart +cd apps/client && flutter test +git diff --check +``` + +예상 결과: duplicate alias error 없이 targeted regression과 client Flutter test가 통과하고 whitespace error가 없다. + +모든 코드 변경 완료 후 반드시 `CODE_REVIEW-local-G04.md`의 구현 에이전트 소유 섹션을 채운다. 이 파일 작성이 구현의 마지막 단계다. diff --git a/apps/edge/internal/node/mapper_test.go b/apps/edge/internal/node/mapper_test.go index 0041f54..1ef9941 100644 --- a/apps/edge/internal/node/mapper_test.go +++ b/apps/edge/internal/node/mapper_test.go @@ -524,3 +524,64 @@ func TestBuildConfigPayload_DuplicateOpenAICompatNameError(t *testing.T) { t.Fatal("expected error for duplicate openai_compat instance name") } } + +// S02 REVIEW_VLLM_CONFIG: vLLM OpenAI-compatible instance preserves provider, +// endpoint, no headers, and queue policy through BuildConfigPayload. +func TestBuildConfigPayload_VLLMOpenAICompatInstance(t *testing.T) { + rec := &edgenode.NodeRecord{ + ID: "node-vllm-01", + Alias: "vllm-gpu-node", + Token: "token", + Adapters: config.AdaptersConf{ + OpenAICompatInstances: []config.OpenAICompatInstanceConf{ + { + Name: "vllm-gpu", + Enabled: true, + Provider: "vllm", + Endpoint: "http://127.0.0.1:8000/v1", + Headers: map[string]string{}, + Capacity: 4, + MaxQueue: 16, + QueueTimeoutMS: 30000, + RequestTimeoutMS: 120000, + }, + }, + }, + Runtime: config.RuntimeConf{WorkspaceRoot: "/tmp/ws"}, + } + + payload, err := edgenode.BuildConfigPayload(rec) + if err != nil { + t.Fatalf("BuildConfigPayload failed: %v", err) + } + + var oaiAdapter *iop.AdapterConfig + for _, a := range payload.Adapters { + if a.Type == "openai_compat" { + oaiAdapter = a + break + } + } + if oaiAdapter == nil { + t.Fatal("expected openai_compat adapter in payload") + } + if oaiAdapter.Name != "vllm-gpu" { + t.Errorf("adapter name: got %q, want %q", oaiAdapter.Name, "vllm-gpu") + } + oc := oaiAdapter.GetOpenaiCompat() + if oc == nil { + t.Fatal("expected typed OpenAICompatAdapterConfig") + } + if oc.GetProvider() != "vllm" { + t.Errorf("provider: got %q, want %q", oc.GetProvider(), "vllm") + } + if oc.GetEndpoint() != "http://127.0.0.1:8000/v1" { + t.Errorf("endpoint: got %q, want %q", oc.GetEndpoint(), "http://127.0.0.1:8000/v1") + } + if len(oc.GetHeaders()) != 0 { + t.Errorf("expected empty headers for vLLM, got %+v", oc.GetHeaders()) + } + if oc.GetCapacity() != 4 || oc.GetMaxQueue() != 16 || oc.GetQueueTimeoutMs() != 30000 || oc.GetRequestTimeoutMs() != 120000 { + t.Errorf("queue config mismatch: %+v", oc) + } +} diff --git a/configs/edge.yaml b/configs/edge.yaml index 8d2976f..567da9b 100644 --- a/configs/edge.yaml +++ b/configs/edge.yaml @@ -58,7 +58,7 @@ openai: # resolve adapter/target per-entry. Entries not matched fall back to target/adapter above. # workspace_required: true marks CLI agent routes that require a workspace path from the caller. # max_queue and queue_timeout_ms configure the Edge-owned queue policy for the model alias. - # model_routes: + # model_routes (legacy/adapter/type reference): # - model: "codex" # adapter: "cli" # target: "codex" @@ -68,14 +68,50 @@ openai: # target: "llama3:8b" # max_queue: 10 # queue_timeout_ms: 30000 + # + # # adapter: "vllm" — legacy path: node runs the built-in vllm adapter + # # (direct HTTP-to-vLLM-engine). Deprecated/discouraged for new deploys. + # # New deploys should use openai_compat adapter with provider="vllm" + # # instead, so that auth/headers/options can be configured per-route. # - model: "qwen3" - # adapter: "vllm" + # adapter: "vllm" # legacy — prefer openai_compat+provider:vllm # target: "qwen3-72b" # node: "node-gpu-01" + # # - model: "lemonade" # adapter: "openai_compat" # target: "lemonade-served-model" # node: "node-lemonade-01" + # + # vLLM OpenAI-compatible provider example (recommended for new deploys): + # 1. Define the route alias in model_routes with adapter="openai_compat" + # and target set to the served model id (no provider field here). + # 2. Define the vLLM instance in nodes[].adapters.openai_compat_instances + # with provider="vllm", endpoint, and queue policy. + # - alias: "qwen3.6:35b", served model: "nvidia/Qwen3.6-35B-A3B-NVFP4" + # model_routes: + # - model: "qwen3.6:35b" + # adapter: "openai_compat" + # target: "nvidia/Qwen3.6-35B-A3B-NVFP4" + # node: "node-vllm-01" + # max_queue: 10 + # queue_timeout_ms: 30000 + # + # nodes: + # - id: "node-vllm-01" + # alias: "vllm-gpu-node" + # token: "" + # adapters: + # openai_compat_instances: + # - name: "vllm-gpu" + # enabled: true + # provider: "vllm" + # endpoint: "http://127.0.0.1:8000/v1" + # # headers: no default auth (use proxy/credential path) + # capacity: 4 + # max_queue: 16 + # queue_timeout_ms: 30000 + # request_timeout_ms: 120000 session_id: "openai" timeout_sec: 120 strict_output: true diff --git a/packages/go/config/config_test.go b/packages/go/config/config_test.go index cc7c459..8a3d509 100644 --- a/packages/go/config/config_test.go +++ b/packages/go/config/config_test.go @@ -1626,3 +1626,110 @@ func TestNormalizeAdapters_OpenAICompatQueueValidation(t *testing.T) { t.Fatalf("expected error to mention capacity, got %v", err) } } + +// S02 REVIEW_VLLM_CONFIG: vLLM OpenAI-compatible route + instance fixture +// verifies that alias/target/provider/endpoint/no-headers/timeout/queue are +// preserved through config load and mapper/factory contract. +func TestLoadEdge_VLLMOpenAIRouteAndInstance(t *testing.T) { + dir := t.TempDir() + f := filepath.Join(dir, "edge.yaml") + yaml := ` +server: + listen: "0.0.0.0:9090" +openai: + enabled: true + model_routes: + - model: "qwen3.6:35b" + adapter: "openai_compat" + target: "nvidia/Qwen3.6-35B-A3B-NVFP4" + node: "node-vllm-01" + max_queue: 10 + queue_timeout_ms: 30000 + - model: "codex-agent" + adapter: "cli" + target: "codex" + workspace_required: true +nodes: + - id: "node-vllm-01" + alias: "vllm-gpu-node" + token: "" + adapters: + openai_compat_instances: + - name: "vllm-gpu" + enabled: true + provider: "vllm" + endpoint: "http://127.0.0.1:8000/v1" + capacity: 4 + max_queue: 16 + queue_timeout_ms: 30000 + request_timeout_ms: 120000 + cli: + enabled: true + profiles: + codex: + command: "codex" + mode: "codex-exec" +` + if err := os.WriteFile(f, []byte(yaml), 0o600); err != nil { + t.Fatalf("write yaml: %v", err) + } + cfg, err := config.LoadEdge(f) + if err != nil { + t.Fatalf("load: %v", err) + } + + // Verify model_routes: vLLM route has no provider field (only adapter/target). + if len(cfg.OpenAI.ModelRoutes) != 2 { + t.Fatalf("expected 2 model_routes, got %d", len(cfg.OpenAI.ModelRoutes)) + } + vllmRoute := cfg.OpenAI.ModelRoutes[0] + if vllmRoute.Model != "qwen3.6:35b" { + t.Errorf("model: got %q, want %q", vllmRoute.Model, "qwen3.6:35b") + } + if vllmRoute.Adapter != "openai_compat" { + t.Errorf("adapter: got %q, want %q", vllmRoute.Adapter, "openai_compat") + } + if vllmRoute.Target != "nvidia/Qwen3.6-35B-A3B-NVFP4" { + t.Errorf("target: got %q, want %q", vllmRoute.Target, "nvidia/Qwen3.6-35B-A3B-NVFP4") + } + if vllmRoute.NodeRef != "node-vllm-01" { + t.Errorf("node: got %q, want %q", vllmRoute.NodeRef, "node-vllm-01") + } + if vllmRoute.MaxQueue != 10 || vllmRoute.QueueTimeoutMS != 30000 { + t.Errorf("queue policy mismatch: max_queue=%d, queue_timeout_ms=%d", vllmRoute.MaxQueue, vllmRoute.QueueTimeoutMS) + } + // Codex agent route: workspace_required=true. + agentRoute := cfg.OpenAI.ModelRoutes[1] + if agentRoute.Model != "codex-agent" || agentRoute.Adapter != "cli" || agentRoute.Target != "codex" { + t.Errorf("agent route mismatch: %+v", agentRoute) + } + if !agentRoute.WorkspaceRequired { + t.Error("agent route workspace_required should be true") + } + + // Verify openai_compat_instances: provider="vllm", endpoint, no headers, queue policy. + nodes := cfg.Nodes + if len(nodes) != 1 { + t.Fatalf("expected 1 node, got %d", len(nodes)) + } + insts := nodes[0].Adapters.OpenAICompatInstances + if len(insts) != 1 { + t.Fatalf("expected 1 openai_compat instance, got %d", len(insts)) + } + inst := insts[0] + if inst.Name != "vllm-gpu" { + t.Errorf("instance name: got %q, want %q", inst.Name, "vllm-gpu") + } + if inst.Provider != "vllm" { + t.Errorf("provider: got %q, want %q", inst.Provider, "vllm") + } + if inst.Endpoint != "http://127.0.0.1:8000/v1" { + t.Errorf("endpoint: got %q, want %q", inst.Endpoint, "http://127.0.0.1:8000/v1") + } + if len(inst.Headers) != 0 { + t.Errorf("expected no headers for vLLM, got %+v", inst.Headers) + } + if inst.Capacity != 4 || inst.MaxQueue != 16 || inst.QueueTimeoutMS != 30000 || inst.RequestTimeoutMS != 120000 { + t.Errorf("queue config mismatch: %+v", inst) + } +}