Merge branch 'main' of https://git.toki-labs.com/toki/iop
This commit is contained in:
commit
de44a80cb7
2 changed files with 8 additions and 2 deletions
|
|
@ -30,7 +30,7 @@ tracked config에는 public 예시와 기본 구조만 두고, 실제 endpoint/c
|
|||
## 핵심 규칙
|
||||
|
||||
- `openai.model_routes[]`는 외부 OpenAI-compatible `model` id를 내부 `adapter + target` route로 매핑하는 compatibility catalog다.
|
||||
- `models[]`는 provider pool 방향의 canonical routing key이며 `nodes[].providers[].id`를 참조한다.
|
||||
- `models[]`는 provider pool 방향의 canonical routing key이며 `nodes[].providers[].id`를 참조한다. `default_max_tokens`, `min_max_tokens`, `default_thinking_token_budget`은 OpenAI-compatible 요청을 내부 실행으로 넘기기 전에 적용하는 모델 단위 generation policy다.
|
||||
- `nodes[].providers[]`는 Node 아래 resource/provider catalog다. `category`는 `api`, `cli`, `local_inference` resource kind를 나타낸다.
|
||||
- `nodes[].providers[].id`는 전체 Edge config 안에서 중복되면 안 된다.
|
||||
- `nodes[].providers[].adapter`는 같은 Node 안의 enabled adapter instance key를 참조해야 한다. Exact instance key를 우선하고, legacy type-name route는 같은 type의 enabled instance가 정확히 하나일 때만 허용한다. `category: cli` resource는 enabled CLI adapter가 필요하다.
|
||||
|
|
@ -42,7 +42,7 @@ tracked config에는 public 예시와 기본 구조만 두고, 실제 endpoint/c
|
|||
|
||||
## refresh 분류 기준
|
||||
|
||||
- live apply 가능: provider capacity, provider priority, provider max queue, provider queue timeout, provider `enabled` toggle, `models[]` display/provider mapping, legacy node runtime concurrency metadata.
|
||||
- live apply 가능: provider capacity, provider priority, provider max queue, provider queue timeout, provider `enabled` toggle, `models[]` display/provider/generation policy mapping, legacy node runtime concurrency metadata.
|
||||
- restart required: Edge identity/listen/bootstrap/logging/metrics/console/control-plane/openai/a2a listener config, node 추가/삭제, node token/alias/agent kind, adapter 설정, provider type/category/adapter/models/health/lifecycle capability, provider-first execution fields(`provider`, `endpoint`, `base_url`, `headers`, `command`, `args`, `env`, `mode`, `resume_args`, `output_format`, `context_size`, `request_timeout_ms`) 변경.
|
||||
- rejected: candidate config load/validate 실패, invalid refresh mode, apply failure.
|
||||
|
||||
|
|
|
|||
|
|
@ -196,6 +196,12 @@ Provider별 think-control 정책:
|
|||
- `reasoning_effort=low|medium|high` -> `unsupported think control` 오류 반환
|
||||
- Unknown / 기타 provider: 요청 field를 그대로 전달하되, provider가 지원하지 않는 값은 backend 또는 adapter error가 될 수 있다.
|
||||
|
||||
Provider pool model catalog의 `models[]` entry가 generation policy를 제공하면 Edge는 요청을 내부 실행으로 넘기기 전에 다음 값을 보정한다.
|
||||
|
||||
- `default_max_tokens`: caller가 출력 token limit을 생략했을 때 `max_tokens` 또는 `max_output_tokens`로 주입한다.
|
||||
- `min_max_tokens`: caller가 너무 작은 출력 token limit을 보냈을 때 해당 값까지 올린다. caller 값이 더 크면 보존한다.
|
||||
- `default_thinking_token_budget`: caller가 `thinking_token_budget`을 생략했고 strict output이 reasoning을 금지하지 않을 때 내부 실행 입력에 주입한다.
|
||||
|
||||
Conflict 정책:
|
||||
|
||||
- `reasoning_effort`가 비어 있거나 `none|low|medium|high` 외 값이면 400 에러.
|
||||
|
|
|
|||
Loading…
Reference in a new issue