diff --git a/agent-roadmap/phase/knowledge-tool-optimization-extension/PHASE.md b/agent-roadmap/phase/knowledge-tool-optimization-extension/PHASE.md index 538fb62e..05cb20c1 100644 --- a/agent-roadmap/phase/knowledge-tool-optimization-extension/PHASE.md +++ b/agent-roadmap/phase/knowledge-tool-optimization-extension/PHASE.md @@ -67,7 +67,7 @@ Phase를 가로지르는 실제 다음 작업 선택은 [전역 마일스톤 실 - [진행중] [bench-lite-01] 초경량 Agent 모델 비교 - 경로: [[bench-lite-01] 초경량 Agent 모델 비교](milestones/thin-agent-model-comparison-benchmark.md) - - 요약: 최소 HTML 스모크를 통과한 동일 경로를 복구·재개·자동 채점 없는 단일 시도로 실행하고, 성공 여부·경과 시간·제공된 usage·산출물만 한 표에 기록한다. + - 요약: 최소 HTML 스모크를 통과한 동일 경로를 복구·재개 없는 단일 시도로 실행하고, 성공 여부·경과 시간·제공된 usage와 고정 100점 기준표의 1회 산출물 평가를 기록한다. - [계획] [surface-01] Inference API Surface와 실행 Lifecycle 책임 경계 리팩터링 - 경로: [[surface-01] Inference API Surface와 실행 Lifecycle 책임 경계 리팩터링](milestones/inference-api-surface-execution-lifecycle-refactor.md) diff --git a/agent-roadmap/phase/knowledge-tool-optimization-extension/milestones/thin-agent-model-comparison-benchmark.md b/agent-roadmap/phase/knowledge-tool-optimization-extension/milestones/thin-agent-model-comparison-benchmark.md index 8c62238b..fef250aa 100644 --- a/agent-roadmap/phase/knowledge-tool-optimization-extension/milestones/thin-agent-model-comparison-benchmark.md +++ b/agent-roadmap/phase/knowledge-tool-optimization-extension/milestones/thin-agent-model-comparison-benchmark.md @@ -8,7 +8,7 @@ ## 목표 `[bench-route-01]`에서 호출 가능성이 확인된 동일 9개 조합을 고정된 실제 비교 과제로 한 번씩 실행해 최소 비교 결과를 남긴다. -측정 지원 코드는 만들지 않고, caller 실행과 결과 기록만 측정 경계로 둔다. +측정 지원 코드는 만들지 않고, caller 실행과 결과 기록, 고정 기준표에 따른 산출물별 1회 심층 평가만 측정 경계로 둔다. ## 상태 @@ -28,6 +28,7 @@ - 모든 조합에 [얇은 비교 결과 문서](../../../../agent-test/dev/iop-thin-agent-model-comparison.md)의 같은 고정 비교 prompt와 같은 빈 임시 workspace 사용 - 조합별 정확히 1회 실행 - 성공 여부, 전체 경과 시간, caller가 직접 제공한 usage, 산출물 경로와 짧은 수동 관찰만 기록 +- 실행 전에 잠근 공통 100점 기준표로 각 산출물의 source와 동일 viewport render를 한 번만 분석하고, 항목별 증거·감점 사유·총점을 기록 - 실패한 조합은 실패로 기록하고 같은 측정 안에서 retry, resume 또는 대체 run을 하지 않음 ## 기능 @@ -36,6 +37,7 @@ - [ ] [single-attempt-matrix] 9개 조합을 같은 prompt와 초기 상태에서 정확히 한 번씩 실행한다. 검증: 조합별 producer attempt가 하나이며 retry/resume/recovery 기록이 없어야 한다. - [ ] [minimal-result-table] 성공 여부, 경과 시간, caller 제공 usage, 산출물 경로와 짧은 관찰을 단일 Markdown 표로 기록한다. 제공되지 않은 usage는 `미제공`으로 두고 추정하거나 0으로 바꾸지 않는다. +- [ ] [single-pass-scorecard] 실행 전에 고정한 공통 100점 기준표로 각 scorable 산출물의 source와 desktop/mobile render를 한 번만 함께 분석해 항목별 점수, 직접 증거, 감점 사유와 산술 총점을 기록한다. 검증: 평가 pass에는 route·model·시간·usage를 제공하지 않고 opaque 평가 ID만 사용하며, 모든 점수는 고정 anchor와 evidence를 가지고 재채점은 산술·전사 오류 수정으로만 제한한다. - [ ] [bounded-conclusion] 성공한 결과만 비교하고 실패·미제공 데이터를 점수 0으로 취급하지 않는 짧은 결론을 남긴다. 자동 채점이나 통계적 일반화는 하지 않는다. ## 완료 리뷰 @@ -46,7 +48,7 @@ - 검토 항목: - [x] `[bench-route-01]`이 통과 또는 사용자 승인된 외부 차단 상태다. - [ ] 새 benchmark script와 자동화 state가 없다. - - [ ] 조합별 정확히 한 번의 실행과 최소 결과 표만 남았다. + - [ ] 조합별 정확히 한 번의 실행, 최소 결과 표와 evidence-backed 단일 평가표만 남았다. - agent-ui 상태 반영: 해당 없음 - 리뷰 코멘트: 없음 @@ -54,8 +56,8 @@ - manifest runner, orchestration framework, lifecycle store - retry, resume, recovery qualification, stale-run repair -- browser/CDP 자동 검증, screenshot gate, accessibility/network gate -- 익명 LLM 채점, 자동 순위, 반복·분산·유의성 분석 +- browser/CDP 자동 검증, screenshot pass/fail gate, accessibility/network 자동 gate +- 별도 judge 모델, 다중 평가자 합의, 자동 순위, 반복·분산·유의성 분석 - 이 측정을 IOP 제품 안정성 또는 다른 Milestone의 완료 조건으로 승격하는 것 ## 작업 컨텍스트 @@ -63,5 +65,5 @@ - 선행 작업: [벤치 경로 최소 HTML 스모크](../../../archive/phase/knowledge-tool-optimization-extension/milestones/benchmark-route-minimal-html-smoke.md) 완료 - 실행 방식: 기존 공식 caller 명령을 한 번씩 직접 실행하며 공통 runner를 만들지 않는다. - 결과 위치: [얇은 비교 결과](../../../../agent-test/dev/iop-thin-agent-model-comparison.md) -- 준비 상태: 고정 prompt, 9행 결과표, 단일 시도 판정 규칙을 준비했다. 별도 script, manifest, state store는 없다. +- 준비 상태: 교체 가능한 고정 prompt, 9행 결과표, 공통 100점 기준표, 단일 평가 scorecard를 준비했다. 별도 script, judge, manifest, state store는 없다. - 세션 라우팅: 이 세션에서 execution preset의 Work 바인딩은 사용자 지시에 따라 live `ornith:35b`를 사용하며 tracked 설정은 변경하지 않는다. diff --git a/agent-roadmap/priority-queue.md b/agent-roadmap/priority-queue.md index 26c81394..27575895 100644 --- a/agent-roadmap/priority-queue.md +++ b/agent-roadmap/priority-queue.md @@ -7,7 +7,7 @@ ### bench-lite 1. [[bench-lite-01] 초경량 Agent 모델 비교](phase/knowledge-tool-optimization-extension/milestones/thin-agent-model-comparison-benchmark.md) - 통과한 동일 경로를 복구·재개·자동 채점 없이 한 번씩 실행하고 최소 비교 표만 남긴다. + 통과한 동일 경로를 복구·재개 없이 한 번씩 실행하고, 고정 기준표로 산출물을 한 번만 깊게 평가해 근거와 총점을 남긴다. ### route diff --git a/agent-test/dev/iop-thin-agent-model-comparison.md b/agent-test/dev/iop-thin-agent-model-comparison.md index 2915112b..22366240 100644 --- a/agent-test/dev/iop-thin-agent-model-comparison.md +++ b/agent-test/dev/iop-thin-agent-model-comparison.md @@ -2,38 +2,77 @@ ## 목적 -검증을 마친 9개 caller/model/route 조합에 같은 HTML 구현 요청을 정확히 한 번씩 실행해 성공 여부, 경과 시간, caller가 직접 제공한 usage와 짧은 관찰만 비교한다. 별도 benchmark script, runner, manifest, retry, resume, browser gate 또는 자동 채점은 사용하지 않는다. +검증을 마친 9개 caller/model/route 조합에 같은 HTML 구현 요청을 정확히 한 번씩 실행한다. 운영 결과와 산출물 품질을 분리하고, 품질은 실행 전에 잠근 공통 100점 기준표로 산출물별 정확히 한 번 깊게 분석한다. 별도 benchmark script, runner, judge, manifest, retry, resume 또는 자동 gate는 사용하지 않는다. ## 고정 요청 아래 문장을 모든 조합에 그대로 사용한다. -> Create a polished single-file responsive landing page in `index.html` for “Orbit Ops”, a fictional AI operations dashboard. Use no external assets, frameworks, or JavaScript. Include a semantic header, main, and footer; a hero with a title and two calls to action; three feature cards; and a system-status panel with three services and visible status labels. Put all CSS in a `