Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
4.0 KiB
4.0 KiB
실행 기록 — 어느 모델이 무엇을 만들었나
다른 모델로 같은 작업을 다시 돌려 비교하기 위한 기록이다. 비교 기준선(baseline)은 아래 상태다.
모델
| 범위 | 모델 |
|---|---|
| 인덱싱 파이프라인 본체 (Stage 1~6: 정규화 · 파서 · 적재 · 요약/조각 추출 · 질의 API · 위키/뷰어) | Fable 5.1 |
정의부(declaration) 수집·조립 기능 (2026-09-21, docs/definition-block-design.md) |
Opus 5 (1M context, claude-opus-5[1m]) |
이 저장소에 있는 것의 거의 전부는 Fable 5.1 이 만들었다. 정의부 작업은 그 위에 얹은 한 기능이다.
기준선 지표 (2026-09-21 기준)
샘플 55본으로 전 단계를 돌린 결과다. 재실행 결과를 여기에 대보면 된다.
| 항목 | 값 |
|---|---|
| 프로그램 / unit / 문장 | 55 · 6,296 · 95,401 |
| 파서 미인식 문장 | 3건 (0.003%) |
| 로직 조각 (LLM 추출) | 3,212건 |
| 선언(정의부) | 18,049건 — 조각의 79%가 정의부를 가짐 (평균 3.5건) |
| 위키 | 프로그램 55 · 테이블 160 · 펑션 119 · 개념 23 · T-code 17 |
| 테스트 | 99 passed / 6 skipped (6건은 ZFIR10070 정규화 산출물이 없어 skip) |
| index.db | 약 43 MB |
재실행할 때 주의
- 이 저장소 상태 위에서 같은 프롬프트를 돌리면 비교가 안 된다. 결과물(코드·위키·DB)이 이미 있어서 다음 모델은 "무엇을 만들어야 하는지"를 읽고 시작하게 된다. 같은 출발선에서 재려면 변경 전 상태를 따로 떠 두고 거기서 돌려야 한다 (이 저장소는 git 관리가 아니다).
- Stage 3(조각 추출)은 LLM 호출이라 모델이 바뀌면 조각의 개수·경계·설명이 달라진다. Stage 1·2·4(정규화·파서·적재)는 LLM 없이 결정론적이므로 코드가 같으면 결과도 같아야 한다. 즉 모델 비교가 실제로 갈리는 지점은 코드를 어떻게 짜는가와 조각 추출 품질이다.
- 조각 추출을 다시 돌릴 거면
PROMPT_VERSION(summarize/runner.py)과.env의 모델 설정을 함께 기록해 둘 것 — 그게 없으면 나중에 어느 조각이 어느 모델 산출인지 구분되지 않는다.
GLM 5.2 비용 실측 (2026-09-21)
비교 실행 대상은 OpenRouter z-ai/glm-5.2. 전체 실행은 잔액 부족(402) 으로 못 돌렸고,
실제 프롬프트 5건을 GLM 5.2 로 직접 호출해 단가를 쟀다 (총 $0.024 소요).
| 측정값 | 결과 |
|---|---|
| 문자/토큰 (한국어+ABAP 혼합) | 1.97 ~ 2.1 |
| 호출 1회 (프롬프트 3.1k~5.1k자) | 입력 1,643 |
| 그중 추론(reasoning) 토큰 | 출력의 58~68% — GLM 5.2 는 추론 모델이라 비용의 큰 몫 |
| 프롬프트 1,000자당 비용 | $0.00071 (관측 범위 $0.0005~$0.0012) |
| 단가 | 입력 $0.6496/M · 출력 $2.0416/M |
이 단가를 현재 코퍼스의 실제 프롬프트 5,642건(23.3M자) 에 적용한 예측:
| 범위 | 비용 |
|---|---|
| 프로그램 1본 (중앙값 120호출·446k자) | $0.32 (범위 $0.22~$0.52) |
| 현재 코퍼스 55본 전체 | $16.5 (범위 $11.6~$27.0) |
| $10 으로 가능한 양 | 프로그램 약 32본 / LLM 호출 약 3,400회 |
- 호출 수는 파서가 정하므로(unit 수) 모델이 바뀌어도 같다. 달라지는 건 토큰 단가와 추론 길이다.
- 추론 길이 편차가 커서 범위가 넓다(같은 크기 프롬프트에서 출력 130~1,639 토큰).
- 더 싼 슬러그 환산:
z-ai/glm-4.7약 $12.5,z-ai/glm-5.3-flash약 $2.4 (같은 코퍼스 전체). summarize/llm_client.py가max_tokens를 안 보낸다. OpenRouter 는 최대 출력 기준으로 선결제 견적을 잡으므로 잔액이 적으면 402 가 난다. 추론 폭주 방어도 겸해 상한을 두는 게 좋다.
실행용 폴더: C:\EdgeCenter\abap-indexing-glm52 (코드 + data/raw 만 복사, Stage 1·2·4 완료,
ZFIR10070 1본 적재 = unit 122·문장 1,756). 키만 채우면 Stage 3 부터 바로 돌릴 수 있다.