feat(gateway): 이미지 붙은 요청만 vision 모델(Gemma4)로 — 텍스트는 기본 339
Gemma4 가 '안녕' 한 단어에 94s(580 은 188s) 라 텍스트 기본으로는 못 씀. AAF_FABRIX_VISION_MODEL_ID 가 있으면 messages 에 image_url 파트가 있을 때만 그 모델로 x-llm-model-id 를 바꿈. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Fable 5.1
parent
2b8c2d7742
commit
7ad48732ae
@@ -10,3 +10,14 @@
|
||||
|
||||
- 세 모델 다 같은 client key 로 열려 있음. 토큰은 `Bearer ` 접두 필수(날것은 401), 클라이언트 헤더는 `x-generative-ai-client`·`x-fabrix-client` 둘 다 됨.
|
||||
- Gemma4 는 토큰당 속도가 눈에 띄게 느림 → 텍스트 기본은 339, 이미지 있을 때만 605 로 보내는 게 맞음.
|
||||
|
||||
## 2차 (같은 날 저녁, "안녕" 한 단어)
|
||||
|
||||
| id | 모델 | 전체 |
|
||||
|---|---|---|
|
||||
| 339 | GaussO Flash | 0.7s |
|
||||
| 605 | Gemma4 | 94.4s |
|
||||
| 580 | Gemma4(다른 인스턴스) | 188.5s |
|
||||
|
||||
짧은 입력에 더 오래 걸림 → 출력 길이가 아니라 **큐 대기/서빙 문제**. 사용 불가 수준. FabriX 담당에 서빙 스펙 확인 요청.
|
||||
대응: 기본 339, 이미지 붙은 요청만 605 (`AAF_FABRIX_VISION_MODEL_ID`, 게이트웨이 자동 분기).
|
||||
|
||||
Reference in New Issue
Block a user