Qwen 3.8 Flash API: $0.15/$0.47, 그리고 요금이 붙는 추론 토큰
Qwen 3.8 Flash는 100만 토큰당 $0.47로 Flash 등급에서 가장 싼 출력 단가다. 동시에 추론 모델이라 max_tokens를 작게 주면 빈 응답이 오고, 그 몫도 그대로 청구된다.
Qwen 3.8 Flash는 입력 100만 토큰당 $0.15, 출력 $0.47로 Flash 등급에서 가장 싼 출력 단가다. 동시에 추론 모델이기도 한데, 바로 여기서 사람들이 걸린다. max_tokens를 짧게 주면 빈 문자열이 돌아오고, 보지도 못한 토큰 값을 지불하게 된다.
모델 ID: bailian/qwen3.8-flash (별칭: qwen3.8-flash)
가격: 100만당 입력 $0.15 / 출력 $0.47
컨텍스트: 1,131,072 토큰
최대 출력: 131,072 토큰
모달리티: 텍스트 + 이미지 → 텍스트
엔드포인트: /v1/chat/completions, /v1/responses
파라미터: temperature, top_p, max_tokens, stop, tools,
tool_choice, response_format, reasoning
2026년 9월 6일 실시간 Ofox /v1/models 엔드포인트에서 읽었다. 아래 동작도 같은 날 같은 엔드포인트에서 측정한 것이다.
처음에 다들 부딪히는 빈 응답
max_tokens: 30을 보냈더니 빈 문자열이 돌아왔다. 오류가 아니다. 요금까지 붙은 성공 응답이다:
{"content": "",
"usage": {"prompt_tokens": 66, "completion_tokens": 30,
"completion_tokens_details": {"reasoning_tokens": 30}}}
응답 토큰 30개, 전부 추론 토큰, 보이는 건 아무것도 없다. 모델은 답의 첫 글자를 내놓기도 전에 예산 전부를 생각하는 데 썼다.
해결책은 두 가지, 둘 다 같은 프롬프트에서 측정했다:
| 설정 | completion_tokens | reasoning_tokens | content |
|---|---|---|---|
max_tokens: 30 | 30 | 30 | "" — 비어 있음 |
max_tokens: 800 | 27 | 23 | "ok" |
max_tokens: 50, effort: none | 1 | — | "ok" |
상한을 올리면 된다. 모델에 필요한 건 총 27 토큰이었고, 30이라는 상한이 생각 도중에 잘라버린 것이기 때문이다.
추론을 끄면 더 낫다. 이 정도로 단순한 프롬프트라면 effort: none은 같은 답을 27개가 아니라 1개 토큰으로 내놨다. 27배 차이다. 짧은 출력을 대량으로 돌리는 작업에서는 100만당 $0.47이냐, 그 일부만 내느냐의 차이가 된다.
추론 모델 전반에 통하는 실무 규칙: max_tokens는 추론과 답변을 모두 덮어야 하고, 추론은 당신이 보든 안 보든 출력 단가로 청구된다. max_tokens를 답변 길이인 양 잡는 것이, 멀쩡한 모델을 고장 난 것처럼 보이게 만드는 원인이다.
$0.47이 Flash 등급에서 놓인 자리
모든 요금은 2026년 9월 6일 실시간 Ofox 카탈로그 기준:
| 모델 | 입력 / 100만 | 출력 / 100만 | 컨텍스트 | 최대 출력 |
|---|---|---|---|---|
bailian/qwen3.8-flash | $0.15 | $0.47 | 1,131,072 | 131,072 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1,048,576 | 131,072 |
deepseek/deepseek-v4-flash-0731 | $0.44 | $1.32 | 1,000,000 | 384,000 |
openai/gpt-5.6-luna | $1.00 | $6.00 | 1,050,000 | 128,000 |
google/gemini-3.8-flash | $1.50 | $7.50 | 1,000,000 | 65,536 |
Qwen 3.8 Flash와 GLM-5.3 Flash는 사실상 동률이다. 입력 단가는 같고 출력은 3센트 차이. 이 둘 사이에서는 가격이 결정 요인이 못 되므로, 실제 업무에 둘 다 돌려보는 게 맞다.
나머지와의 격차는 크다. Qwen 3.8 Flash의 출력은 DeepSeek V4 Flash보다 2.8배, Gemini 3.8 Flash보다 16배 싸다.
그 격차가 말해주지 않는 두 가지:
- DeepSeek V4 Flash에는 독립 점수가 있고 Qwen 3.8 Flash에는 없다. DeepSeek V4 Flash 0731은 vals.ai SWE-Bench Verified에서 88.80%로 Claude Opus 4.8보다 높지만, Qwen 3.8 Flash는 그 리더보드에 아예 없다. 돈을 덜 내는 대신 뒷받침하는 공개 근거가 적은 모델을 쓰는 셈이다. 괜찮을 수도 있지만 알고는 있어야 한다.
- DeepSeek V4 Flash는 384,000 토큰 응답을 허용한다. Qwen은 131,072다. 아주 긴 단일 출력을 생성한다면 단가보다 이 상한이 더 중요하다.
실제로 얼마나 드는가
$0.15 / $0.47 기준, 위의 추론 관련 주의사항을 반영하면:
| 작업 | 토큰 | 비용 |
|---|---|---|
짧은 분류 1만 건 (입력 200 / 출력 20, effort: none) | 입력 2M / 출력 0.2M | $0.39 |
| 짧은 분류 1만 건 (입력 200 / 출력 300, 추론 켬) | 입력 2M / 출력 3M | $1.71 |
| 100만 토큰 문서, 1회 처리 | 입력 1M / 출력 5K | $0.15 |
앞의 두 줄은 같은 작업이다. 차이는 추론이 켜져 있느냐뿐이고, 이런 형태의 작업에서 대략 4.3배다. 이 모델을 대량 파이프라인에 넣기 전에 머리에 넣어둘 숫자가 바로 이것이다.
호출 방법
curl -X POST https://api.ofox.io/v1/chat/completions \
-H "Authorization: Bearer $OFOX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bailian/qwen3.8-flash",
"messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
"reasoning": {"effort": "none"},
"max_tokens": 50
}'
처음 몇 번은 usage.completion_tokens_details.reasoning_tokens를 읽어보자. 숙고가 필요 없는 작업에서 이 값이 completion_tokens의 큰 비중을 차지한다면, effort: none은 공짜로 줍는 돈이다.
이 모델은 텍스트뿐 아니라 이미지 입력도 받으므로 값싼 비전 작업 — 캡션 생성, OCR에 가까운 추출, 스크린샷 분류 — 도 커버한다. 위에 나온 비전 지원 Flash 모델들보다 훨씬 낮은 단가로 말이다.
쓰지 말아야 할 때
- 선택 근거로 독립 벤치마크가 필요한 경우. Qwen 3.8 Flash는 vals.ai SWE-Bench에도, Artificial Analysis 지수에도 없다. DeepSeek V4 Flash는 $0.44 / $1.32에 공개된 88.80%가 있다.
- 아주 긴 단일 응답을 생성하는 경우. 131,072 토큰이라는 응답 상한은 DeepSeek V4 Flash의 3분의 1이다.
- 작업 자체가 정말 어려운 경우. 이건 Flash 등급 모델이다. 복잡한 추론의 정확도가 결과를 좌우한다면, 프런티어 모델 비교에서 추가 비용이 무엇을 사주는지 다룬다.
- 이미 GLM-5.3 Flash를 쓰고 있는 경우. 출력 100만당 3센트는 이전할 이유가 못 된다.
관련 글
- Qwen 3.8 Max 가격과 접근 — 같은 계열의 플래그십, $2.00 / $6.00.
- Qwen 3.8 Max vs DeepSeek V4 Flash — 한 등급 위에서 벌어지는 같은 «싼 쪽 대 플래그십» 문제.
- Qwen 3.8 27B 로컬 실행 — 싼 Qwen을 원하는 이유가 사실은 자체 호스팅이라면.
출처
- https://ofox.io/models/bailian/qwen3.8-flash
- https://ofox.io/models/deepseek/deepseek-v4-flash-0731
- https://ofox.io/models/z-ai/glm-5.3-flash
가격, 컨텍스트 길이, 응답 상한, 지원 파라미터와 엔드포인트는 2026년 9월 6일 실시간 Ofox /v1/models 엔드포인트에서 읽었다. 추론 토큰 동작은 같은 날 bailian/qwen3.8-flash에 대한 세 번의 실시간 /v1/chat/completions 호출 결과로, 프롬프트는 동일하고 max_tokens와 reasoning.effort만 달리했다. 하루 동안 한 경로에서 얻은 작은 표본이지 사양이 아니므로, 파이프라인 규모를 정하기 전에 자신의 워크로드에서 직접 측정하길 권한다. DeepSeek V4 Flash의 SWE-Bench 수치는 vals.ai 출처이며 리더보드 갱신일은 2026-08-26이다.
자주 묻는 질문
- Qwen 3.8 Flash 요금은 얼마인가요?
- Ofox에서 bailian/qwen3.8-flash로 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.47입니다. 2026년 9월 6일 실시간 카탈로그에서 읽은 값입니다. 이 출력 단가는 Flash 등급 중 가장 낮습니다. GLM-5.3 Flash는 $0.50, DeepSeek V4 Flash 0731은 $1.32, GPT-5.6 Luna는 $6.00, Gemini 3.8 Flash는 $7.50입니다.
- Qwen 3.8 Flash가 빈 content를 반환하는 이유는?
- 추론 모델이라서, 눈에 보이는 텍스트가 나오기 전에 지정한 토큰 상한이 추론으로 다 소모됐기 때문입니다. max_tokens 30을 보냈더니 content는 빈 문자열이었고 completion_tokens는 30, 그 전부가 reasoning_tokens였습니다. 상한을 올리거나 reasoning effort를 none으로 설정하세요. 이건 실패가 아니며 해당 토큰에도 요금이 붙습니다.
- Qwen 3.8 Flash에서 추론 토큰을 안 쓰게 하려면?
- reasoning을 전달하고 effort를 none으로 두세요. 같은 짧은 프롬프트에서 completion_tokens가 27에서 1로 줄었습니다. 사소한 호출 하나에서 27배 차이입니다. 분류·추출·라우팅처럼 숙고가 필요 없는 짧은 출력 작업이라면, 이 모델에서 가장 큰 비용 레버입니다.
- Qwen 3.8 Flash의 컨텍스트 윈도는?
- 실시간 Ofox 카탈로그 기준 컨텍스트 1,131,072 토큰, 최대 응답 131,072 토큰입니다. 텍스트와 이미지를 입력으로 받아 텍스트를 반환하며, /v1/chat/completions와 /v1/responses 양쪽에서 쓸 수 있습니다.
- Qwen 3.8 Flash가 DeepSeek V4 Flash보다 싼가요?
- 네, 출력 기준으로 약 2.8배 쌉니다. Qwen 3.8 Flash가 $0.15 / $0.47, DeepSeek V4 Flash 0731이 $0.44 / $1.32입니다. 다만 DeepSeek V4 Flash는 vals.ai SWE-Bench Verified에서 88.80%라는 공개 점수를 갖고 있고 Qwen 3.8 Flash는 그 리더보드에 아예 없습니다. 싼 대신 비교할 독립 점수가 없다는 뜻입니다.
- Qwen 3.8 Flash의 모델 ID는?
- Ofox에서 bailian/qwen3.8-flash이며 별칭은 qwen3.8-flash입니다. temperature, top_p, max_tokens, stop, tools, tool_choice, response_format, reasoning을 지원합니다.


