Qwen 3.8 Flash API: $0.15/$0.47, 그리고 요금이 붙는 추론 토큰

Qwen 3.8 Flash는 100만 토큰당 $0.47로 Flash 등급에서 가장 싼 출력 단가다. 동시에 추론 모델이라 max_tokens를 작게 주면 빈 응답이 오고, 그 몫도 그대로 청구된다.

Qwen 3.8 Flash API: $0.15/$0.47, 그리고 요금이 붙는 추론 토큰

Qwen 3.8 Flash는 입력 100만 토큰당 $0.15, 출력 $0.47로 Flash 등급에서 가장 싼 출력 단가다. 동시에 추론 모델이기도 한데, 바로 여기서 사람들이 걸린다. max_tokens를 짧게 주면 빈 문자열이 돌아오고, 보지도 못한 토큰 값을 지불하게 된다.

모델 ID:     bailian/qwen3.8-flash   (별칭: qwen3.8-flash)
가격:        100만당 입력 $0.15 / 출력 $0.47
컨텍스트:    1,131,072 토큰
최대 출력:   131,072 토큰
모달리티:    텍스트 + 이미지 → 텍스트
엔드포인트:  /v1/chat/completions, /v1/responses
파라미터:    temperature, top_p, max_tokens, stop, tools,
             tool_choice, response_format, reasoning

2026년 9월 6일 실시간 Ofox /v1/models 엔드포인트에서 읽었다. 아래 동작도 같은 날 같은 엔드포인트에서 측정한 것이다.

처음에 다들 부딪히는 빈 응답

max_tokens: 30을 보냈더니 빈 문자열이 돌아왔다. 오류가 아니다. 요금까지 붙은 성공 응답이다:

{"content": "",
 "usage": {"prompt_tokens": 66, "completion_tokens": 30,
           "completion_tokens_details": {"reasoning_tokens": 30}}}

응답 토큰 30개, 전부 추론 토큰, 보이는 건 아무것도 없다. 모델은 답의 첫 글자를 내놓기도 전에 예산 전부를 생각하는 데 썼다.

해결책은 두 가지, 둘 다 같은 프롬프트에서 측정했다:

설정completion_tokensreasoning_tokenscontent
max_tokens: 303030"" — 비어 있음
max_tokens: 8002723"ok"
max_tokens: 50, effort: none1"ok"

상한을 올리면 된다. 모델에 필요한 건 총 27 토큰이었고, 30이라는 상한이 생각 도중에 잘라버린 것이기 때문이다.

추론을 끄면 더 낫다. 이 정도로 단순한 프롬프트라면 effort: none은 같은 답을 27개가 아니라 1개 토큰으로 내놨다. 27배 차이다. 짧은 출력을 대량으로 돌리는 작업에서는 100만당 $0.47이냐, 그 일부만 내느냐의 차이가 된다.

추론 모델 전반에 통하는 실무 규칙: max_tokens는 추론과 답변을 모두 덮어야 하고, 추론은 당신이 보든 안 보든 출력 단가로 청구된다. max_tokens를 답변 길이인 양 잡는 것이, 멀쩡한 모델을 고장 난 것처럼 보이게 만드는 원인이다.

$0.47이 Flash 등급에서 놓인 자리

모든 요금은 2026년 9월 6일 실시간 Ofox 카탈로그 기준:

모델입력 / 100만출력 / 100만컨텍스트최대 출력
bailian/qwen3.8-flash$0.15$0.471,131,072131,072
z-ai/glm-5.3-flash$0.15$0.501,048,576131,072
deepseek/deepseek-v4-flash-0731$0.44$1.321,000,000384,000
openai/gpt-5.6-luna$1.00$6.001,050,000128,000
google/gemini-3.8-flash$1.50$7.501,000,00065,536

Qwen 3.8 Flash와 GLM-5.3 Flash는 사실상 동률이다. 입력 단가는 같고 출력은 3센트 차이. 이 둘 사이에서는 가격이 결정 요인이 못 되므로, 실제 업무에 둘 다 돌려보는 게 맞다.

나머지와의 격차는 크다. Qwen 3.8 Flash의 출력은 DeepSeek V4 Flash보다 2.8배, Gemini 3.8 Flash보다 16배 싸다.

그 격차가 말해주지 않는 두 가지:

  • DeepSeek V4 Flash에는 독립 점수가 있고 Qwen 3.8 Flash에는 없다. DeepSeek V4 Flash 0731은 vals.ai SWE-Bench Verified에서 88.80%로 Claude Opus 4.8보다 높지만, Qwen 3.8 Flash는 그 리더보드에 아예 없다. 돈을 덜 내는 대신 뒷받침하는 공개 근거가 적은 모델을 쓰는 셈이다. 괜찮을 수도 있지만 알고는 있어야 한다.
  • DeepSeek V4 Flash는 384,000 토큰 응답을 허용한다. Qwen은 131,072다. 아주 긴 단일 출력을 생성한다면 단가보다 이 상한이 더 중요하다.

실제로 얼마나 드는가

$0.15 / $0.47 기준, 위의 추론 관련 주의사항을 반영하면:

작업토큰비용
짧은 분류 1만 건 (입력 200 / 출력 20, effort: none)입력 2M / 출력 0.2M$0.39
짧은 분류 1만 건 (입력 200 / 출력 300, 추론 켬)입력 2M / 출력 3M$1.71
100만 토큰 문서, 1회 처리입력 1M / 출력 5K$0.15

앞의 두 줄은 같은 작업이다. 차이는 추론이 켜져 있느냐뿐이고, 이런 형태의 작업에서 대략 4.3배다. 이 모델을 대량 파이프라인에 넣기 전에 머리에 넣어둘 숫자가 바로 이것이다.

호출 방법

curl -X POST https://api.ofox.io/v1/chat/completions \
  -H "Authorization: Bearer $OFOX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bailian/qwen3.8-flash",
    "messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
    "reasoning": {"effort": "none"},
    "max_tokens": 50
  }'

처음 몇 번은 usage.completion_tokens_details.reasoning_tokens를 읽어보자. 숙고가 필요 없는 작업에서 이 값이 completion_tokens의 큰 비중을 차지한다면, effort: none은 공짜로 줍는 돈이다.

이 모델은 텍스트뿐 아니라 이미지 입력도 받으므로 값싼 비전 작업 — 캡션 생성, OCR에 가까운 추출, 스크린샷 분류 — 도 커버한다. 위에 나온 비전 지원 Flash 모델들보다 훨씬 낮은 단가로 말이다.

쓰지 말아야 할 때

  • 선택 근거로 독립 벤치마크가 필요한 경우. Qwen 3.8 Flash는 vals.ai SWE-Bench에도, Artificial Analysis 지수에도 없다. DeepSeek V4 Flash는 $0.44 / $1.32에 공개된 88.80%가 있다.
  • 아주 긴 단일 응답을 생성하는 경우. 131,072 토큰이라는 응답 상한은 DeepSeek V4 Flash의 3분의 1이다.
  • 작업 자체가 정말 어려운 경우. 이건 Flash 등급 모델이다. 복잡한 추론의 정확도가 결과를 좌우한다면, 프런티어 모델 비교에서 추가 비용이 무엇을 사주는지 다룬다.
  • 이미 GLM-5.3 Flash를 쓰고 있는 경우. 출력 100만당 3센트는 이전할 이유가 못 된다.

관련 글

출처

가격, 컨텍스트 길이, 응답 상한, 지원 파라미터와 엔드포인트는 2026년 9월 6일 실시간 Ofox /v1/models 엔드포인트에서 읽었다. 추론 토큰 동작은 같은 날 bailian/qwen3.8-flash에 대한 세 번의 실시간 /v1/chat/completions 호출 결과로, 프롬프트는 동일하고 max_tokensreasoning.effort만 달리했다. 하루 동안 한 경로에서 얻은 작은 표본이지 사양이 아니므로, 파이프라인 규모를 정하기 전에 자신의 워크로드에서 직접 측정하길 권한다. DeepSeek V4 Flash의 SWE-Bench 수치는 vals.ai 출처이며 리더보드 갱신일은 2026-08-26이다.

자주 묻는 질문

Qwen 3.8 Flash 요금은 얼마인가요?
Ofox에서 bailian/qwen3.8-flash로 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.47입니다. 2026년 9월 6일 실시간 카탈로그에서 읽은 값입니다. 이 출력 단가는 Flash 등급 중 가장 낮습니다. GLM-5.3 Flash는 $0.50, DeepSeek V4 Flash 0731은 $1.32, GPT-5.6 Luna는 $6.00, Gemini 3.8 Flash는 $7.50입니다.
Qwen 3.8 Flash가 빈 content를 반환하는 이유는?
추론 모델이라서, 눈에 보이는 텍스트가 나오기 전에 지정한 토큰 상한이 추론으로 다 소모됐기 때문입니다. max_tokens 30을 보냈더니 content는 빈 문자열이었고 completion_tokens는 30, 그 전부가 reasoning_tokens였습니다. 상한을 올리거나 reasoning effort를 none으로 설정하세요. 이건 실패가 아니며 해당 토큰에도 요금이 붙습니다.
Qwen 3.8 Flash에서 추론 토큰을 안 쓰게 하려면?
reasoning을 전달하고 effort를 none으로 두세요. 같은 짧은 프롬프트에서 completion_tokens가 27에서 1로 줄었습니다. 사소한 호출 하나에서 27배 차이입니다. 분류·추출·라우팅처럼 숙고가 필요 없는 짧은 출력 작업이라면, 이 모델에서 가장 큰 비용 레버입니다.
Qwen 3.8 Flash의 컨텍스트 윈도는?
실시간 Ofox 카탈로그 기준 컨텍스트 1,131,072 토큰, 최대 응답 131,072 토큰입니다. 텍스트와 이미지를 입력으로 받아 텍스트를 반환하며, /v1/chat/completions와 /v1/responses 양쪽에서 쓸 수 있습니다.
Qwen 3.8 Flash가 DeepSeek V4 Flash보다 싼가요?
네, 출력 기준으로 약 2.8배 쌉니다. Qwen 3.8 Flash가 $0.15 / $0.47, DeepSeek V4 Flash 0731이 $0.44 / $1.32입니다. 다만 DeepSeek V4 Flash는 vals.ai SWE-Bench Verified에서 88.80%라는 공개 점수를 갖고 있고 Qwen 3.8 Flash는 그 리더보드에 아예 없습니다. 싼 대신 비교할 독립 점수가 없다는 뜻입니다.
Qwen 3.8 Flash의 모델 ID는?
Ofox에서 bailian/qwen3.8-flash이며 별칭은 qwen3.8-flash입니다. temperature, top_p, max_tokens, stop, tools, tool_choice, response_format, reasoning을 지원합니다.