−15 % sur les recharges — code OFOXAI2608En savoir plus
Qwen

Qwen Flash

Chat
bailian/qwen-flash

Qwen Flash est le modèle le plus rapide et le moins coûteux de la famille Qwen d'Alibaba, servi via Dashscope et conçu pour les tâches sensibles à la latence. Il offre une inférence ultrarapide tout en prenant en charge l'appel d'outils (function calling), la mise en cache des prompts et la recherche web. Fenêtre de contexte : 1M tokens, sortie : 32K. Cette fenêtre de 1M tokens lui permet de parcourir de longs documents en une seule passe, et la mise en cache des prompts garde les instructions répétées peu coûteuses dans les pipelines à fort volume. Disponible via les protocoles OpenAI et Anthropic.

Fenêtre de contexte
1M
Tokens de sortie max
32K
Publié
2025-07-28
Capacités
Function CallingPrompt CachingRecherche web
Fournisseurs disponibles
BaiLianAliyun
Protocoles supportés
OpenAIopenaiAnthropicanthropic

Providers

BaiLianAliyun
Tokens d'entrée
$0.022/M
Tokens de sortie
$0.22/M
Lecture cache
$0.0043/M
Écriture cache
$0.027/M
Recherche web
$0.01/R
Protocols
OpenAIopenai/v1/chat/completions/v1/responses
Anthropicanthropic

Exemples de code

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.io/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="bailian/qwen-flash",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Questions fréquentes

Qwen Flash sur Ofox.ai coûte $0.022/M par million de tokens d'entrée et $0.22/M par million de tokens de sortie. Paiement à l'usage, sans frais mensuels.