Mixtral 8x22B-Instruct: quando o open-source vence em custo-benefício
A Mistral AI disponibilizou ontem o Mixtral 8x22B-Instruct, a versão ajustada para instruções do seu modelo mixture-of-experts flagship. O modelo usa 8 especialistas de 22B cada, com 2 ativos por token — totalizando ~44B parâmetros efetivos durante inferência.
Em benchmarks de seguimento de instruções (MT-Bench, AlpacaEval), o modelo fica a 4 pontos percentuais do Claude Opus 5.5 e 2 pontos acima do Llama 4 70B. Mas o argumento real é econômico:
- Custo por 1M tokens (entrada): $0.60 (Mixtral) vs $15.00 (Opus) — 25x mais barato
- Custo de self-hosting em H100: ~$0.08/1M tokens (mixto de aluguel spot)
- Throughput em vLLM: ~3.500 tokens/s em H100 8x
Para times brasileiros com orçamento limitado, o Mixtral 8x22B-Instruct é a primeira opção que entrega qualidade de produção a custo operacional realista. A disponibilidade via API da Mistral, Together AI e AWS Bedrock torna a adoção simples.
A única ressalva: latência de primeira resposta é maior que modelos densos (cold-start dos especialistas). Em workloads interativos, considerar Mixtral Small como fallback.