Mistral Large 3 a US$ 1,50 vs gpt-oss-20b a US$ 0,13: vale a diferença?
Dois modelos abertos com IQ parecido, mas preço de saída quase 12 vezes maior. O que cada um entrega de verdade.
Saiu por US$ 1,50 o milhão de tokens de saída ou por US$ 0,13? A pergunta parece técnica demais, mas é ela que vai decidir o próximo deploy na sua empresa. Hoje o catálogo aberto traz dois modelos com índice de inteligência quase colado — 15,92 do Mistral Large 3 2512 contra 15,22 do gpt-oss-20b — e uma diferença de preço que não cabe no mesmo parágrafo sem levantar sobrancelha.
O que cada um é, sem release
O Mistral Large 3 2512 é um sparse MoE de 675B parâmetros totais, com 41B ativos por passada, lançado em 1º de dezembro de 2025 sob Apache 2.0. Francês, multimodal (aceita texto, imagem e arquivo, devolve texto) e com janela de 262 mil tokens. É o flagship aberto da Mistral.
O gpt-oss-20b é o irmão pequeno do gpt-oss-120b da OpenAI, lançado em 5 de agosto de 2025, também Apache 2.0. São 21B totais com só 3,6B ativos por forward — é um MoE enxuto, pensado para rodar barato. Texto puro, 131 mil tokens de contexto, e marcado como modelo de raciocínio.
O preço que aparece na fatura
Aqui a conversa fica interessante. O Mistral cobra US$ 0,50 por milhão de tokens de entrada e US$ 1,50 por milhão de saída, com cache a US$ 0,05. O gpt-oss-20b cobra US$ 0,03 de entrada, US$ 0,13 de saída e US$ 0,03 de cache. Em uma tarefa típica 1:4 (entrada quatro vezes menor que saída), o custo blended do Mistral fica em US$ 0,75 por milhão e o do gpt-oss-20b em US$ 0,0925 — ou seja, o modelo da OpenAI custa cerca de um oitavo do Mistral para o mesmo volume.
Onde cada um realmente ganha
Olhando os números de capacidade: coding quaseempatado (20,07 do Mistral contra 20,70 do gpt-oss-20b), agentic 5,52 contra 3,10 a favor do francês, velocidade 77,45 tokens por segundo contra 112,6 do americano. O gpt-oss-20b entrega mais tokens por segundo mesmo sendo menor — coerente com 3,6B ativos contra 41B.
A diferença prática está em três coisas. Primeiro, multimodalidade: o Mistral aceita imagem e arquivo, o gpt-oss-20b só texto. Se o seu fluxo precisa ler PDF, print de erro ou foto de produto, o gpt-oss-20b está fora. Segundo, contexto: 262 mil contra 131 mil tokens — o Mistral aguenta bases de código inteiras ou documentos longos onde o outro corta. Terceiro, raciocínio: o gpt-oss-20b é marcado como reasoning, o Mistral Large 3 não.
| Critério | Mistral Large 3 2512 | gpt-oss-20b |
|---|---|---|
| Índice de inteligência | 15.9 | 15.2 |
| Entrada US$/M | 0.5 | 0.03 |
| Saída US$/M | 1.5 | 0.13 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 77 | 113 |
| Índice de código | 20.1 | 20.7 |
| Índice agêntico | 5.5 | 3.1 |
Para quem cada um vale
Escolhe o Mistral Large 3 2512 se você precisa de janela grande, multimodalidade ou agente rodando em fluxos longos. É o caso de quem joga uma base de código inteira no prompt, anexa screenshots de bug ou constrói um agente que precisa planejar antes de agir. O preço de US$ 1,50 por milhão de saída pesa, mas a Apache 2.0 deixa você hospedar e ajustar se quiser cortar custo.
Escolhe o gpt-oss-20b se o seu gargalo é volume e a tarefa cabe em texto puro. Chatbots de atendimento, classificação, geração de resumo, extração de JSON, qualquer coisa que rode em loop com prompts curtos. Os US$ 0,13 de saída e os 112 tokens por segundo fazem dele um motor de produção barato — e como é reasoning, aguenta problemas que pedem cadeia de pensamento sem você pagar extra.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O detalhe que ninguém coloca no slide
Os dois são open weights e os dois rodam self-hosted. Se você tem GPU sobrando, o preço de API vira teto, não custo real. Nesse cenário, o gpt-oss-20b com 3,6B ativos cabe em uma única GPU moderna, enquanto os 41B ativos do Mistral pedem cluster. Para quem vai hospedar, o cálculo é outro: o modelo menor ganha em infra, o maior ganha em capacidade bruta.
Pague US$ 1,50 por milhão de saída do Mistral quando precisar de multimodalidade, contexto longo ou agente pesado; pague US$ 0,13 do gpt-oss-20b quando o volume for alto, o prompt couber em texto e você quiser raciocínio barato.
Perguntas frequentes
Mistral Large 3 2512 é melhor que gpt-oss-20b em código?
Quaseempatam: 20,07 contra 20,70 no índice de coding. A diferença está no entorno — o Mistral aceita imagem e arquivo, o gpt-oss-20b só texto.
Quanto economizo trocando Mistral Large 3 pelo gpt-oss-20b?
Em uma proporção 1:4 de entrada e saída, o custo blended cai de US$ 0,75 para US$ 0,0925 por milhão de tokens — cerca de oito vezes mais barato.
Posso rodar os dois localmente?
Sim, ambos são Apache 2.0 e open weights. O gpt-oss-20b roda em uma GPU moderna pelos 3,6B ativos; o Mistral Large 3, com 41B ativos, pede cluster.