StepFun entra no catálogo com modelo de 196B a US$ 1,15 por milhão de tokens
Step 3.7 Flash é multimodal e tem pesos abertos, mas fica longe do topo de inteligência — e isso muda o cálculo de quem paga a API.
Você não vai colocar o Step 3.7 Flash no mesmo grupo do Gemini 3.1 Pro ou do GPT-5.3-Codex. Mas talvez seja exatamente esse o ponto: a StepFun não veio brigar pelo topo, veio brigar pela sua fatura.
Hoje entrou no catálogo um modelo novo da criadora chinesa StepFun, o Step 3.7 Flash. É multimodal nativo — aceita texto, imagem e vídeo, devolve texto —, tem 196 bilhões de parâmetros totais numa arquitetura Mixture-of-Experts que ativa só cerca de 11B por inferência, e custa US$ 1,15 por milhão de tokens de saída. O cache sai por US$ 0,04. Os pesos são abertos.
O que o preço significa de verdade
US$ 1,15 por milhão de tokens de saída parece barato até você comparar com o que já está sentado no catálogo. O DeepSeek V4 Pro, o modelo chinês mais barato acima de IQ 45, cobra US$ 1,74 pela mesma unidade. O Gemini 3.5 Flash cobra US$ 9. O Gemini 3.1 Pro Preview, US$ 12. O GPT-5.3-Codex, US$ 14.
Traduzindo: para cada milhão de tokens que sai do modelo, o Step 3.7 Flash custa menos que o DeepSeek, custa uma fração do Gemini Flash e é quase 13 vezes mais barato que o Codex. A conta muda de figura quando você roda agente, sumariza vídeo ou faz classificação em massa.
Onde ele perde — e onde ele não chega
O índice de inteligência Artificial Analysis do Step 3.7 Flash é 30,9. Em coding, marca 39,6. Em agentic, 21,7. Compare com o topo da lista de hoje: Gemini 3.1 Pro Preview está em 47,7, Gemini 3.5 Flash em 46,7, GPT-5.3-Codex em 45,5, DeepSeek V4 Pro em 45,3. A diferença não é de quelques pontos percentuais — é de outro andar.
Isso responde logo a pergunta: para quem vale? Para quem roda volume alto em tarefas onde 30,9 de inteligência basta — classificação, extração, sumarização de imagem e vídeo, primeiro passe de código antes de revisão humana. Para quem não vale: quem precisa do modelo mais capaz para raciocínio pesado, planejamento de agente complexo ou geração de código crítica. Nesses casos, o DeepSeek V4 Pro a US$ 1,74 entrega quase 15 pontos a mais de inteligência por um custo ainda baixo.
O detalhe multimodal que pesa
A maioria dos modelos baratos do catálogo é só texto. O Step 3.7 Flash entende imagem e vídeo nativamente, sem pipeline separado. Janela de contexto de 262 mil tokens. É um MoE eficiente: 196B no papel, 11B ativos por passada. Pense num motor com 196 cavalos de potência declarada mas que só usa 11 deles por vez — você paga manutenção do conjunto grande, mas o consumo é do conjunto pequeno.
| Campo | Valor |
|---|---|
| Identificador | stepfun/step-3.7-flash |
| Criador | stepfun |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 1.15 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.040 / M (80% de desconto) |
| Índice de inteligência (AA) | 30.9 |
| Índice de código | 39.6 |
| Índice agêntico | 21.7 |
| Parâmetros | 198B (11B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 93 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O tabuleiro em 28 de maio
O catálogo hoje tem mais de 451 modelos de 61 criadores. Nos últimos 30 dias, 20 modelos novos entraram. O topo de inteligência segue dominado por Google e OpenAI, com a DeepSeek colada logo abaixo. A StepFun entra pela porta dos fundos do ranking, mas com uma proposta que ninguém nessa faixa de preço oferecia até agora: multimodal nativo, pesos abertos e custo de saída abaixo de US$ 1,20.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Step 3.7 Flash (o novo) | 30.9 | 0.2 | 1.15 | 262k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| Gemini 3.5 Flash | 46.7 | 1.5 | 9 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| DeepSeek V4 Pro 0423 | 45.3 | 1.0423 | 2.0845 | 1.05M |
Para quem paga a conta
Se você já roda Flash ou Haiku para classificar, extrair ou pré-processar entrada multimodal, vale testar o Step 3.7 Flash como drop-in: o custo de saída cai e a janela de contexto sobe. Se seu gargalo é qualidade de raciocínio, mantenha o DeepSeek V4 Pro ou o Gemini Flash no caminho crítico — a economia de centavos não compensa a diferença de 15 pontos de inteligência.
Teste o Step 3.7 Flash em tarefas multimodais de alto volume onde 30,9 de inteligência basta; para raciocínio crítico, o DeepSeek V4 Pro ainda entrega 15 pontos a mais por pouco mais.
Perguntas frequentes
Quanto custa o Step 3.7 Flash por milhão de tokens?
Custa US$ 1,15 por milhão de tokens de saída, US$ 0,20 por milhão de tokens de entrada e US$ 0,04 por milhão de tokens em cache. É mais barato que o DeepSeek V4 Pro (US$ 1,74) e bem mais barato que o Gemini 3.5 Flash (US$ 9).
O Step 3.7 Flash é melhor que o DeepSeek V4 Pro?
Não em inteligência: o índice Artificial Analysis do Step é 30,9 contra 45,3 do DeepSeek. O diferencial do Step está no preço mais baixo e na multimodalidade nativa (texto, imagem e vídeo).
Os pesos do Step 3.7 Flash são abertos?
Sim, o modelo tem pesos abertos. A arquitetura é Mixture-of-Experts com 196B parâmetros totais e cerca de 11B ativos por inferência.