FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

StepFun entra no catálogo com modelo de 196B a US$ 1,15 por milhão de tokens

Step 3.7 Flash é multimodal e tem pesos abertos, mas fica longe do topo de inteligência — e isso muda o cálculo de quem paga a API.

Redação FalaVIP IA 3 min de leitura
US$ 1,15por milhão de tokens de saída
196B parâmetrostotais, com 11B ativos por inferência
30,9índice de inteligência Artificial Analysis

Você não vai colocar o Step 3.7 Flash no mesmo grupo do Gemini 3.1 Pro ou do GPT-5.3-Codex. Mas talvez seja exatamente esse o ponto: a StepFun não veio brigar pelo topo, veio brigar pela sua fatura.

Hoje entrou no catálogo um modelo novo da criadora chinesa StepFun, o Step 3.7 Flash. É multimodal nativo — aceita texto, imagem e vídeo, devolve texto —, tem 196 bilhões de parâmetros totais numa arquitetura Mixture-of-Experts que ativa só cerca de 11B por inferência, e custa US$ 1,15 por milhão de tokens de saída. O cache sai por US$ 0,04. Os pesos são abertos.

O que o preço significa de verdade

US$ 1,15 por milhão de tokens de saída parece barato até você comparar com o que já está sentado no catálogo. O DeepSeek V4 Pro, o modelo chinês mais barato acima de IQ 45, cobra US$ 1,74 pela mesma unidade. O Gemini 3.5 Flash cobra US$ 9. O Gemini 3.1 Pro Preview, US$ 12. O GPT-5.3-Codex, US$ 14.

Preço de saída (US$ por milhão de tokens)
Step 3.7 Flash1,15Gemini 3.1 Pro Preview12Gemini 3.5 Flash9GPT-5.3-Codex14DeepSeek V4 Pro 04232,0845US$/M
Fonte: OpenRouter

Traduzindo: para cada milhão de tokens que sai do modelo, o Step 3.7 Flash custa menos que o DeepSeek, custa uma fração do Gemini Flash e é quase 13 vezes mais barato que o Codex. A conta muda de figura quando você roda agente, sumariza vídeo ou faz classificação em massa.

Onde ele perde — e onde ele não chega

O índice de inteligência Artificial Analysis do Step 3.7 Flash é 30,9. Em coding, marca 39,6. Em agentic, 21,7. Compare com o topo da lista de hoje: Gemini 3.1 Pro Preview está em 47,7, Gemini 3.5 Flash em 46,7, GPT-5.3-Codex em 45,5, DeepSeek V4 Pro em 45,3. A diferença não é de quelques pontos percentuais — é de outro andar.

Índice de inteligência (Artificial Analysis)
Step 3.7 Flash30,9Gemini 3.1 Pro Preview47,7Gemini 3.5 Flash46,7GPT-5.3-Codex45,5DeepSeek V4 Pro 042345,3índice
Fonte: Artificial Analysis
Inteligência × preço de saída
Step 3.7 FlashGemini 3.1 Pro PreviewGemini 3.5 FlashGPT-5.3-CodexDeepSeek V4 Pro 0423US$ por milhão (saída, escala log)índice de inteligência

Isso responde logo a pergunta: para quem vale? Para quem roda volume alto em tarefas onde 30,9 de inteligência basta — classificação, extração, sumarização de imagem e vídeo, primeiro passe de código antes de revisão humana. Para quem não vale: quem precisa do modelo mais capaz para raciocínio pesado, planejamento de agente complexo ou geração de código crítica. Nesses casos, o DeepSeek V4 Pro a US$ 1,74 entrega quase 15 pontos a mais de inteligência por um custo ainda baixo.

O detalhe multimodal que pesa

A maioria dos modelos baratos do catálogo é só texto. O Step 3.7 Flash entende imagem e vídeo nativamente, sem pipeline separado. Janela de contexto de 262 mil tokens. É um MoE eficiente: 196B no papel, 11B ativos por passada. Pense num motor com 196 cavalos de potência declarada mas que só usa 11 deles por vez — você paga manutenção do conjunto grande, mas o consumo é do conjunto pequeno.

Ficha técnica — Step 3.7 Flash
CampoValor
Identificadorstepfun/step-3.7-flash
Criadorstepfun
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 1.15 / M tokens
Janela de contexto262k
Modalidadetext+image+video->text
Leitura de cacheUS$ 0.040 / M (80% de desconto)
Índice de inteligência (AA)30.9
Índice de código39.6
Índice agêntico21.7
Parâmetros198B (11B ativos por token)
Pesosabertos
Velocidade de saída93 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O tabuleiro em 28 de maio

O catálogo hoje tem mais de 451 modelos de 61 criadores. Nos últimos 30 dias, 20 modelos novos entraram. O topo de inteligência segue dominado por Google e OpenAI, com a DeepSeek colada logo abaixo. A StepFun entra pela porta dos fundos do ranking, mas com uma proposta que ninguém nessa faixa de preço oferecia até agora: multimodal nativo, pesos abertos e custo de saída abaixo de US$ 1,20.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 451 modelos disponíveis no catálogo nesta data.
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Step 3.7 Flash (o novo)30.90.21.15262k
Gemini 3.1 Pro Preview47.72121.05M
Gemini 3.5 Flash46.71.591.05M
GPT-5.3-Codex45.51.7514400k
DeepSeek V4 Pro 042345.31.04232.08451.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para quem paga a conta

Se você já roda Flash ou Haiku para classificar, extrair ou pré-processar entrada multimodal, vale testar o Step 3.7 Flash como drop-in: o custo de saída cai e a janela de contexto sobe. Se seu gargalo é qualidade de raciocínio, mantenha o DeepSeek V4 Pro ou o Gemini Flash no caminho crítico — a economia de centavos não compensa a diferença de 15 pontos de inteligência.

Em uma frase

Teste o Step 3.7 Flash em tarefas multimodais de alto volume onde 30,9 de inteligência basta; para raciocínio crítico, o DeepSeek V4 Pro ainda entrega 15 pontos a mais por pouco mais.

Perguntas frequentes

Quanto custa o Step 3.7 Flash por milhão de tokens?

Custa US$ 1,15 por milhão de tokens de saída, US$ 0,20 por milhão de tokens de entrada e US$ 0,04 por milhão de tokens em cache. É mais barato que o DeepSeek V4 Pro (US$ 1,74) e bem mais barato que o Gemini 3.5 Flash (US$ 9).

O Step 3.7 Flash é melhor que o DeepSeek V4 Pro?

Não em inteligência: o índice Artificial Analysis do Step é 30,9 contra 45,3 do DeepSeek. O diferencial do Step está no preço mais baixo e na multimodalidade nativa (texto, imagem e vídeo).

Os pesos do Step 3.7 Flash são abertos?

Sim, o modelo tem pesos abertos. A arquitetura é Mixture-of-Experts com 196B parâmetros totais e cerca de 11B ativos por inferência.

Leia também