Step 3.7 Flash quer brigar com Gemma multimodal, mas cobra 3,4 vezes mais
Modelo da StepFun é multimodal e open weights, roda a 92,9 de velocidade — mas o IQ 30,9 e o preço de US$ 1,15 de saída enfraquecem o argumento.
A StepFun publicou nesta quinta-feira (28) o Step 3.7 Flash, e o nome Flash já acende um alerta. No mercado atual, "Flash" virou sinônimo de barato e rápido — vide Gemini 3.5 Flash, MiMo-V2-Flash, Gemma 4 26B A4B. O anúncio da StepFun tem 198 bilhões de parâmetros totais, com só 11 bilhões ativos por token, entende imagem e vídeo, e é open weights. Tudo isso é verdade. O que também é verdade é o preço: US$ 1,15 por milhão de tokens de saída. É mais do que você paga pelo Xiaomi MiMo-V2.5 Pro, que entrega IQ 42,9 contra 30,9 deste. É 3,4 vezes mais caro que o Gemma 4 31B, que também é multimodal.
| Campo | Valor |
|---|---|
| Identificador | stepfun/step-3.7-flash |
| Criador | stepfun |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 1.15 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.040 / M (80% de desconto) |
| Índice de inteligência (AA) | 30.9 |
| Índice de código | 39.6 |
| Índice agêntico | 21.7 |
| Parâmetros | 198B (11B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 93 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
A conta precisa ser olhada antes da empolgação. O Step 3.7 Flash tem IQ 30,9 e cobra US$ 1,15 de saída. O MiMo-V2.5 Pro, que está entre os cinco mais inteligentes do catálogo de hoje, cobra US$ 0,87 — e entrega IQ 42,9. Para cada dólar gasto em saída, o MiMo-V2.5 Pro devolve 49 unidades de IQ; o Step 3.7 Flash devolve 27. Em outras palavras: o "Flash" da StepFun cobra caro pelo que entrega em inteligência bruta.
Onde ele entra no tabuleiro de maio
O topo do catálogo hoje é dominado por Google, OpenAI e DeepSeek. Gemini 3.1 Pro Preview (IQ 47,7, US$ 12 de saída), Gemini 3.5 Flash (IQ 46,7, US$ 9), GPT-5.3-Codex (IQ 45,5, US$ 14) e DeepSeek V4 Pro (IQ 45,3, US$ 1,74) formam a primeira fila. O Step 3.7 Flash está 17 pontos de IQ abaixo do quinto colocado — e cobrando mais do que o quarto. O catálogo completo tem mais de 451 modelos hoje, e este entra pela porta de trás em custo-benefício.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
A vantagem real é multimodal + open weights + chinês
Se você tira o filtro "texto puro", a história muda. O MiMo-V2-Flash, o Ring-2.6-1T e a maioria dos modelos chineses de código aberto só entendem texto. O Step 3.7 Flash entende imagem e vídeo de forma nativa, com um codificador de visão acoplado aos 196 bilhões do backbone de linguagem. Entre os pares que também são multimodais, a briga é com os dois Gemma 4 da Google: o 31B (IQ 29,7, US$ 0,34 de saída) e o 26B A4B (IQ 26,1, US$ 0,34). Em ambos os casos o modelo da StepFun entrega mais IQ — mas a 3,4× o preço do Gemma 4 31B. Em custo por unidade de IQ entregue, o Gemma 4 31B é o vencedor claro.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Step 3.7 Flash (o novo) | 30.9 | 0.2 | 1.15 | 262k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| Gemma 4 31B | 29.7 | 0.09 | 0.34 | 262k |
| Gemma 4 26B A4B | 26.1 | 0.07 | 0.34 | 262k |
| Ring-2.6-1T | 31.7 | 0.075 | 0.625 | 262k |
Velocidade: 92,9 é um trunfo legítimo
O número 92,9 de velocidade não é marketing. É quase o triplo do Gemma 4 31B (35,1) e bate de frente com o Ring-2.6-1T (128,3), que é texto puro. Se o seu caso de uso é multimodal com vídeo e latência importa — por exemplo, automação de análise de cenas em tempo quase real — o Step 3.7 Flash é, hoje, o multimodal open weights mais rápido do catálogo entre os comparados. O Ring é mais rápido, mas não lê vídeo.
Para quem vale, para quem não
Vale para você se: precisa entender vídeo nativamente, quer rodar open weights em infra chinesa ou asiática, e tem orçamento para pagar entre 3× e 5× mais por token que rivais de IQ parecido. A latência baixa é o argumento principal.
Não muda nada para você se: a maior parte do seu tráfego é texto, se você já está pagando US$ 0,30 de saída em modelos como MiMo-V2-Flash e Ring-2.6-1T (ambos entregam mais IQ), ou se você roda nos EUA e pode usar Gemma 4 31B sem restrição geopolítica. Também não vale se "melhor IQ pelo menor preço" é seu critério — nesse eixo, o MiMo-V2.5 Pro a US$ 0,87 segue imbatível em maio de 2026.
O que fazer com isso
A pergunta certa não é "o Step 3.7 Flash é bom?". É "eu já tenho Gemma 4 31B ou MiMo-V2-Flash rodando, e alguma coisa no Step 3.7 Flash me faz trocar?". Para a maioria dos casos, a resposta é não. A exceção é vídeo com latência baixa em ambiente open weights chinês — só essa.
Só vale trocar pelo Step 3.7 Flash se você precisa entender vídeo com latência baixa e roda open weights em ambiente chinês — em qualquer outro cenário, o Gemma 4 31B ou o MiMo-V2-Flash entregam mais por menos.
Perguntas frequentes
Step 3.7 Flash é melhor que o Gemma 4 31B?
Depende do que você prioriza. O Step 3.7 Flash entrega IQ 30,9 contra 29,7 do Gemma 4 31B e roda 2,6 vezes mais rápido (92,9 vs 35,1). Mas custa 3,4 vezes mais por token de saída. Se latência e vídeo importam, o Step vence. Se preço importa, o Gemma 4 31B vence.
Para que serve o Step 3.7 Flash?
Serve para casos em que você precisa entender imagem e vídeo com latência baixa em ambiente open weights, e tem orçamento para pagar entre 3× e 5× mais por token que alternativas de IQ parecido. Para texto puro, o MiMo-V2-Flash e o Ring-2.6-1T entregam mais inteligência por menos.
Quanto custa rodar o Step 3.7 Flash?
Pela API custa US$ 0,20 por milhão de tokens de entrada e US$ 1,15 por milhão de tokens de saída, com cache a US$ 0,04. Como o modelo é open weights, você também pode hospedar em GPU própria — desde que tenha a infra para os 198 bilhões de parâmetros totais.