FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Step 3.7 Flash quer brigar com Gemma multimodal, mas cobra 3,4 vezes mais

Modelo da StepFun é multimodal e open weights, roda a 92,9 de velocidade — mas o IQ 30,9 e o preço de US$ 1,15 de saída enfraquecem o argumento.

Redação FalaVIP IA 3 min de leitura
US$ 1,15por milhão de tokens de saída
3,4×mais caro que o Gemma 4 31B multimodal
92,9de velocidade, o maior entre os multimodais open weights comparados

A StepFun publicou nesta quinta-feira (28) o Step 3.7 Flash, e o nome Flash já acende um alerta. No mercado atual, "Flash" virou sinônimo de barato e rápido — vide Gemini 3.5 Flash, MiMo-V2-Flash, Gemma 4 26B A4B. O anúncio da StepFun tem 198 bilhões de parâmetros totais, com só 11 bilhões ativos por token, entende imagem e vídeo, e é open weights. Tudo isso é verdade. O que também é verdade é o preço: US$ 1,15 por milhão de tokens de saída. É mais do que você paga pelo Xiaomi MiMo-V2.5 Pro, que entrega IQ 42,9 contra 30,9 deste. É 3,4 vezes mais caro que o Gemma 4 31B, que também é multimodal.

Ficha técnica — Step 3.7 Flash
CampoValor
Identificadorstepfun/step-3.7-flash
Criadorstepfun
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 1.15 / M tokens
Janela de contexto262k
Modalidadetext+image+video->text
Leitura de cacheUS$ 0.040 / M (80% de desconto)
Índice de inteligência (AA)30.9
Índice de código39.6
Índice agêntico21.7
Parâmetros198B (11B ativos por token)
Pesosabertos
Velocidade de saída93 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

A conta precisa ser olhada antes da empolgação. O Step 3.7 Flash tem IQ 30,9 e cobra US$ 1,15 de saída. O MiMo-V2.5 Pro, que está entre os cinco mais inteligentes do catálogo de hoje, cobra US$ 0,87 — e entrega IQ 42,9. Para cada dólar gasto em saída, o MiMo-V2.5 Pro devolve 49 unidades de IQ; o Step 3.7 Flash devolve 27. Em outras palavras: o "Flash" da StepFun cobra caro pelo que entrega em inteligência bruta.

Inteligência × preço de saída
Step 3.7 FlashMiMo-V2-FlashGemma 4 31BGemma 4 26B A4B Ring-2.6-1TUS$ por milhão (saída, escala log)índice de inteligência

Onde ele entra no tabuleiro de maio

O topo do catálogo hoje é dominado por Google, OpenAI e DeepSeek. Gemini 3.1 Pro Preview (IQ 47,7, US$ 12 de saída), Gemini 3.5 Flash (IQ 46,7, US$ 9), GPT-5.3-Codex (IQ 45,5, US$ 14) e DeepSeek V4 Pro (IQ 45,3, US$ 1,74) formam a primeira fila. O Step 3.7 Flash está 17 pontos de IQ abaixo do quinto colocado — e cobrando mais do que o quarto. O catálogo completo tem mais de 451 modelos hoje, e este entra pela porta de trás em custo-benefício.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 451 modelos disponíveis no catálogo nesta data.

A vantagem real é multimodal + open weights + chinês

Se você tira o filtro "texto puro", a história muda. O MiMo-V2-Flash, o Ring-2.6-1T e a maioria dos modelos chineses de código aberto só entendem texto. O Step 3.7 Flash entende imagem e vídeo de forma nativa, com um codificador de visão acoplado aos 196 bilhões do backbone de linguagem. Entre os pares que também são multimodais, a briga é com os dois Gemma 4 da Google: o 31B (IQ 29,7, US$ 0,34 de saída) e o 26B A4B (IQ 26,1, US$ 0,34). Em ambos os casos o modelo da StepFun entrega mais IQ — mas a 3,4× o preço do Gemma 4 31B. Em custo por unidade de IQ entregue, o Gemma 4 31B é o vencedor claro.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Step 3.7 Flash (o novo)30.90.21.15262k
MiMo-V2-Flash34.00.10.3262k
Gemma 4 31B29.70.090.34262k
Gemma 4 26B A4B 26.10.070.34262k
Ring-2.6-1T31.70.0750.625262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Velocidade: 92,9 é um trunfo legítimo

O número 92,9 de velocidade não é marketing. É quase o triplo do Gemma 4 31B (35,1) e bate de frente com o Ring-2.6-1T (128,3), que é texto puro. Se o seu caso de uso é multimodal com vídeo e latência importa — por exemplo, automação de análise de cenas em tempo quase real — o Step 3.7 Flash é, hoje, o multimodal open weights mais rápido do catálogo entre os comparados. O Ring é mais rápido, mas não lê vídeo.

Para quem vale, para quem não

Vale para você se: precisa entender vídeo nativamente, quer rodar open weights em infra chinesa ou asiática, e tem orçamento para pagar entre 3× e 5× mais por token que rivais de IQ parecido. A latência baixa é o argumento principal.

Não muda nada para você se: a maior parte do seu tráfego é texto, se você já está pagando US$ 0,30 de saída em modelos como MiMo-V2-Flash e Ring-2.6-1T (ambos entregam mais IQ), ou se você roda nos EUA e pode usar Gemma 4 31B sem restrição geopolítica. Também não vale se "melhor IQ pelo menor preço" é seu critério — nesse eixo, o MiMo-V2.5 Pro a US$ 0,87 segue imbatível em maio de 2026.

O que fazer com isso

A pergunta certa não é "o Step 3.7 Flash é bom?". É "eu já tenho Gemma 4 31B ou MiMo-V2-Flash rodando, e alguma coisa no Step 3.7 Flash me faz trocar?". Para a maioria dos casos, a resposta é não. A exceção é vídeo com latência baixa em ambiente open weights chinês — só essa.

Em uma frase

Só vale trocar pelo Step 3.7 Flash se você precisa entender vídeo com latência baixa e roda open weights em ambiente chinês — em qualquer outro cenário, o Gemma 4 31B ou o MiMo-V2-Flash entregam mais por menos.

Perguntas frequentes

Step 3.7 Flash é melhor que o Gemma 4 31B?

Depende do que você prioriza. O Step 3.7 Flash entrega IQ 30,9 contra 29,7 do Gemma 4 31B e roda 2,6 vezes mais rápido (92,9 vs 35,1). Mas custa 3,4 vezes mais por token de saída. Se latência e vídeo importam, o Step vence. Se preço importa, o Gemma 4 31B vence.

Para que serve o Step 3.7 Flash?

Serve para casos em que você precisa entender imagem e vídeo com latência baixa em ambiente open weights, e tem orçamento para pagar entre 3× e 5× mais por token que alternativas de IQ parecido. Para texto puro, o MiMo-V2-Flash e o Ring-2.6-1T entregam mais inteligência por menos.

Quanto custa rodar o Step 3.7 Flash?

Pela API custa US$ 0,20 por milhão de tokens de entrada e US$ 1,15 por milhão de tokens de saída, com cache a US$ 0,04. Como o modelo é open weights, você também pode hospedar em GPU própria — desde que tenha a infra para os 198 bilhões de parâmetros totais.

Leia também