Cohere estreia a família North com modelo de código grátis — e ele não compete pelo topo
North Mini Code chega com 30B de parâmetros, raciocínio ligado e preço zero. A pergunta é para quem ele serve de verdade.
O grátis que não é o mais barato
Você já viu lançamento de modelo gratuito antes. A conta, normalmente, é simples: preço zero, alguma troca em capacidade, todo mundo sai feliz. O North Mini Code, primeiro modelo da nova família North da Cohere, segue essa cartilha — 30B de parâmetros totais, só 3B ativos por inferência, pesos abertos, raciocínio ligado e tarifa US$ 0 por milhão de token, tanto na entrada quanto na saída. Gratuito mesmo, sem asterisco.
Mas dá uma olhada no índice de inteligência de hoje: 20,169. Isso coloca o modelo bem longe do topo, onde aparece Claude Fable 5 com 62,073, GLM 5.2 com 52,641, Gemini 3.1 Pro Preview com 47,738 e Gemini 3.5 Flash com 46,673. Em coding, a nota do North Mini Code é 36,452 — útil, mas não brilhante no cenário geral.
Para que ele existe, então?
A descrição oficial diz tudo: é o primeiro modelo agêntico de código da Cohere, otimizado para fluxos de coding onde o orçamento importa mais que a nota em benchmark. Sparse mixture-of-experts com 30B totais e 3B ativos significa que cada consulta liga só uma fração da rede — o resto fica parado. É o mesmo truque que a NVIDIA usa no Nemotron 3 Nano e que a própria OpenAI aplica nos gpt-oss. A diferença é que aqui o preço é zero.
Em agentic, o índice fica em 3,119. Em coding, 36,452. Em velocidade, 86,53 tokens por segundo. Contexto de 256 mil tokens. País de origem: Canadá. Pesos abertos, então você pode hospedar onde quiser e ignorar a camada gratuita se precisar.
| Campo | Valor |
|---|---|
| Identificador | cohere/north-mini-code:free |
| Criador | cohere |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 256k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 20.2 |
| Índice de código | 36.5 |
| Índice agêntico | 3.1 |
| Parâmetros | 30B (3B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 87 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Onde ele ganha e onde ele perde
Compare com o que já estava no catálogo:
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| North Mini Code (free) (o novo) | 20.2 | 0 | 0 | 256k |
| Nemotron 3 Nano Omni (free) | 15.0 | 0 | 0 | 256k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Nemotron 3 Nano 30B A3B | 14.5 | 0.05 | 0.2 | 262k |
Olhando para os pares, a história fica clara. O NVIDIA Nemotron 3 Nano Omni gratuito (lançado em abril) marca 13,754 em coding — quase três vezes menos que o North Mini Code. O gpt-oss-20b, da OpenAI, paga US$ 0,13 por milhão de token de saída e entrega 20,697 em coding. O gpt-oss-120b, do mesmo criador, custa US$ 0,17 de saída e sobe para 30,441 em coding — ainda abaixo do North Mini Code, que cobra zero.
Ou seja: para quem quer rodar tarefas de código em escala sem abrir a fatura, o North Mini Code na faixa gratuita é hoje uma das melhores notas em coding entre os modelos sem custo. A velocidade de 86,53 t/s não impressiona — o Nemotron Omni gratuito entrega 326,83 t/s — mas a nota compensa.
Quando NÃO vale a pena
Se você precisa de raciocínio pesado, planejamento multi-etapa ou agente que segura contexto complexo por horas, o agentic de 3,119 avisa que o North Mini Code não é o lugar. Para isso, o gpt-oss-120b entrega 13,425 em agentic pelo mesmo preço de US$ 0,17 de saída — quatro vezes mais capacidade de agente por quase nada.
Se a sua carga é multimodal — texto, imagem, áudio, vídeo entrando — o modelo é só text→text. O Nemotron Omni gratuito aceita tudo isso e roda a 326 t/s, embora com nota de coding bem menor.
O tabuleiro em 17 de junho de 2026
O catálogo passa de 473 modelos hoje, com 61 criadores diferentes. Nos últimos 30 dias, 30 modelos foram lançados — o North Mini Code é o mais recente deles. No topo por inteligência, Claude Fable 5 da Anthropic lidera com 62,073 e cobra US$ 50 por milhão de saída. Na faixa "acima de IQ 45 mais barata", o mínimo é o MiniMax M3 a US$ 1,20, seguido do DeepSeek V4 Pro a US$ 1,74 e do GLM 5.2 a US$ 3,036.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
O North Mini Code entra nessa foto como uma opção específica: pesos abertos, raciocínio ligado, gratuito, com nota decente em coding e janela de 256 mil tokens. Não disputa o topo. Disputa o canto inferior direito do gráfico de custo-benefício.
O que você faz com isso
Se a sua fila de tarefas é "gerar trecho de código, refatorar função, escrever teste unitário" em volume alto e você quer hospedar localmente ou usar a camada gratuita sem rate-limit agressivo, vale testar. Se a fila é "planejar arquitetura, depurar sistema distribuído, manter agente de 20 passos sem perder o fio", o gpt-oss-120b paga-se em pouco tempo. E se a fila é multimodal, o Nemotron Omni gratuito continua sendo o caminho.
A pergunta prática é: você vai rodar em servidor próprio ou pela API gratuita? Se for a segunda, North Mini Code entra no curto-lista. Se for a primeira, os pesos abertos permitem comparação direta sem custo de licenciamento.
Use o North Mini Code gratuito quando o orçamento for zero e a tarefa for código em volume; pule para gpt-oss-120b quando a tarefa exigir agente sério.
Perguntas frequentes
O Cohere North Mini Code é realmente gratuito?
Sim. O catálogo registra US$ 0 por milhão de tokens de entrada e de saída. Como tem pesos abertos, você também pode hospedar e rodar localmente sem custo de licenciamento.
North Mini Code serve para agente de produção?
Serve para tarefas curtas de coding. O índice agentic é 3,119 — bem abaixo do gpt-oss-120b, que marca 13,425 cobrando US$ 0,17 por milhão de tokens de saída.
Qual a diferença para o NVIDIA Nemotron 3 Nano Omni gratuito?
O Nemotron Omni é multimodal (texto, imagem, áudio e vídeo) e três vezes mais rápido, mas tem nota de coding quase três vezes menor: 13,754 contra 36,452 do North Mini Code.