Qwen3 Next 80B Instruct custa quase o dobro do Nemotron Nano 12B VL — mas entrega 56% mais IQ
Comparativo frente a frente entre dois modelos abertos lançados em menos de 60 dias: quem ganha em texto puro, quem ganha em multimodal, e por que a conta da API não fecha sozinha.
A conta que o release não mostra
O Qwen3 Next 80B A3B Instruct chegou em 11 de setembro cobrando US$ 1,10 por milhão de tokens de saída. O Nemotron Nano 12B 2 VL, da NVIDIA, desembarcou em 28 de outubro pedindo US$ 0,60 pelo mesmo milhão. Parece óbvio: pega o mais barato. Mas o índice de inteligência atual do Qwen é 13,754 contra 8,801 do Nemotron — uma diferença de 56% que não some no fim do mês quando a fatura chega. O barato, aqui, é só no papel.
O que cada um é, de verdade
O Qwen é texto puro. 262 mil tokens de contexto, arquitetura MoE com 80 bilhões de parâmetros totais mas só 3 bilhões ativos por passada — é o tipo de modelo que roda caro no servidor do provedor e barato no seu bolso. Knowledge cutoff em 30 de setembro de 2025, sem capacidade de ver imagem ou vídeo. É um canivete suíço afiado para uma coisa só.
O Nemotron Nano 2 VL é outra história. 13,2 bilhões de parâmetros, todos ativos, mas aceita texto, imagem e vídeo na entrada e devolve texto. É multimodal de verdade, com uma arquitetura híbrida Transformer-Mamba que a NVIDIA empurrou para acelerar inferência em vídeo. Sabe aquele PDF com screenshot, aquele frame de câmera de segurança, aquele clipe curto? O Qwen nem olha. O Nemotron devolve legenda.
Onde o Qwen ganha — e onde perde feio
Em texto puro, o Qwen entrega mais: 56% mais IQ no índice da Artificial Analysis, contexto duas vezes maior (262k contra 131k), e velocidade quase quatro vezes superior — 173 tokens por segundo contra 42,84 do Nemotron. Se você está montando um pipeline de RAG, resumindo documentos longos ou gerando código em massa, a conta fecha: o Qwen custa mais por token, mas entrega mais por token e termina o trabalho mais rápido.
O detalhe que ninguém comenta: o Qwen é não-raciocínio (reasoning: false). Resposta direta, sem cadeia de pensamento exposta. Se você precisa de um modelo que "pense em voz alta" antes de responder, ele não é o caminho.
Onde o Nemotron ganha — e por que ele existe
O Nemotron é raciocínio (reasoning: true) e multimodal. Aceita vídeo, coisa que pouquíssimos modelos abertos fazem hoje. Os 13,2 bilhões totalmente ativos custam menos para o provedor operar — e essa economia aparece no preço: US$ 0,20 por milhão de entrada contra US$ 0,10 do Qwen, e US$ 0,60 de saída contra US$ 1,10. Em volume, a diferença pesa.
A velocidade de 42 tokens por segundo é baixa para chat, mas razoável para tarefas onde cada chamada processa um vídeo ou um documento denso — o gargalo não é geração, é compreensão multimodal. E o cache de prompt não foi publicado pelo catálogo, o que significa que você não consegue prever o custo de chamadas repetitivas sem testar.
| Critério | Qwen3 Next 80B A3B Instruct | Nemotron Nano 12B 2 VL |
|---|---|---|
| Índice de inteligência | 13.8 | 8.8 |
| Entrada US$/M | 0.1 | 0.2 |
| Saída US$/M | 1.1 | 0.6 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 173 | 43 |
| Índice de código | — | — |
| Índice agêntico | — | — |
O tabuleiro em 12 de novembro de 2025
O catálogo tem mais de 270 modelos listados, 41 criadores diferentes, e 17 lançamentos nos últimos 30 dias. O topo do índice de inteligência hoje é o OpenAI o3 (IQ 31,096), seguido do Claude Haiku 4.5 (29,892) — ambos distantes demais desses dois para comparação direta. O Qwen3 Next Instruct e o Nemotron Nano 2 VL brigam em outra faixa: a dos modelos abertos, baratos, com pesos publicados, onde cada centavo por milhão de tokens importa.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Quem leva qual
Texto puro, alto volume, sem imagem: Qwen3 Next 80B Instruct. Mais rápido, mais inteligente, contexto maior. O custo maior por token se dilui porque você entrega mais por chamada.
Vídeo, imagem, documentos escaneados, raciocínio explícito: Nemotron Nano 12B 2 VL. É o único dos dois que olha para o que não é texto, e cobra menos para fazer isso.
Quem não ganha nenhum dos dois: quem precisa de benchmark de coding ou agentic publicados — o catálogo não trouxe números para nenhum dos dois, então qualquer afirmação de superioridade nessas categorias é chute.
Se a sua fila é 100% texto, paga o Qwen e para de pensar; se entra vídeo ou imagem em qualquer etapa, o Nemotron é o único dos dois que abre a porta — e ainda custa quase metade por token de saída.
Perguntas frequentes
Qwen3 Next 80B Instruct ou Nemotron Nano 12B 2 VL: qual é mais barato?
O Nemotron é mais barato: US$ 0,60 por milhão de tokens de saída contra US$ 1,10 do Qwen. Mas o Qwen entrega 56% mais índice de inteligência e processa quase quatro vezes mais tokens por segundo, então o custo por tarefa útil pode inverter.
Qual dos dois entende vídeo?
Só o Nemotron Nano 12B 2 VL. Ele é multimodal (texto, imagem e vídeo na entrada) e tem arquitetura Transformer-Mamba da NVIDIA. O Qwen3 Next 80B Instruct é exclusivamente texto.
Os dois modelos são open weights?
Sim. Ambos têm pesos abertos: o Qwen é da Qwen (China) com 80B totais e 3B ativos; o Nemotron é da NVIDIA (EUA) com 13,2B totalmente ativos. Dá para baixar e rodar localmente se você tiver a infraestrutura.