FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B Instruct custa quase o dobro do Nemotron Nano 12B VL — mas entrega 56% mais IQ

Comparativo frente a frente entre dois modelos abertos lançados em menos de 60 dias: quem ganha em texto puro, quem ganha em multimodal, e por que a conta da API não fecha sozinha.

Redação FalaVIP IA 3 min de leitura
US$ 1,10preço de saída por milhão de tokens do Qwen3 Next 80B Instruct
US$ 0,60preço de saída por milhão de tokens do Nemotron Nano 12B 2 VL
13,754 × 8,801índice de inteligência (Artificial Analysis)

A conta que o release não mostra

O Qwen3 Next 80B A3B Instruct chegou em 11 de setembro cobrando US$ 1,10 por milhão de tokens de saída. O Nemotron Nano 12B 2 VL, da NVIDIA, desembarcou em 28 de outubro pedindo US$ 0,60 pelo mesmo milhão. Parece óbvio: pega o mais barato. Mas o índice de inteligência atual do Qwen é 13,754 contra 8,801 do Nemotron — uma diferença de 56% que não some no fim do mês quando a fatura chega. O barato, aqui, é só no papel.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Nemotron Nano 12B 2 VL0,6US$/M
Fonte: OpenRouter

O que cada um é, de verdade

O Qwen é texto puro. 262 mil tokens de contexto, arquitetura MoE com 80 bilhões de parâmetros totais mas só 3 bilhões ativos por passada — é o tipo de modelo que roda caro no servidor do provedor e barato no seu bolso. Knowledge cutoff em 30 de setembro de 2025, sem capacidade de ver imagem ou vídeo. É um canivete suíço afiado para uma coisa só.

O Nemotron Nano 2 VL é outra história. 13,2 bilhões de parâmetros, todos ativos, mas aceita texto, imagem e vídeo na entrada e devolve texto. É multimodal de verdade, com uma arquitetura híbrida Transformer-Mamba que a NVIDIA empurrou para acelerar inferência em vídeo. Sabe aquele PDF com screenshot, aquele frame de câmera de segurança, aquele clipe curto? O Qwen nem olha. O Nemotron devolve legenda.

Onde o Qwen ganha — e onde perde feio

Em texto puro, o Qwen entrega mais: 56% mais IQ no índice da Artificial Analysis, contexto duas vezes maior (262k contra 131k), e velocidade quase quatro vezes superior — 173 tokens por segundo contra 42,84 do Nemotron. Se você está montando um pipeline de RAG, resumindo documentos longos ou gerando código em massa, a conta fecha: o Qwen custa mais por token, mas entrega mais por token e termina o trabalho mais rápido.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Nemotron Nano 12B 2 VL8,8índice
Fonte: Artificial Analysis

O detalhe que ninguém comenta: o Qwen é não-raciocínio (reasoning: false). Resposta direta, sem cadeia de pensamento exposta. Se você precisa de um modelo que "pense em voz alta" antes de responder, ele não é o caminho.

Onde o Nemotron ganha — e por que ele existe

O Nemotron é raciocínio (reasoning: true) e multimodal. Aceita vídeo, coisa que pouquíssimos modelos abertos fazem hoje. Os 13,2 bilhões totalmente ativos custam menos para o provedor operar — e essa economia aparece no preço: US$ 0,20 por milhão de entrada contra US$ 0,10 do Qwen, e US$ 0,60 de saída contra US$ 1,10. Em volume, a diferença pesa.

A velocidade de 42 tokens por segundo é baixa para chat, mas razoável para tarefas onde cada chamada processa um vídeo ou um documento denso — o gargalo não é geração, é compreensão multimodal. E o cache de prompt não foi publicado pelo catálogo, o que significa que você não consegue prever o custo de chamadas repetitivas sem testar.

Qwen3 Next 80B A3B Instruct × Nemotron Nano 12B 2 VL
CritérioQwen3 Next 80B A3B InstructNemotron Nano 12B 2 VL
Índice de inteligência13.88.8
Entrada US$/M0.10.2
Saída US$/M1.10.6
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)17343
Índice de código
Índice agêntico

O tabuleiro em 12 de novembro de 2025

O catálogo tem mais de 270 modelos listados, 41 criadores diferentes, e 17 lançamentos nos últimos 30 dias. O topo do índice de inteligência hoje é o OpenAI o3 (IQ 31,096), seguido do Claude Haiku 4.5 (29,892) — ambos distantes demais desses dois para comparação direta. O Qwen3 Next Instruct e o Nemotron Nano 2 VL brigam em outra faixa: a dos modelos abertos, baratos, com pesos publicados, onde cada centavo por milhão de tokens importa.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

Quem leva qual

Texto puro, alto volume, sem imagem: Qwen3 Next 80B Instruct. Mais rápido, mais inteligente, contexto maior. O custo maior por token se dilui porque você entrega mais por chamada.

Vídeo, imagem, documentos escaneados, raciocínio explícito: Nemotron Nano 12B 2 VL. É o único dos dois que olha para o que não é texto, e cobra menos para fazer isso.

Quem não ganha nenhum dos dois: quem precisa de benchmark de coding ou agentic publicados — o catálogo não trouxe números para nenhum dos dois, então qualquer afirmação de superioridade nessas categorias é chute.

Em uma frase

Se a sua fila é 100% texto, paga o Qwen e para de pensar; se entra vídeo ou imagem em qualquer etapa, o Nemotron é o único dos dois que abre a porta — e ainda custa quase metade por token de saída.

Perguntas frequentes

Qwen3 Next 80B Instruct ou Nemotron Nano 12B 2 VL: qual é mais barato?

O Nemotron é mais barato: US$ 0,60 por milhão de tokens de saída contra US$ 1,10 do Qwen. Mas o Qwen entrega 56% mais índice de inteligência e processa quase quatro vezes mais tokens por segundo, então o custo por tarefa útil pode inverter.

Qual dos dois entende vídeo?

Só o Nemotron Nano 12B 2 VL. Ele é multimodal (texto, imagem e vídeo na entrada) e tem arquitetura Transformer-Mamba da NVIDIA. O Qwen3 Next 80B Instruct é exclusivamente texto.

Os dois modelos são open weights?

Sim. Ambos têm pesos abertos: o Qwen é da Qwen (China) com 80B totais e 3B ativos; o Nemotron é da NVIDIA (EUA) com 13,2B totalmente ativos. Dá para baixar e rodar localmente se você tiver a infraestrutura.

Leia também