Arcee AI lança Trinity Large Thinking por US$ 0,80 por milhão de saída
Modelo de raciocínio aberto, com 399B de parâmetros e 13B ativos, mira custo baixo — mas fica bem abaixo do topo em inteligência.
O que a Arcee AI colocou na mesa hoje
A conta de API está mais uma vez no centro da notícia. A Arcee AI soltou nesta terça-feira (1º de abril) o Trinity Large Thinking, um modelo de raciocínio com pesos abertos, 399 bilhões de parâmetros totais e apenas 13 bilhões ativos por token — uma arquitetura MoE que, no fim do mês, pesa bem menos no seu bolso do que parece. O preço de saída é US$ 0,80 por milhão de tokens; o de entrada, US$ 0,25; com cache a US$ 0,06. Janela de contexto de 262 mil tokens.
| Campo | Valor |
|---|---|
| Identificador | arcee-ai/trinity-large-thinking |
| Criador | arcee-ai |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 0.800 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.060 / M (76% de desconto) |
| Índice de inteligência (AA) | 18.7 |
| Índice de código | 25.8 |
| Índice agêntico | 3.7 |
| Parâmetros | 399B (13B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 311 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Em tradução direta: você paga menos de um centavo de dólar por cada mil tokens que o modelo devolve — desde que consiga encaixar o trabalho dele no seu pipeline.
Onde ele se perde
Olha o índice de inteligência e a conversa muda. O Trinity Large Thinking marca 18,66 no índice da Artificial Analysis — uma fração do que os dois modelos mais caros do catálogo entregam hoje: Google Gemini 3.1 Pro Preview (47,74) e OpenAI GPT-5.3-Codex (45,51). Em agentic, a nota é 3,72; em coding, 25,77. É um modelo que raciocina, mas não é um modelo que lidera.
A Arcee destaca nos materiais que ele “mostra forte desempenho em PinchBench, agentic workloads e tarefas de raciocínio”. Traduzindo: o modelo foi treinado para pensar em voz alta e se sair bem em benchmarks específicos — não para destronar ninguém do topo.
O que ficou barato — e o que não
O marketing diz “modelo de raciocínio acessível”. O número confirma a parte do preço. Comparado com os dois únicos modelos acima de IQ 45 no catálogo atual, o Gemini Pro Preview (US$ 12 por milhão de saída) e o GPT-5.3-Codex (US$ 14), o Trinity sai por 15 vezes menos no token de saída. É uma diferença que aparece na fatura.
Mas o que não mudou: a distância em capacidade. No gráfico de custo-benefício, o Trinity ocupa um canto bem distinto dos dois líderes — barato, porém com índice de inteligência numa faixa à qual os topos nem chegam perto.
A linha completa da Arcee AI hoje
Junto com a versão paga, a empresa publicou uma variante gratuita do mesmo modelo, com a mesma janela de 262 mil tokens e custo zero de entrada e saída. É a oferta típica de “experimenta primeiro, paga depois” — útil pra quem quer validar o raciocínio antes de colocar em produção.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Trinity Large Thinking (free | 0 | 0 | 262k |
Pra quem vale — e pra quem não
Vale pra você se o seu gargalo é custo por token em tarefas de raciocínio que não exigem o estado da arte — sumarização de documentos longos, agentes internos com orçamento apertado, prototipagem rápida, geração de código de baixa criticidade. Os 262 mil tokens de contexto abrem espaço para workloads que outros modelos pequenos não acomodam.
Não muda nada pra você se a sua escolha de modelo gira em torno de benchmarks de coding de ponta, agentic complexo ou qualquer coisa que dependa de IQ acima de 40. Nesse terreno, Gemini Pro Preview e GPT-5.3-Codex continuam reinando, e o Xiaomi MiMo-V2-Omni (IQ 35,87, US$ 2 por milhão de saída) já oferece um meio-termo mais inteligente por um custo que ainda é baixo.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Trinity Large Thinking (o novo) | 18.7 | 0.25 | 0.8 | 262k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| MiMo-V2-Omni | 35.9 | 0.4 | 2 | 262k |
O contexto do dia ajuda a calibrar: o catálogo soma hoje 382 modelos listados, de 54 criadores, com 32 lançamentos nos últimos 30 dias. O topo absoluto segue dominado por Google e OpenAI, e a faixa de modelos chineses (Xiaomi, Qwen) vem ocupando o espaço intermediário com preços agressivos. A Arcee entra por baixo — em preço — e em código aberto.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O que fazer com isso
Se você roda agentes em volume e a conta de API está incomodando, vale testar o Trinity Large Thinking como substituto de tarefas que hoje vão para modelos acima de IQ 40. Meça no seu caso real: o índice agregado não traduz automaticamente para o seu workload. E se a variável é “quero o melhor raciocínio que existe, dinheiro é secundário”, continue pagando Gemini Pro Preview — a diferença de US$ 11 por milhão de tokens tem um motivo.
Rode o Trinity Large Thinking em workloads de raciocínio onde o custo pesa mais que o topo do benchmark — e meça no seu caso antes de migrar o que hoje vai para Gemini ou GPT.
Perguntas frequentes
Quanto custa o Arcee Trinity Large Thinking?
US$ 0,80 por milhão de tokens de saída e US$ 0,25 por milhão de tokens de entrada, com cache a US$ 0,06 por milhão. Existe também uma variante gratuita com a mesma janela de contexto.
O Trinity Large Thinking é melhor que o Gemini 3.1 Pro Preview?
Não. O índice de inteligência do Trinity é 18,66 contra 47,74 do Gemini Pro Preview. A vantagem do Trinity é o preço: sai por cerca de 15 vezes menos no token de saída.
O Arcee Trinity Large Thinking tem pesos abertos?
Sim. É um modelo open weights, com 399 bilhões de parâmetros totais e 13 bilhões ativos por inferência (arquitetura MoE).