Trinity Large Thinking cobra US$ 0,80 por milhão e tropeça em agente
Modelo aberto da Arcee AI é o mais rápido entre os pares comparáveis, mas o agentic score de 3,7 desmente o nome e cobra caro por isso.
O nome promete raciocínio. Os números entregam outra coisa.
Há quatro dias a Arcee AI colocou no mercado o Trinity Large Thinking, modelo de raciocínio de código aberto, 399 bilhões de parâmetros totais com apenas 13B ativos por passada, contexto de 262 mil tokens, preço a partir de US$ 0,25 por milhão de entrada e US$ 0,80 por milhão de saída. O release oficial diz que o modelo mostra "strong performance in PinchBench, agentic workloads, and reasoning tasks". Entra na nova leva de abertos americanos de 2026.
Pense num escritório com 399 especialistas, mas só 13 são acionados por vez. É a ideia do MoE que Trinity usa — o que ajuda a explicar parte da velocidade, mas também impõe limites.
A questão é o que está por trás do rótulo "thinking".
Velocidade é o único lugar em que ele lidera
Entre os pares comparáveis — todos abertos, todos de raciocínio, todos MoE — Trinity é o mais rápido: 311,3 tokens por segundo. O segundo colocado, Nemotron 3 Nano da NVIDIA, roda a 247,99. O gpt-oss-120b da OpenAI, a 155,22. Se a sua dor é latência em volume, esse número sozinho coloca Trinity na lista.
Em inteligência geral, ele não lidera ninguém. Marca 18,658 no índice, à frente do gpt-oss-20b (15,225) e do Nemotron (14,538), mas atrás do Mistral Small 4 (19,708) e bem atrás do gpt-oss-120b (24,126). Em código, 25,77 — perde para os dois modelos da OpenAI e para o Mistral. O lançamento tem quatro dias; estes são os números que o catálogo registra hoje.
Onde Trinity perde — e não é pouco
O ponto que mais incomoda é o agentic score: 3,719. É melhor que o Nemotron (1,993) e ligeiramente superior ao gpt-oss-20b (3,103), mas é quase quatro vezes menor que o do gpt-oss-120b (13,425) e fica atrás do Mistral Small 4 (4,629). Para qualquer pipeline que dependa de tool use, planejamento multi-etapa ou agente autônomo, Trinity não é a melhor escolha nessa faixa.
E cobra caro por isso. US$ 0,80 por milhão de tokens de saída é mais que o Mistral Small 4 (US$ 0,60) e quase cinco vezes o gpt-oss-120b (US$ 0,17). O cache, a US$ 0,06 por milhão, também fica acima dos US$ 0,03 do gpt-oss-20b e dos US$ 0,025 do Nemotron. O que a Arcee chama de "agentic workloads" no release não corresponde ao que a régua mede.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Trinity Large Thinking (o novo) | 18.7 | 0.25 | 0.8 | 262k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Nemotron 3 Nano 30B A3B | 14.5 | 0.05 | 0.2 | 262k |
| Mistral Small 4 | 19.7 | 0.15 | 0.6 | 262k |
O tabuleiro aberto em abril de 2026
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O topo do mercado segue com modelos fechados. Gemini 3.1 Pro Preview lidera com IQ 47,738 a US$ 12 por milhão de saída, seguido de GPT-5.3-Codex (45,512, US$ 14/M), Claude Sonnet 4.6 (35,108, US$ 15/M), MiMo-V2-Omni (35,866, US$ 2/M) e Qwen3.5 397B (34,262, US$ 2,34/M). Trinity não compete com eles — é outra categoria, outra conta, outra decisão.
O catálogo conta hoje com 388 modelos de 54 criadores, 31 lançados nos últimos 30 dias. Trinity entra num segmento lotado de abertos americanos e europeus que brigam por volume, latência e agentic score. Xiaomi e Qwen vêm da China com IQ alto a preço baixo; OpenAI, NVIDIA, Mistral e Arcee disputam o pedaço americano e europeu.
Na prática, o que muda na sua fila
Para agente de verdade, escolha o gpt-oss-120b — quase quatro vezes mais agentic score por um quinto do preço. Para raciocínio puro com latência crítica, Trinity Large Thinking tem lugar: é o mais rápido da categoria e roda contexto de 262 mil tokens com 13B ativos. Para pagar menos sem perder raciocínio aberto, o Mistral Small 4, francês, segue sendo a referência. "Thinking" no nome não paga a conta de API de ninguém — três números decidem, e Trinity só ganha em um.
Trinity Large Thinking vence em latência e perde em agente: para tool use, vá de gpt-oss-120b; para economizar em raciocínio aberto, Mistral Small 4.
Perguntas frequentes
O que é o Trinity Large Thinking?
Modelo de raciocínio open-weight da Arcee AI, lançado em 1º de abril de 2026. É um MoE de 399B parâmetros totais com 13B ativos por passada, contexto de 262 mil tokens, vendido a US$ 0,80 por milhão de tokens de saída.
Trinity Large Thinking é melhor que o gpt-oss-120b?
Em velocidade sim, 311 contra 155 tokens por segundo. Em agentic, não: 3,7 contra 13,4. E o gpt-oss-120b custa quase cinco vezes menos por milhão de tokens de saída.
Vale usar Trinity Large Thinking para agentes?
Pelo agentic score atual, não é a opção mais forte da categoria. Para tool use e planejamento multi-etapa, o gpt-oss-120b e o Mistral Small 4 entregam mais pelo mesmo preço ou menos.