FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Trinity Large Thinking cobra US$ 0,80 por milhão e tropeça em agente

Modelo aberto da Arcee AI é o mais rápido entre os pares comparáveis, mas o agentic score de 3,7 desmente o nome e cobra caro por isso.

Redação FalaVIP IA 3 min de leitura
US$ 0,80por milhão de tokens de saída
311,3tokens por segundo — o mais rápido entre os pares
3,7agentic score, contra 13,4 do gpt-oss-120b

O nome promete raciocínio. Os números entregam outra coisa.

Há quatro dias a Arcee AI colocou no mercado o Trinity Large Thinking, modelo de raciocínio de código aberto, 399 bilhões de parâmetros totais com apenas 13B ativos por passada, contexto de 262 mil tokens, preço a partir de US$ 0,25 por milhão de entrada e US$ 0,80 por milhão de saída. O release oficial diz que o modelo mostra "strong performance in PinchBench, agentic workloads, and reasoning tasks". Entra na nova leva de abertos americanos de 2026.

Pense num escritório com 399 especialistas, mas só 13 são acionados por vez. É a ideia do MoE que Trinity usa — o que ajuda a explicar parte da velocidade, mas também impõe limites.

A questão é o que está por trás do rótulo "thinking".

Velocidade é o único lugar em que ele lidera

Índice de inteligência (Artificial Analysis)
Trinity Large Thinking18,7gpt-oss-20b15,2gpt-oss-120b24,1Nemotron 3 Nano 30B A3B14,5Mistral Small 419,7índice
Fonte: Artificial Analysis

Entre os pares comparáveis — todos abertos, todos de raciocínio, todos MoE — Trinity é o mais rápido: 311,3 tokens por segundo. O segundo colocado, Nemotron 3 Nano da NVIDIA, roda a 247,99. O gpt-oss-120b da OpenAI, a 155,22. Se a sua dor é latência em volume, esse número sozinho coloca Trinity na lista.

Em inteligência geral, ele não lidera ninguém. Marca 18,658 no índice, à frente do gpt-oss-20b (15,225) e do Nemotron (14,538), mas atrás do Mistral Small 4 (19,708) e bem atrás do gpt-oss-120b (24,126). Em código, 25,77 — perde para os dois modelos da OpenAI e para o Mistral. O lançamento tem quatro dias; estes são os números que o catálogo registra hoje.

Onde Trinity perde — e não é pouco

Inteligência × preço de saída
Trinity Large Thinkinggpt-oss-20bgpt-oss-120bNemotron 3 Nano 30B A3BMistral Small 4US$ por milhão (saída, escala log)índice de inteligência

O ponto que mais incomoda é o agentic score: 3,719. É melhor que o Nemotron (1,993) e ligeiramente superior ao gpt-oss-20b (3,103), mas é quase quatro vezes menor que o do gpt-oss-120b (13,425) e fica atrás do Mistral Small 4 (4,629). Para qualquer pipeline que dependa de tool use, planejamento multi-etapa ou agente autônomo, Trinity não é a melhor escolha nessa faixa.

E cobra caro por isso. US$ 0,80 por milhão de tokens de saída é mais que o Mistral Small 4 (US$ 0,60) e quase cinco vezes o gpt-oss-120b (US$ 0,17). O cache, a US$ 0,06 por milhão, também fica acima dos US$ 0,03 do gpt-oss-20b e dos US$ 0,025 do Nemotron. O que a Arcee chama de "agentic workloads" no release não corresponde ao que a régua mede.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Trinity Large Thinking (o novo)18.70.250.8262k
gpt-oss-20b15.20.030.13131k
gpt-oss-120b24.10.0370.17131k
Nemotron 3 Nano 30B A3B14.50.050.2262k
Mistral Small 419.70.150.6262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O tabuleiro aberto em abril de 2026

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 388 modelos disponíveis no catálogo nesta data.

O topo do mercado segue com modelos fechados. Gemini 3.1 Pro Preview lidera com IQ 47,738 a US$ 12 por milhão de saída, seguido de GPT-5.3-Codex (45,512, US$ 14/M), Claude Sonnet 4.6 (35,108, US$ 15/M), MiMo-V2-Omni (35,866, US$ 2/M) e Qwen3.5 397B (34,262, US$ 2,34/M). Trinity não compete com eles — é outra categoria, outra conta, outra decisão.

O catálogo conta hoje com 388 modelos de 54 criadores, 31 lançados nos últimos 30 dias. Trinity entra num segmento lotado de abertos americanos e europeus que brigam por volume, latência e agentic score. Xiaomi e Qwen vêm da China com IQ alto a preço baixo; OpenAI, NVIDIA, Mistral e Arcee disputam o pedaço americano e europeu.

Na prática, o que muda na sua fila

Para agente de verdade, escolha o gpt-oss-120b — quase quatro vezes mais agentic score por um quinto do preço. Para raciocínio puro com latência crítica, Trinity Large Thinking tem lugar: é o mais rápido da categoria e roda contexto de 262 mil tokens com 13B ativos. Para pagar menos sem perder raciocínio aberto, o Mistral Small 4, francês, segue sendo a referência. "Thinking" no nome não paga a conta de API de ninguém — três números decidem, e Trinity só ganha em um.

Em uma frase

Trinity Large Thinking vence em latência e perde em agente: para tool use, vá de gpt-oss-120b; para economizar em raciocínio aberto, Mistral Small 4.

Perguntas frequentes

O que é o Trinity Large Thinking?

Modelo de raciocínio open-weight da Arcee AI, lançado em 1º de abril de 2026. É um MoE de 399B parâmetros totais com 13B ativos por passada, contexto de 262 mil tokens, vendido a US$ 0,80 por milhão de tokens de saída.

Trinity Large Thinking é melhor que o gpt-oss-120b?

Em velocidade sim, 311 contra 155 tokens por segundo. Em agentic, não: 3,7 contra 13,4. E o gpt-oss-120b custa quase cinco vezes menos por milhão de tokens de saída.

Vale usar Trinity Large Thinking para agentes?

Pelo agentic score atual, não é a opção mais forte da categoria. Para tool use e planejamento multi-etapa, o gpt-oss-120b e o Mistral Small 4 entregam mais pelo mesmo preço ou menos.

Leia também