A tabela do peso pesado dos LLMs mudou em julho de 2026. A Moonshot AI soltou o KIMI 3 em 16 de julho e o pódio deixou de ser estável. Nós acompanhamos esse movimento desde o surgimento dos modelos open-weight de grande escala — e o sinal agora é claro: 2 bilhões de dólares bem colocados abrem espaço no pódio.
O que é o KIMI 3: 2.8T em MoE, 16 experts ativos de 896
Segundo a Moonshot AI, o KIMI 3 tem 2.8 trilhões de parâmetros em arquitetura MoE (Mixture of Experts), com 16 experts ativos de um total de 896 e janela de contexto de 1M de tokens. A Moonshot AI é uma empresa chinesa fundada em 2023 por Zhilin Yang, bancada pela Alibaba, que levantou 2 bilhões de dólares.
MoE significa que só 16 experts rodam por token. O custo de inferência cai na proporção: em vez de ativar 2.8 trilhões de parâmetros, ativa apenas a fração correspondente aos 16 experts selecionados. Inteligência comparável, fração do compute. É a arquitetura que permite competir com modelos densos do topo sem o custo de inferência de um denso de 2.8T.
O placar nos benchmarks que importam
Segundo a tabela da Moonshot AI, o KIMI 3 faz 93.5% no GPQA Diamond — o melhor resultado open-weight já publicado nesse benchmark. Supera o Claude Fable 5 (92.6%) e o Claude Opus 4.8 (91.0%), ficando acima dos dois modelos da Anthropic. O GPT-5.6 Sol está em 94.1% e ainda lidera nesse benchmark específico — K3 ainda perde para o topo da OpenAI no GPQA Diamond.
Segundo a Arena.ai, o KIMI 3 está em primeiro lugar no Code WebDev. Liderança absoluta em código que roda em navegador. É onde o modelo brilha mais.
Segundo a Moonshot AI, no HLE sem ferramentas o KIMI 3 faz 43.5%. Com ferramentas, sobe para 56.0%. Diferença de 12.5 pontos quando o modelo recebe ferramentas. Agente de verdade.
Segundo o Artificial Analysis Intelligence Index, o KIMI 3 está em quarto lugar entre 189 modelos com 57.1 pontos. Ainda perde no geral para Claude Fable 5 e GPT-5.6 Sol. Mas em coding e agentes gerais, passou Claude Opus 4.8 e GPT-5.5 de raspagem.
Preço e cost-performance: onde o DeepSeek V3 ainda vence
Segundo a Moonshot AI, o preço do KIMI 3 é 3,00 dólares por MTok de input em cache miss, 0,30 dólares por MTok em cache hit e 15,00 dólares por MTok de output. A API internacional está disponível em api.moonshot.ai desde o lançamento — quem quiser testar agora, pode.
O DeepSeek V3 ainda é mais barato. O KIMI 3 não joga no preço mínimo — joga em cost-performance. Inteligência de topo em coding e agentes por uma fração do compute de um modelo denso equivalente. O cache de contexto é onde a economia real aparece: 0,30 dólares por MTok em cache hit contra 3,00 dólares em cache miss. Quem não usa cache, queima dinheiro.
O que muda para o Brasil: LGPD e soberania de dados
Segundo a Moonshot AI, os open weights saem em 27 de julho de 2026. Isso muda o jogo para o Brasil. Self-host on-prem. Soberania de dados.
A LGPD, legislação brasileira, exige medidas de segurança para dados pessoais. Com open weights, o modelo roda dentro do datacenter do cliente. Os dados pessoais não precisam cruzar a fronteira. Nenhuma API em dólar precisa entrar no fluxo de dados pessoais. É conformidade por arquitetura, não por contrato. É soberania de dados na prática — e é o que diferencia o KIMI 3 de modelos fechados que só rodam em endpoints internacionais.
O que a Tech86 implementa com KIMI 3
Nós implementamos cinco frentes com o KIMI 3:
- Inferência on-prem via NVIDIA NIM com open weights. Dados sensíveis nunca saem do datacenter do cliente. LGPD-compliant por arquitetura.
- Self-host de open weights em cluster H100. Custo por token cai para depreciação de hardware. Sem spread de vendor, sem aprisionamento.
- Engenharia de prompt para agentes de código. KIMI 3 lidera o Arena Code WebDev, segundo a Arena.ai. É onde ele brilha mais.
- Cache de contexto explorando 1M de tokens. 0,30 dólares por MTok em cache hit contra 3,00 dólares em cache miss. Quem não usa cache, queima dinheiro.
- Roteamento entre KIMI 3 e DeepSeek V3 por workload. Barato para tarefas simples, pesado para raciocínio. Otimização de cost-performance por token.
Conclusão: o pódio dos LLMs deixou de ser estável
A Moonshot acabou de provar que 2 bilhões de dólares bem colocados abrem espaço no pódio. O pódio dos LLMs deixou de ser estável. O KIMI 3 não é o melhor modelo no geral — ainda perde para Claude Fable 5 e GPT-5.6 Sol no Artificial Analysis Intelligence Index. Mas em coding e agentes, está no topo. E com open weights em 27 de julho de 2026, é o primeiro modelo de pódio que o Brasil pode hospedar localmente sem abrir mão de soberania de dados. Na Tech86, nós ajudamos empresas a fazer exatamente isso — deploy on-prem, roteamento por workload e conformidade LGPD por arquitetura.