Pular para o conteúdo principal
Fechar
IA

KIMI 3: 2.8 trilhões de parâmetros em MoE que abalam o pódio dos LLMs

Gabriel Ferraresi· CEO | Tech8618 de julho de 20265 min
iallmkimi3moemoonshot-aiopen-weightslgpdsoberaniainferenciaagentes

A tabela do peso pesado dos LLMs mudou em julho de 2026. A Moonshot AI soltou o KIMI 3 em 16 de julho e o pódio deixou de ser estável. Nós acompanhamos esse movimento desde o surgimento dos modelos open-weight de grande escala — e o sinal agora é claro: 2 bilhões de dólares bem colocados abrem espaço no pódio.

O que é o KIMI 3: 2.8T em MoE, 16 experts ativos de 896

Segundo a Moonshot AI, o KIMI 3 tem 2.8 trilhões de parâmetros em arquitetura MoE (Mixture of Experts), com 16 experts ativos de um total de 896 e janela de contexto de 1M de tokens. A Moonshot AI é uma empresa chinesa fundada em 2023 por Zhilin Yang, bancada pela Alibaba, que levantou 2 bilhões de dólares.

MoE significa que só 16 experts rodam por token. O custo de inferência cai na proporção: em vez de ativar 2.8 trilhões de parâmetros, ativa apenas a fração correspondente aos 16 experts selecionados. Inteligência comparável, fração do compute. É a arquitetura que permite competir com modelos densos do topo sem o custo de inferência de um denso de 2.8T.

O placar nos benchmarks que importam

Segundo a tabela da Moonshot AI, o KIMI 3 faz 93.5% no GPQA Diamond — o melhor resultado open-weight já publicado nesse benchmark. Supera o Claude Fable 5 (92.6%) e o Claude Opus 4.8 (91.0%), ficando acima dos dois modelos da Anthropic. O GPT-5.6 Sol está em 94.1% e ainda lidera nesse benchmark específico — K3 ainda perde para o topo da OpenAI no GPQA Diamond.

Segundo a Arena.ai, o KIMI 3 está em primeiro lugar no Code WebDev. Liderança absoluta em código que roda em navegador. É onde o modelo brilha mais.

Segundo a Moonshot AI, no HLE sem ferramentas o KIMI 3 faz 43.5%. Com ferramentas, sobe para 56.0%. Diferença de 12.5 pontos quando o modelo recebe ferramentas. Agente de verdade.

Segundo o Artificial Analysis Intelligence Index, o KIMI 3 está em quarto lugar entre 189 modelos com 57.1 pontos. Ainda perde no geral para Claude Fable 5 e GPT-5.6 Sol. Mas em coding e agentes gerais, passou Claude Opus 4.8 e GPT-5.5 de raspagem.

Preço e cost-performance: onde o DeepSeek V3 ainda vence

Segundo a Moonshot AI, o preço do KIMI 3 é 3,00 dólares por MTok de input em cache miss, 0,30 dólares por MTok em cache hit e 15,00 dólares por MTok de output. A API internacional está disponível em api.moonshot.ai desde o lançamento — quem quiser testar agora, pode.

O DeepSeek V3 ainda é mais barato. O KIMI 3 não joga no preço mínimo — joga em cost-performance. Inteligência de topo em coding e agentes por uma fração do compute de um modelo denso equivalente. O cache de contexto é onde a economia real aparece: 0,30 dólares por MTok em cache hit contra 3,00 dólares em cache miss. Quem não usa cache, queima dinheiro.

O que muda para o Brasil: LGPD e soberania de dados

Segundo a Moonshot AI, os open weights saem em 27 de julho de 2026. Isso muda o jogo para o Brasil. Self-host on-prem. Soberania de dados.

A LGPD, legislação brasileira, exige medidas de segurança para dados pessoais. Com open weights, o modelo roda dentro do datacenter do cliente. Os dados pessoais não precisam cruzar a fronteira. Nenhuma API em dólar precisa entrar no fluxo de dados pessoais. É conformidade por arquitetura, não por contrato. É soberania de dados na prática — e é o que diferencia o KIMI 3 de modelos fechados que só rodam em endpoints internacionais.

O que a Tech86 implementa com KIMI 3

Nós implementamos cinco frentes com o KIMI 3:

  1. Inferência on-prem via NVIDIA NIM com open weights. Dados sensíveis nunca saem do datacenter do cliente. LGPD-compliant por arquitetura.
  2. Self-host de open weights em cluster H100. Custo por token cai para depreciação de hardware. Sem spread de vendor, sem aprisionamento.
  3. Engenharia de prompt para agentes de código. KIMI 3 lidera o Arena Code WebDev, segundo a Arena.ai. É onde ele brilha mais.
  4. Cache de contexto explorando 1M de tokens. 0,30 dólares por MTok em cache hit contra 3,00 dólares em cache miss. Quem não usa cache, queima dinheiro.
  5. Roteamento entre KIMI 3 e DeepSeek V3 por workload. Barato para tarefas simples, pesado para raciocínio. Otimização de cost-performance por token.

Conclusão: o pódio dos LLMs deixou de ser estável

A Moonshot acabou de provar que 2 bilhões de dólares bem colocados abrem espaço no pódio. O pódio dos LLMs deixou de ser estável. O KIMI 3 não é o melhor modelo no geral — ainda perde para Claude Fable 5 e GPT-5.6 Sol no Artificial Analysis Intelligence Index. Mas em coding e agentes, está no topo. E com open weights em 27 de julho de 2026, é o primeiro modelo de pódio que o Brasil pode hospedar localmente sem abrir mão de soberania de dados. Na Tech86, nós ajudamos empresas a fazer exatamente isso — deploy on-prem, roteamento por workload e conformidade LGPD por arquitetura.

blog.cta_consulting_title

blog.cta_consulting_subtitle

Engenharia de IA com Soberania de Dados

Perguntas Frequentes

KIMI 3 é o modelo lançado pela Moonshot AI em 16 de julho de 2026. Segundo a Moonshot AI, ele tem 2.8 trilhões de parâmetros em arquitetura MoE, 16 experts ativos de 896 e janela de 1M de tokens. A Moonshot AI é uma empresa chinesa fundada em 2023 por Zhilin Yang, bancada pela Alibaba, que levantou 2 bilhões de dólares. O diferencial é o cost-performance: inteligência comparável a modelos densos do topo, fração do compute.

MoE significa Mixture of Experts. Segundo a Moonshot AI, o KIMI 3 tem 896 experts, mas só 16 rodam por token. O custo de inferência cai na proporção: em vez de ativar 2.8 trilhões de parâmetros, ativa apenas a fração correspondente aos 16 experts selecionados. Inteligência comparável, fração do compute. É por isso que o modelo consegue entregar 93.5% no GPQA Diamond com um preço de 3,00 dólares por MTok em cache miss.

Segundo a tabela da Moonshot AI, o KIMI 3 faz 93.5% no GPQA Diamond — acima do Claude Fable 5 (92.6%) e do Claude Opus 4.8 (91.0%). O GPT-5.6 Sol está em 94.1% e ainda lidera nesse benchmark específico. Segundo a Arena.ai, o KIMI 3 está em primeiro lugar no Code WebDev. Segundo o Artificial Analysis Intelligence Index, o KIMI 3 está em quarto lugar entre 189 modelos com 57.1 pontos — ainda perde no geral para Claude Fable 5 e GPT-5.6 Sol, mas em coding e agentes passou Claude Opus 4.8 e GPT-5.5.

Segundo a Moonshot AI, os open weights saem em 27 de julho de 2026. Isso permite self-host on-prem: o modelo roda dentro do datacenter do cliente e os dados pessoais não precisam cruzar a fronteira. Nenhuma API em dólar precisa entrar no fluxo de dados pessoais. A LGPD, legislação brasileira, exige medidas de segurança para dados pessoais — hospedar o modelo localmente é conformidade por arquitetura, não por contrato. É soberania de dados na prática.

Segundo a Moonshot AI, o preço é 3,00 dólares por MTok de input em cache miss, 0,30 dólares por MTok em cache hit e 15,00 dólares por MTok de output. O DeepSeek V3 ainda é mais barato. O KIMI 3 joga em cost-performance: não é o mais barato, mas entrega inteligência de topo em coding e agentes por uma fração do compute de um modelo denso equivalente. O roteamento entre os dois por workload é o que otimiza o custo total.

Blog — Fale Conosco

Tem alguma pergunta sobre nossos artigos ou serviços? Nossa equipe está pronta para ajudar.

Agendar Reunião

Reserve um horário.

Agendar Agora

E-mail

Envie uma mensagem.

[email protected]

WhatsApp

Conversa rápida.

Endereço

Avenida Paulista, 1636 - São Paulo - SP - 01310-200

Especialista Tech86

Online agora

Olá! Como podemos ajudar a escalar seu negócio hoje?

Tech86 Engineering

Nós valorizamos sua privacidade

Utilizamos cookies e tecnologias similares para otimizar a sua experiência, analisar o tráfego do site e personalizar conteúdo. Ao clicar "Aceitar Todos", você concorda com o uso de todos os cookies. Leia nossa Política de Privacidade.