A Moonshot soltou os pesos do Kimi K3: 2,8 trilhões de parâmetros de graça

Início » Inteligência Artificial » A Moonshot soltou os pesos do Kimi K3: 2,8 trilhões de parâmetros de graça
9 min de leitura

São 2,8 trilhões de parâmetros liberados pra download, primeiro lugar em código de frontend e terceiro no índice geral. E você provavelmente não vai conseguir rodar em casa.

Publicidade

A Moonshot AI liberou os pesos do Kimi K3. É o maior modelo de peso aberto já publicado: 2,8 trilhões de parâmetros, contexto de 1 milhão de tokens e entrada multimodal nativa.

A empresa tinha marcado 27 de julho como data, e acabou soltando algumas horas antes, na noite do dia 26. Quem estava esperando pra baixar já pode baixar.

E antes que alguém pergunte: sim, é o mesmo Kimi que a gente noticiou aqui semana passada quando a Casa Branca acusou a Moonshot de copiar o Fable da Anthropic. A briga continua. Os pesos saíram assim mesmo.

2,8 trilhões no papel, uns 50 bilhões acordados por vez

O número grande engana, então vamos destrinchar.

O K3 é um modelo de mistura de especialistas, o famoso MoE. Em vez de acender a rede inteira a cada palavra gerada, ele acende só um pedaço. São 896 especialistas no total e apenas 16 disparam por token.

Na prática isso dá algo em torno de 50 bilhões de parâmetros ativos por token. É por isso que um modelo de 2,8 trilhões consegue responder rápido: ele carrega o peso de um monstro mas pensa com o custo de um modelo médio.

A arquitetura tem nome próprio. A Moonshot descreve o modelo em cima de duas peças que ela batizou: Kimi Delta Attention e Attention Residuals, dentro de um esquema que chamam de Stable LatentMoE. Traduzindo do marketing: são otimizações pra treinar um MoE gigante sem ele desestabilizar no meio do caminho, que é exatamente onde a maioria das tentativas desse porte morre.

Onde o K3 ganha e onde ele apanha

Aqui é onde a coisa fica interessante, porque não é aquele lançamento chinês que só ganha em benchmark caseiro.

Nos rankings independentes:

  • Frontend Code Arena: primeiro lugar, com 1.679 pontos, à frente do Fable 5, em teste cego com desenvolvedores votando sem saber qual modelo é qual
  • Vals AI: segundo lugar geral
  • Artificial Analysis Intelligence Index: terceiro geral, atrás só do Claude Fable e do GPT-5.6 Sol Max, e mais barato que os dois

Nos benchmarks divulgados pela própria Moonshot, o K3 bate o Opus 4.8 e o GPT-5.5, e perde pro Fable 5 e pro GPT-5.6 Sol. A empresa não escondeu que perde, o que já é mais honesto que a média do setor.

O ponto que ninguém deveria passar batido: um modelo aberto ficou em primeiro lugar em código de frontend, num teste onde o desenvolvedor não sabe quem escreveu. Isso não é ranking de laboratório, é gente escolhendo o resultado que prefere.

Nos testes de agente e terminal, como DeepSWE e Terminal-Bench, a Moonshot também aponta vantagem. Vale a ressalva de sempre: benchmark declarado pelo fabricante vale menos que arena cega. Os dois primeiros itens da lista acima são independentes, os últimos não.

US$ 0,30 no cache, US$ 15 na saída: a tabela que mexe no mercado

Preço de API do K3, em dólares por milhão de tokens:

  • Entrada com cache acertado: US$ 0,30
  • Entrada sem cache: US$ 3,00
  • Saída: US$ 15,00

Essa diferença de dez vezes entre entrada com e sem cache não é detalhe. A Moonshot afirma taxa de acerto de cache acima de 90% em trabalho de código, porque quem programa manda o mesmo repositório de contexto várias vezes seguidas.

Faz a conta de um dia de trabalho pesado com agente de código. Digamos 30 milhões de tokens de entrada, com 90% batendo cache, e 2 milhões de saída. Dá 27 milhões a US$ 0,30 (US$ 8,10), mais 3 milhões a US$ 3,00 (US$ 9,00), mais 2 milhões de saída a US$ 15 (US$ 30). Total: US$ 47,10 no dia, uns R$ 260 no câmbio de hoje.

Não é de graça. Mas pra um modelo que aparece em terceiro no índice geral de inteligência, é barato demais. E como os pesos estão abertos, provedor de infraestrutura vai começar a servir o K3 mais barato ainda em questão de dias.

Aberto não quer dizer que você vai rodar na sua máquina

Agora o balde de água fria.

As estimativas de tamanho do download divergem conforme a fonte e o formato: tem gente falando em torno de 600 GB numa versão reduzida e tem gente falando em mais de 1 terabyte na precisão cheia. Escolha o número que quiser, nenhum deles cabe no seu SSD com folga.

E baixar é a parte fácil. Rodar um MoE de 2,8 trilhões exige manter todos os especialistas acessíveis em memória, mesmo que só 16 disparem por vez. Isso significa rack, não desktop. Estamos falando de dezenas de GPUs de data center ou uma máquina com memória absurda e paciência de monge pra tolerar a lentidão.

Então quem ganha com “peso aberto” aqui não é o entusiasta com uma RTX na mesa. Quem ganha é:

  • Provedor de nuvem que vai hospedar e cobrar mais barato que a Moonshot
  • Empresa que precisa rodar dentro de casa por questão de dado sensível
  • Pesquisador que quer abrir o capô e entender por que o negócio funciona
  • Governo que não quer depender de API americana nem chinesa

O modelo aberto de verdade continua sendo o de 30 bilhões que roda no seu notebook. Esse aqui é aberto no sentido jurídico e científico, não no sentido doméstico.

A China fez isso com chip limitado por embargo

Esse é o subtexto que dá arrepio em Washington.

A Moonshot treinou um modelo de 2,8 trilhões de parâmetros operando sob restrição americana de exportação de chip avançado. Não é que eles tenham menos GPU do que gostariam, é que eles legalmente não podem comprar as melhores.

E o resultado apareceu em primeiro lugar numa arena cega de código, na frente do modelo topo de linha de uma empresa americana.

Some isso ao movimento da semana: mais de vinte gigantes de tecnologia, incluindo Nvidia, Microsoft e Meta, pressionando o governo americano a não restringir modelos de peso aberto. A leitura do lobby é simples, e eu acho que está certa: se os Estados Unidos travarem o próprio ecossistema aberto, o padrão global de modelo aberto passa a ser chinês por falta de concorrente.

Não é hipótese distante. Hoje, o maior modelo aberto do mundo é chinês. Ponto.

Publicidade

O que muda pra quem programa aqui no Brasil

Coisa concreta, sem futurologia.

Primeiro, preço. Toda vez que um modelo desse nível cai no domínio aberto, a tabela dos concorrentes fechados sente em algumas semanas. Foi assim com as rodadas anteriores de modelo chinês e não tem motivo pra ser diferente agora. Se você paga API em dólar, provavelmente vai pagar menos até setembro.

Segundo, contexto de 1 milhão de tokens. Isso é repositório inteiro de projeto médio dentro da janela, sem gambiarra de busca vetorial. Pra quem mexe com código legado mal documentado, e o Brasil é campeão nisso, é um ganho prático real.

Terceiro, soberania de dado. Empresa brasileira com restrição de LGPD que hoje não manda dado pra API de terceiro passa a ter opção de rodar um modelo de ponta em infraestrutura própria ou em nuvem nacional. Caro, mas possível. Antes nem possível era.

Conselho de bolso: não migra tudo de uma vez. Pega uma tarefa cara que você já roda em modelo caro, joga no K3 pela API e compara resultado e conta no fim da semana. Se ganhou, migra o resto. Se não ganhou, você gastou uns dólares pra descobrir.

As dúvidas que sempre chegam quando um modelo chinês abre os pesos

Se ele é aberto e bom, por que alguém continuaria pagando OpenAI ou Anthropic?
Porque o K3 ainda perde pros modelos topo de linha nos índices gerais, e porque a maioria das empresas não quer administrar infraestrutura de modelo. Peso aberto derruba o preço do mercado inteiro, mas não elimina a conveniência de uma API que simplesmente funciona.

Dá pra confiar num modelo treinado na China com dado que eu não vejo?
Você não vê o dado de treino de nenhum dos grandes, americano incluído. A vantagem do peso aberto é que dá pra auditar o comportamento do modelo, rodar isolado da internet e testar viés por conta própria. É mais transparência do que você tem hoje, não menos.

Quanto custaria rodar isso dentro da minha empresa?
Muito. Estamos falando de servidor com dezenas de GPUs de data center, o que passa fácil de sete dígitos em reais só de hardware, sem contar energia e refrigeração. Pra quase todo mundo, alugar em nuvem sai mais barato que possuir.

A acusação da Casa Branca sobre cópia do Fable derruba esse lançamento?
Até agora não saiu prova pública, e a Moonshot nega. Se sanção vier, ela atinge negócio e distribuição, não os pesos que já estão baixados por milhares de pessoas. Arquivo publicado não volta pra caixa.

Por que eu acho que o preço da IA cai de novo antes de setembro

Vou na lata: esse lançamento é mais importante pelo preço do que pela inteligência.

O K3 não é o melhor modelo do mundo, e a Moonshot nem finge que é. Ele é o melhor modelo do mundo que qualquer um pode baixar. Essas duas frases parecem próximas e são completamente diferentes na prática.

Quando o melhor modelo fechado custa cinco vezes mais que um aberto que fica três posições atrás, a diferença precisa se justificar em resultado de trabalho real. Pra tarefa difícil, se justifica. Pra 80% do que empresa faz com IA no dia a dia, que é resumir, classificar, transformar texto e escrever código de rotina, não se justifica.

É isso que aperta a margem dos fechados. Não é o benchmark, é o cliente médio percebendo que estava pagando caro por uma folga que ele não usa.

Sobre o modelo em si: primeiro lugar em arena cega de frontend, com peso aberto, treinado sob embargo. Isso é máquina, e quem torce por concorrência devia comemorar independente de bandeira.

E você, já testou o K3 em alguma coisa de verdade ou ainda tá no hype do gráfico? Conta aí.

A newsletter do Escrito pela IA manda esse tipo de leitura antes do algoritmo lembrar de você.

Fontes

ESCRITO PELA IA. REVISADO POR HUMANOS.

Publicidade
WhatsApp
Facebook
X
LinkedIn
Publicidade
Política de PrivacidadeTermos de UsoPolítica de CookiesSobreContato