O Que É Kimi K3? Benchmarks, Preços, Janela de Contexto e Planos de Peso Aberto
Kimi K3 é o novo modelo principal da Moonshot AI para codificação de longo horizonte, trabalho de conhecimento agêntico, compreensão visual e raciocínio profundo. Anunciado em 16 de julho de 2026, ele combina uma arquitetura Mixture-of-Experts de 2.8 trilhões de parâmetros com uma janela de contexto de um milhão de tokens e um projeto de roteamento incomumente esparso.
As especificações principais são impressionantes, mas os detalhes importam. Os resultados de benchmark mais fortes atualmente vêm da própria avaliação de lançamento da Moonshot, a saída da API é significativamente mais cara do que os modelos Kimi anteriores, e os pesos para download prometidos ainda não estavam disponíveis quando este artigo foi publicado em 23 de julho de 2026. Este guia separa o que já é utilizável do que permanece um plano de lançamento.
Principais pontos
- Kimi K3 é um modelo multimodal MoE de 2.8T parâmetros que ativa 16 de 896 especialistas roteados para cada token.
- A janela de contexto é de 1.048.576 tokens , com cache de prefixo automático e sem nível de preço de API mais alto para prompts mais longos.
- O preço oficial da API é de $0.30 por milhão de tokens de entrada com cache, $3.00 por milhão de tokens de entrada sem cache e $15.00 por milhão de tokens de saída.
- A Moonshot relata resultados líderes ou quase líderes em vários benchmarks de codificação, navegação, planilhas, automação e agentes visuais, embora as configurações de avaliação não sejam idênticas entre os modelos.
- O lançamento dos pesos estava agendado para 27 de julho de 2026. Em 23 de julho, o checkpoint, a licença final, os tamanhos dos arquivos e as instruções práticas de implantação da comunidade ainda não estavam disponíveis para inspeção.
O que é Kimi K3?
Kimi K3 é o sucessor da geração Kimi K2 da Moonshot AI e o maior modelo da empresa até agora. A Moonshot o descreve como o primeiro modelo aberto na classe de três trilhões de parâmetros. Ele é projetado menos como um modelo de chat leve e mais como um agente sempre raciocinando que pode manter o estado em longos fluxos de trabalho de engenharia, pesquisa, documentos e uso de ferramentas.
O modelo é nativamente multimodal. Aceita texto, imagens e vídeo através de produtos Kimi suportados e formatos de entrada de API, então produz texto e chamadas de ferramentas. A Moonshot posiciona o K3 em torno de três cargas de trabalho principais: engenharia de software de longo horizonte, trabalho de conhecimento ponta a ponta e tarefas que combinam feedback visual com código ou ferramentas estruturadas.
Kimi K3 está disponível através de Kimi.com, os aplicativos móveis Kimi, Kimi Work, Kimi Code e a API Kimi. Os desenvolvedores usam o ID de modelo da API kimi-k3. A documentação da API afirma que o acesso principal é desbloqueado após um carregamento de conta bem-sucedido de pelo menos $1, com limites de taxa determinados pelo nível da conta.
Leitores que precisam de um plano de fundo mais amplo sobre a família de produtos podem começar com o guia da Zerlo para Kimi AI e Moonshot AI. . K3 é o lançamento do modelo; Kimi é o ecossistema mais amplo de assistente, aplicativo e desenvolvedor.
Arquitetura do Kimi K3: por que 2.8 trilhões de parâmetros não significam 2.8 trilhões de parâmetros ativos
Kimi K3 usa um design de Mixture-of-Experts esparso. A rede contém 896 especialistas roteados, mas apenas 16 são selecionados para cada token. Isso permite que o modelo armazene uma grande quantidade de capacidade especializada sem executar todos os especialistas em cada passagem de avanço. O checkpoint completo ainda precisa ser armazenado e distribuído em um cluster de inferência, então a ativação esparsa reduz a computação mais do que reduz o desafio de armazenamento.
A Moonshot destaca quatro componentes arquitetônicos:
- Kimi Delta Attention (KDA): um mecanismo de atenção linear usado em três de cada quatro camadas de atenção para tornar o processamento de sequências longas mais eficiente.
- Gated Multi-Head Latent Attention: a quarta camada no ciclo retém atenção global completa para recuperação precisa de informações.
- Attention Residuals: os blocos podem recuperar seletivamente representações de profundidades anteriores em vez de depender apenas de um único fluxo residual continuamente acumulado.
- Stable LatentMoE: o framework de roteamento de especialistas que suporta a configuração de especialistas extremamente esparsa de 16 de 896.
A empresa diz que essas mudanças, combinadas com métodos de treinamento atualizados e receitas de dados, fornecem aproximadamente 2.5 vezes a eficiência geral de escalonamento do Kimi K2. Esse número é uma afirmação da Moonshot, e não uma medição reproduzida de forma independente. O K3 também usa treinamento consciente de quantização com pesos MXFP4 e ativações MXFP8, e a Moonshot recomenda implantações de supernodos com pelo menos 64 aceleradores.
Um cálculo simples de armazenamento ilustra a escala. A quatro bits por parâmetro, 2.8 trilhões de parâmetros representam cerca de 1.4 terabytes de dados de peso brutos antes de metadados, estruturas de roteamento, buffers de tempo de execução, cache KV, redundância e sobrecarga de framework. É por isso que um eventual lançamento de peso aberto será valioso para pesquisadores e empresas de hospedagem, mas não tornará o Kimi K3 um modelo de desktop normal.
Benchmarks Kimi K3
Os materiais de lançamento da Moonshot comparam o Kimi K3 com GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 e GLM-5.2. O próprio resumo da empresa é relativamente contido: o K3 ainda está atrás dos sistemas proprietários mais capazes no geral, mas atinge desempenho de nível de fronteira e lidera muitas tarefas individuais.
| Benchmark | Pontuação Kimi K3 | Posição no gráfico de lançamento da Moonshot |
|---|---|---|
| DeepSWE | 67.5 | Atrás de GPT-5.6 Sol e Claude Fable 5 |
| Terminal Bench 2.1 | 88.3 | Segundo, 0.5 pontos atrás de GPT-5.6 Sol |
| Program Bench | 77.8 | Maior pontuação reportada no gráfico |
| SWE Marathon | 42.0 | Maior pontuação reportada no gráfico |
| FrontierSWE | 81.2 | Segundo atrás de Claude Fable 5 |
| BrowseComp | 91.2 | Maior pontuação reportada no gráfico |
| SpreadsheetBench 2 | 34.8 | Mais alto por 0.1 ponto sobre Claude Fable 5 |
| AutomationBench | 30.8 | Maior pontuação reportada no gráfico |

Fonte: kimi.com
A Moonshot relata resultados particularmente fortes para agentes de codificação. O K3 lidera Program Bench e SWE Marathon no gráfico de lançamento, enquanto se posiciona perto do topo em Terminal Bench 2.1 e FrontierSWE.
Como ler as afirmações de benchmark
Esses números não devem ser tratados como uma tabela de classificação perfeitamente controlada. A Moonshot usou Kimi Code, Claude Code ou Codex, dependendo do benchmark. Alguns resultados de concorrentes vieram de classificações oficiais ou postagens de lançamento, enquanto outros modelos foram executados novamente pela Moonshot. A tabela de lançamento também observa o possível comportamento de fallback para Claude Fable 5 e interrupções de guardrail para GPT-5.6 Sol em algumas tarefas.
Todos os resultados principais do K3 foram obtidos com o máximo esforço de raciocínio. Essa configuração pode melhorar a qualidade, mas também pode aumentar a latência e o consumo de tokens de saída. Várias avaliações são internas, incluindo Kimi Code Bench 2.0 e partes da avaliação de trabalho de conhecimento. Até que os pesos e as ferramentas de avaliação sejam públicas, terceiros não podem reproduzir totalmente o conjunto completo de resultados.
A leitura mais útil, portanto, não é “K3 vence todos os modelos fechados”. Uma conclusão melhor é que o K3 parece altamente competitivo para codificação de longa duração e fluxos de trabalho de agentes, com resultados próprios de destaque em engenharia de software, navegação, automação, planilhas e tarefas de documentos visuais. A qualidade real do produto ainda dependerá da adesão às instruções, latência, integração de ferramentas, comportamento de segurança e estabilidade ao longo de sessões longas.

Fonte: kimi.com
O K3 também apresenta resultados fortes no dia do lançamento, além da codificação pura, incluindo o primeiro lugar nas comparações de BrowseComp, AutomationBench e SpreadsheetBench 2.
Preço do Kimi K3
A API oficial do Kimi usa três taxas de token. Os preços excluem impostos e usam um milhão de tokens decimais como unidade de cobrança.
| Categoria do token | Preço por milhão de tokens | Quando se aplica |
|---|---|---|
| Entrada com cache | $0.30 | Um prefixo de prompt repetido é servido do cache de contexto automático do Kimi |
| Entrada sem cache | $3.00 | Entrada nova ou alterada que deve ser processada normalmente |
| Saída | $15.00 | Tokens de raciocínio e resposta gerados cobrados como saída |
O K3 tem um preço fixo por token em toda a sua faixa de contexto. Não há cobrança adicional separada quando uma solicitação ultrapassa um limite de 200 mil ou similar. No entanto, prompts longos ainda podem ser caros em termos absolutos, e um modelo sempre pensando pode produzir uma saída substancial. Uma solicitação com um milhão de tokens de entrada sem cache custaria $3 antes da saída; o mesmo prefixo armazenado em cache custaria $0.30.
O cache automático não requer um ID de cache ou uma configuração separada da API. A documentação diz que o prompt anterior deve exceder 256 tokens, e as solicitações posteriores devem preservar o prefixo longo inalterado para ter uma chance de atingir o cache. Isso torna o K3 mais econômico para análises repetidas do mesmo repositório, coleção de documentos ou base de conhecimento do que para prompts únicos que mudam constantemente.
Qual o tamanho da janela de contexto do Kimi K3?
Kimi K3 suporta 1.048.576 tokens de contexto. Em termos práticos, isso pode conter grandes bases de código, extensas coleções de documentos, longos históricos de agentes ou combinações de entradas de texto e visuais. O número exato de palavras, páginas ou arquivos varia porque a tokenização depende do idioma, formatação, código-fonte e dados incorporados.
A documentação da API lista um valor padrão `max_completion_tokens` de 131.072 e permite que seja aumentado para 1.048.576. Esse limite superior não deve ser interpretado como uma recomendação para gerar respostas de um milhão de tokens. É principalmente um limite arquitetônico para fluxos de trabalho incomumente longos.
Uma grande janela de contexto também não garante recuperação perfeita. A Moonshot adverte explicitamente que o K3 foi treinado para preservar seu histórico de pensamento. Frameworks de agentes devem passar a mensagem completa do assistente de volta em turnos subsequentes. Perder o histórico de raciocínio, trocar de modelo no meio de uma sessão ou usar um arreio incompatível pode tornar a qualidade da geração instável.
Kimi K3 é de código aberto ou de peso aberto?
A Moonshot chama o Kimi K3 de modelo de “classe de três trilhões” “aberto” e de “código aberto”, mas o tempo é crucial. A empresa anunciou que os pesos completos seriam lançados até 27 de julho de 2026, juntamente com mais detalhes técnicos. Este artigo foi publicado quatro dias antes desse prazo.
Em 23 de julho, o K3 era utilizável através dos produtos Kimi e da API oficial, mas o checkpoint completo ainda não estava listado na página pública da organização Moonshot no Hugging Face. A licença final do modelo, fragmentos de peso, somas de verificação, pegada de armazenamento exata, mecanismos de inferência suportados e procedimentos de implantação testados pela comunidade, portanto, ainda não podiam ser verificados.
A descrição precisa no momento da publicação é um modelo proprietário hospedado com uma promessa de lançamento de peso aberto. Após o aparecimento do checkpoint, a licença determinará se o uso comercial, modificação, redistribuição e serviços hospedados são permitidos. Pesos abertos não significam automaticamente que os dados de treinamento, o código de treinamento completo ou o pipeline de treinamento reproduzível também serão publicados.
Esta distinção é abordada em mais detalhes na visão geral da Zerlo sobre o ecossistema de IA de peso aberto da China. . O K3 também é uma comparação de escala útil com GLM-5 e sua abordagem de codificação agêntica de peso aberto.
Onde você pode usar Kimi K3?
- Kimi.com e aplicativos móveis: acesso do consumidor via web e os aplicativos atuais para iOS, Android e HarmonyOS.
- Kimi Work: o ambiente de trabalho de conhecimento para desktop, com suporte K3 na versão 3.1.0 ou posterior para Windows e Macs com chip Apple.
- Kimi Code: acesso à codificação baseado em terminal, onde os usuários selecionam o K3 através do menu do modelo.
- Kimi API: Acesso de desenvolvedor compatível com OpenAI usando o identificador de modelo kimi-k3.
- Kimi Enterprise: contas organizacionais com recursos de privacidade empresarial e gerenciamento de membros.
- Auto-hospedagem: planejado após o lançamento do peso, mas a implantação realista exigirá uma grande infraestrutura multiaceleradora.
Quem deve considerar Kimi K3?
O K3 é mais atraente para equipes que precisam de um agente para operar em conjuntos de trabalho incomumente grandes: repositórios complexos, longos históricos técnicos, grandes coleções de PDF, pesquisas com muitos dados, fluxos de trabalho de software visual ou consultas repetidas em uma base de conhecimento estável. Seu preço de cache é projetado para recompensar esse padrão de prefixo repetido.
É menos obviamente adequado para conclusões de chat curtas e baratas. O modelo sempre raciocina, a saída custa $15 por milhão de tokens, e a execução com esforço máximo pode ser mais lenta do que um modelo leve que não raciocina. As equipes devem comparar o custo total da tarefa em vez do preço de entrada sozinho: repetições, rastros de raciocínio longos, chamadas de ferramentas e tempo de execução do agente podem importar mais do que a taxa de token principal.
Organizações interessadas principalmente na implantação aberta devem aguardar o lançamento real do peso e da licença antes de tomar decisões de infraestrutura ou conformidade. Mesmo que o checkpoint seja licenciado permissivamente, um modelo de 2.8T provavelmente será consumido por meio de provedores de inferência especializados, em vez de ser baixado para estações de trabalho comuns.
Limitações e questões em aberto
- Verificação independente incompleta: o checkpoint completo não era público na data de publicação.
- As configurações de benchmark variam: diferentes arreios e pontuações de terceiros citadas limitam a comparabilidade direta.
- O raciocínio sempre ativo pode aumentar o custo e a latência: Menos esforço pode ajudar, mas não é equivalente a um modo não pensante.
- A estabilidade da sessão longa depende do tratamento do histórico: a Moonshot adverte contra a perda de histórico de pensamento ou a troca de modelos no meio da sessão.
- O modelo pode ser excessivamente proativo: a documentação de lançamento recomenda limites comportamentais explícitos para aplicativos que não devem improvisar além de limites estreitos.
- A auto-hospedagem é um projeto em escala de cluster: a ativação esparsa não elimina a necessidade de armazenar e distribuir o enorme checkpoint.
Perguntas frequentes
O que é Kimi K3?
Kimi K3 é o modelo multimodal principal de 2.8 trilhões de parâmetros da Moonshot AI. Ele é projetado para codificação de longo horizonte, pesquisa, uso de ferramentas, raciocínio visual e trabalho de conhecimento, com uma janela de contexto de um milhão de tokens.
Quanto custa a API do Kimi K3?
A taxa oficial é de $0.30 por milhão de tokens de entrada com cache, $3.00 por milhão de tokens de entrada sem cache e $15.00 por milhão de tokens de saída, excluindo impostos aplicáveis.
Qual é a janela de contexto do Kimi K3?
Kimi K3 suporta 1.048.576 tokens de contexto. A API padrão tem um limite máximo de conclusão de 131.072 tokens, que pode ser aumentado para 1.048.576 para cargas de trabalho especializadas.
O Kimi K3 está disponível no Hugging Face?
Ainda não no momento da publicação em 23 de julho de 2026. A Moonshot afirmou que os pesos completos seriam lançados até 27 de julho. A página oficial da organização Hugging Face deve ser verificada novamente após essa data.
O Kimi K3 pode rodar localmente?
Não é um modelo local prático para hardware de consumidor. Somente um cálculo de peso aproximado de quatro bits é de cerca de 1.4 TB antes da sobrecarga de tempo de execução, e a Moonshot recomenda configurações de implantação com pelo menos 64 aceleradores.
Kimi K3 é melhor que GPT ou Claude?
Nenhum vencedor universal pode ser estabelecido a partir dos dados de lançamento. O K3 lidera vários benchmarks relatados de codificação e agente, enquanto a própria Moonshot diz que o modelo ainda está atrás dos sistemas proprietários mais fortes no geral. Testes independentes após o lançamento do peso serão mais informativos.
O Kimi K3 suporta imagens e vídeo?
Sim. O K3 possui compreensão visual nativa e suporta entrada de imagem e vídeo através de produtos Kimi documentados e formatos de API. A API requer formatos de entrada de arquivo carregado ou codificado suportados em vez de URLs de imagem públicas arbitrárias.
Resumo
Kimi K3 é um dos lançamentos de modelo de IA mais ambiciosos de 2026: um MoE esparso de 2.8T com visão nativa, uma janela de contexto de um milhão de tokens, forte codificação proprietária e benchmarks de agente, e preços competitivos de entrada em cache. Já está disponível como um modelo hospedado, mas a história de peso aberto ainda era uma promessa em 23 de julho, em vez de um checkpoint licenciado e para download.
Desenvolvedores podem avaliar a API agora, especialmente para fluxos de trabalho de longo contexto repetidos que se beneficiam do cache automático. Pesquisadores e equipes de infraestrutura devem aguardar o lançamento dos pesos em 27 de julho, então verificar a licença, os arquivos do modelo, as pilhas de serviço suportadas e os resultados de benchmark independentes antes de tratar o K3 como uma implantação de peso aberto pronta para produção.