Skip to main content
Does AI know your business exists? Find out
A developer typing on a laptop with a code editor open
Cheaper capable coding models change who can afford to build with them.
Technology

Um modelo de pesos abertos para programação subiu seis vezes sem novo pré-treino

O GLM-5.3 da Z.ai reutiliza a base exata de 743 mil milhões de parâmetros do antecessor, e todo o salto de capacidade veio do pós-treino, e não de uma nova corrida de pré-treino.

Will Lisil|Director & Digital Creator
••6 min de leitura

Resumo

O GLM-5.3 da Z.ai passou de 4,6% para 28,3% no Terminal-Bench 3.0 usando a mesma base de 743 mil milhões de parâmetros do GLM-5.2, sem novo pré-treino. Fica atrás do GPT-5.6 Sol e do Claude Fable 5 nos benchmarks de programação mais duros, mas lidera no AutomationBench e no CyberGym, a um custo muito menor. Os pesos são esperados no final de agosto.

A parte mais cara de construir um modelo de linguagem de fronteira é a corrida de pré-treino. É a etapa que exige um data center, um orçamento de nove dígitos e meses de computação ininterrupta, e é a razão pela qual a lista de organizações capazes de construir um é curta. Por isso, o número mais interessante ligado ao GLM-5.3 da Z.ai, lançado em 14 de agosto, não é uma pontuação de benchmark. É o facto de o modelo ter saltado essa etapa por completo.

O GLM-5.3 reutiliza exatamente a mesma base de mistura de especialistas de 743 mil milhões de parâmetros do GLM-5.2, com cerca de 40 mil milhões de parâmetros ativos por token. Sem novo pré-treino. Todo o ganho veio do pós-treino em escala. No Terminal-Bench 3.0, uma das avaliações mais duras de programação agêntica, o resultado passou de 4,6% para 28,3% — um salto de seis vezes sobre uma base congelada. Para quem acompanha se um modelo de pesos abertos para programação consegue acompanhar a fronteira fechada, isso é mais importante do que qualquer pontuação isolada.

Verdade em Tecnologia, Entregue pela MW3.BIZ

Junte-se a milhares que confiam em nós para insights imparciais sobre IA, blockchain e o futuro da tecnologia

By subscribing, you agree to our Terms and Privacy Policy.

O que mudou sem um novo modelo base

A Z.ai atribui a melhoria a ambientes de treino ampliados e a corridas mais longas de aprendizagem por reforço sobre a base congelada, usando os seus métodos IndexShare e Scalable Agentic Optimization e a framework slime. Em termos simples: o conhecimento subjacente não mudou, mas a capacidade do modelo de planear, usar ferramentas e recuperar dos próprios erros ao longo de uma tarefa longa mudou.

Essa distinção tem peso comercial. Se ganhos de capacidade desta dimensão podem vir do pós-treino, então a barreira para produzir um modelo de programação competitivo cai de "ter um data center" para "ter um bom ambiente de treino e paciência para o executar". O modelo base passa a ser infraestrutura que pode ser melhorada repetidamente, em vez de uma aposta única.

Os ganhos não se limitaram a um benchmark. Segundo a análise do lançamento feita pela Qubrid, o DeepSWE v1.1 subiu de 46,2% para 66,9%, o SWE-Marathon v1.1 de 19,4% para 42,5% e o AutomationBench de 26,2% para 48,2%. No lado da segurança, o ExploitBench mais do que duplicou, de 24,4% para 54,4%.

Os números que a Z.ai está a reivindicar

Além dos saltos, o GLM-5.3 regista 88,2% no Terminal-Bench 2.1, 78,1% no FrontierSWE, 58,0% no NL2Repo e 73,0% no Toolathlon Verified. Na avaliação agêntica GDPval-AA v2 pontua 1.769 Elo, acima dos 1.508 anteriores.

Uma ressalva deve acompanhar todos esses valores: com exceção do GDPval-AA v2, foram medidos pelo próprio fornecedor. Isso é prática comum em lançamentos de modelos em toda a indústria e não é indício de nada impróprio, mas uma pontuação auto-reportada é uma afirmação à espera de replicação, não um resultado assente. O número independente do conjunto — o GDPval-AA v2 — é justamente aquele em que o GLM-5.3 lidera sobre o Kimi K3 da Moonshot AI, por 1.769 Elo contra 1.668.

A taxa de geração é a vantagem mais silenciosa. A Artificial Analysis mede o GLM-5.3 em 115 tokens por segundo, contra 40 do Kimi K3. Para um agente a percorrer uma refatoração longa, a velocidade sustentada acumula-se em tempo real de forma que uma linha de benchmark não capta.

Onde ainda fica atrás da fronteira fechada

Seria uma leitura errada chamar a isto paridade. No Terminal-Bench 3.0, o GPT-5.6 Sol lidera com 34,6% e o Claude Fable 5 com 33,7%, com o GLM-5.3 em 28,3%. No DeepSWE a ordem é a mesma: 72,7%, 69,7% e 66,9%. No ExploitBench a diferença é grande, com o Claude Fable 5 em 78,0% e o GLM-5.3 em 54,4%.

A Moonshot AI é franca sobre a mesma diferença no seu próprio modelo. Nas notas de lançamento do Kimi K3 — um modelo de mistura de especialistas de 2,8 biliões de parâmetros com contexto de um milhão de tokens, cujos pesos saíram no final de julho — a empresa escreve que, embora o desempenho global ainda fique atrás dos modelos proprietários mais poderosos, o modelo demonstrou desempenho ao nível da fronteira. Ambos os laboratórios descrevem a mesma forma: perto em muitos eixos, atrás nos mais difíceis.

Há também duas lideranças mais estreitas que vale a pena registar, porque são as que uma equipa preocupada com segurança vai valorizar: o GLM-5.3 lidera a comparação no AutomationBench com 48,2% e no CyberGym com 84,5%, à frente dos dois modelos fechados nesses dois casos.

A diferença de custo é a verdadeira história para equipas pequenas

A capacidade decide o que é possível. O preço decide quem pode tentar. As subscrições do plano de programação da Z.ai começam em 12,60 dólares por mês na faturação anual no nível Lite, com o Pro a 56 e o Max a 117,60. O preço por token do GLM-5.3 não tinha sido publicado no lançamento; a tabela pública ainda termina no GLM-5.2, a 1,40 dólares por milhão de tokens de entrada e 4,40 por milhão de saída.

Coloque isso ao lado das tarifas de API publicadas do Kimi K3, de 3,00 dólares por milhão de tokens de entrada sem cache e 15,00 por milhão de saída, e a diferença dentro do próprio campo de pesos abertos é de várias vezes. Uma comparação direta independente da Composio colocou ambos os modelos em sete de doze tarefas resolvidas na sua avaliação agêntica, com custos por caso de cerca de 0,89 a 1,50 dólares para o GLM contra 1,83 a 5,25 para o Kimi — resultados comparáveis, faturas materialmente diferentes.

A eficiência de tokens aponta no mesmo sentido. Na avaliação interna de código da Z.ai, o GLM-5.3 atingiu 31,4% de precisão usando cerca de 50 mil tokens de saída, onde o Claude Opus 4.8 atingiu 29,5% usando 120 mil. Trate os valores de precisão como reportados pelo fornecedor, mas a proporção de tokens é o número que aparece numa fatura ao fim do mês.

Numa perspetiva de democratização da tecnologia, esta é a parte que mais nos importa na MW3.biz. Uma capacidade que só existe atrás do escalão de preço mais alto está, na prática, disponível para um número reduzido de equipas bem financiadas. A mesma capacidade a um décimo do custo — com pesos que eventualmente podem correr no seu próprio hardware — fica disponível para um estudante, uma startup de duas pessoas ou um programador num país onde o preço das APIs de fronteira é simplesmente incomportável. Não diríamos a ninguém que os modelos fechados são a escolha errada; eles lideram vários dos benchmarks acima por mérito. A nossa visão é que a diferença a fechar-se a partir de baixo é a forma como a capacidade chega de facto às pessoas, e merece atenção quando acontece.

Pesos abertos, com um asterisco

A expressão "peso aberto" está a fazer trabalho real nesta história, e precisa de ser qualificada. No lançamento, os pesos do GLM-5.3 não foram divulgados. Estão retidos atrás de cerca de duas semanas de avaliação de segurança, o que coloca a saída esperada no final de agosto. Até lá, o modelo está disponível por API e, funcionalmente, é proprietário.

A licença também não está definida. O GLM-5.2 saiu sob MIT, que é das mais permissivas que existem, mas a Z.ai não publicou os termos do GLM-5.3, e a licença do antecessor não os estabelece. Também não há ainda checkpoint, tokenizador, especificação de quantização ou orientação de hardware, pelo que alojar o modelo por conta própria não é neste momento uma pergunta que alguém consiga responder.

Vale a pena sinalizar isto com clareza, porque "aberto" tornou-se tanto uma palavra de marketing como um termo técnico. O estado honesto hoje é: um modelo de pesos abertos que se pode mesmo descarregar e executar (o Kimi K3, e o GLM-5.2 antes dele), e outro que anunciou a intenção de se tornar um. Quem estiver a planear com base no segundo deve contar com a possibilidade de a data anunciada mudar.

O que um programador solo deve fazer agora

O conselho prático não é glamoroso. Não migre um fluxo de trabalho que funciona com base numa tabela de benchmarks do dia do lançamento, sobretudo uma medida pelo fornecedor. Faça a sua própria avaliação nas tarefas que realmente repete, porque os números publicados concentram-se em programação agêntica e trabalho de segurança, e se essa não for a sua carga de trabalho a ordenação pode não sobreviver ao contacto com ela.

Dois detalhes operacionais vão apanhar as pessoas desprevenidas. O GLM-5.3 introduz uma alteração incompatível na API: o raciocínio não pode ser desligado, e a definição mínima é um esforço de raciocínio baixo em vez de nenhum. E se o seu plano depender de alojamento próprio, espere pelos pesos e pela licença reais, e não pelo anúncio deles.

A tendência mais ampla é a que convém planear. A pressão de custos há algum tempo que empurra equipas pequenas para infraestrutura que controlam, e quem acompanhou a nossa reportagem sobre o que a inflação recorde do SaaS está a fazer às decisões de construir ou comprar vai reconhecer o padrão. Um modelo de programação de pesos abertos e capaz, a correr no seu próprio hardware, transforma isso de um argumento de custo num argumento de arquitetura — mas só quando os pesos estiverem genuinamente nas suas mãos.

Tags:#open-weight coding model#GLM-5.3#Kimi K3#agentic coding#open source AI#AI coding tools#Z.ai#Moonshot AI
Palavras-chave:open-weight coding modelGLM-5.3Kimi K3Terminal-Benchagentic coding
Compartilhar:X (Twitter)LinkedIn

Pontos Principais

  • •O GLM-5.3 reutiliza a base exata de mistura de especialistas de 743 mil milhões de parâmetros do GLM-5.2, sem novo pré-treino; todo o ganho veio do pós-treino em escala.
  • •O Terminal-Bench 3.0 subiu de 4,6% para 28,3%, com o DeepSWE v1.1 a passar de 46,2% para 66,9% e o ExploitBench de 24,4% para 54,4%.
  • •Ainda fica atrás do GPT-5.6 Sol e do Claude Fable 5 no Terminal-Bench 3.0, no DeepSWE e no ExploitBench, embora lidere no AutomationBench e no CyberGym.
  • •Todos os benchmarks foram medidos pelo fornecedor, exceto o GDPval-AA v2, a única avaliação independente, na qual o GLM-5.3 lidera o Kimi K3 por 1.769 Elo contra 1.668.
  • •Os pesos não foram divulgados no lançamento e a licença não está publicada; a abertura é esperada no final de agosto, por isso planos de alojamento próprio devem aguardar os ficheiros reais.

Frequently Asked Questions

Significa que a Z.ai não executou uma nova passagem de pré-treino, a fase mais cara da construção de um modelo. O GLM-5.3 assenta na base idêntica de 743 mil milhões de parâmetros do GLM-5.2, e todos os ganhos de capacidade vêm do pós-treino: ambientes ampliados e corridas mais longas de aprendizagem por reforço sobre pesos congelados.

Ainda não. No lançamento os pesos ficaram retidos atrás de cerca de duas semanas de avaliação de segurança, com divulgação esperada no final de agosto. Não foi publicada qualquer licença para o GLM-5.3, e os termos MIT do GLM-5.2 não se transferem automaticamente. Até os ficheiros saírem, está disponível por API e é efetivamente proprietário.

Fica atrás nos benchmarks de programação mais duros: o GPT-5.6 Sol lidera o Terminal-Bench 3.0 com 34,6% e o Claude Fable 5 com 33,7%, contra os 28,3% do GLM-5.3. Lidera no AutomationBench com 48,2% e no CyberGym com 84,5%. A maioria destes valores foi medida pelo fornecedor e deve ser tratada como afirmação pendente de replicação.

Porque o preço decide o acesso. Os planos de programação da Z.ai começam em 12,60 dólares por mês na faturação anual, e uma comparação independente da Composio encontrou custos por caso de cerca de 0,89 a 1,50 dólares contra 1,83 a 5,25 para o Kimi K3, com taxas de sucesso comparáveis. Capacidade semelhante por uma fração da fatura alarga quem consegue construir com ela.

Faça primeiro a sua própria avaliação. Os resultados publicados concentram-se em tarefas de programação agêntica e de segurança, pelo que podem não prever o desempenho na sua carga de trabalho. Note também uma alteração incompatível na API: o raciocínio não pode ser desligado, e o mínimo é um esforço de raciocínio baixo.

Fontes

  1. Qubrid AI - GLM-5.3 Benchmarks, Architecture and Pricing(accessed 2026-08-25)
  2. Moonshot AI - Kimi K3 Tech Blog: Open Frontier Intelligence(accessed 2026-08-25)
  3. Composio - GLM 5.2 vs Kimi K3 head-to-head evaluation(accessed 2026-08-25)

Continue Lendo

A robotic arm polishing a guitar body in a factory
Technology15 de setembro de 2026

Oitenta por cento das fabricas americanas ainda nao tem robos

Will Lisil•6 min de leitura
Leia Mais →
The European Parliament hemicycle in Strasbourg during a plenary session
Technology9 de setembro de 2026

A Lei de IA da UE agora obriga seu chatbot a se apresentar

Will Lisil•7 min de leitura
Leia Mais →
Three developers working together around laptops at a hackathon
Technology5 de setembro de 2026

Ferramentas de codificação agêntica interromperam uma em cada três compras de software

A pesquisa State of AI da McKinsey concluiu que 32% de 1.719 organizações em 97 países decidiram não comprar ao menos um produto ou recurso de software porque ferramentas de codificação agêntica permitiram construí-lo internamente. A parcela de organizações que percebe algum impacto no lucro com IA permaneceu estável em 37%, ou seja, a construção ainda não virou resultado.

Will Lisil•6 min de leitura
Leia Mais →
AI Agent Payments Hit 75 Million Transactions on One Standard Alone
Technology19 de agosto de 2026

Pagamentos por agentes de IA atingem 75 milhões de transações em um único padrão

Somente o padrão x402 liquidou 75,41 milhões de transações e US$ 24,24 milhões em volume em 30 dias. Quatro protocolos rivais disputam agora como o software autônomo paga pelo que usa.

Will Lisil•6 min de leitura
Leia Mais →
Data Residency Rules Now Reach Two-Person SaaS Teams
Technology10 de agosto de 2026

Regras de residência de dados agora alcançam equipes de SaaS com duas pessoas

O regime europeu de troca de nuvem se aplica a fornecedores de todos os portes, sem isenção para pequenos, e as últimas taxas de saída permitidas desaparecem em 12 de janeiro de 2027.

Will Lisil•6 min de leitura
Leia Mais →
Ver Todas as Notícias
Mais artigos na seção de notícias

Volte em breve para mais atualizações da MW3.BIZ