#Llm
O Ox Alpha era o GLM-5.3-Flash. Cinco dias antes de qualquer anúncio, o fingerprinting por tokenizador já apontava a Zhipu: 95 de 95 contra o vocabulário do GLM-5. Agora a Z.ai confirmou, publicou os pesos no Hugging Face sob licença MIT e revelou a arquitetura: 320B totais com 18B ativos, 1M de contexto, US$ 0,075 por milhão. O benchmark de 80% continua sendo o que sempre foi: uma amostra de dez tarefas. No conjunto completo, 63%.
A Alibaba anunciou o Qwen3.8-Flash-Next: 125B totais com apenas 6B ativos por token, mais 51B em embeddings N-gram e uma atenção esparsa redesenhada. O que foi confirmado pela Qwen, o que ainda é estimativa da comunidade, quanta memória ele pede de verdade e por que a arquitetura está sendo publicada antes do Qwen 4. Nenhum benchmark oficial saiu até agora.
Um endpoint compatível com a API da OpenAI para centenas de modelos, com fallback automático entre provedores. O que é o OpenRouter, como chamar em curl, Python e PHP, como controlar roteamento, provedor e teto de custo, e os cenários em que essa camada extra atrapalha mais do que ajuda.
A internet trata o Laravel AI SDK e o Prism PHP como concorrentes e ainda repete que o SDK oficial usa o Prism por baixo dos panos. O composer.json diz outra coisa. Neste post: o que cada pacote faz de fato, o código lado a lado, a tabela do que só existe em um deles, a cadência de release dos dois e um guia de decisão por caso concreto. Sem "depende".
O Laravel AI SDK é o pacote first-party de IA do Laravel: agentes como classes PHP, tool calling, structured output, streaming, embeddings com pgvector e fakes para testar sem gastar token. Guia prático do composer require ao primeiro agente rodando, com o que o SDK resolve, o que ele não resolve e as limitações que ninguém conta.
A DeepSeek publicou o DeepSeek-V4-Pro-0813 na página oficial de preços e o release oficial do V4 Pro finalmente saiu do rótulo de preview. Os números reportados, o que é fato e o que ainda não tem documento público, a comparação com o Flash 0731 e o Opus 4.8, e o aviso na própria página de preços de que a DeepSeek vai aumentar os valores em breve.
A Cactus Compute lançou o Needle 2: 45M de parâmetros, binário de 14 MB, sessão em 28 MB de RAM, 500 tokens/s num Raspberry Pi 5 e 70 MFLOPs por token contra 460 do LFM2.5 230M. A engenharia é real: quantização CQ2-bit aplicada desde o pré-treino, gramática byte-level que trava a saída em function calls válidas. Mas o Show HN virou laboratório público de falhas: digitar "HN" dispara lock_door com confidence 0, "warmer" vira mode cool, e a demo de ESP32 que viralizou era do Needle 1.
A imprensa diz que o Muse Glimmer 30B exige uma 5090. O r/LocalLLaMA posta print rodando numa 3090 usada de 2020. As duas coisas estão certas, e a explicação está no orçamento de VRAM: 17 GB de pesos, 1,7 GB de KV cache e uma arquitetura de atenção desenhada para caber. Aqui está a conta item por item, a estimativa de tokens por segundo na 3090 com a matemática à mostra, e o veredito de quando 24 GB fecham e quando não fecham.
O Gemini 3.5 Pro ainda não saiu, e a cada semana tem uma data nova circulando. Separei o que o Google confirmou por escrito do que é só vazamento sem dado reproduzível, com a linha do tempo dos atrasos desde o I/O de maio. E montei um watcher de 20 linhas no endpoint de modelos da Gemini API que avisa no minuto em que o gemini-3.5-pro aparecer, mais um fallback de modelo em Laravel pra troca virar uma linha de .env.
O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.
A Alibaba vai publicar os pesos do Qwen3.8-Max, 2,4 trilhões de parâmetros, na semana de 10 de agosto: é a primeira vez que um modelo classe Max abre. A conta honesta do que isso significa na prática: quanto pesa em VRAM, por que nem um nó de 8 H200 fecha, por que o Qwen3.8-27B é o checkpoint que realmente te interessa, e o detalhe que quase ninguém está olhando, a licença que ainda não foi anunciada.
A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.