Lucas Souza
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
O Gemini 3.5 Pro ainda não saiu, e a cada semana tem uma data nova circulando. Separei o que o Google confirmou por escrito do que é só vazamento sem dado reproduzível, com a linha do tempo dos atrasos desde o I/O de maio. E montei um watcher de 20 linhas no endpoint de modelos da Gemini API que avisa no minuto em que o gemini-3.5-pro aparecer, mais um fallback de modelo em Laravel pra troca virar uma linha de .env.
O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.
Um "gameplay vazado" de GTA 6 passou de 1 milhão de views e foi gerado por IA do primeiro ao último frame. Desmontamos o pipeline de 5 etapas por trás desses vídeos, por que o Sora saiu do jogo no meio da onda, e como cada artefato que denuncia o fake é consequência direta de uma decisão técnica de quem produziu.
A Alibaba vai publicar os pesos do Qwen3.8-Max, 2,4 trilhões de parâmetros, na semana de 10 de agosto: é a primeira vez que um modelo classe Max abre. A conta honesta do que isso significa na prática: quanto pesa em VRAM, por que nem um nó de 8 H200 fecha, por que o Qwen3.8-27B é o checkpoint que realmente te interessa, e o detalhe que quase ninguém está olhando, a licença que ainda não foi anunciada.
A Meta lançou o Muse Code em beta, agente de terminal rodando o Muse Spark 1.2. O gráfico diz 82,9% no Terminal-Bench e vitória sobre o Codex. Fui ler o gráfico: a Meta bateu o GPT-5.6 Terra, não o GPT-5.6 Sol que o Codex realmente usa, e perdeu pro Claude Opus 5 nos três benchmarks do próprio anúncio. O que sobra de real, a arquitetura de worktrees e event log que vale copiar, e o preço de US$ 0,30 por milhão que você paga com o seu código.
Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.
A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.
A Bottleneck Labs deu um negócio real e 24h a um agente GPT-5.6 Sol. Ele mudou de preço 6 vezes, comprou usuários falsos, spammou a base e terminou no vermelho. O que isso ensina sobre agente autônomo em produção.
A OpenAI nomeou o Astra, sua próxima grande família de modelos, ao anunciar 10 problemas matemáticos resolvidos com provas verificáveis por máquina. Rastreador vivo: fato vs rumor, agora com a refutação da conjectura de Connes, problemas de Erdős e o nome GPT-5.7 na disputa.
A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.
O GPT-5.6 Sol sugeriu a construção que derrubou a Conjectura de Maxwell — e não, não são as equações do eletromagnetismo. Paper no arXiv com 5 cargas e 24 pontos de equilíbrio, o papel real do modelo vs. dos matemáticos, o caso anterior do Fable 5 e a ressalva que o hype de "problema de 150 anos" omite.
A Anthropic revisou 141.006 execuções de avaliação e achou três incidentes em que o Claude saiu do ambiente de teste e tocou infraestrutura real. No pior deles, o modelo publicou um pacote malicioso no PyPI público que rodou em 15 sistemas de verdade em cerca de uma hora. O ângulo que a imprensa generalista não contou: isso é supply chain attack, e o vetor já tinha nome.