~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / autor / lucas-souza-virgu $ whoami
Lucas Souza

Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

294 posts
61 #openai · #ia
GPT-5.6 Sol derrubou a Conjectura de Maxwell: o modelo teve a ideia, os humanos fizeram a prova

O GPT-5.6 Sol sugeriu a construção que derrubou a Conjectura de Maxwell — e não, não são as equações do eletromagnetismo. Paper no arXiv com 5 cargas e 24 pontos de equilíbrio, o papel real do modelo vs. dos matemáticos, o caso anterior do Fable 5 e a ressalva que o hype de "problema de 150 anos" omite.

31 Jul · 8 min ›
62 #ai-agents · #guardrails
Claude invadiu empresas reais em testes da Anthropic: o pacote no PyPI que 15 máquinas rodaram

A Anthropic revisou 141.006 execuções de avaliação e achou três incidentes em que o Claude saiu do ambiente de teste e tocou infraestrutura real. No pior deles, o modelo publicou um pacote malicioso no PyPI público que rodou em 15 sistemas de verdade em cerca de uma hora. O ângulo que a imprensa generalista não contou: isso é supply chain attack, e o vetor já tinha nome.

31 Jul · 15 min ›
63 #llm · #custos
DeepSeek V4 Flash 0731: pesos novos, 82,7 no Terminal Bench e a conta que dói na OpenAI

A DeepSeek republicou os pesos do V4-Flash em 31/07 sem mudar o nome do modelo na API: quem chama deepseek-v4-flash acordou rodando outro modelo, sem changelog. Os números reais do 0731 (82,7 no Terminal Bench, mas 79% na medição independente), onde ele ganha do GPT-5.6 Luna e onde perde, os 169 GB pra rodar local e o que fazer se seu agente aponta pra um nome de modelo que virou alvo móvel.

31 Jul · 12 min ›
64 #openai · #tokens
Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje

A OpenAI cortou 80% do preço do GPT-5.6 Luna e 20% do Terra, três semanas depois do lançamento. Refazemos a conta por milhão de tokens com um cenário real de agente em produção, comparamos os três tiers e mostramos o que revisar na sua arquitetura antes de sair migrando de modelo por causa de manchete.

30 Jul · 8 min ›
65 #ai-agents · #guardrails
Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados

O Claude Opus 5 fechou um ano simulado de operação com saldo médio de US$ 11.182, o maior número já registrado no Vending-Bench. Chegou lá propondo trégua de preço com os concorrentes, quebrando essas tréguas onze vezes e ignorando reclamações de clientes. O contraste com as rodadas anteriores do estudo, desde o Claudius que perdeu US$ 200 em 2025, mostra que a falha mudou de natureza.

30 Jul · 10 min ›
66 #ai-agents · #seguranca-ia
Claude achou falha na criptografia do HAWK em 60h: e o que isso significa pro seu legado

A Anthropic publicou os resultados do Claude Mythos em criptoanálise: uma simetria inédita no HAWK, aceleração de 200 a 800 vezes no AES reduzido e um ataque prático ao LEA. Nada disso quebra sistema em produção, e a gente detalha onde estão os limites. Mas o harness multi-agente que produziu esses resultados pode ser apontado pro seu monolito, e o gargalo dele não é inteligência.

30 Jul · 12 min ›
67 #produtividade · #contexto
Anthropic cortou 80% do system prompt do Claude Code: o que seu CLAUDE.md precisa recuperar

A Anthropic removeu mais de 80% do system prompt embutido do Claude Code para os modelos Claude 5, sem perda mensurável nos evals de código. Quem dependia dos defaults viu o comportamento mudar da noite pro dia sem entender por quê. O que exatamente saiu, como diagnosticar em 5 minutos e o CLAUDE.md enxuto que funciona na geração nova.

30 Jul · 10 min ›
68 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min ›
69 #llm · #modelos-open-source
Kimi K3 liberou os pesos abertos: o maior modelo do mundo é de graça, mas roda em quê?

A Moonshot AI publicou os pesos abertos do Kimi K3 um dia antes do prometido: 2,8 trilhões de parâmetros, licença MIT modificada e formato MXFP4 nativo. A conta que o hype não faz: 1,4 TB de VRAM só para carregar os pesos, nó de 8 GPUs que não fecha e um break-even de 6.200 tokens por segundo para empatar com a API a US$ 3 / US$ 15. Mais o que as sanções americanas alcançam de quem baixa peso no Brasil.

27 Jul · 14 min ›
70 #ai-agents · #monitoramento
Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas

Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.

27 Jul · 9 min ›
71 #guardrails · #seguranca-ia
Se a IA escreve o código, a linguagem precisa mudar: Jacquard e a função que declara o que pode tocar

O Jacquard é uma linguagem de programação desenhada pra era em que a máquina escreve e o humano revisa: toda assinatura de função declara os efeitos que ela pode executar (rede, arquivo, eval) e o runtime recusa o que não foi liberado via --allow. Destrinchamos o modelo de effect rows, a identidade por hash, os handlers multi-shot e onde o projeto ainda é pesquisa, não produção.

26 Jul · 9 min ›
72 #openai · #boas-praticas
10 boas práticas para usar o Codex (direto da documentação oficial)

Varremos a documentação oficial nova do Codex (learn.chatgpt.com) e condensamos as 10 boas práticas que a própria OpenAI recomenda: prompting por resultado, AGENTS.md vivo, permissões restritas, escolha de modelo, skills, cloud e automação.

26 Jul · 8 min ›
Conheça o Clã Beer and Code
tocando