Use a IA antes que ela use você.
Tutoriais práticos, notícias do ecossistema e pacotes que valem o seu tempo. Por Lucas Souza.
A Cactus Compute lançou o Needle 2: 45M de parâmetros, binário de 14 MB, sessão em 28 MB de RAM, 500 tokens/s num Raspberry Pi 5 e 70 MFLOPs por token contra 460 do LFM2.5 230M. A engenharia é real: quantização CQ2-bit aplicada desde o pré-treino, gramática byte-level que trava a saída em function calls válidas. Mas o Show HN virou laboratório público de falhas: digitar "HN" dispara lock_door com confidence 0, "warmer" vira mode cool, e a demo de ESP32 que viralizou era do Needle 1.
ler agora ›Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.
Varremos a documentação oficial nova do Codex (learn.chatgpt.com) e condensamos as 10 boas práticas que a própria OpenAI recomenda: prompting por resultado, AGENTS.md vivo, permissões restritas, escolha de modelo, skills, cloud e automação.
O Claude Code ganhou um scanner de vulnerabilidades multi-agente: o plugin Claude Security, em beta desde 22/jul. Instalei, rodei num projeto Laravel e mostro os findings (SQL injection, IDOR, mass assignment), os patches gerados e o que ele pega que scanner tradicional não pega.
Dá pra rodar um modelo decente no seu notebook, sem mandar um byte pra nuvem. O guia de quando isso faz sentido, o que roda no seu hardware, como subir com Ollama e quando local ganha da API.