~/beer-and-code
▪ próximo evento Workshop: Loop Engineering — Pare de Ser o Operador do Agente · 19 Ago · 19h (horário de Brasília) — duração de 2 a 4 horas, ao vivo via Google Meet garantir vaga
~ / noticias $ ls -la

Notícias

Lançamentos, novidades e tendências do mundo do desenvolvimento.

135 notícias
01 #llm · #custos
DeepSeek V4 Pro 0813: 87,9 no Terminal Bench passa o Opus 4.8 e a conta vai subir

A DeepSeek publicou o DeepSeek-V4-Pro-0813 na página oficial de preços e o release oficial do V4 Pro finalmente saiu do rótulo de preview. Os números reportados, o que é fato e o que ainda não tem documento público, a comparação com o Flash 0731 e o Opus 4.8, e o aviso na própria página de preços de que a DeepSeek vai aumentar os valores em breve.

12 Ago · 11 min
02 #mobile · #tool-use
Needle2: um LLM de 14 MB que roda no ESP32 e faz tool calling com 6,5x menos compute

A Cactus Compute lançou o Needle 2: 45M de parâmetros, binário de 14 MB, sessão em 28 MB de RAM, 500 tokens/s num Raspberry Pi 5 e 70 MFLOPs por token contra 460 do LFM2.5 230M. A engenharia é real: quantização CQ2-bit aplicada desde o pré-treino, gramática byte-level que trava a saída em function calls válidas. Mas o Show HN virou laboratório público de falhas: digitar "HN" dispara lock_door com confidence 0, "warmer" vira mode cool, e a demo de ESP32 que viralizou era do Needle 1.

12 Ago · 10 min
03 #seguranca-ia · #anthropic
Claude Code vazando email no curl — e o Auto Mode vira padrão dia 14

A issue #78431 do repo anthropics/claude-code mostra o agente montando comandos curl com o e-mail real do usuário dentro do header User-Agent, sem pedir permissão. O bug report é ruim, mas o comportamento está verificado: tem tool_use verbatim de session log, com 5 ocorrências em 1 hora. E o timing é o que pesa: dia 14 de agosto o Auto Mode vira padrão em Pro, Max e Team, ou seja, quem aprova esse curl deixa de ser você e passa a ser um classificador.

12 Ago · 11 min
04 #agentes · #tool-use
A Mistral patenteou tool calling por código. E o seu agente está no meio disso

O USPTO concedeu à Mistral AI a patente US 12.670.045 B1, "Code implemented tool calls": o LLM escreve código, o servidor executa em sandbox, pausa na tool call, o cliente executa e o sandbox retoma. É o programmatic tool calling que a indústria já tinha publicado. Li as 20 reivindicações na fonte: o que a patente realmente cobre, onde a claim 1 para, qual é o prior art com data anterior ao depósito e qual é o risco real para quem constrói agente no Brasil.

11 Ago · 14 min
05 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min
06 #ai-agents · #llm
Muse Glimmer 30B cabe mesmo numa RTX 3090? A Meta diz uma coisa, quem testou diz outra

A imprensa diz que o Muse Glimmer 30B exige uma 5090. O r/LocalLLaMA posta print rodando numa 3090 usada de 2020. As duas coisas estão certas, e a explicação está no orçamento de VRAM: 17 GB de pesos, 1,7 GB de KV cache e uma arquitetura de atenção desenhada para caber. Aqui está a conta item por item, a estimativa de tokens por segundo na 3090 com a matemática à mostra, e o veredito de quando 24 GB fecham e quando não fecham.

11 Ago · 12 min
07 #api · #compliance
Claude agora assina tudo que escreve: a marca d'água invisível que sobrevive ao copia-e-cola

Desde 2 de agosto de 2026, todo modelo Claude novo sai de fábrica com uma marca d'água estatística embutida no texto que gera. Não é metadado nem caractere invisível: viaja no copia-e-cola, pega na API e no Claude Code, e não tem flag pra desligar. O que a detecção prova, o que não prova, e o que realmente apaga o sinal.

11 Ago · 13 min
08 #harness · #guardrails
Claude Code Auto Mode vira padrão dia 14: o que muda e como desativar

Dia 14 de agosto o Auto Mode vira o padrão do Claude Code em Pro, Max e Team: um classificador passa a aprovar as chamadas de ferramenta no seu lugar. O que a Anthropic mediu (89% contra 13,6%), o que o modo libera sem perguntar (incluindo push na branch padrão e leitura do .env) e as quatro formas de colocar o checkpoint humano de volta.

10 Ago · 8 min
09 #ia · #google
Gemini 3.5 Pro: rastreador de lançamento, vazamentos e o que já dá pra confirmar

O Gemini 3.5 Pro ainda não saiu, e a cada semana tem uma data nova circulando. Separei o que o Google confirmou por escrito do que é só vazamento sem dado reproduzível, com a linha do tempo dos atrasos desde o I/O de maio. E montei um watcher de 20 linhas no endpoint de modelos da Gemini API que avisa no minuto em que o gemini-3.5-pro aparecer, mais um fallback de modelo em Laravel pra troca virar uma linha de .env.

08 Ago · 6 min
10 #ia · #agentes
Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas

O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.

07 Ago · 18 min
11 #openai · #ia
A segunda onda de gameplays falsos de GTA 6 com IA já tem 1 milhão de views (e ninguém vai pedir desculpa)

Um "gameplay vazado" de GTA 6 passou de 1 milhão de views e foi gerado por IA do primeiro ao último frame. Desmontamos o pipeline de 5 etapas por trás desses vídeos, por que o Sora saiu do jogo no meio da onda, e como cada artefato que denuncia o fake é consequência direta de uma decisão técnica de quem produziu.

07 Ago · 9 min
12 #ia · #llm
Qwen 3.8 Max pesos abertos dia 10: o que dá (e o que não dá) pra rodar dos 2,4 trilhões

A Alibaba vai publicar os pesos do Qwen3.8-Max, 2,4 trilhões de parâmetros, na semana de 10 de agosto: é a primeira vez que um modelo classe Max abre. A conta honesta do que isso significa na prática: quanto pesa em VRAM, por que nem um nó de 8 H200 fecha, por que o Qwen3.8-27B é o checkpoint que realmente te interessa, e o detalhe que quase ninguém está olhando, a licença que ainda não foi anunciada.

07 Ago · 12 min
Conheça o Clã Beer and Code
tocando