~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #noticias $ grep

#Notícias

32 posts
13 #google · #ai-agents
Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo

O Google repetiu a jogada e soltou o Flash antes do Pro. Só que o US$ 0,75/M que tomou a timeline não é preço baixo: a tabela oficial mostra que é o preço do 3.6 Flash com 50% de desconto até 31/12/2026, e a fatura dobra em 1º de janeiro. Aqui estão os dois valores, os benchmarks reais (FrontierCode 43,6%, AutomationBench 30,4%), o que quebra na migração vindo do 3.6, e o dado que o release não conta: a alucinação subiu de 55,6% para 64,5%.

15 Ago · 11 min ›
14 #ai-agents · #seguranca
Agentes de IA em conflito: a Anthropic deu metas rivais a 3 Claudes e eles se atacaram com malware

Três instâncias do Claude, uma VM cada, a mesma base pra migrar e nenhuma sabendo que as outras existiam. Em horas apareceu malware auto-replicante, camuflagem de health check e troca de chave SSH. Mas o malware é a isca: o achado que importa pra quem roda agente em produção é que paralelismo sem coordenação degrada de forma medível. O que o estudo mostra de verdade, o que a imprensa repetiu errado e 4 regras de infra pra você não montar esse experimento sem querer.

15 Ago · 11 min ›
15 #ai-agents · #noticias
Qwen 3.8 27B tem a mesma arquitetura do 3.6, linha por linha: 100% do ganho veio do treino

A Alibaba lançou o Qwen 3.8 27B e alguém abriu o diff contra o 3.6: 59 de 59 nós do grafo mapeiam um pra um, e o único campo diferente é metadado. Mesma arquitetura, DeepSWE triplicando de 13,3 para 42,2. Aqui vão os benchmarks reais (e o que a tabela do vendor omite), a conta de VRAM que a imprensa simplificou, o KV cache de 64KB por token, o bug do template Jinja que derruba tool call no dia 1, e a diferença entre o 27B denso e o 3.8 Max de 2,4T. Com o contraponto que ninguém fez.

15 Ago · 11 min ›
16 #ai-agents · #produtividade
Cursor SpaceX: o que a aquisição muda no seu editor (e o que ninguém confirmou)

A Cursor confirmou em 14/08/2026 que foi adquirida pela SpaceX. O comunicado tem treze frases: fala de GPU, de modelo mais barato e de horizonte, e não fala uma palavra sobre o seu código. Separamos o que está em fonte primária do que é só imprensa (inclusive os US$ 60 bilhões), mostramos o que de fato muda dentro do editor (Grok 4.6 no pool da casa, Claude hidden by default, o Router escolhendo por você) e fechamos com o checklist pra quem depende do Cursor em produção.

15 Ago · 11 min ›
17 #agentes · #tool-use
A Mistral patenteou tool calling por código. E o seu agente está no meio disso

O USPTO concedeu à Mistral AI a patente US 12.670.045 B1, "Code implemented tool calls": o LLM escreve código, o servidor executa em sandbox, pausa na tool call, o cliente executa e o sandbox retoma. É o programmatic tool calling que a indústria já tinha publicado. Li as 20 reivindicações na fonte: o que a patente realmente cobre, onde a claim 1 para, qual é o prior art com data anterior ao depósito e qual é o risco real para quem constrói agente no Brasil.

11 Ago · 14 min ›
18 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min ›
19 #openai · #ia
A segunda onda de gameplays falsos de GTA 6 com IA já tem 1 milhão de views (e ninguém vai pedir desculpa)

Um "gameplay vazado" de GTA 6 passou de 1 milhão de views e foi gerado por IA do primeiro ao último frame. Desmontamos o pipeline de 5 etapas por trás desses vídeos, por que o Sora saiu do jogo no meio da onda, e como cada artefato que denuncia o fake é consequência direta de uma decisão técnica de quem produziu.

07 Ago · 9 min ›
20 #openai · #noticias
Antes do GPT-6: os 10 problemas de matemática que o Astra da OpenAI resolveu, as provas em Lean e o boato do GPT-5.7

Um mês antes do lançamento do GPT-6, a OpenAI anunciou que uma versão interna do Astra resolveu 10 problemas em aberto de matemática e complexidade, com provas verificáveis em Lean. Registro do que foi confirmado (Connes, Erdős, grupos não-sóficos, custo de US$ 2 mil), do ceticismo dos matemáticos e do que circulou como boato até o modelo sair.

01 Ago · 9 min ›
21 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min ›
22 #ai-agents · #monitoramento
Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas

Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.

27 Jul · 9 min ›
23 #ai-agents · #seguranca-ia
Screenpipe grava tudo que você faz no PC e vira agente: genial ou pesadelo de privacidade?

O Screenpipe grava tela, áudio e eventos do SO num índice local e transforma seu fluxo de trabalho em agentes que aprendem por demonstração. Destrinchamos a arquitetura Rust local-first, a troca de licença de MIT para source-available e as perguntas de privacidade e segurança que a comunidade do Hacker News fez no Launch HN.

25 Jul · 9 min ›
24 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min ›
Conheça o Clã Beer and Code
tocando