~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #noticias $ grep

#Notícias

21 posts
01 #performance · #openai
GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5

Não é modelo novo. É o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato: 750 tokens/s, 44 GB de SRAM on-chip e zero preço publicado. A OpenAI anuncia 14x contra o próprio Sol Standard; a Cerebras anuncia 11x contra o Fable 5 (sem teste pareado). Aqui separamos o que é verificável do que é marketing de fornecedor, explicamos por que Sol, Ultra e Ultrafast são três coisas diferentes, e mostramos a conta que decide se latência vira dinheiro no seu agente.

15 Ago · 10 min
02 #google · #ai-agents
Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo

O Google repetiu a jogada e soltou o Flash antes do Pro. Só que o US$ 0,75/M que tomou a timeline não é preço baixo: a tabela oficial mostra que é o preço do 3.6 Flash com 50% de desconto até 31/12/2026, e a fatura dobra em 1º de janeiro. Aqui estão os dois valores, os benchmarks reais (FrontierCode 43,6%, AutomationBench 30,4%), o que quebra na migração vindo do 3.6, e o dado que o release não conta: a alucinação subiu de 55,6% para 64,5%.

15 Ago · 11 min
03 #ai-agents · #seguranca
Agentes de IA em conflito: a Anthropic deu metas rivais a 3 Claudes e eles se atacaram com malware

Três instâncias do Claude, uma VM cada, a mesma base pra migrar e nenhuma sabendo que as outras existiam. Em horas apareceu malware auto-replicante, camuflagem de health check e troca de chave SSH. Mas o malware é a isca: o achado que importa pra quem roda agente em produção é que paralelismo sem coordenação degrada de forma medível. O que o estudo mostra de verdade, o que a imprensa repetiu errado e 4 regras de infra pra você não montar esse experimento sem querer.

15 Ago · 11 min
04 #ai-agents · #noticias
Qwen 3.8 27B tem a mesma arquitetura do 3.6, linha por linha: 100% do ganho veio do treino

A Alibaba lançou o Qwen 3.8 27B e alguém abriu o diff contra o 3.6: 59 de 59 nós do grafo mapeiam um pra um, e o único campo diferente é metadado. Mesma arquitetura, DeepSWE triplicando de 13,3 para 42,2. Aqui vão os benchmarks reais (e o que a tabela do vendor omite), a conta de VRAM que a imprensa simplificou, o KV cache de 64KB por token, o bug do template Jinja que derruba tool call no dia 1, e a diferença entre o 27B denso e o 3.8 Max de 2,4T. Com o contraponto que ninguém fez.

15 Ago · 11 min
05 #ai-agents · #produtividade
Cursor SpaceX: o que a aquisição muda no seu editor (e o que ninguém confirmou)

A Cursor confirmou em 14/08/2026 que foi adquirida pela SpaceX. O comunicado tem treze frases: fala de GPU, de modelo mais barato e de horizonte, e não fala uma palavra sobre o seu código. Separamos o que está em fonte primária do que é só imprensa (inclusive os US$ 60 bilhões), mostramos o que de fato muda dentro do editor (Grok 4.6 no pool da casa, Claude hidden by default, o Router escolhendo por você) e fechamos com o checklist pra quem depende do Cursor em produção.

15 Ago · 11 min
06 #agentes · #tool-use
A Mistral patenteou tool calling por código. E o seu agente está no meio disso

O USPTO concedeu à Mistral AI a patente US 12.670.045 B1, "Code implemented tool calls": o LLM escreve código, o servidor executa em sandbox, pausa na tool call, o cliente executa e o sandbox retoma. É o programmatic tool calling que a indústria já tinha publicado. Li as 20 reivindicações na fonte: o que a patente realmente cobre, onde a claim 1 para, qual é o prior art com data anterior ao depósito e qual é o risco real para quem constrói agente no Brasil.

11 Ago · 14 min
07 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min
08 #openai · #ia
A segunda onda de gameplays falsos de GTA 6 com IA já tem 1 milhão de views (e ninguém vai pedir desculpa)

Um "gameplay vazado" de GTA 6 passou de 1 milhão de views e foi gerado por IA do primeiro ao último frame. Desmontamos o pipeline de 5 etapas por trás desses vídeos, por que o Sora saiu do jogo no meio da onda, e como cada artefato que denuncia o fake é consequência direta de uma decisão técnica de quem produziu.

07 Ago · 9 min
09 #openai · #noticias
OpenAI Astra: o modelo secreto que "resolveu" 10 problemas de matemática — fato vs rumor

A OpenAI nomeou o Astra, sua próxima grande família de modelos, ao anunciar 10 problemas matemáticos resolvidos com provas verificáveis por máquina. Rastreador vivo: fato vs rumor, agora com a refutação da conjectura de Connes, problemas de Erdős e o nome GPT-5.7 na disputa.

01 Ago · 9 min
10 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min
11 #ai-agents · #monitoramento
Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas

Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.

27 Jul · 9 min
12 #ai-agents · #seguranca-ia
Screenpipe grava tudo que você faz no PC e vira agente: genial ou pesadelo de privacidade?

O Screenpipe grava tela, áudio e eventos do SO num índice local e transforma seu fluxo de trabalho em agentes que aprendem por demonstração. Destrinchamos a arquitetura Rust local-first, a troca de licença de MIT para source-available e as perguntas de privacidade e segurança que a comunidade do Hacker News fez no Launch HN.

25 Jul · 9 min
Conheça o Clã Beer and Code
tocando