~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #harness $ grep

#Harness

58 posts
01 #openai · #harness
GPT-6 Astra vs Claude Fable 5.1 vs GPT-5.6 Sol: os números, o preço e o 99,9% que depende do harness

A OpenAI lançou o GPT-6 Astra em 03/09/2026 pelo mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, o índice independente onde o Fable ainda lidera, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% dependendo só do harness. Mais o que muda na sua API com o primeiro modelo "Critical" em cyber.

03 Set · 18 min
02 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min
03 #ia · #ai-agents
Graph engineering é hype? Li o paper, os benchmarks e a conta

Uma frase de doze palavras no X virou paradigma com paper em cinco semanas. Fui ler o survey procurando o benchmark que justifica o degrau novo: não tem nenhum. O que separa hype de engenharia em graph engineering, com os números rastreados até a fonte, quais são de fabricante e quais são independentes, e a régua de cinco perguntas pra decidir se o seu caso pede grafo ou se você só quer o crachá novo.

27 Ago · 14 min
04 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min
05 #harness · #guardrails
Claude Code Auto Mode vira padrão dia 14: o que muda e como desativar

Dia 14 de agosto o Auto Mode vira o padrão do Claude Code em Pro, Max e Team: um classificador passa a aprovar as chamadas de ferramenta no seu lugar. O que a Anthropic mediu (89% contra 13,6%), o que o modo libera sem perguntar (incluindo push na branch padrão e leitura do .env) e as quatro formas de colocar o checkpoint humano de volta.

10 Ago · 8 min
06 #ia · #agentes
Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas

O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.

07 Ago · 18 min
07 #ai-agents · #observabilidade
Um agente deixou bilhete pro próximo — e o seu também deixa

A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.

05 Ago · 11 min
08 #ai-agents · #harness
Harness engineering não basta: o manifesto que explica por que as "fábricas de software" com IA falham

O manifesto da HumanLayer que bateu 373 pontos no Hacker News explica por que fábricas de software 100% autônomas degradam codebases e o que fazer no lugar.

25 Jul · 8 min
09 #openai · #ai-agents
HP adotou a OpenAI Frontier. O que isso muda (e o que é só anúncio)

A HP Inc. virou uma das primeiras grandes a rodar a OpenAI Frontier, a plataforma de gestão de agentes da OpenAI. Separamos o que foi entregue do que é promessa, e o que isso revela sobre botar agente em produção.

30 Jun · 7 min
10 #ia · #agentes
O que é Harness de IA? O ambiente que faz seu agente parar de travar

O harness é o ambiente que roda o agente — loop, ferramentas, estado e guardrails. É ele, não o modelo, que decide se seu agente aguenta produção ou trava na primeira tarefa de verdade.

15 Jun · 8 min
11 #agentes · #ai-agents
Por que seu agente de IA entra em loop infinito (e como pôr um freio)

Seu agente repete a mesma ação pra sempre e queima tokens. As três causas — sem critério de parada, tool result mal formatado, prompt ambíguo — e os freios práticos pra cortar isso em produção.

11 Jun · 11 min
12 #ia · #rag
Context engineering: a skill nº1 do AI engineer em 2026

Em 2026 a vaga sênior não pede mais prompt engineer. Pede pipeline de contexto. Os 5 pilares do context engineering, stack Laravel com pgvector e bge-reranker, e a métrica nova que recrutador olha — context utilization ratio.

30 Mai · 11 min
Conheça o Clã Beer and Code
tocando