~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #harness $ grep

#Harness

62 posts
01 #laravel · #ai-agents
Higgsfield MCP: o que é e 10 sistemas onde um dev pode integrar imagem e vídeo

O Higgsfield MCP entrega mais de 30 modelos de imagem e vídeo para o seu agente, com o harness de geração pronto. Como conectar no Claude Code, quanto custa cada geração em créditos e 10 sistemas onde um dev pode integrar isso.

01 Out · 11 min ›
02 #laravel · #php
Claude Code headless: como o claude -p vira um agente de IA orquestrado pelo seu código

Um comando artisan, uma fila e o Claude Code em modo headless (claude -p) gerando 11 sites dentro da assinatura. Como orquestrar o agente por PHP, onde a conta fecha e como plugar o Higgsfield como etapa de assets com orçamento controlado por código.

30 Set · 8 min ›
03 #harness · #llm
Grok 4.7 responde em 0,85s e o Fable 5.1 em 298s: onde cada um compensa

O Grok 4.7 chegou em 21/09/2026 custando 5x menos por token que o Fable 5.1 e o GPT-6 Astra — e mesmo assim perde pro Astra no custo por tarefa concluída. Onde esse modelo realmente compensa (spoiler: latência, não código), onde fica 22 pontos atrás no Terminal-Bench, e a conta que desmonta a comparação por preço de tabela.

22 Set · 14 min ›
04 #harness · #llm
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek lançou o V4.1 Flash e a timeline recortou a linha boa do benchmark. Comparamos o modelo com Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e GPT-6 Astra em preço e performance, mostramos onde ele realmente lidera, onde cai 20 pontos, e o dado escondido no model card: o scaffold muda o resultado quarenta vezes mais que a troca de modelo.

10 Set · 11 min ›
05 #openai · #harness
GPT-6 Astra vs Fable 5.1 vs GPT-5.6 Sol: o que é, preço e benchmarks

GPT-6 Astra é o novo modelo topo de linha da OpenAI, lançado em 03/09/2026 a $10/$50 por milhão de tokens, o mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% só trocando o harness.

03 Set · 18 min ›
06 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min ›
07 #ia · #ai-agents
Graph engineering é hype? Li o paper, os benchmarks e a conta

Uma frase de doze palavras no X virou paradigma com paper em cinco semanas. Fui ler o survey procurando o benchmark que justifica o degrau novo: não tem nenhum. O que separa hype de engenharia em graph engineering, com os números rastreados até a fonte, quais são de fabricante e quais são independentes, e a régua de cinco perguntas pra decidir se o seu caso pede grafo ou se você só quer o crachá novo.

27 Ago · 14 min ›
08 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min ›
09 #harness · #guardrails
Auto Mode do Claude Code: o que é, como ativar/desativar, o que libera

O Auto Mode é o modo de permissão padrão do Claude Code em Pro, Max e Team desde 14/08: um classificador aprova as chamadas de ferramenta no seu lugar (barrou 89% dos comandos perigosos contra 14% dos humanos). Como ativar e desativar (Shift+Tab ou defaultMode), o que ele libera sem perguntar, incluindo push na branch padrão e leitura do .env, e as quatro formas de colocar o checkpoint humano de volta.

10 Ago · 8 min ›
10 #ia · #agentes
Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas

O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.

07 Ago · 18 min ›
11 #ai-agents · #observabilidade
Um agente deixou bilhete pro próximo — e o seu também deixa

A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.

05 Ago · 11 min ›
12 #ai-agents · #harness
Harness engineering não basta: o manifesto que explica por que as "fábricas de software" com IA falham

O manifesto da HumanLayer que bateu 373 pontos no Hacker News explica por que fábricas de software 100% autônomas degradam codebases e o que fazer no lugar.

25 Jul · 8 min ›
Conheça o Clã Beer and Code
tocando