~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #llm $ grep

#Llm

123 posts
01 #llm · #seguranca-ia
Anthropic acusa Moonshot de servir Claude no lugar do Kimi: o que o relatório prova (e o que não prova)

A Anthropic acusa a Moonshot de repassar requests de clientes do Kimi para o Claude Opus e exibir a resposta como se fosse do Kimi: quase 300 mil requests em dez dias, 5.380 contas fraudulentas e 23 milhões de trocas de destilação. Separamos o que o relatório de 154 páginas afirma, o que ele não prova, o que a Moonshot (não) respondeu e o que muda pra quem roda Kimi K3 em produção.

06 Out · 15 min ›
02 #harness · #llm
Grok 4.7 responde em 0,85s e o Fable 5.1 em 298s: onde cada um compensa

O Grok 4.7 chegou em 21/09/2026 custando 5x menos por token que o Fable 5.1 e o GPT-6 Astra — e mesmo assim perde pro Astra no custo por tarefa concluída. Onde esse modelo realmente compensa (spoiler: latência, não código), onde fica 22 pontos atrás no Terminal-Bench, e a conta que desmonta a comparação por preço de tabela.

22 Set · 14 min ›
03 #guardrails · #llm
Substituir LLM por Jev: 10 lugares onde a migração se paga em uma semana

Um catálogo de decisão com número, não adjetivo: dez tarefas que hoje rodam em LLM de fronteira e cabem nos três primitivos do Jev. Um milhão de chamadas em cada caso custa US$ 46.200 no LLM e US$ 523 no Jev. Tem o payload de cada caso, o padrão cascata, como medir a migração em shadow mode sem rotular nada e as quatro tarefas em que o Jev é a escolha errada.

21 Set · 19 min ›
04 #ia · #alucinacao
O que é o Jev IA: o modelo que não escreve nada (e por isso custa 100x menos)

A TypeSafe lançou o Jev, o primeiro System One model: ele não completa texto, recebe o estado do seu programa e devolve decisão tipada numa passagem paralela. Sem parser, sem retry, sem JSON quebrado. Neste post: o que o Jev é de fato, por que ele não consegue alucinar (e por que isso não significa que não erra), a conta real de US$ 0,042 por milhão de tokens com output de graça, os três primitivos com código Python rodando, e as 5 armadilhas que a própria doc admite.

21 Set · 15 min ›
05 #harness · #llm
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek lançou o V4.1 Flash e a timeline recortou a linha boa do benchmark. Comparamos o modelo com Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e GPT-6 Astra em preço e performance, mostramos onde ele realmente lidera, onde cai 20 pontos, e o dado escondido no model card: o scaffold muda o resultado quarenta vezes mais que a troca de modelo.

10 Set · 11 min ›
06 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min ›
07 #ai-agents · #llm
Classificação de intenção com LLM: como o agente decide qual rota seguir

O agente decide sozinho qual fluxo usar, mas ninguém consegue explicar por que ele escolheu errado ontem às 14h. Roteador determinístico vs. roteador por LLM, classificação de intenção com schema fechado e evidência, política de fallback explícita, atributos de trace para auditar a decisão e como medir acerto de rota sem rotular dez mil conversas na mão.

02 Set · 17 min ›
08 #ia · #api
JSON que não quebra: structured output em LLM sem parser defensivo

Se o seu código tem um try/catch em volta de um json_decode da resposta do modelo, você não tem contrato. Tem esperança. Como garantir saída estruturada de verdade no LLM: constrained decoding no provider, schema que o modelo consegue cumprir, validação semântica e retry com orçamento fixo, sem loop infinito e sem parser defensivo.

02 Set · 16 min ›
09 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min ›
10 #ia · #rag
Grounding de LLM: as 4 camadas que prendem a resposta da IA no seu dado (e validam antes de entregar)

Grounding não é RAG, é a propriedade que você quer: a resposta presa no dado que é seu. As técnicas que amarram o LLM, structured output com schema estrito, a verificação de faithfulness que roda antes de entregar pro cliente pagante, e o que ainda vai escapar depois de tudo isso.

01 Set · 13 min ›
11 #ai-agents · #llm
LangGraph, Mem0, LangChain, MCP: do que você realmente precisa

Mapa honesto do ecossistema de orquestração e memória de agentes. O que LangGraph, Mem0, LangChain e MCP realmente fazem, o ponto em que cada um deixa de ser overhead, e a árvore de decisão de 5 perguntas antes de instalar qualquer coisa.

01 Set · 15 min ›
12 #ia · #produto-ia
Oracle Generative AI: quais modelos o OCI tem e quando escolher em vez do Bedrock

O terceiro provider de infraestrutura de LLM já tem região em São Paulo, catálogo com Grok 4.3, Gemini 2.5, Llama 4 e Cohere Command A, e cobra por caractere em vez de token. O catálogo real do Oracle Generative AI, como chamar o serviço com o SDK da OpenAI, a conta do cluster dedicado e o critério objetivo para decidir entre OCI e Bedrock.

01 Set · 13 min ›
Conheça o Clã Beer and Code
tocando