#Ollama
A imprensa diz que o Muse Glimmer 30B exige uma 5090. O r/LocalLLaMA posta print rodando numa 3090 usada de 2020. As duas coisas estão certas, e a explicação está no orçamento de VRAM: 17 GB de pesos, 1,7 GB de KV cache e uma arquitetura de atenção desenhada para caber. Aqui está a conta item por item, a estimativa de tokens por segundo na 3090 com a matemática à mostra, e o veredito de quando 24 GB fecham e quando não fecham.
Passo a passo pra rodar um LLM local com Ollama: instala, roda o qwen3:8b em 2 comandos e pluga no seu código pelo endpoint compatível com OpenAI. Roda com 8 GB de RAM e sem GPU obrigatória. De quebra, a conta de VRAM por tamanho de modelo e quando local ganha da API.