#Ollama
2 posts
01
#ai-agents · #llm
Muse Glimmer 30B cabe mesmo numa RTX 3090? A Meta diz uma coisa, quem testou diz outra
A imprensa diz que o Muse Glimmer 30B exige uma 5090. O r/LocalLLaMA posta print rodando numa 3090 usada de 2020. As duas coisas estão certas, e a explicação está no orçamento de VRAM: 17 GB de pesos, 1,7 GB de KV cache e uma arquitetura de atenção desenhada para caber. Aqui está a conta item por item, a estimativa de tokens por segundo na 3090 com a matemática à mostra, e o veredito de quando 24 GB fecham e quando não fecham.
11 Ago · 12 min
›
02
#ia · #llm
Como rodar um LLM local: guia do zero (Ollama, hardware e quando vale a pena)
Dá pra rodar um modelo decente no seu notebook, sem mandar um byte pra nuvem. O guia de quando isso faz sentido, o que roda no seu hardware, como subir com Ollama e quando local ganha da API.
22 Jul · 9 min
›