Deixei de pagar o ChatGPT e construí meu próprio sistema de IA.

Ultimamente, tenho me interessado bastante em executar Modelos de Linguagem Grandes (LLMs) localmente e, depois de ver tudo Coisas legais que você pode fazer com as ferramentas MCPPercebi que era hora de atualizar um pouco as minhas configurações.

Deixei de pagar o ChatGPT e construí meu próprio sistema de IA.

Inicialmente, embarquei na onda do hype quando o DeepSeek R1 foi lançado, mas desde então, muitos novos modelos surgiram. Com a rapidez com que tudo está mudando, achei que fazia sentido otimizar também meu fluxo de trabalho.

LM Studio é o melhor aplicativo local para LLM que já usei (até agora).

Ollama é bom, mas eu prefiro este.

Comecei a experimentar com Modelos Locais de Linguagem Ampla (LLMs) no ano passado, usando o Ollama.Funcionou razoavelmente bem, mas meu pobre MacBook Air com apenas 8 GB de RAM certamente não foi projetado para lidar com esse tipo de carga de trabalho. Mesmo assim, eu queria tentar algo diferente, em parte por curiosidade e em parte para ver se conseguiria obter ainda mais desempenho.

Por isso, decidi experimentar o LM Studio. É um aplicativo que permite baixar e executar Modelos de Linguagem Grandes (LLMs) localmente no seu computador, além de ter uma interface de usuário intuitiva. Como uso um Mac, o suporte ao MLX era essencial para mim. Caso não conheça, o MLX é a estrutura de aprendizado de máquina da Apple, desenvolvida especificamente para o Apple Silicon.

Essencialmente, isso permite que os modelos sejam executados de forma mais eficiente usando a unidade de processamento gráfico (GPU). No entanto, eu queria traduzir isso em números, então comparei o Ollama com o LMStudio lado a lado, usando o mesmo modelo.

LM Studio vs Ollama tokens por segundo

Eu estava obtendo um número maior de símbolos por segundo com o LM Studio, mas a diferença era tão pequena que não alterou muito a experiência geral. No entanto, eu aceitaria qualquer ganho de desempenho que pudesse obter.

No entanto, não creio que faça muita diferença escolher entre o Ollama e o LM Studio, especialmente porque ambos se baseiam em estruturas básicas semelhantes para executar modelos localmente.

Minha principal queixa quando comecei era a falta de suporte a multimídia. Mas isso não é mais um problema. Tanto o Ollama quanto o LM Studio agora oferecem suporte a modelos multimídia, e existem algumas opções poderosas que lidam bem com texto e imagens em dispositivos locais.

Escolher o modelo certo pode ser um pouco difícil.

Pode ser um hobby caro

Lista de pesquisa de modelos do LM Studio

Ao instalar o LM Studio pela primeira vez, você precisará escolher um modelo. Isso pode parecer um pouco confuso para quem nunca usou o programa, já que não existe uma resposta única e direta do tipo "use este modelo". A escolha certa depende do seu hardware.

Se você abrir o menu de Busca de Modelos no LM Studio, verá uma lista dos modelos mais populares. Uma maneira simples de entender a demanda por um modelo é observar o número que precede a letra "B" em seu nome.

O "B" significa bilhões de parâmetros. Geralmente, quanto maior esse número, mais poderoso será o modelo. Isso também significa que ele exigirá mais recursos. Em um Mac com 8 GB de VRAM, considero que algo entre 3 e 4 bilhões de parâmetros seja uma boa faixa. As coisas podem ficar um pouco mais complicadas em um PC. Em vez da RAM padrão do sistema, a quantidade de VRAM disponível é o que mais importa.

Se você tiver 8 GB de VRAM, poderá experimentar confortavelmente com modelos usando parâmetros de 7 bits, especialmente em configurações quânticas mais leves. Na minha experiência, a melhor abordagem é começar com um modelo menor e ir aumentando gradualmente até encontrar o ajuste ideal.

Pessoalmente, me senti mais atraído pelo modelo Gemma 3 4B, que é construído sobre a mesma base dos modelos Gemini do Google. No entanto, ainda recomendo experimentar também os modelos Qwen. Dependendo do que você faz, eles podem ser uma opção muito melhor para você.

Você pode até adicionar a pesquisa na web ao seu LLM local.

DuckDuckGo vem em socorro.

Página do complemento DuckDuckGo no LM Studio

Uma das maiores queixas que tenho visto sobre os Modelos de Linguagem Grandes (LLMs) nativos é a sua limitação em comparação com modelos baseados na nuvem, como o ChatGPT, no que diz respeito à busca na web. Não é muito útil perguntar sobre o iPhone mais recente e o LLM começar a falar sobre o iPhone 14. Esta é uma área em que os modelos baseados na nuvem têm se mostrado superiores.

O LM Studio possui um sistema de plugins integrado e adicionar pesquisa na web é incrivelmente simples. Basta acessar Página de complementos do DuckDuckGoE especifique "Executar no LM Studio".

Uma vez ativada, ao executar um formulário, você verá uma opção abaixo da caixa de bate-papo perguntando se deseja usar o DuckDuckGo para sua consulta. Se você ativar essa opção, o LM Studio buscará resultados de pesquisa em tempo real e os exibirá no formulário antes de gerar uma resposta.

A LM Studio realiza buscas na web através do DuckDuckGo.

Mas isso não é tudo que você pode fazer com plugins. A equipe do LM Studio também criou alguns muito úteis. Por exemplo, eles têm um plugin da Wikipédia que permite que seu modelo de linguagem grande leia e pesquise artigos da Wikipédia (é claro).

Existe também o plugin JavaScript Sandbox, que pode ser muito útil se você estiver interessado em experimentação com código e quiser ter uma ideia geral do que está sendo construído. Mas eu não diria que vale a pena o esforço para criar algo pronto para produção.

Livre-se das grandes empresas

Você pode configurar o LM Studio para acessar seu modelo de linguagem extenso a partir do seu celular, mas se preferir transferir toda a inferência diretamente para o seu celular, isso também é possível. Executando modelos de linguagem menores e maiores em um telefone AndroidEmbora não seja tão potente quanto o que você obteria em um Mac.

O aprimoramento desses modelos leves continua em um ritmo rápido e impressionante. Com a expectativa de aumento nos custos de hardware, não me surpreenderia se empresas como a OpenAI ou o Google aumentassem os preços de suas assinaturas. É reconfortante ter uma configuração que permanece imune a tudo isso.

Ir para o botão superior