IA local no teu portátil: o teu primeiro serviço pessoal de IA

O teu portátil responde a uma pergunta sem ligação à internet. Depois, sem mudares nada, responde à mesma pergunta numa segunda aplicação instalada no próprio portátil. É esse segundo passo que transforma o portátil que já usas num pequeno serviço pessoal de IA, a que outras aplicações e scripts podem recorrer.

Este guia mostra como executar um modelo descarregado, não como treiná-lo. Se ainda não confirmaste que o teu portátil tem RAM ou VRAM suficiente, lê primeiro quanta RAM é necessária para correr IA local no portátil. Se já sabes que o teu portátil serve, avança.

As quatro camadas de uma configuração de IA local

Qualquer configuração de IA local tem quatro camadas distintas. Perceber o papel de cada uma torna os passos seguintes mais fáceis de acompanhar.

Os pesos do modelo são o ficheiro que descarregas, por exemplo, uma versão quantizada de 3,4 GB de um modelo pequeno. Esse é o tamanho do ficheiro descarregado, não a RAM de que o modelo precisa quando está em execução.

O motor de inferência é o programa que carrega esses pesos e responde aos pedidos. Aqui, é o Ollama, que disponibiliza a sua própria API HTTP local. É esse motor que permite a outras aplicações usar a IA do portátil.

A interface envia o pedido: pode ser o chat integrado no Ollama, um pequeno script ou outra aplicação. É ela que determina se o pedido fica no portátil ou segue para outro destino.

Um índice de documentos opcional permite a um modelo de chat pesquisar nos teus ficheiros, recorrendo a um modelo de embeddings separado e a um espaço de armazenamento próprio. Não é criado automaticamente e não faz parte deste guia.

Em resumo: uma aplicação ou um script faz pedidos ao Ollama em 127.0.0.1:11434, e o Ollama carrega o modelo que descarregaste. Apagar o modelo não apaga o histórico de conversas guardado pela interface: são armazenados em locais diferentes.

Antes de instalar: o teu portátil tem especificações semelhantes às destes modelos?

Antes de instalares seja o que for, dedica dois minutos a anotar a quantidade de RAM do portátil, o sistema operativo, o processador, a memória gráfica dedicada (VRAM), caso exista, e o espaço livre no SSD. Para saberes de quanta RAM e VRAM precisas para correr IA local, consulta quanta RAM é necessária para correr IA local no portátil.

Os dois portáteis abaixo são modelos reais, disponíveis atualmente na refurbed. Ambos são recondicionados: passaram por testes, limpeza e recondicionamento profissionais e têm uma garantia de 12 meses. Um é um MacBook de entrada com Apple Silicon; o outro, um portátil Windows com memória gráfica dedicada. Qualquer um permite seguir todos os passos deste guia.

Instala o Ollama no macOS, no Windows ou em Linux

Para começar, instala a aplicação oficial do Ollama no macOS ou no Windows; se usas Linux, segue as instruções de instalação para esse sistema. Depois, abre o Ollama. No Linux, executa ollama serve se o serviço ainda não estiver a aceitar pedidos.

Atualmente, a aplicação permite executar modelos localmente e também usar opções na nuvem. Quando fores executar um modelo no portátil, escolhe o identificador do modelo que descarregares: não precisas de iniciar sessão para usar a inferência local.

Para acompanhares este guia, descarrega o modelo identificado por qwen3.5:4b-q4_K_M, um ficheiro de 3,4 GB. O identificador exato importa: um rótulo genérico como «latest» pode levar-te, sem te aperceberes, a usar um modelo muito maior do que aquele que testaste. Os 3,4 GB referem-se ao ficheiro descarregado, não à RAM necessária para executar o modelo: não indicam quanta memória será necessária para responder aos pedidos.

Descarrega o primeiro modelo e começa a conversar

Bastam dois comandos para começares a conversar com um modelo:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

O primeiro descarrega o modelo e o segundo abre uma conversa interativa. Em vez de lhe dizeres apenas olá, propõe-lhe uma tarefa pequena e concreta, por exemplo: «Transforma estas três notas de reunião numa lista de tarefas. Não inventes datas.»

Quando terminares, escreve /bye para sair da conversa.

Faz um pedido à API: a IA já corre no teu portátil

No terminal, é a interface que comunica com o motor de inferência. Agora vais fazer um pedido diretamente a esse mesmo motor, como faria outra aplicação.

No macOS ou em Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Define inferência local numa frase."}],"stream":false,"options":{"num_ctx":4096}}'

No Windows, através do PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Define inferência local numa frase."}],"stream":false,"options":{"num_ctx":4096}}'

Procura message.content na resposta. Ao definires stream como false, pedes uma resposta completa, em vez de a receberes por partes. Com num_ctx: 4096, usas neste primeiro teste uma janela de contexto modesta em comparação com o máximo, muito superior, anunciado para o modelo.

O que a resposta te diz

A resposta contém mais do que o texto gerado. Além de message.content, o Ollama devolve campos que vale a pena consultar: load_duration, prompt_eval_count, prompt_eval_duration, eval_count e eval_duration.

Em conjunto, permitem distinguir duas coisas que um único valor de «tokens por segundo» mistura: o tempo gasto a carregar o modelo na memória e o tempo gasto a gerar a resposta. O primeiro pedido depois de iniciares o Ollama costuma ser o mais lento: inclui o tempo de carregamento, que não volta a pesar no pedido seguinte.

Os valores exatos dependem inteiramente da tua máquina, por isso não apresentamos aqui números como se fossem típicos. Compara estes campos em duas execuções no mesmo portátil, em vez de te guiares por uma única indicação de velocidade.

Vê o que está a correr: ps, ls e remoção da memória após inatividade

Três comandos bastam: dois para consultar os modelos e um para remover um de que já não precisas.

ollama ps mostra os modelos carregados e onde estão a ser executados. Na coluna do processador, podes ver 100% GPU, 100% CPU ou uma combinação dos dois.

ollama ls apresenta todos os modelos que descarregaste.

ollama rm qwen3.5:4b-q4_K_M remove um modelo descarregado de que já não precisas.

Por defeito, o Ollama retira um modelo da memória após cinco minutos de inatividade. Se ollama ps não mostrar nenhum modelo carregado, faz outro pedido antes de concluíres que há um problema.

Liga uma segunda aplicação à API local compatível com a da OpenAI

É neste passo que o portátil passa a disponibilizar IA a uma segunda aplicação, além do chat integrado. Em vez de recorrer a um serviço na nuvem, essa aplicação faz os pedidos ao teu portátil.

A maioria das aplicações que permite configurar um endereço personalizado compatível com a API da OpenAI pede três dados: um URL de base, o nome do modelo e uma chave de API. Usa http://localhost:11434/v1/ como URL de base e qwen3.5:4b-q4_K_M como nome do modelo.

A chave de API é a parte menos intuitiva. Algumas aplicações não aceitam o campo vazio. Por isso, a documentação do Ollama usa api_key='ollama' como valor de preenchimento: o servidor local exige um valor não vazio, mas ignora o conteúdo introduzido. Essa sequência não autentica ninguém. Serve apenas para preencher o campo; não é uma palavra-passe.

A compatibilidade abrange apenas parte das funcionalidades de cada API. Antes de contares, por exemplo, com o envio de imagens ou a invocação de ferramentas, testa a funcionalidade em causa na aplicação que vais usar. Não partas do princípio de que tudo funciona da mesma forma.

A prova: desliga a internet e repete o pedido

Até aqui, em teoria, um pedido podia ter sido enviado para a internet sem dares por isso. Para tirares a dúvida, basta um teste.

Assim que o modelo estiver descarregado, desliga o Wi-Fi do portátil ou retira o cabo de rede. Repete, no chat ou pela API, o mesmo pedido que fizeste antes. Se obtiveres uma resposta sem qualquer ligação à internet, tens a prova de que o modelo corre localmente.

Uma resposta que só aparece quando estás online não serve de prova. O mesmo vale para uma resposta vinda de https://ollama.com em vez de localhost, ou para um pedido feito com o identificador de um modelo na nuvem em vez de um modelo descarregado. No Ollama, um pedido local fica no teu portátil; os modelos na nuvem recorrem a um serviço alojado noutro local.

IA offline: como manter a configuração privada

A privacidade não está garantida à partida. Importa perceber o que te protege e o que não protege.

Por defeito, o Ollama só aceita ligações no endereço 127.0.0.1:11434, acessível apenas a partir do próprio portátil. Mantém essa configuração. Não definas OLLAMA_HOST=0.0.0.0 nem redireciones a porta 11434 para a internet pública: a chave de API usada como valor de preenchimento não verifica quem se liga. Expor essa porta deixa o acesso aberto, não protegido.

Se quiseres desligar por completo as funcionalidades na nuvem do Ollama, adiciona {"disable_ollama_cloud": true} a ~/.ollama/server.json ou define OLLAMA_NO_CLOUD=1. Não precisas de o fazer para executar um modelo descarregado localmente. Reinicia o Ollama para que a alteração tenha efeito.

Aceder a esta configuração a partir de outra divisão ou de outro dispositivo é um assunto mais avançado: envolve uma rede privada e um proxy com autenticação à frente do serviço. Não o abordamos aqui, nem se resolve expondo a porta diretamente.

Se algo correr mal, começa por aqui

Estes são os problemas mais comuns e os primeiros pontos a verificar.

Ligação recusada. Confirma que a aplicação do Ollama está em execução ou que o comando ollama serve está ativo. Depois, tenta novamente.

A primeira resposta é lenta; as seguintes são mais rápidas. A diferença está no tempo de carregamento do modelo, não na velocidade de geração. Consulta os campos da resposta indicados acima.

Tudo parece muito mais lento do que esperavas. Executa ollama ps: o processamento pode estar a ser feito apenas na CPU ou dividido entre a CPU e a GPU. Verifica se a tua GPU e os respetivos controladores são compatíveis com o teu sistema operativo.

Memória no limite ou encerramentos inesperados. Passa para um modelo mais pequeno, reduz num_ctx e fecha outras aplicações que consumam muita memória antes de voltares a tentar.

O disco está a ficar cheio. Usa ollama ls para ver o que descarregaste e ollama rm para remover os modelos que não usas.

Se o Ollama não for a opção mais indicada para ti, por exemplo, porque queres explorar modelos numa interface gráfica ou ter um controlo mais fino da CPU e da GPU, vale a pena conhecer o LM Studio e o llama.cpp. São razões para mudar de motor, não para manter duas configurações em paralelo.

Perguntas frequentes sobre IA local no portátil

Preciso de internet depois da configuração? Não. Assim que o modelo estiver descarregado, o chat e os pedidos à API do Ollama funcionam sem ligação à internet.

O valor usado como chave de API protege o acesso? Não. O servidor local do Ollama aceita qualquer valor não vazio sem o verificar. Por isso, a chave pedida por algumas aplicações não é uma medida de segurança.

Os meus pedidos ficam no portátil? Sim, se usares o identificador de um modelo local descarregado. O Ollama também disponibiliza modelos na nuvem, que usam um serviço alojado noutro local. A diferença depende do identificador que escolhes, não de uma predefinição oculta.

Preciso de uma placa gráfica dedicada? Não. Um portátil que use apenas a CPU consegue executar um modelo pequeno, normalmente mais devagar. ollama ps mostra como um determinado pedido foi processado.

E se eu quiser um modelo maior ou diferente? Troca o identificador nos mesmos comandos ollama pull e ollama run, mas verifica primeiro quanta RAM e VRAM tem o teu portátil. Para perceberes os requisitos, consulta quanta RAM é necessária para correr IA local no portátil.

O modelo vai lembrar-se dos meus documentos daqui para a frente? Não. Um modelo de chat não memoriza, por si só, os ficheiros de uma pasta de forma permanente. Para pesquisar nos teus ficheiros, precisas de um índice de documentos separado, uma configuração opcional que não abordamos aqui.

Agora é contigo: põe o teu serviço pessoal de IA a trabalhar

Escolhe uma tarefa concreta e experimenta-a nos dois clientes que tens agora: o chat integrado e a segunda aplicação que acabaste de ligar. Podes, por exemplo, resumir uma nota pessoal, organizar um conjunto de ficheiros em grupos com etiquetas ou pedir uma explicação simples de um pequeno excerto de código.

Seja qual for a tarefa, regista o identificador exato do modelo, a versão do motor, a definição do contexto, o URL e a própria tarefa. Assim, podes reproduzir o resultado mais tarde ou dar a outra pessoa os dados necessários para fazer o mesmo.

Se concluíste que o teu portátil tem pouca RAM ou VRAM para isto, vale a pena ponderar outro com mais folga. No próximo artigo desta série, vamos ver como montar um pequeno conjunto de modelos: um para conversar, outro para código e outro para pesquisa.

Portátil recondicionado adequado para executar IA local, disponível na refurbed

Subscreve a nossa newsletter pela primeira vez e poupa 15€!

Não percas mais nenhuma oferta.

Informações sobre o uso de dados pessoais podem ser encontrados na nossaPolítica de Privacidade.