Em outubro apresentámos o LynxServer, o nosso primeiro servidor de IA privado. Provou um princípio: na Lynxmind, a IA vive em máquinas que são nossas. Esta é a versão de produção dessa ideia.

A máquina

Duas GPUs NVIDIA RTX PRO 6000 Blackwell Workstation Edition num único chassis.

GPU NVIDIA RTX PRO 6000 Blackwell para infraestrutura de IA e execução local de LLM

Montada por nós. Afinada por nós. Nossa.

O modelo

À data deste artigo, corremos o Gemma 4 (31b), a família de modelos de pesos abertos da Google, localmente no servidor.Com 192 GB de VRAM, o modelo é executado em alta precisão, corre com janelas de contexto completas e responde toda a equipa em paralelo.

Desempenho real

Números da nossa utilização atual em produção:

  • ~60 sessões em simultâneo
  • 256k de contexto por sessão
  • ~52 tokens por segundo, por utilizador

Isto representa metade da equipa da Lynxmind, além de consultores, agentes e automações, tudo correr numa única máquina, em paralelo, sem filas de espera. É como ter um Claude Sonnet 4.5 privado só para a empresa.

A stack: Open WebUI e LiteLLM

Duas peças assentam sobre as GPU:

O Open WebUI dá à equipa uma interface de conversa limpa, ao estilo do ChatGPT, ligada à nossa própria infraestrutura.. A mesma experiência que já todos conhecem, sem curva de aprendizagem.

Instalação local do modelo Gemma 31B num servidor de IA privado, com interface ao estilo do ChatGPT

O LiteLLM funciona como o nosso gateway interno de IA:

· Autenticação centralizada, com chaves virtuais por utilizador.
· Limites de utilização e encaminhamento dentro do cluster.
· Registo de auditoria completo de cada pedido.
· Salvaguardas aplicadas no gateway: filtros contra injeção de prompts, verificação de dados pessoais e políticas de conteúdo.

É isto que transforma uma estação de trabalho potente numa plataforma governada.

As contas

Na Lynxmind, a IA corre sem parar. Agentes OpenClaw e Hermes ativos 24 horas por dia. O Guardian a correlacionar telemetria e a executar pipelines multiagente. Projetos de automação de currículos. Fluxos n8n. Reconhecimento ótico de faturas. Experiências internas.

E depois há o custo por pessoa. Uma licença típica do Claude, da Anthropic, ronda os 20 € por consultor, por mês, antes de entrar qualquer utilização intensiva. Multiplique isso por uma equipa de engenharia e passa a ser uma rubrica com peso, que cresce a cada nova contratação.

Os nossos consultores apontam agora o Claude Code, dentro do VS Code, diretamente para o endpoint da API do nosso servidor. A mesma experiência de desenvolvimento com agentes. Zero licenciamento por posto. Zero código-fonte a sair de casa.

Numa API comercial, a fatura mensal acumulada torna-se uma rubrica que a gestão nota. No nosso servidor, o custo marginal de mais uma inferência é eletricidade.

O hardware paga-se em meses. Cada pedido a partir daí é, na prática, gratuito.

Deixámos também de estar expostos às oscilações de preço dos fornecedores de IA. A inteligência vai ser uma mercadoria como a água ou a eletricidade, mas sem regulação estatal. Optámos por ser donos da nossa.

A maior vitória, porém, é cultural: o custo deixa de ser uma razão para dizer que não. Os engenheiros deixam de racionar. Os consultores deixam de hesitar. A inovação deixa de ser orçamentada e passa a estar no ar que se respira.

As três condições, repetidas

Esta é a mesma arquitetura que defendemos para os nossos clientes:

· Soberania. Os dados nunca saem da nossa infraestrutura.
· Controlo de custos. Sem tokens. Sem faturação por posto.
· Privacidade. Prompts, código e resultados ficam em hardware que é nosso.

O que defendemos, praticamos.

Servidor de IA em instalações próprias, montado para IA privada e computação de alto desempenho com GPU

Para terminar

O primeiro LynxServer foi uma prova. Este é uma plataforma.

Hardware montado pela nossa equipa. Modelo de pesos abertos a correr localmente. Open WebUI para a equipa, LiteLLM a impor as salvaguardas. Zero tráfego para fora.

Na Lynxmind, a soberania da IA não é um slogan. É uma lista de componentes, um bastidor e uma equipa que sabe juntar tudo isso.

Pedro Monteiro
Pedro Monteiro

Arquiteto, programador e administrador de integração de aplicações empresariais (EAI), com percurso comprovado em TI, especializo-me em arquitetura orientada a serviços (SOA) e microsserviços. Com mais de dez anos a desenvolver e a dar suporte a soluções de middleware, ganhei competências em Apache Kafka, TIBCO, MuleSoft, Java Spring, Apache Camel e React.js. A minha capacidade de liderança tem-me permitido conduzir equipas na entrega de projetos bem-sucedidos.