Como programador e entusiasta de extensões Checkmk, e mais recentemente certificado em OpenTelemetry, quis pôr a observabilidade em prática num projeto real.

Para a Lynxmind, verificar apenas se o site estava de pé já não chegava. Precisávamos de mais do que uma visão binária entre “ligado” e “em baixo”. O objetivo era perceber o estado real do sistema: como se comporta sob carga, como consome recursos e onde surgem os estrangulamentos.

Painel OpenTelemetry com dados em tempo real


A solução

Instrumentei a nossa stack Node.js e Astro com o SDK do OpenTelemetry e exportei as métricas para o OpenTelemetry Collector do Checkmk 2.4 (OTLP/HTTP). Este pipeline foi desenhado para captar os sinais essenciais em tempo de execução: utilização de CPU, estatísticas de memória e de heap, pausas de recolha de lixo, latência do event loop e desempenho HTTP, do lado do cliente e do servidor.

Recorrendo ao mapeamento de nomes de serviço com o Dynamic Configuration Daemon (DCD) do Checkmk, hosts como o site da Lynxmind foram criados automaticamente. Painéis à medida no Checkmk transformaram depois esta telemetria em bruto em informação acionável.

Exemplo de painel Checkmk com métricas


O resultado

Os painéis passaram a mostrar:

  • Consumo de CPU e memória em tempo real
  • Indicadores de pressão sobre a heap (por exemplo, cerca de 88% de utilização)
  • Capacidade de resposta do event loop nos percentis 95 e 99
  • Repartição da recolha de lixo por tipo
  • Taxas de pedidos HTTP, distribuição de latências e acompanhamento de erros

As vantagens

Esta stack de observabilidade traz valor concreto:

  • Deteção precoce de anomalias, antes de afetarem quem usa o site
  • Planeamento de capacidade e decisões de escalabilidade assentes em dados
  • Identificação clara de estrangulamentos, como pressão de memória e atrasos na recolha de lixo
  • Visibilidade partilhada entre as equipas de desenvolvimento e de operações
  • Mais estabilidade e fiabilidade para o lynxmind.com

Conclusão

Com o OpenTelemetry e o Checkmk, deixámos de apenas monitorizar se a Lynxmind está disponível. Passámos a monitorizar em que estado está, como se comporta sob pressão e onde é preciso otimizar.

Por outras palavras, é como conseguir ver o bolo por dentro enquanto ainda está no forno.

Elicarlos Dias
Elicarlos Dias

Como estagiário de consultoria DevOps na Lynxmind, está a construir bases sólidas em automação, CI/CD e infraestrutura cloud. Com uma abordagem prática e vontade de crescer, apoia a equipa na simplificação de processos e no reforço da fiabilidade dos sistemas.