For the complete documentation index, see llms.txt. This page is also available as Markdown.

Monitoramento

Para monitoramento, usamos Prometheus e Grafana.

Instalação e Configuração do Prometheus (para Kubernetes)

Somente Kubernetes

Configure o Prometheus

Se necessário, instale o Prometheus em seu cluster usando o GitHub deles.

Nossos charts já contêm recursos personalizados para o Prometheus: serviceMonitor. Por padrão, serviceMonitor está desativado; para ativá-lo, defina enable: true em prometheus_exportersserviceMonitor.

prometheus_exporters:
# Parâmetro global. Se verdadeiro, adiciona exporters do Prometheus para as aplicações 
# com o mesmo parâmetro também definido como verdadeiro na seção da aplicação
  enable: true 
# Parâmetro global. se verdadeiro - expõe métricas das aplicações no ingress 
# Verifique os mesmos parâmetros nas configurações das aplicações
  addToIngress: false 
# Caminho base para métricas, por exemplo, <https://host.local/metricsBasePath/metricsEndPath>
  metricsBasePath: /metrics/ 
  auth:
  # Defina HTTP Basic AUTH para métricas no ingress. Usável apenas se 'addToIngress' for verdadeiro
    enable: true 
    username: flower_user
    password: flowerpass
# Ative serviceMonitor (Service Discovery for Prometheus)
  serviceMonitor: 
    enable: true
    interval: 15s

Para garantir que o Prometheus Operator detecte os parâmetros, adicione o correspondente Namespace ou serviceMonitor ele próprio à spec seção, conforme mostrado abaixo:

spec:
  serviceMonitorNamespaceSelector:
    matchNames:
    - default
    - monitoring

Se você não especificar os parâmetros, todos Namespace serão adicionados:

spec:
  serviceMonitorNamespaceSelector: {}
  serviceMonitorSelector: {}

Verifique as Configurações

Se tudo estiver correto, e serviceMonitor tiver sido adicionado ao cluster, você verá o recurso personalizado correspondente em Recursos Personalizadosmonitoring.coreos.comService Monitor.

Certifique-se de que o Service Monitor contém os recursos listados na tela abaixo:

Também é possível verificar esses recursos no próprio Prometheus. Prossiga para Status e selecione Alvos no menu suspenso.

O que deve ser visto:

Para mais detalhes sobre como trabalhar com Service Monitor no Prometheus, consulte Documentação do Prometheus Operator

Configuração do dashboard

  1. Avance para nosso repositório e encontre a branch que corresponda à versão do seu chart.

  1. Baixe o cliente do dashboard:

    • Para API 6 e superior: Oz_dashboard_client_api6.json ou Oz_dashboard_client_api6_with_k8s_metrics.json, dependendo do tipo de instalação do seu produto.

    • Para API 5 e inferior: Oz_dashboard_client.json.

  2. Abra o Grafana e, no Início menu, selecione Painéis.

  1. Clique em Novo e escolha Importar no menu suspenso.

  1. Selecione Envie o arquivo JSON do dashboard e localize o Oz_dashboard_client.json arquivo que você baixou. Altere o nome do arquivo ou o diretório, se necessário, mas isso é opcional.

  2. Adicione a prometheus fonte de dados para obter métricas.

  3. Clique em Importar e salve o dashboard.

Variáveis

  • namespace (Somente Kubernetes) é um rótulo do namespace de :tensorflow:cc:saved_model:load_latency{clustername="$cluster"},

  • quantil é um valor de quantil para tabelas que o exigem. Valores possíveis: 0,95, 0,5, 0,90, 0,99, 1.

Encontre alertas para diferentes versões da API aqui:

API v6 e posterioresAPI v5 e anteriores

Você pode personalizar os alertas de acordo com suas necessidades. Por favor, prossiga para nosso repositório para encontrar os arquivos de alerta.

Atualizado

Isto foi útil?