Monitoramento
Para monitoramento, usamos Prometheus e Grafana.
Instalação e Configuração do Prometheus (para Kubernetes)
Omitir esta parte se houver instalação do Docker e prosseguir diretamente para Configuração do dashboard.
Somente Kubernetes
Configure o Prometheus
Se necessário, instale o Prometheus em seu cluster usando o GitHub deles.
Nossos charts já contêm recursos personalizados para o Prometheus: serviceMonitor. Por padrão, serviceMonitor está desativado; para ativá-lo, defina enable: true em prometheus_exporters → serviceMonitor.
prometheus_exporters:
# Parâmetro global. Se verdadeiro, adiciona exporters do Prometheus para as aplicações
# com o mesmo parâmetro também definido como verdadeiro na seção da aplicação
enable: true
# Parâmetro global. se verdadeiro - expõe métricas das aplicações no ingress
# Verifique os mesmos parâmetros nas configurações das aplicações
addToIngress: false
# Caminho base para métricas, por exemplo, <https://host.local/metricsBasePath/metricsEndPath>
metricsBasePath: /metrics/
auth:
# Defina HTTP Basic AUTH para métricas no ingress. Usável apenas se 'addToIngress' for verdadeiro
enable: true
username: flower_user
password: flowerpass
# Ative serviceMonitor (Service Discovery for Prometheus)
serviceMonitor:
enable: true
interval: 15sPara garantir que o Prometheus Operator detecte os parâmetros, adicione o correspondente Namespace ou serviceMonitor ele próprio à spec seção, conforme mostrado abaixo:
spec:
serviceMonitorNamespaceSelector:
matchNames:
- default
- monitoringSe você não especificar os parâmetros, todos Namespace serão adicionados:
spec:
serviceMonitorNamespaceSelector: {}
serviceMonitorSelector: {}Verifique as Configurações
Se tudo estiver correto, e serviceMonitor tiver sido adicionado ao cluster, você verá o recurso personalizado correspondente em Recursos Personalizados → monitoring.coreos.com → Service Monitor.

Certifique-se de que o Service Monitor contém os recursos listados na tela abaixo:

Também é possível verificar esses recursos no próprio Prometheus. Prossiga para Status e selecione Alvos no menu suspenso.

O que deve ser visto:

Para mais detalhes sobre como trabalhar com Service Monitor no Prometheus, consulte Documentação do Prometheus Operator
Configuração do dashboard
Avance para nosso repositório e encontre a branch que corresponda à versão do seu chart.

Baixe o cliente do dashboard:
Para API 6 e superior:
Oz_dashboard_client_api6.jsonouOz_dashboard_client_api6_with_k8s_metrics.json, dependendo do tipo de instalação do seu produto.Para API 5 e inferior:
Oz_dashboard_client.json.
Abra o Grafana e, no Início menu, selecione Painéis.

Clique em Novo e escolha Importar no menu suspenso.

Selecione Envie o arquivo JSON do dashboard e localize o
Oz_dashboard_client.jsonarquivo que você baixou. Altere o nome do arquivo ou o diretório, se necessário, mas isso é opcional.Adicione a
prometheusfonte de dados para obter métricas.Clique em Importar e salve o dashboard.
Variáveis

namespace(Somente Kubernetes) é um rótulo do namespace de:tensorflow:cc:saved_model:load_latency{clustername="$cluster"},quantilé um valor de quantil para tabelas que o exigem. Valores possíveis: 0,95, 0,5, 0,90, 0,99, 1.
Encontre alertas para diferentes versões da API aqui:
API v6 e posterioresAPI v5 e anterioresVocê pode personalizar os alertas de acordo com suas necessidades. Por favor, prossiga para nosso repositório para encontrar os arquivos de alerta.
Atualizado
Isto foi útil?
