For the complete documentation index, see llms.txt. This page is also available as Markdown.

Kubernetes

Se você usar nossos charts do Helm, o ServiceMonitor lida automaticamente com a configuração do Prometheus.

Informações gerais

Portas do Exporter

Exporter
Porta

API

api_pod:8000/metrics

statsd

api_pod:9102/metrics/app

TFSS

bio_pod:8501/metrics/tfss

Blackbox do Bio

bio_pod:9115

Caminhos de healthcheck

API

GET http://api:8000/api/version

GET http://api:8000/api/healthcheck

BIO

GET http://bio:8501/v1/models/{{model_name}}

POST http://bio:8501/v1/models/dummy:predict

method: POST
body: '{"inputs": {"images_bytes": [{"b64": "aaa"}]}}'

API

Visão geral das métricas

Métrica
Descrição
Tipo
Rótulos

oz_api_versions_total (também disponível como oz_api_versions_created, oz_api_info_created, oz_api_info_total)

Exibe informações da versão da API quando você chama /api/version

contador

lamb

core – versão do core

oz_api – versão da API

oz_api_analyses_total

Número de análises processadas

contador

analysis_result – estado da análise (FINALIZADA, FAILED)

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

company_id – identificador da empresa

resolution_status – resolução da análise (SUCCESS, DECLINED)

oz_api_analyses_created

Número de análises que foram iniciadas

medidor

analysis_result – estado da análise (FINALIZADA, FAILED)

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

company_id – identificador da empresa

resolution_status – resolução da análise (SUCCESS, DECLINED)

oz_api_analyses_in_progress

Número de análises atualmente em processamento

medidor

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

company_id – identificador da empresa

oz_api_analyse_duration_seconds_bucket

Um histograma da duração da análise. Buckets padrão: 0.1,0.5,1,1.5,2,2.5,3,3.5,4,4.5,5,6,7,8,10,12,15,20,30,inf

histograma

analysis_result – estado da análise (FINALIZADA, FAILED)

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

resolution_status – resolução da análise (SUCCESS, DECLINED)

company_id – identificador da empresa

le – tamanho do bucket

oz_api_analyse_duration_seconds_count

Soma das durações das análises

contador

analysis_result – estado da análise (FINALIZADA, FAILED)

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

resolution_status – estado da análise (SUCCESS, DECLINED)

company_id – identificador da empresa

oz_api_analyse_duration_seconds_sum

Número de análises cujas durações foram contabilizadas

contador

analysis_result – resolução da análise (FINALIZADA, FAILED)

analysis_type – tipo de análise (QUALITY, BIOMETRY, DOCUMENTS)

resolution_status – resolução da análise (SUCCESS, DECLINED)

company_id – identificador da empresa

oz_api_analyse_duration_seconds_created

Carimbo de data/hora do início da contagem da métrica de duração

django_http_requests_total_by_transport_total

Número de requisições por protocolo de transporte

contador

transport – protocolo (HTTP, HTTPS)

uid – identificador do usuário

django_http_responses_before_middlewares_total

Número de respostas do Django antes da execução dos middlewares

contador

uid – identificador do usuário

django_http_exceptions_total_by_type_total

Número de exceções do Django por tipo

contador

exception_type – tipo de exceção

uid – identificador do usuário

django_http_requests_latency_seconds_by_view_method_bucket

Histograma da latência de processamento de requisições por views

histograma

method – método HTTP

uid – identificador do usuário

view_name – nome da view

le – tamanho do bucket

django_http_requests_latency_seconds_by_view_method_count

Número de medições das durações de processamento de requisições por views

contador

method – método HTTP

uid – identificador do usuário

view_name – nome da view

django_http_requests_latency_seconds_by_view_method_sum

Soma das durações de processamento de requisições por views

contador

method – método HTTP

uid – identificador do usuário

view_name – nome da view

Capturas de tela ilustrativas:

Duração das análises dividida pelo valor médio / tipo de análise e quantil / tipo de análise. A descontinuidade é causada pelo contador da métrica, que é iniciado separadamente para cada análise

Alertas do Grafana


TFSS

Visão geral das métricas

Métrica
Descrição

:tensorflow:serving:request_count

Número total de requisições ao TFSS

:tensorflow:serving:request_latency_bucket

Histograma do tempo de processamento da requisição

:tensorflow:serving:request_latency_sum

Soma das durações de processamento das requisições

:tensorflow:serving:request_latency_count

Número total de requisições cujas durações foram contabilizadas

:tensorflow:cc:saved_model:load_attempt_count

Modelos carregados

Capturas de tela ilustrativas:

Número total de requisições ao TFSS por segundo e por minuto, dividido por modelo
Quantil 0,95 (ou o definido em $quantile) da duração de processamento da requisição no TFSS
Tempo médio de processamento da análise
O blackbox integrado envia requisições para verificar os estados dos modelos, deve ser 1; se não, probe_success o TFSS não está funcionando corretamente

Alertas do Grafana


nginx

Visão geral das métricas

Métrica
Descrição

nginx_up

Mostra se o nginx está em execução: 1 – serviço está ativo, 0 – serviço está inativo

nginx_connections_accepted

Número de conexões aceitas pelo nginx

nginx_connections_handled

Número de conexões tratadas pelo nginx

nginx_connections_active

Conexões ativas do nginx

Capturas de tela ilustrativas:

Número total de requisições ao nginx
Estado das conexões do nginx. Verifique se não há conexões obsoletas
Taxa de sucesso do processamento. Os números de conexões aceitas e tratadas devem ser iguais

Alertas do Grafana


A API 6 não requer mais Celery nem Redis, portanto as métricas correspondentes não são abordadas neste guia.

Você pode personalizar os alertas de acordo com suas necessidades. Por favor, prossiga para nosso repositório para encontrar os arquivos de alerta.

Atualizado

Isto foi útil?