Je vais configurer la surveillance et les alertes avec Prometheus et Grafana pour vos serveurs
AWS DevOps et SRE, 7 ans, Kubernetes CKA, Terraform, CICD
À propos de ce service
Découvrir que votre serveur était en panne par un client n’est pas la meilleure façon de l’apprendre. Laissez-moi mettre en place une surveillance qui vous avertira en premier.
Senior DevOps / SRE, plus de 7 ans chez Zoom, Airtel, Infosys et Mindtree. Je gère la permanence pour plus de 150 hôtes Linux et un multi-cluster EKS avec un taux de disponibilité supérieur à 99 %, en utilisant Prometheus, Grafana, Datadog et PagerDuty chaque jour. Certifié : CKA, AWS Solutions Architect, AWS SysOps, Terraform.
CE QUE JE METS EN PLACE
Prometheus avec node exporter, cAdvisor et des exporters de services
Tableaux de bord Grafana qui montrent ce qui compte vraiment, pas 40 panneaux inutiles
Règles Alertmanager routées vers Slack, email ou PagerDuty
Loki pour des logs centralisés, consultables à côté de vos métriques
Surveillance Kubernetes : pods, nœuds, déploiements, pression sur les ressources
Alarmes AWS CloudWatch là où elles sont plus adaptées que Prometheus
POURQUOI C’EST IMPORTANT
Les alertes qui se déclenchent constamment sont ignorées. Je règle les seuils pour que chaque alerte indique qu’il y a réellement un problème nécessitant l’intervention humaine.
COMMENT JE TRAVAILLE
Étape un : dites-moi ce que vous utilisez et ce qui vous a déjà causé des soucis.
Étape deux : je confirme la portée et ce sur quoi il faut alerter. La consultation est gratuite.
Étape trois : une stack opérationnelle, des alertes réglées et un runbook pour chaque alerte.
Contactez-moi avec votre configuration pour une consultation gratuite.
Outils:
Docker
•
Kubernetes
•
Amazon EKS
•
Autres
Frameworks:
Terraform
•
Ansible
Fournisseur de services cloud:
Amazon Web Services
Langage de programmation:
Bash
•
Python
Expertise:
Installation
•
Débogage
•
Configuration

