Exploitation et continuité Mellentaane
Des services possédant des équipes, des procédures, des sauvegardes vérifiées et des exercices de reprise réellement exécutés.
Organisation
Exploiter est une fonction de souveraineté
Installer des outils ne suffit pas. Chaque service doit avoir un propriétaire, une équipe, un niveau de service, des procédures, un inventaire, un plan de continuité et un transfert de compétences.
Boîte à outils
Outils d’exploitation proposés
| Domaine | Produit open source | Rôle |
|---|---|---|
| Centre de services | GLPI | Incidents, demandes, changements, actifs et niveaux de service |
| Source de vérité réseau | NetBox | Sites, racks, équipements, IP, câblage et automatisation |
| Supervision | Zabbix + Prometheus | Infrastructure, services, capacité et alertes |
| Sauvegarde générique | Restic | Copies chiffrées, dédupliquées et vérifiées |
| Kubernetes | Velero | Ressources, configurations et volumes persistants |
| PostgreSQL | pgBackRest | Sauvegarde complète, incrémentale, WAL et restauration temporelle |
Clarifier les concepts
Haute disponibilité, sauvegarde et reprise ne sont pas synonymes
Haute disponibilité
Maintient le service malgré la panne d’un composant, mais peut répliquer une corruption.
Réplication
Copie rapidement l’état vers un autre site; elle ne remplace pas un historique de sauvegardes.
Sauvegarde
Conserve des versions restaurables avec isolation et rétention.
Reprise après sinistre
Rétablit un service complet sur une infrastructure alternative.
La preuve par l’exercice
Tests obligatoires
| Test | Fréquence indicative | Résultat attendu |
|---|---|---|
| Restauration d’un fichier ou objet | Mensuelle | Objet lisible, métadonnées et droits corrects |
| Restauration PostgreSQL à un instant donné | Trimestrielle | RPO atteint et cohérence applicative |
| Reconstruction d’un cluster | Semestrielle | Plateforme redéployée depuis le code |
| Bascule de site | Annuelle ou selon criticité | RTO atteint et utilisateurs reconnectés |
| Perte de fournisseur | Annuelle pour les composants critiques | Substitution ou continuité démontrée |
Responsabilités nationales
Équipes du modèle d’exploitation
Centre d’exploitation
01Supervision, capacité, changements et continuité.
Centre de sécurité
02Détection, réponse, vulnérabilités et exercices.
Équipe cloud et plateforme
03OpenStack, Ceph, Kubernetes et automatisation.
Équipe données
04PostgreSQL, registres, qualité, sauvegarde et performance.
Équipe identité
05Keycloak, PKI, secrets et comptes privilégiés.
Centre de services
06Support utilisateurs, incidents, demandes et connaissance.