Monitoring & Hochverfügbarkeit
- checkmk
- Nagios
- Grafana
- Enterprise Manager
- RMAN
- Patroni
- Galera
- HAProxy
Ein System ist erst dann betrieben, wenn jemand den Ausfall kommen sieht, bevor er eintritt. Wir bauen Monitoring, das die richtigen Dinge misst und Probleme erkennt. Dazu bauen wir Architekturen, die einen Ausfall wegstecken: Failover-Cluster seit Solaris- und Veritas-Zeiten, heute Patroni auf Kubernetes, MariaDB Galera, HAProxy/nginx/Apache/Squid mit Keepalived und GlusterFS. Dazu Backup und Recovery, die wir regelmäßig wirklich testen.
Für Kunden mit hohen Verfügbarkeitsanforderungen bauen wir Systeme, die den Verlust eines ganzen Rechenzentrums überstehen (Disaster Recovery). Den Ernstfall testen wir mit unseren Kunden regelmäßig.
Typische Aufgaben
- System- und Service-Monitoring mit checkmk oder Nagios aufbauen, Alarmierung mit Sinn und Maß
- Metriken und Logs: Grafana, InfluxDB und Telegraf, ELK-Stack mit Logstash und Filebeat
- Datenbank-Monitoring mit Oracle Enterprise Manager und Grid Control, von 10g bis 12c eingeführt
- Backup und Recovery mit RMAN und Veritas NetBackup, Recovery-Tests statt Hoffnung
- Failover-Cluster und Hochverfügbarkeit: Veritas Cluster Server, Patroni, MariaDB Galera, HAProxy und Keepalived, GlusterFS, Samba mit CTDB
- Patch-Management und Security-Patching, Secrets mit HashiCorp Vault
Aus der Praxis
Für die RCI Banque haben wir ein hochverfügbares Nextcloud-System mit MariaDB Galera und GlusterFS und ein HA-Samba-System mit CTDB aufgebaut; die OpenShift-Cluster werden mit checkmk überwacht. Ein älteres Beispiel: Für rund 120 Test-Datenbanken bei Vodafone haben wir zwischen 2002 und 2007 ein Failover-Cluster-Konzept mit Veritas Cluster Server und EMC-SAN entworfen und umgesetzt und Oracle Enterprise Manager Grid Control als zentrales Datenbank-Monitoring eingeführt.