Un SRE IA qui explique avant d'alerter.
RemediAI s'intercale entre vos alertes et votre équipe d'astreinte. Il enquête, trie et rend compte, en lecture seule sur vos outils d'observabilité.
Architecture
Déclencheurs
- Requêtes PromQL et LogQL en lecture seule
- Corrélation avec les incidents récents
- Cause racine, confiance, tri on-call
Restitution
La cause racine, avec ses preuves
L'agent procède comme un ingénieur senior : il vérifie la métrique en alerte, cherche des corrélations, lit les logs, formule des hypothèses et les confronte aux données.
- Requêtes Prometheus et Loki affichées avec leurs graphes et leurs lignes de log
- Cause racine distinguée des symptômes, avec un niveau de confiance honnête
- Chronologie, impact, recommandations et points non vérifiés
- Questions de suivi en langage naturel dans le fil de l'incident
{service_name="centreon"} |~ "(?i)(error|timeout)" Réveiller l'équipe seulement quand ça compte
À la fin de chaque analyse, l'agent décide : escalader, ou clôturer sans astreinte. Dans le doute, il escalade.
- Fausses alertes clôturées avec leur justification chiffrée
- Rappels d'une même alerte rattachés à l'incident, sans nouvelle analyse
- Ticket Jira créé uniquement pour les incidents escaladés
- Clôture automatique désactivable : l'agent donne alors seulement son avis
La latence reste au-dessus de 800 ms depuis 12 min et les erreurs applicatives suivent la même courbe dans les logs.
Impact démontré : j'escalade avec la cause racine et les preuves.
Escaladé à l'astreinteÉcrivez ce qu'il faut surveiller, l'agent s'en charge
Une consigne en français devient un agent planifié : signaux, fréquence, fenêtre et référence de comparaison sont proposés, vous validez.
- Comparaison à une baseline (moyenne 7 jours, veille, seuil)
- Dérive détectée : incident ouvert, investigué et trié automatiquement
- Retour à la normale : l'incident se résout de lui-même
- Historique de chaque passage avec les requêtes exécutées
Je compte les erreurs sur 30 min et je compare à la baseline. Au-delà, j'ouvre un incident.
L'état de la production sur un seul écran
Ce qui est en alerte, ce qui a changé et ce que l'agent a évité, mis à jour en continu.
- Règles Grafana en alerte, en attente ou en erreur
- Santé des cibles Prometheus
- Changements récents lus dans les logs (rechargements, redémarrages)
- Astreintes évitées, MTTR et durée moyenne d'analyse
Ce que RemediAI ne fait pas
La confiance se construit avec des règles claires.
- Aucune action sur vos serveurs : pas de redémarrage, pas de commande, pas de modification de configuration
- Aucune affirmation sans preuve : chaque conclusion cite la requête qui la soutient
- Aucune donnée envoyée au modèle en dehors du contexte de l'alerte et des métriques et logs que l'agent interroge
- Pas de clôture silencieuse : chaque décision de tri reste visible et justifiée
Testez-le sur vos propres alertes
Nous raccordons RemediAI à votre Grafana et passons en revue les premières analyses avec vous.