RemediAI
SRE IA pour Grafana, Prometheus et Loki

L'astreinte, sans les nuits blanches.

RemediAI investigue chaque alerte, trouve la cause racine et ne réveille votre équipe que lorsque c'est vraiment nécessaire.

Grafana · 02:07
Alerte : disque / au-dessus de 85 %srv-prod-01 · DiskSpaceLow
RemediAI

J'accuse réception. Je regarde l'évolution de l'espace libre sur les 6 dernières heures.

Requête Prometheus 184 ms
node_filesystem_avail_bytes{mountpoint="/"}

Pic de 4 min pendant la sauvegarde planifiée de 02:00, redescendu à 61 %. Aucune autre alerte, aucun impact service.

Clôturé sans astreinte
02:08 · analyse en 41 s

Branché sur votre stack d'observabilité

GrafanaAlertes (webhook)
PrometheusMétriques (PromQL)
LokiLogs (LogQL)
CentreonLogs et états via Grafana
JiraTickets enrichis
ClaudeModèle d'analyse (Anthropic)
ZabbixProchainement
DynatraceProchainement

Moins d'alertes subies, plus de causes comprises

Moins de réveils pour rien

L'agent tient le premier niveau d'astreinte : il vérifie chaque alerte et ne vous escalade que celles qui ont un impact.

La cause racine, preuves à l'appui

Métriques, logs et incidents liés sont croisés en quelques dizaines de secondes. Chaque conclusion cite ses requêtes.

La surveillance en langage naturel

Vos consignes deviennent des agents qui tournent en continu, sans écrire une ligne de PromQL.

Un SRE IA pour chaque étape de l'incident

De l'alerte au ticket, l'agent travaille sous vos yeux, dans un fil de discussion que toute l'équipe peut relire.

Grafana · 14:32
Alerte : latence p95 MariaDB > 800 msdb-01 · MariaDBSlowQueries
RemediAI

La latence reste au-dessus de 800 ms depuis 12 min et les erreurs applicatives suivent la même courbe dans les logs.

Impact démontré : j'escalade avec la cause racine et les preuves.

Escaladé à l'astreinte
Ticket Jira OPS-142 créé
RemediAI
Recherche dans les logs Loki 312 ms
{service_name="centreon"} |~ "(?i)(error|timeout)"
Cause racine Confiance 86 %
La rotation des logs ClickHouse ne s'exécute plus depuis la mise à jour de 06:10. 3 preuves · chronologie · 2 recommandations
Surveille les erreurs de centreon-engine toutes les 15 min et préviens-moi si elles dépassent la moyenne des 7 derniers jours.
RemediAI

Je compte les erreurs sur 30 min et je compare à la baseline. Au-delà, j'ouvre un incident.

Erreurs du moteur CentreonActif
DéclencheurToutes les 15 min
Surveilleerreurs centengine warnings
Fenêtre30 min · baseline 7 jours
En cas de dériveIncident investigué et trié
Géré par RemediAILancerPause
Ce qui se passe en production
Astreintes évitées · 7 j7
Incidents ouverts1
Analyse moyenne47 s
En alerteDiskSpaceLowdepuis 25 min
En attenteHighErrorLogRatedepuis 4 min
8/8 upCibles Prometheusà l'instant
engineReload configuration finishedil y a 2 h

Comment ça marche

Un webhook Grafana, un accès en lecture à Prometheus et Loki. Pas d'agent à installer sur vos serveurs.

L'alerte se déclenche

Grafana envoie l'alerte à RemediAI, ou un agent de surveillance détecte une dérive.

L'agent investigue

Requêtes PromQL et LogQL, incidents liés, hypothèses vérifiées puis réfutées.

Il trie

Fausse alerte : clôturée avec sa justification. Vrai incident : escaladé à l'astreinte.

Il rend compte

Cause racine, preuves, chronologie et recommandations, jusque dans votre ticket Jira.

Pensé pour la production

RemediAI observe et explique. Il ne touche jamais à vos systèmes.

Ce que RemediAI ne fait pas
Lecture seule : aucune commande, aucun redémarrage, aucune modification
Traçable : chaque requête de l'agent est visible et rejouable
Déployable chez vous : conteneurs Docker sur votre infrastructure
Données limitées : seules les métriques et logs interrogés sont transmis au modèle
Humain dans la boucle : les recommandations restent des suggestions
Qui est derrière RemediAI

Conçu par un architecte observabilité, à partir de vraies astreintes.

RemediAI est développé par Tristan Jossier, consultant indépendant en supervision et AIOps. Il déploie et fait vivre des plateformes de supervision en production, et a construit RemediAI pour automatiser la partie la plus répétitive de l'astreinte : comprendre ce qui se passe.

Centreon (MAP, MBI, BAM)DynatraceZabbixPrometheusGrafanaOpenTelemetryAIOps

Déploiement accompagné

La mise en place se fait avec vous, sur vos vraies alertes : raccordement de Grafana, réglage des agents, revue des premières analyses.

Parler de votre supervision

Voyez l'agent à l'œuvre sur vos alertes

Une démonstration, puis un pilote sur votre propre stack Grafana.