Operability est la surface Admin permettant de comprendre comment le runtime gouverné se comporte maintenant. Elle complète Audit, centré sur les événements individuels de sécurité/exécution, ainsi qu’OpenTelemetry/Prometheus, qui exportent la télémétrie vers des systèmes externes.
Métriques d’exécution
L’endpoint de métriques peut retourner :
- nombres de Query et DML ;
- succès, échecs et taux de succès ;
- latences p50 et p95 ;
- taille de l’échantillon et indicateur d’échantillonnage ;
- nombre de requêtes lentes ;
- nombre de limitations IP ;
- nombre de limitations par clé MCP.
Les filtres peuvent restreindre la vue par période, base, clé d’accès et nom d’outil.
Santé des bases
Les éléments de santé exposent l’état opérationnel de chaque connexion gérée :
| Champ | Signification |
|---|---|
Status | état de santé courant |
LastCheckedAt | dernière heure de sonde |
LastSuccessAt | dernière sonde réussie |
LatencyMs | latence de sonde si disponible |
ConsecutiveFailures | nombre d’échecs consécutifs |
OutageStartedAt | début de l’incident courant si connu |
LastError | dernière erreur moteur/sonde |
Les sondes sont contrôlées par les paramètres HEALTH_PROBE_*. Si la sonde d’arrière-plan est désactivée, cette surface ne doit pas être interprétée comme un système de supervision externe continuellement rafraîchi.
Usage des clés MCP
Les résultats indiquent l’identité/le nom de la clé, sa dernière utilisation, le nombre de requêtes, les succès/échecs, les limitations et le taux de refus.
Utilisez ces données pour identifier les identifiants inutilisés, les agents anormalement bavards et les clés qui atteignent régulièrement leur limite. Consultez ensuite Clés MCP avant de changer périmètre ou limites.
Livraisons sortantes
Le runtime enregistre les tentatives de livraison sortante, notamment les webhooks d’alerte/SIEM configurés. Chaque élément expose :
- catégorie et statut ;
- nombre de tentatives ;
- date de création/livraison/dernière tentative ;
- dernière erreur.
L’endpoint de liste accepte limit, avec 100 par défaut.
Relancer une livraison
| Opération | Permission |
|---|---|
| métriques / santé DB / usage des clés / liste des livraisons | /runtime/operability → view |
| relance de livraison | /runtime/operability → edit |
La relance est une mutation opérateur explicite. Elle est utile après correction d’un problème réseau/destination transitoire, mais ne remplace pas la correction d’un endpoint, secret ou service aval invalide.
Où poursuivre l’investigation
- Audit — acteurs/actions/résultats exacts et contexte d’exécution SQL.
- Politiques de sécurité — limites runtime pouvant expliquer les refus.
- Observabilité — Prometheus, OTLP, traces et intégration télémétrique externe.
- Déploiement distribué — coordination partagée lorsque plusieurs nœuds doivent partager limites et état.