运行状态页面用于了解当前受治理运行时实际表现如何。它与 Audit 和 OpenTelemetry/Prometheus 互为补充:Audit 更关注单个安全/执行事件,后者负责把遥测导出到外部系统。
执行指标
指标端点可返回:
- Query 和 DML 数量
- 成功/失败数量以及成功率
- p50 / p95 延迟
- 延迟样本数以及是否采用采样
- 慢查询数量
- IP 限流数量
- MCP 密钥限流数量
可按时间范围、数据库、access key 和工具名过滤。
数据库健康
每个受管连接的健康项会提供:
| 字段 | 含义 |
|---|---|
Status | 当前健康状态 |
LastCheckedAt | 最近探测时间 |
LastSuccessAt | 最近一次成功探测 |
LatencyMs | 可用时的探测延迟 |
ConsecutiveFailures | 当前连续失败次数 |
OutageStartedAt | 可确定时的当前故障开始时间 |
LastError | 最近 provider/探测错误 |
健康探测由 HEALTH_PROBE_* 配置控制。如果后台探测被关闭,就不要把该页面理解为持续刷新的外部监控系统。
MCP 密钥使用情况
密钥使用数据会报告密钥身份/名称、最后使用时间、请求数、成功/失败、限流次数以及限流拒绝率。
这些数据可以帮助识别长期不用的凭据、请求量异常的 Agent,以及持续触发配额的密钥。修改范围或限制前,先查看 MCP 密钥。
出站投递
运行时会记录已配置告警/SIEM Webhook 等出站投递尝试,包括:
- 类别和状态
- 尝试次数
- 创建/投递/最近尝试时间
- 最新错误
列表端点支持 limit 参数,默认值为 100。
重试投递
| 操作 | 权限 |
|---|---|
| 指标 / DB 健康 / 密钥使用 / 投递列表 | /runtime/operability → view |
| 重试投递 | /runtime/operability → edit |
重试属于显式运维修改操作。修复临时目标端或网络问题后可以使用,但不能用不断重试来替代修复错误 endpoint、secret 或下游服务。