メインコンテンツまでスキップ

メトリクス

VeloDB Cloudは、コンソール内に組み込みメトリクスを提供し、Metrics APIを通じて生のメトリクスを公開します。コンソールを使用してwarehouseとclusterの健全性をインタラクティブに検査したり、Metrics APIを独自のPrometheusとGrafanaスタックに接続して一元的な可観測性を実現したりできます。

コンソールでメトリクスを表示する

Metricsページでは以下が可能です:

  • warehouseまたはcluster別にメトリクスを表示する
  • Starredを使用して、warehouseとcluster全体で気になるメトリクスをピン留めし、一緒に表示する
  • 時間セレクターを調整して、過去30日までの履歴データを確認する
  • ほぼリアルタイムの更新(5秒間隔)のために自動更新を有効にする

メトリクスは2つのカテゴリに分かれています:Resource Metrics(物理的なリソース使用率)とService Metrics(クエリとワークロードのパフォーマンス)です。

Resource Metrics

Resource metricsは、warehouseとclusterノード全体の物理的な使用率を追跡します。これらは、特定の時間範囲でwarehouseまたはclusterが健全かどうかを判断し、履歴または現在のクエリがパフォーマンスに影響しているかどうかを判断するのに役立ちます。これは、スケールアップ、スケールダウン、またはSQLの最適化を計画する際の有用な入力となります。

metrics basic

Scope列は、メトリクスがwarehouseレベル、clusterレベル、またはその両方で適用されるかを示します。Available from列は、必要な最小エンジン(core)バージョンを示します。空白のセルは、最初のリリースからメトリクスが利用可能であったことを意味します。

MetricScopeUnitAvailable fromWhat it shows
CPU UtilizationWarehouse, Cluster%全ノード全体のCPU使用率。スケーリングやその他のリソース集約型操作の静かな時間を見つけるのに有用。
Memory UsageWarehouse, ClusterGB全ノード全体で消費されるメモリ。持続的な高使用率は、スケールまたはワークロード調整の必要性を示す。
Memory UtilizationWarehouse, Cluster%全ノード全体のメモリ使用率。持続的なメモリ圧迫を検出するのに役立つ。
I/O UtilizationWarehouse, Cluster%ノード全体のディスクI/O使用率。持続的な高い値は、ストレージのボトルネックを示唆する。
Disk Cache UtilizationCluster%4.0.4ローカルキャッシュ容量の使用率。キャッシュ容量が十分かどうかを評価するのに役立つ。
Disk Cache Hit RateCluster%ローカルキャッシュから提供された読み取りの割合。低い値は、キャッシュサイズまたはポリシーの見直しを示唆する。
Disk Cache Read/Write IOPSClusterIOPSローカルキャッシュの読み取りおよび書き込みIOPS。キャッシュ層のリクエスト負荷を反映する。
Disk Cache Read/Write ThroughputClusterMB/sローカルキャッシュの読み取りおよび書き込みスループット。キャッシュ層のデータ転送を反映する。
Remote Storage Read/Write IOPSClusterIOPS4.0.4オブジェクトストレージの読み取りおよび書き込みIOPS。リモートストレージのリクエスト負荷を反映する。
Remote Storage Read/Write ThroughputClusterMB/s4.0.4オブジェクトストレージの読み取りおよび書き込みスループット。
Network Inbound/Outbound ThroughputWarehouse, ClusterMB/sインバウンドおよびアウトバウンドネットワークスループット。帯域幅のボトルネックを特定するのに役立つ。
Unreachable Node CountWarehouse, Clusterホスト可用性チェックに基づく、ホストレベルの到達不可能ノード。
Inactive FE Service Node CountWarehouseサービスプロセスがアクティブでないFEノード。systemdまたはプロセス障害を表面化する。

Service Metrics

Service metricsは、クエリとワークロードの動作を追跡します:クエリの実行速度、成功数、および書き込みパスの動作です。

metrics query

MetricScopeUnitAvailable fromWhat it shows
Queries per SecondWarehouse, ClusterQPS1秒あたりに処理されるクエリリクエスト。ピークQPSは、clusterのサイジング時の有用な入力。
Query Success RateWarehouse, Cluster%成功したクエリの割合。異常な低下は、clusterまたはノード障害を示す可能性がある。
Average Query LatencyClusterms平均クエリレイテンシ。上昇は、調査すべきcluster全体の減速を示す。
P99 Query LatencyClusterms99パーセンタイルのクエリレイテンシ。テールレイテンシと低速クエリのリスクを反映する。
Rows Loaded per SecondWarehouse, ClusterRow/sロードジョブによって1秒あたりに書き込まれる行数。取り込みスループットを追跡する。
Load ThroughputWarehouse, ClusterMB/sロードジョブによって1秒あたりに書き込まれるデータ。取り込み帯域幅を追跡する。
Active ConnectionsWarehouse全cluster全体のwarehouseへのアクティブ接続。
Finished Load Job RateWarehouseロードジョブの最近の完了率。急激な変化は、ワークロードの変化を示す可能性がある。
Average Load Job LatencyWarehousemsロードジョブの平均実行レイテンシ。低いほど、データがより早くクエリ可能になることを意味する。
Stream Load Request RateWarehouseStream Loadリクエスト率。リアルタイム取り込みトラフィックを反映する。
Broker Load Job RateWarehouseBroker Loadジョブ率。バッチ取り込みトラフィックを反映する。
Insert Into Job RateWarehouseInsert Into書き込み率。SQLベースの取り込みトラフィックを反映する。
Routine Load Jobs by StatusWarehouse各ステータスのRoutine Loadジョブ数。継続的取り込みの健全性を追跡する。
Compaction ScoreClusterデータファイルのマージ圧力。高いスコアは、書き込みまたはクエリパフォーマンスに影響する可能性がある。
Routine Load LagWarehouse4.0.5例えばKafkaからのRoutine Load消費ラグ。データの新鮮さを反映する。
Routine Load Aborted TransactionsWarehouse4.0.5過去5分間で中止されたRoutine Loadトランザクション。増加は取り込み失敗を示す。
Routine Load Jobs in ABNORMAL_PAUSED StateWarehouse4.0.5異常に一時停止されたRoutine Loadジョブ。通常、調査と手動再開が必要。
Virtual Cluster Active-Standby SwitchesWarehouse4.1.7仮想clusterのアクティブスタンバイ切り替えイベント、少なくとも10分間のウィンドウにわたる。
Data SizeWarehouseGBwarehouseのデータサイズの履歴トレンド。
MV Refresh Skipped TasksWarehousetasks4.1.8ウィンドウ内でスキップされたマテリアライズドビューリフレッシュタスク。スケジューリング遅延またはバックログを表面化する。
MV Refresh Queue LengthWarehousetasks4.1.8実行中および待機中のマテリアライズドビューリフレッシュタスク。リフレッシュバックログを追跡する。
MV Refresh Success RateWarehouse%4.1.8成功したマテリアライズドビューリフレッシュの割合。リフレッシュがないウィンドウは100%を示す。
MV Refresh DurationWarehousems4.1.8P75およびP95のマテリアライズドビューリフレッシュ期間。

個別のRoutine LoadおよびWarmupジョブのジョブレベルメトリクスは、ここではなく各ジョブ自身のページに表示されます。これらにアラートを設定するには、Alertsを参照してください。

次のステップ

  • Metrics API:これらのメトリクスを独自のPrometheusまたはGrafanaスタックに取り込む
  • Alerts:メトリクスが閾値を超えたときに通知を受け取る