自然言語だけでサーバー監視!Grafana Cloudの生成AIでダッシュボード作成からアラート設定まで全部やってみた

こんにちは、エンジニアのHKです。
突然ですが皆さんは Grafana でサーバー監視をしていますか?
弊社ではサーバーの負荷状況などを確認するために Grafana を使っています。
Grafanaのダッシュボードやアラートはyamlで記述できれば自由にカスタムできますが、そのクラウド版のGrafana Cloudに追加されたAI機能を使うことでyamlファイルがわからなくても日本語で好きにダッシュボードやアラートルールを作ることができるようになりました。
今回はGrafana Cloudでダッシュボード作成とアラートルール作成、そして実際にアラートが発報した時の調査の手がかりまでAIに任せてやってみましょう。
ダッシュボード作成
まずはリソース監視のためのダッシュボードを作成します。 こんな感じのシンプルな指示でもちゃんとダッシュボードを作ってくれます
Ubuntuサーバーの今の状態がひと目でわかるダッシュボードを作って。
CPU、メモリ、ディスクの空き容量、ネットワークのグラフをまとめて入れてほしい。↑の指示で出来上がったダッシュボードはこんな感じ

サーバーから送られてくるメトリクスをよしなに解釈して作ってくれます。
アラートルール作成
次にアラートルールの作成をします。 凝った指示をすれば細かいところまで内容を指定出来ますが、あえてシンプルな指示で作ってみます。
メインディスク(/)の容量不足を防ぐためのアラートルールを作って。
ディスクの使用率が85%を超えたら、すぐにアラートを発報するように設定して。
こんな感じで即運用可能なアラート設定を作成してくれます。
トラブルシューティングだってできる
実際にアラートが発生したらもちろんアラートの原因調査をしていかなくてはなりませんが、この調査の手伝いもAIがやってくれます。 今回はディスク容量を計測するアラートルールを作ったので、巨大なダミーファイルを作成して強制的にディスク使用率をアラート状態にします。
fallocate -l 7G dummy_test.tmpコマンドを実行してしばらくするとディスク使用率が急上昇、アラート状態になりました。

それではAIに聞いてみましょう。
ディスク容量のアラートが出たけど、原因を特定するにはどうすればいい?するとこのように答えが返ってきました。
このように調査のために実行できるコマンドを教えてくれるので、実行することでサーバー内のディスク使用量が大きいファイルを見つけだすことができます。
まとめ
今回はGrafana CloudのAI機能を使って、日本語だけでGrafanaの監視を実現してみました。
yamlファイルの書き方はとっつきづらいと思うところもあり、私も最初はyamlファイルのインデントずれなどでしょっちゅうエラーが出て躓いていましたが、自然言語でダッシュボードやアラートが作れるようになればそういった悩みも無縁になる時代がくるかもしれません。
それでは、また。


