セットアップ
APIトークン1つで、Rayクラスターを完全に可視化
読み取り専用のAPIトークンでAnyscale組織を接続するだけ。DoiTが消費量メトリクス、クラスターの使用状況、AWSやGCPの基盤クラウド支出を自動的に取り込みます。エージェントは不要、Rayジョブのコード変更も一切ありません。接続から数時間で統合レポートが利用可能になります。
できること
Anyscale上でRayを運用する現場のために
FinOps担当者やMLプラットフォームのリーダーがAnyscale組織の接続時に実際に求める機能を揃えました。
統合された消費量レポート
Anyscaleの支出をワークスペース、プロジェクト、クラスター、チーム別に分析し、基盤となるクラウドコストと併せて把握できます。
リアルタイム異常検知
暴走したRayジョブやGPU支出の急増を数分以内にアラートで通知します。
クラスターのライトサイジング
サイズ過剰なヘッドノードやワーカーノードを検出し、CPU・GPU・メモリについてすぐに実行できる推奨事項を提示します。
アイドルクラスターの検出
ジョブ終了後に稼働したままのRayクラスターを洗い出し、無駄な支出を取り戻します。
GPU・アクセラレーターの可視化
請求書の合計額に埋もれがちな、トレーニング・チューニング・サービングの各ワークロードにおけるGPU、CPU、xPUの使用状況を明確に把握できます。
ガバナンスと予算管理
MLチームやプロジェクト単位で予算を設定し、次のトレーニング実行前に超過を検知します。
Anyscaleのダッシュボードでわかるのは消費量まで。Cloud Intelligence™は、そこから行動につなげます。
Anyscaleの使用状況ダッシュボードのその先へ
マルチクラウドの統合ビュー
AWS、GCP、Kubernetes上で稼働するAnyscaleの支出を統合表示し、任意のクラスターまでドリルダウンできます。
リアルタイム異常アラート
ワークスペース、クラスター、ジョブの各ディメンションで機械学習による検知を行い、Slackやメールに通知します。
GPUコミットメントの計画
Savings Plans、CUD、リザベーションを、コミットする前に実際のRay使用量と照らしてシミュレーションできます。
プロジェクトと配賦の整備
タグ付けされていないRayワークロードを発見し、配賦ルールを適用して、財務部門が求める形で共有コストを按分できます。
Kubernetesのコスト配賦
追加のエクスポーターなしで、Kubernetes上のAnyscale支出をネームスペース、ワークロード、ラベル別に分解します。
Forward Deployed Engineers
世界トップクラスのクラウドアーキテクトが、お客様のチームの一員として最適化の実装を支援します。
急成長企業がCloud Intelligence™を活用しています
導入後90日以内の平均削減率
平均導入期間
“DoiTの信頼性へのこだわりとシステムの柔軟性のおかげで、エンジニアの手をまったく煩わせることなく、Amazon EKSワークロードを安全に最適化できています。”
Oren Ashkenazy氏
Fiverr社 DevOps & クラウド ディレクター
Anyscale組織を接続してみませんか?
Rayクラスターの支出を徹底的に可視化しましょう。
Frequently asked
questions
ワークスペースやプロジェクトを横断してAnyscaleのコストを一元的に確認できますか?
Anyscale組織を一度接続するだけで、Cloud Intelligence™がすべてのワークスペースとプロジェクトの消費データを取り込みます。手作業での集計なしに、クラスター、ジョブ、チーム、基盤クラウド別のコストを単一のビューで分析できます。
Anyscaleの使用データをCloud Intelligence™に接続するには何が必要ですか?
Anyscale組織の読み取り専用APIトークンと、AWSまたはGCPの請求データ接続を使用します。データの取り込み、正規化、時間単位のレポート作成はDoiTが行います。ほとんどのチームは1日以内に利用を開始できます。
どのRayクラスターやジョブが支出の大半を占めているか把握できますか?
コスト・使用状況レポートで、Anyscale全体の支出から特定のクラスター、ジョブ、ノードタイプまでドリルダウンできます。SQLを書かずに、ワークスペース、プロジェクト、リージョン、インスタンスファミリーで絞り込みが可能です。
Anyscaleのコスト異常が発生した際、すぐに通知を受け取れますか?
異常検知は、ワークスペース、クラスター、ジョブの各ディメンションで常時稼働しています。深夜にGPU時間を消費し続けるトレーニング実行など、異常な兆候があれば、推定原因とともにSlackまたはメールでアラートが届きます。
アイドル状態やサイズ過剰なRayクラスターによる無駄を減らすには?
Cloud Intelligence™は、利用率目標を下回るクラスター、ワークロードに対してサイズ過剰なヘッドノード、ジョブ完了後にアイドル状態のまま放置されたクラスターを検出します。各推奨事項には削減見込み額が表示されます。
Anyscaleの支出をMLチームやモデルに配賦するには?
Anyscaleのワークスペース、プロジェクト、タグを社内のコストセンターにマッピングできます。共有GPUプールは配賦ルールで按分できるため、財務部門はスプレッドシートでの手作業なしに、チーム別・モデル別のコストを把握できます。
すでにAnyscaleの使用状況ダッシュボードを使っています。Cloud Intelligence™で何が加わりますか?
Anyscaleのダッシュボードで確認できるのは、Anyscale内の消費量の推定値です。Cloud Intelligence™はそれを実際のクラウド支出と紐付け、マルチクラウドの可視化、プロアクティブな推奨、異常検知、ガバナンス、そしてForward Deployed Engineersへのアクセスを提供します。
Cloud Intelligence™はAnyscale組織にどのようなアクセス権限を持ち、どのように保護されますか?
Cloud Intelligence™は、最小権限の読み取り専用APIトークンを使用します。お客様の承認なしにクラスターやジョブを変更することは一切なく、プラットフォームはSOC 2 Type II認証を取得しています。
