1. Home
  2. News
  3. AIワークロードのインフラ障害発生時にも継続稼働させる耐障害性ソフトウェアを提供する"Clockwork.io"が$31Mを調達
2026/10/07

Startup Portfolio

AIワークロードのインフラ障害発生時にも継続稼働させる耐障害性ソフトウェアを提供する"Clockwork.io"が$31Mを調達

Clockwork.ioは、Premji Invest、Wing Venture Capital、Seligman Venturesが共同リードし、NEAとe& Capitalが参加した資金調達ラウンドで$31Mを調達し、累計調達額は$73Mとなりました。

AIトレーニング、強化学習、推論のワークロードをインフラ障害発生時にも継続稼働させる耐障害性ソフトウェアを提供するClockwork.ioは、Software-Driven AI Fabrics™を開拓しています。これはハードウェアとワークロードの間に位置するプログラム可能なレイヤーであり、アクセラレーター、ネットワーク、クラウドの種類を問わず、GPUクラスターの可観測性、耐障害性、最大限の利用率を実現します。AIワークロードではクラスター全体が1台のマシンのように動作する必要がありますが、障害やボトルネックによってGPUがアイドル状態になることがあります。

Clockwork.ioのFleetLensプラットフォームは、こうして失われるキャパシティを回復します。ナノ秒精度のテレメトリーによって、ジョブを遅延または停止させているGPU、ノード、リンクを特定し、稼働開始前にクラスターを検証します。さらにLinkPassとTorchPassを組み合わせることで、トレーニングから推論まで、インフラの障害や性能低下が発生してもワークロードを継続稼働させます。

SemiAnalysisは独自のベンチマークを実施し、TorchPassがチェックポイントからの再起動や主要なオープンソースフレームワークよりも高速に障害から復旧できることを確認しています。LinkedIn、Together AI、WhiteFiber、Wells Fargo、Nebius、NScale、DCAIが、自社のAIインフラを支えるためにClockwork.ioを採用しています。

大規模な分散AIワークロードでは、数千基のGPUを同期させて稼働させる必要があります。GPUが1基故障したり、リンクが切断されたり、サーバーがフリーズしたりするだけで、ジョブ全体が停止する可能性があります。Metaは、16,384基のGPUを使用した54日間のLlama 3トレーニングにおいて、予期せぬ中断が平均して約3時間に1回発生したと報告しています。

一般的な対応方法は、ジョブの進捗状況を保存したコピーであるチェックポイントを再読み込みすることです。復旧には最大90分を要する場合があり、その間、正常なGPUも待機することになります。また、チェックポイント以降に完了していた処理を再度実行する必要があります。顧客はアイドル状態のGPUと重複した計算処理の双方に料金を支払うことになり、モデルの完成までの時間も長くなります。ジョブの規模が拡大するほど、再起動のたびに失われる可能性のあるGPU稼働時間も増加します。

この規模では、障害が発生しても有効な処理を継続させることがインフラの必須要件となります。Clockwork.ioは、ハードウェアとワークロードの間のレイヤーとしてプラットフォームチームが導入する耐障害性ソフトウェア群によって、この要件に対応しています。LinkPassは、障害が発生したリンクを迂回してトラフィックを再ルーティングするため、ジョブ側が障害を認識することなく稼働を継続できます。TorchPassは、障害が発生しつつあるGPUから正常なGPUへ処理を移動させることで、ロールバックすることなくトレーニングを継続させます。両製品ともすでに本番環境で稼働しています。TorchPassの新しいプラットフォーム・スナップショットは、実行中の分散ジョブの状態を保存し、単純な移行では回避できないほど大規模な障害が発生した場合でも、ジョブ全体を復元できるようにします。

「AIを大規模に運用すれば、障害は避けられません。しかし、そのために何時間もの有効な処理を失う必要はありません」とClockwork.ioのCEOであるSuresh Vasudevanは述べています。「耐障害性はgoodputを高めるための乗数効果を持ちます。GPUを復旧待ちや、すでに完了した処理のやり直しに使うのではなく、有効な処理に使い続けることができます。私たちは、最大規模のGPUフリートを運用する企業やクラウドプロバイダーとともにソフトウェアを構築してきたため、彼らが実際に直面する障害に対応できます。このような保護機能は、企業やクラウドプロバイダーが日々依存するインフラに組み込まれるべきものです。」

自社でGPUフリートを運用する企業、ハイパースケーラー、ネオクラウドは、より多くのGPU稼働時間を有効な処理に充てるという共通の目的からClockwork.ioを採用しています。

LinkedInは、AIインフラ全体にLinkPassのネットワーク耐障害機能を導入し、毎月数万GPU時間に相当するダウンタイムを防止しています。Together AIは、同社のGPU Clusters上のサービスとしてTorchPassを市場投入します。PyTorch Conferenceでは、両社がマルチノードのトレーニングジョブに意図的にネットワーク障害とGPU障害を発生させ、再起動することなく処理を継続するライブデモを実施します。既存顧客であるWhiteFiber(NASDAQ)は、世界各地で拡大するGPU-as-a-Service事業において、Clockwork.ioソフトウェアの利用を拡大しています。

TagsAIDevOpsSaaSCloud

関連ニュース

Contact

AT PARTNERSにご相談ください