Expanse
Spring 2026活動中眠っているGPU容量を解放する。
- サマリー
- GPUを利用する研究機関や企業向けに、未使用のGPU計算能力を引き出すソフトウェアを提供する
- 課題
- GPUジョブの失敗や過剰なリソース割り当てにより、計算時間と多額のGPU費用が無駄になる
- 解決策
- リソース予測、最適化提案、失敗予測でGPUジョブを事前に改善し、アイドル計算資源を活用する
AI による要約
- 所在地
- San Francisco, CA, USA
- チーム規模
- 4 人
事業内容
Expanseは、使われていないGPU容量を解放する。3つの機能でアイドル状態の計算リソースを活用する。リソース予測では、ジョブがスケジューラに送られる前に投入サイズを適正化する。最適化提案では、研究者自身が適用できるコードや設定の変更を提示する。失敗予測では、GPU時間を何時間も消費する前に、失敗するジョブを検出する。 私たちは4人のエンジニアで構成されている。最大手のクオンツファンドや国立スーパーコンピューティングセンターで、HPCおよびGPUトレーニングのワークロードを運用してきた。この問題を身をもって経験し、当時の唯一の解決策は過剰にリソースを確保し、数百万ドルを浪費することだった。Ismaeelは、Edinburgh’s Parallel Computing Centre(EPCC)での研究として、初のマルチモーダルHPCリソース予測システムを開発し、公開されているすべてのベースラインを上回った。これは、私たち自身が欲しかったツールである。