NEW
リモート可
【Kubernetes/Linux/Docker/リモート併用】K8s Run:ai検証プロジェクト
雇用形態
業務委託(フリーランス)
業務内容
【募集背景】
Kubernetes環境におけるノードおよびネットワーク分離、マルチクラスタ構成、GPU利用方式に関する動作検証を実施します。
【作業内容】
ユーザー単位で利用可能なノード・ネットワークを分離した場合の動作を検証します。2クラスタ構成でストレージを共有し、Run:aiを各クラスタで独立稼働させる構成を検証します。用途に応じたローカルGPU・分散GPUの使い分け手法を確立し、構成の妥当性を検証します。
【求める人物像】
顧客との要件ヒアリングや進捗報告を円滑に行い、検証結果を報告書として整理できる方を求めます。
【ポジションの魅力】
Kubernetes、マルチクラスタ、ネットワーク、ストレージ、GPU基盤を横断した検証に携われます。
【開発環境】
Kubernetes、Linux、Docker、Run:ai、GPU、共有ストレージを使用します。
スキルタグ
求めるスキル
- ■必須スキル:
- ・Kubernetesの基礎操作(kubectl操作、関連ドキュメント作成) ・Linuxサーバ運用の基礎知識 ・コンテナ/Dockerの基礎知識 ・検証設計・報告書作成及び顧客への報告経験 ・顧客折衝(要件ヒアロング・進捗報告)への抵抗がないこと ・高いコミュニケーション能力 ・Kubernetesクラスタ設計構築・運用経験(マルチクラスタ環境の経験があれば尚良) ・CNI(Calico/Cilium/Flannel等)の設計構築・運用経験、NetworkPolicy設計経験 ・VLAN設計、物理/仮想スイッチの設定経験 ・クラスタ間ネットワーク接続の設計経験(複数クラスタ間の疎通・ルーティング設計) ・分散/共有ストレージの設計構築・運用経験(NFS、Ceph、GlusterFS、またはVAST/Weka/PureStorage等AI向けストレージ製品) ・Kubernetes CSI(Container Storage Interface)の設計構築・運用経験 ・複数クラスタから同一ストレージへアクセスさせる構成の設計経験
- ■歓迎スキル:
- ・NVIDIA GPU Operator、GPUドライバ/CUDAの知識 ・Run:aiの実機構築・運用経験(Project/Department/Node Pool設定、フラクショナルGPU、Gang Scheduling) ・分散学習フレームワークの知識(PyTorch DDP、Horovod、DeepSpeed等)とKubernetes上での実行経験(Kubeflow Training Operator等)