Skip to content
← Back to job listings

3040_インフラエンジニア・プラットフォーム開発 / Infrastructure Engineer・Platform Engineering

Turing株式会社 · ■平和島オフィス 〒143-0006 東京都大田区平和島6丁目1-1 物流ビルA棟 ▼アクセス 東京モノレール流通センター駅から徒歩7分 ※通勤方法 ・電車・バス等の公共交通機関 もしくは ・自家用車やバイクでの通勤 ※通勤手当 ・公共交通機関利用者は1ヶ月あたり40,000円を支給限度とします。 ・自家用車利用者は燃費代相当費用+合理的な高速代(高速代は別途要件あり、要事前許可)を精算対

IT - Network / Systems / DB AdminExternal listingfull-timeabout 1 month ago

About The Role

3040_インフラエンジニア・プラットフォーム開発 / Infrastructure Engineer・Platform Engineering

仕事概要

チューリングは「We Overtake Tesla」を掲げ、完全自動運転AIの開発に取り組むスタートアップです。2022年のほぼGPUゼロの状態から計算資源を増強し続け、2025年12月時点でオンプレミス・クラウド合わせてスパコン「富岳」のAI演算性能の約40%に相当する約0.7EFLOPS(FP16)を常時運用しています。さらに今後2年でこれを5〜10倍に拡大する計画が、現在進行形で動いています。

現在のE2E自動運転モデルは、データとGPUを増やすほど素直に性能が伸びるフェーズにあり、社内は「GPUがあるだけ使い切る」状況です。つまり、計算資源の利用効率を1%改善することが、そのまま自動運転AIの進化スピードに直結します。

本ポジションでは、チューリングの機械学習基盤を支えるGPUクラスタ(主にクラウド上のSlurm環境)の運用・改善をリードし、オンプレを含めた計算資源の利用効率を最大化することをミッションとします。

現在はAWS/GCP上のSlurmクラスタを中心に運用しており、これらを高度に自動化・最適化しながら、将来的にはオンプレミス環境との統合やKubernetesとのハイブリッド化など、より高度な計算基盤の設計・実装にも取り組んでいただきます。インフラチームは、GPU間をEthernet(RoCE v2)で800Gbps・End-to-Endで接続する次期オンプレミスGPU基盤の構築を進めており、クラウドとオンプレをまたぐハイブリッド基盤の進化はまさにこれからが本番です。

機械学習エンジニア/インフラエンジニア/MLOpsエンジニアと密に連携し、ワークロード特性を理解した上で、インフラからアプリケーションレイヤまで横断的に課題解決をリードできるエンジニアを募集しています。

■ 具体的な業務内容

・AWS / GCP上のSlurmクラスタの運用、改善(Terraform / Ansible等による自動化)

・Python / Goによる運用ツール・ジョブ管理の自動化開発

・GPU利用状況の可視化・ボトルネック分析、ジョブスケジューリング最適化(優先度制御、プリエンプション等)

・クラウド/オンプレ間のワークロード最適配置(例:推論系ジョブのオンプレ移行)

・MLエンジニアと連携した実験、学習基盤の改善、CI/CD・モニタリング基盤の整備

・オンプレ統合、Slurm × Kubernetesハイブリッド基盤など中長期的な基盤アーキテクチャ設計

必須スキル

チューリングは「We Overtake Tesla」を掲げ、完全自動運転AIの開発に取り組むスタートアップです。2022年のほぼGPUゼロの状態から計算資源を増強し続け、2025年12月時点でオンプレミス・クラウド合わせてスパコン「富岳」のAI演算性能の約40%に相当する約0.7EFLOPS(FP16)を常時運用しています。さらに今後2年でこれを5〜10倍に拡大する計画が、現在進行形で動いています。

現在のE2E自動運転モデルは、データとGPUを増やすほど素直に性能が伸びるフェーズにあり、社内は「GPUがあるだけ使い切る」状況です。つまり、計算資源の利用効率を1%改善することが、そのまま自動運転AIの進化スピードに直結します。

本ポジションでは、チューリングの機械学習基盤を支えるGPUクラスタ(主にクラウド上のSlurm環境)の運用・改善をリードし、オンプレを含めた計算資源の利用効率を最大化することをミッションとします。

現在はAWS/GCP上のSlurmクラスタを中心に運用しており、これらを高度に自動化・最適化しながら、将来的にはオンプレミス環境との統合やKubernetesとのハイブリッド化など、より高度な計算基盤の設計・実装にも取り組んでいただきます。インフラチームは、GPU間をEthernet(RoCE v2)で800Gbps・End-to-Endで接続する次期オンプレミスGPU基盤の構築を進めており、クラウドとオンプレをまたぐハイブリッド基盤の進化はまさにこれからが本番です。

機械学習エンジニア/インフラエンジニア/MLOpsエンジニアと密に連携し、ワークロード特性を理解した上で、インフラからアプリケーションレイヤまで横断的に課題解決をリードできるエンジニアを募集しています。

■ 具体的な業務内容

・AWS / GCP上のSlurmクラスタの運用、改善(Terraform / Ansible等による自動化)

・Python / Goによる運用ツール・ジョブ管理の自動化開発

・GPU利用状況の可視化・ボトルネック分析、ジョブスケジューリング最適化(優先度制御、プリエンプション等)

・クラウド/オンプレ間のワークロード最適配置(例:推論系ジョブのオンプレ移行)

・MLエンジニアと連携した実験、学習基盤の改善、CI/CD・モニタリング基盤の整備

・オンプレ統合、Slurm × Kubernetesハイブリッド基盤など中長期的な基盤アーキテクチャ設計

歓迎スキル

※全てではなく、下記のいずれかやその他の技術に精通している方を探しています

・GPUクラスタの運用・チューニング経験

・MLワークロード(学習・推論)の理解

・ジョブスケジューリングやリソース最適化の経験

・Slurm × Kubernetes の統合・運用経験

・分散学習(PyTorch DDP 等)の知識

・並列ファイルシステムや高速ネットワークの知識

・コスト最適化(FinOps / CapEx・OpEx設計)の経験

求める人物像

・インフラからアプリケーションまで横断的に課題解決できる方

・MLエンジニアの課題を理解し、技術的施策に落とし込める方

・不確実性の高い環境でも、優先順位をつけてアドホックに動ける方

・将来的な基盤進化(オンプレ統合・K8s連携など)にも主体的に挑戦できる方

【参考情報】

▼会社HP

▼ Turing Tech Blog

▼チューリポ(オウンドメディア)

【応募時のお願い】

・応募時の書類(履歴書・職務経歴書)はPDF形式にてご提出いただきますようお願い申し上げます

・応募時の書類(履歴書・職務経歴書)やエントリーページの入力箇所に年収情報(現在年収や希望年収)を記載するのはお控えください

  • 年収情報については選考プロセスが進む中でHRよりヒアリングをさせていただきます
  • 応募概要
  • 給与
  • シニアエンジニア
  • ・想定年収:10,000,000円~15,000,000円
  • ・基本給:634,925円~952,380円
  • ・みなし残業手当:198,415円~297,620円(※みなし残業40時間相当分)
  • プリンシパルエンジニア
  • ・想定年収:15,000,000円~20,000,000円
  • ・基本給:952,380円~1,269,843円
  • ・みなし残業手当:297,620円~396,827円(※みなし残業40時間相当分)
  • ※上記は想定額のため、最終的には現年収を考慮しつつ経験・スキルを考慮して内定時に提示します
  • ※キャリア採用の場合、下限については概ね1000万円を下回ることはありませんが上限については2000万円を超えるオファーをすることも検討しています
  • 勤務地
  • ■平和島オフィス
  • 〒143-0006
  • 東京都大田区平和島6丁目1-1 物流ビルA棟
  • ▼アクセス
  • 東京モノレール流通センター駅から徒歩7分
  • ※通勤方法
  • ・電車・バス等の公共交通機関
  • もしくは
  • ・自家用車やバイクでの通勤
  • ※通勤手当
  • ・公共交通機関利用者は1ヶ月あたり40,000円を支給限度とします。
  • ・自家用車利用者は燃費代相当費用+合理的な高速代(高速代は別途要件あり、要事前許可)を精算対象とします。
  • ・バイク利用者は燃費代のみを精算対象とします。(高速代はお支払いの対象外となります。)
  • 雇用形態
  • 正社員
  • 勤務体系
  • フレックスタイム制
  • コアタイム:11:00~15:00
  • フレキシブルタイム:08:00~11:00、15:00~22:00
  • 標準的な勤務例:10:00-19:00(休憩1時間)
  • ※ライフスタイルや業務に応じて始業・終業時間を柔軟に調整することが可能です
  • 【休日休暇】
  • ■土日祝日
  • ■年次有給休暇:初年度は入社時に13日間付与
  • ■夏季休暇・年末年始休暇
  • ■ライフサポート休暇:特別有給休暇として入社日に5日間付与(有効期限は付与から1年間)
  • ■結婚休暇(5日間)等の慶弔休暇
  • ■出産休暇・育児休暇制度完備
  • ■小学校3年生が終わるまで取得可能な育児時短制度
  • ■子の看護休暇・介護休暇(無給・5日)
  • 試用期間
  • あり(3カ月間)
  • 福利厚生
  • ■社会保険完備
  • ■交通費支給(会社が認めた通勤経路および通勤方法に基づき、会社が定める基準により算定した額を支給します。)
  • ■社食(昼食支援)制度
  • ■インフルエンザ予防接種の費用補助
  • ■定期健康診断
  • ■提携クリニックによる健康相談
  • ■社外カウンセリング窓口
  • ■PC選択制度(エンジニア対象)
  • ■Turing Unlimited AI制度(直接雇用の全社員を対象に、業務に必要なあらゆるAIサービスを会社負担で上限なく利用できる制度です。)
  • ■駐車場代補助制度(U30エンジニア対象)
  • ■書籍購入制度
  • ■ベビーシッター利用割引制度
  • ■妊活検査(AMH卵巣予備能力指数検査)の無料検査制度
  • ■提携クリニックによる女性特有の健康相談無料カウンセリング制度
  • ■オフィスコンビニ(スマートマルシェ、オフィスグリコ)
  • ■社内交流会(All Hands)の費用補助
  • ■服装自由
  • ■東振協の共同利用保養所サービス
  • ■福利厚生賃貸サービス

This is an external listing. JobSpring does not represent or verify the employer. Report this listing