1010_ML Infrastructure Engineer(MLOps / RoboOps)【正社員】
ugo株式会社 · 東京都千代田区東神田1-7-8 (本社) 東京都中央区日本橋馬喰町2丁目3−2 (開発拠点) ※試用期間終了後、一部リモートワーク可
About The Role
1010_ML Infrastructure Engineer(MLOps / RoboOps)【正社員】
仕事概要
#### ポジションの概要ロボット学習を支えるML基盤(MLOps)全体を担当していただきます。自らモデルを開発するのではなく、**モデル開発を円滑に回すための基盤を構築・運用する**ことがミッションです。ロボット領域ならではのデータ・実機を前提としたこの基盤づくりを、当社では **「RoboOps」** と呼んでいます。当社が新規開発する汎用型双腕ロボットやヒューマノイドロボットといったマニピュレータから得られるマルチモーダルなデータの取り込み・健全化から、データキュレーション、分散学習のスケーリング、そして実機評価前の大規模オフライン評価基盤まで、研究者・モデル開発者がスムーズに実験・開発できる環境を構築します。**ugoでRoboOpsが回るようになることで、ロボット基盤モデルの開発速度と品質を根本から引き上げる**——それがこのポジションの価値です。4つの領域(データ基盤・データキュレーション・学習インフラ・評価基盤)を扱いますが、まずはご自身の得意領域に比重を置いてスタートし、段階的に守備範囲を広げていただけます。将来的には、RoboOps全体を設計・構築するアーキテクトを目指せます。私たちと一緒に、国産AIロボットの開発を通じてフィジカルAIの社会実装に挑戦しませんか?---#### 具体的な仕事内容##### データ基盤構築- マルチモーダルなロボットデータ(映像・行動データ・力覚等)の **取得 → 変換 → ヘルスチェックを一貫したパイプラインとして構築**し、任意のデータの組み合わせを高速に構築・再現できる基盤を整備(複数デバイス・高スループット対応)- 大規模データセット管理のためのストレージシステム・メタデータインデックス構築##### データキュレーション- **モデルの弱点・不足しているデータを起点に、学習に回すデータをデータプールから自動選別するキュレーション基盤(オートキュレーション)の構築**- キュレーション結果を学習に連携し、データ改善 → 再学習のサイクルを高速に回せる仕組みの整備##### 学習インフラ・分散学習- **マルチGPUによる分散学習のサポート**(モデル開発者の負担を最小限に)- 学習インフラ全体の管理(ジョブスケジューリング、チェックポイント、メトリクス、ログ)- SLURM / Kubernetes等によるGPUクラスタのワークロード管理- GPU利用率・メモリ使用量・学習スループットのプロファイリングと最適化- データローダー・シャーディング・プリフェッチの最適化(データ到着から学習開始までの時間短縮)##### 評価基盤- 学習完了後、**実機評価の前に大規模オフライン評価を実施し、モデルの良し悪しを判断できる基盤の構築**(finetuneされたモデルを世界モデル上で評価) - 自動運転領域で確立されつつある「世界モデルを活用したオフライン評価」を、ロボット領域に応用していくことを目指します - ※世界モデルそのものの開発はモデル開発チームが主管。RoboOpsは、世界モデルの学習を支える大規模データ基盤・分散学習インフラの提供と、評価での活用を担います- デバッグ・可視化・実験分析のための研究ツール構築##### 共通業務- 研究者・モデル開発者と密に連携し、研究ニーズを信頼性の高いソフトウェア・インフラに変換- フィールドテストおよび技術検証のサポート- 他部門(ハードウェア、事業開発)との技術調整、要件定義のサポート---#### 開発環境##### OS・インフラ- OS:Linux (Ubuntu 22.04)- インフラ:AWS, GPU環境(学習用)- 学習ワークロード管理:SLURM, Kubernetes等- その他:Docker, GitHub Actions##### 使用言語・技術スタック- 言語:Python- フレームワーク:PyTorch- 分散学習:PyTorch DDP / FSDP, DeepSpeed など- データ管理:LeRobotDataset(データセット), Safetensors(モデル), rosbag / MCAP(実機ログ)- シリアライゼーション:Protobuf, FlatBuffers, MCAP- 実験管理・可視化:Weights & Biases- 世界モデル(オフライン評価での活用):NVIDIA Cosmos など##### 開発ツール- バージョン管理:Git (Git flow)- コミュニケーション:Slack, Notion- AI支援開発:Claude Code, Codex---#### このポジションの魅力##### 技術的な魅力- ロボット学習パイプライン全体(データ〜学習〜評価)を横断的に見られる、裁量の大きいポジション- 分散学習のスケーリングやGPU最適化など、大規模ML基盤ならではの技術課題に挑戦できる- 自動運転領域で確立されつつある「世界モデルを活用したオフライン評価」を、ロボットで実現する挑戦- 研究者・モデル開発者の実験速度を直接引き上げる、事業インパクトの大きい仕事##### 組織・カルチャー- 多様なバックグラウンドを持つエンジニアが国籍問わず在籍するグローバルな環境- 幅広い専門性を持つエンジニアとともに、最先端のロボット開発に挑戦できる環境- 得意分野を活かしながら、新しい領域にも挑戦し、スキルを磨ける機会が多くあります- 国籍も年代も異なる様々なメンバーがフラットに意見を交わし合い、切磋琢磨できるカルチャー##### キャリア・成長機会- MLインフラ・MLOps(RoboOps)のスペシャリストとして、データ基盤・キュレーション・学習インフラ・評価基盤の全領域でスキルを習得- 得意領域からスタートし、将来的には **RoboOps全体(新規ロボット機種の学習・評価基盤)をアーキテクトとして設計・構築**- フレックス勤務を活用し、働きやすい環境で技術革新に挑戦できます---#### 参考情報**▼ コーポレートサイト****▼ note****▼ podcast <ugo Robotics Radio>**---#### 応募時のお願い**・応募時の書類(履歴書・職務経歴書)はPDF形式にてご提出いただきますようお願い申し上げます**
必須スキル
#### ポジションの概要ロボット学習を支えるML基盤(MLOps)全体を担当していただきます。自らモデルを開発するのではなく、**モデル開発を円滑に回すための基盤を構築・運用する**ことがミッションです。ロボット領域ならではのデータ・実機を前提としたこの基盤づくりを、当社では **「RoboOps」** と呼んでいます。当社が新規開発する汎用型双腕ロボットやヒューマノイドロボットといったマニピュレータから得られるマルチモーダルなデータの取り込み・健全化から、データキュレーション、分散学習のスケーリング、そして実機評価前の大規模オフライン評価基盤まで、研究者・モデル開発者がスムーズに実験・開発できる環境を構築します。**ugoでRoboOpsが回るようになることで、ロボット基盤モデルの開発速度と品質を根本から引き上げる**——それがこのポジションの価値です。4つの領域(データ基盤・データキュレーション・学習インフラ・評価基盤)を扱いますが、まずはご自身の得意領域に比重を置いてスタートし、段階的に守備範囲を広げていただけます。将来的には、RoboOps全体を設計・構築するアーキテクトを目指せます。私たちと一緒に、国産AIロボットの開発を通じてフィジカルAIの社会実装に挑戦しませんか?---#### 具体的な仕事内容##### データ基盤構築- マルチモーダルなロボットデータ(映像・行動データ・力覚等)の **取得 → 変換 → ヘルスチェックを一貫したパイプラインとして構築**し、任意のデータの組み合わせを高速に構築・再現できる基盤を整備(複数デバイス・高スループット対応)- 大規模データセット管理のためのストレージシステム・メタデータインデックス構築##### データキュレーション- **モデルの弱点・不足しているデータを起点に、学習に回すデータをデータプールから自動選別するキュレーション基盤(オートキュレーション)の構築**- キュレーション結果を学習に連携し、データ改善 → 再学習のサイクルを高速に回せる仕組みの整備##### 学習インフラ・分散学習- **マルチGPUによる分散学習のサポート**(モデル開発者の負担を最小限に)- 学習インフラ全体の管理(ジョブスケジューリング、チェックポイント、メトリクス、ログ)- SLURM / Kubernetes等によるGPUクラスタのワークロード管理- GPU利用率・メモリ使用量・学習スループットのプロファイリングと最適化- データローダー・シャーディング・プリフェッチの最適化(データ到着から学習開始までの時間短縮)##### 評価基盤- 学習完了後、**実機評価の前に大規模オフライン評価を実施し、モデルの良し悪しを判断できる基盤の構築**(finetuneされたモデルを世界モデル上で評価) - 自動運転領域で確立されつつある「世界モデルを活用したオフライン評価」を、ロボット領域に応用していくことを目指します - ※世界モデルそのものの開発はモデル開発チームが主管。RoboOpsは、世界モデルの学習を支える大規模データ基盤・分散学習インフラの提供と、評価での活用を担います- デバッグ・可視化・実験分析のための研究ツール構築##### 共通業務- 研究者・モデル開発者と密に連携し、研究ニーズを信頼性の高いソフトウェア・インフラに変換- フィールドテストおよび技術検証のサポート- 他部門(ハードウェア、事業開発)との技術調整、要件定義のサポート---#### 開発環境##### OS・インフラ- OS:Linux (Ubuntu 22.04)- インフラ:AWS, GPU環境(学習用)- 学習ワークロード管理:SLURM, Kubernetes等- その他:Docker, GitHub Actions##### 使用言語・技術スタック- 言語:Python- フレームワーク:PyTorch- 分散学習:PyTorch DDP / FSDP, DeepSpeed など- データ管理:LeRobotDataset(データセット), Safetensors(モデル), rosbag / MCAP(実機ログ)- シリアライゼーション:Protobuf, FlatBuffers, MCAP- 実験管理・可視化:Weights & Biases- 世界モデル(オフライン評価での活用):NVIDIA Cosmos など##### 開発ツール- バージョン管理:Git (Git flow)- コミュニケーション:Slack, Notion- AI支援開発:Claude Code, Codex---#### このポジションの魅力##### 技術的な魅力- ロボット学習パイプライン全体(データ〜学習〜評価)を横断的に見られる、裁量の大きいポジション- 分散学習のスケーリングやGPU最適化など、大規模ML基盤ならではの技術課題に挑戦できる- 自動運転領域で確立されつつある「世界モデルを活用したオフライン評価」を、ロボットで実現する挑戦- 研究者・モデル開発者の実験速度を直接引き上げる、事業インパクトの大きい仕事##### 組織・カルチャー- 多様なバックグラウンドを持つエンジニアが国籍問わず在籍するグローバルな環境- 幅広い専門性を持つエンジニアとともに、最先端のロボット開発に挑戦できる環境- 得意分野を活かしながら、新しい領域にも挑戦し、スキルを磨ける機会が多くあります- 国籍も年代も異なる様々なメンバーがフラットに意見を交わし合い、切磋琢磨できるカルチャー##### キャリア・成長機会- MLインフラ・MLOps(RoboOps)のスペシャリストとして、データ基盤・キュレーション・学習インフラ・評価基盤の全領域でスキルを習得- 得意領域からスタートし、将来的には **RoboOps全体(新規ロボット機種の学習・評価基盤)をアーキテクトとして設計・構築**- フレックス勤務を活用し、働きやすい環境で技術革新に挑戦できます---#### 参考情報**▼ コーポレートサイト****▼ note****▼ podcast <ugo Robotics Radio>**---#### 応募時のお願い**・応募時の書類(履歴書・職務経歴書)はPDF形式にてご提出いただきますようお願い申し上げます**
歓迎スキル
- 学習ワークロード管理の経験(SLURM, Kubernetes等)- GPUパフォーマンスチューニング、マルチGPU分散学習(DDP / FSDP / DeepSpeed等)の実務経験- ロボティクス/マルチモーダルデータパイプラインの構築経験- 大規模データのバージョニング・データレイク・メタデータ管理の経験(LeRobotDataset, rosbag / MCAP等)- 実験管理・評価基盤の構築経験(Weights & Biases等)- 世界モデルを活用したオフライン評価パイプラインの構築経験(自動運転領域等)- Protobuf, FlatBuffers, MCAP等のシリアライゼーション形式の経験- 学習用コンパイラ、カスタムカーネル等のMLシステムの深い知見- RoboOps全体(データ〜学習〜評価)を横断的に設計・構築できる素養- スタートアップや少人数チームで設計・構築・運用を自律的に進めた経験
求める人物像
- 設計・構築・運用・改善を一貫して担えるオーナーシップ志向の方- 研究者・モデル開発者と密に連携し、スピード感のあるプロジェクトのボトルネックを解消することを楽しめる方- 自らはモデルを作らずとも、モデル開発を加速させる基盤づくりに価値を見いだせる方- フットワークが軽く、新技術への興味をお持ちの方
- 応募概要
- 給与
- ■想定年収700万円〜1100万円(経験能力考慮の上優遇)
- 勤務地
- 東京都千代田区東神田1-7-8 (本社)東京都中央区日本橋馬喰町2丁目3−2 (開発拠点)※試用期間終了後、一部リモートワーク可
- 雇用形態
- 正社員
- 勤務体系
- 勤務時間(フレックスタイム制、コアタイム:有 11:00~16:00)10:00〜19:00(実働8時間)●年間休日125日●完全週休二日制(土日祝日)●有給休暇年間20日一斉付与●夏季休暇(3日)●年末年始休業(毎年10日前後)
- 試用期間
- あり(3ヶ月)
- 福利厚生
- ●交通費支給●社会保険完備(雇用保険、労災保険、健康保険、厚生年金保険)●書籍購入支援制度●借上社宅制度(現物給与型)
Similar roles you might like
See all →This is an external listing. JobSpring does not represent or verify the employer. Report this listing
