求人情報詳細
NEW 株式会社ジーニー AI Evaluation Scientist / Japanese【JAPAN AI採用】
正社員
1000万円
| 仕事内容 | JAPAN AI株式会社について JAPAN AI株式会社は、AI技術を駆使して働く人々の可能性を飛躍的に高めることを目指し、上場企業である株式会社ジーニーのグループ企業として2023年4月に設立されました。同社は最先端のAI技術を活用し、国内外での研究開発を推進しています。 同社が目指しているのは、単なるAIチャットボットの提供ではありません。企業の全SaaSを統合し、AIが自律的に業務を実行する「企業の脳」ー次世代の基幹システムを構築することです。「JAPAN AI STUDIO」を中核に、DBさえあればアプリ不要、AIが作業して結果だけを返す世界を実装しています。 同社はAIの持つ変革力を通じて、新たな価値を創出し、社会全体の進歩に貢献することを目指しています。AIによるイノベーションをリードし、テクノロジーが人々をより多くのことを達成できるようにする未来を共に創造しましょう。 募集背景 JAPAN AIは「JAPAN AI AGENT / CHAT / SPEECH」をはじめとするエンタープライズ向けAIエージェント群を急速に拡大しています。プロダクトの中核がLLM /マルチエージェントへ移行する中、AI出力の品質・安全性・信頼性を科学的に評価する専門組織を新設します。 ミッション "AIの出力品質を科学するー評価手法の研究・開発で、エージェントの信頼性を証明する" LLM / AIエージェントの出力品質を、機械学習・統計学・計量心理学の手法で定量的に評価・改善します。本ポジションは「テストする人」ではなく、「何をもって良いAIとするかを定義し、測定する科学者」です。 期待する役割について AI Evaluation Scientistとして、AIエージェントの品質評価基盤の設計・構築・運用をリードしていただきます。 評価メトリクスの研究開発ーLLM-as-Judgeの校正、報酬モデリング、ベンチマーク設計を通じて「何をもって品質とするか」を科学的に定義します 自動評価パイプラインの設計・構築ー研究成果を本番CI/CDに組み込み、スケーラブルな品質ゲートを実現します レッドチーミング・安全性検証ーadversarial testingの自動化、ポリシー準拠検証フレームワークを構築します 統計的実験計画に基づく品質改善ーA/Bテスト・有意差検定でプロンプト戦略やモデル変更の効果を定量的に検証します 評価シグナルの研究・開発チームへのフィードバックーモデル改善の複利ループを構築します 約200社が本番利用するプロダクトの品質を「科学する」アプローチで担保します このポジションの魅力 Evaluation Scienceの実践: Apple・Anthropic・Scale AI・Google DeepMind等が注力する「AI評価科学」を、日本のエンタープライズAIの文脈で実践できます。評価手法そのものを研究対象とする、世界的にも希少なポジションです ML/DSスキルの新しい応用:機械学習・統計学の専門性を「モデル開発」ではなく「モデル評価」に応用します。報酬モデリング、LLM-as-Judgeの校正理論、ベンチマーク設計など、研究と実装の両面で知的挑戦があります 品質がプロダクトの信頼を決める:約200社が利用する本番環境で、あなたが構築した評価基盤がリリース品質の最後の砦になります。品質保証がビジネスインパクトに直結する手応えを実感できます 新設ポジション: AIエージェントの品質評価科学という新しい専門領域を、ゼロから設計・構築できます。評価メトリクスの研究開発から自動評価パイプラインの本番実装まで、大きな裁量を持って取り組めます AI安全性の最前線:自動レッドチーミング、adversarial testing、ポリシー準拠検証など、Responsible AIの実践に携われます。AIエージェントが「企業の脳」として業務を自律実行する世界で、安全性を科学的に保証する役割を担います 急成長環境:設立3年で200名以上の規模、9プロダクト展開のスタートアップで、技術的意思決定に大きな裁量を持てます。Research EngineerやAgent Harness Engineerと密接に連携し、プロダクト全体の品質に影響を与えるポジションです 業務内容 AI Evaluation Scientistとして、AIエージェントの評価基盤(Evaluation Infrastructure)の設計・構築・運用をリードしていただきます。 評価メトリクスの研究開発 LLM-as-Judgeの校正手法の研究・実装(rubric設計、バイアス検出、proper scoring rules) 評価ベンチマークの設計・構築・妥当性検証(construct validity、contamination detection) 報酬モデリング/ preference learningの評価への応用研究 評価メトリクスの選定・設計(win rate、task success、factuality、harm detection) 評価セット(合成データ+実ログ)の設計・構築・メンテナンス 自動評価パイプラインの設計・構築 スケーラブルな自動評価パイプラインの設計・実装 CI/CDへの評価パイプライン組込みと品質ゲートの構築 エージェント評価ハーネスの設計(マルチターン・ツール利用・ロングコンテキスト対応) 評価パイプラインの再現性・信頼性の担保 安全性・品質検証 自動レッドチーミング(automated adversarial testing)の研究・実装 安全性/ポリシー準拠の検証フレームワーク構築 ハルシネーション検出・校正手法の研究・実装 プロンプト/ツール回帰テストの設計・実行 統計分析・実験設計 統計的実験計画(A/Bテスト、有意差検定)の設計・分析 品質トレンドの可視化・回帰検出の自動化 品質レポート作成と改善提案 評価シグナルの研究・開発チームへのフィードバック 業務シナリオ ※以下は想定される業務シナリオの例です シナリオ1: LLM-as-Judgeの校正と妥当性検証 新しい評価メトリクスとしてLLM-as-Judgeを導入する際、judgeモデルの校正(calibration)を実施します。人間評価との一致率を統計的に検証し、rubric設計を反復改善します。construct validityを確認した上で、自動評価パイプラインに組み込み、評価コストを80%削減しながら人間評価と同等の信頼性を実現します。 シナリオ2:新モデル導入時の品質ゲート LLMプロバイダーが新モデルをリリースした際、既存のベンチマークスイートで回帰テストを実行し、factualityスコアが3%低下していることを検出します。原因を分析し、プロンプト調整で品質を維持したまま新モデルへの移行を完了します。 シナリオ3:自動レッドチーミングによる安全性検証 金融機関向けにJAPAN AI AGENTを導入する際、自動レッドチーミングパイプラインを構築します。adversarial promptの自動生成・分類器による脆弱性検出を実装し、業界固有のリスクシナリオ(機密情報漏洩、不適切な金融アドバイス等)を網羅的にテストします。ポリシー準拠率99%以上を達成します。 成果責任(KR/メトリクス) 評価カバレッジ率(テストケース網羅率) 回帰検出率(リリース前の品質劣化検出率≧95%) 評価パイプライン実行時間(CI/CD内で完了) LLM-as-Judgeと人間評価の一致率 False Positive / Negative率 安全性インシデント発生率(リリース後) チーム体制 約120名が開発組織に在籍しています。 AI Evaluation Scientistは品質保証の専門チームとして、以下のチームと密接に連携します: 密接に連携する役割: Agentic Product Engineerーエージェント機能開発 Research Engineerー研究開発・モデル改善 Agent Harness Engineer / Software Engineer (AI Platform)ーAI実行基盤開発 Product Managerープロダクト設計・品質要件定義 働き方 ハイブリッド勤務:週3出社、週2リモート フレキシブルな勤務時間帯:コアタイムは要相談 柔軟性:将来的により柔軟なワークスタイルの検討も可能 |
||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 経験・資格 |
※求人情報の応募要件全てに該当しなくても、企業様に対して内々に打診したり相談することが可能な場合もございます。一つでも当てはまる方は前向きにご検討下さい。
必須条件コンピュータサイエンス、ソフトウェア工学、人工知能、機械学習、数学、物理、計量心理学などの関連分野における修士号以上、または同等の実務経験 MLエンジニア/ DS /リサーチエンジニア/ ML評価関連職種の実務経験 LLM /生成AIの評価手法に関する深い知識 統計学・実験計画法の実践的知識 PythonでのML /評価パイプライン構築経験 機械学習フレームワーク(PyTorch, JAX, TensorFlow等)の実務経験 評価メトリクスの設計・実装経験 言語レベル:いずれか必須 日本語: Fluent (プロダクト開発において齟齬なく議論を行えるレベル) 英語:ビジネスレベル 本ポジションはAI出力の評価科学(Evaluation Science)を担う研究開発職です。MLモデル評価・LLM評価における研究または実装経験を必須としています。 歓迎条件 ML / NLPトップカンファレンス(NeurIPS, ICML, ICLR, ACL, EMNLP等)での論文発表経験 報酬モデリング/ preference learning(RLHF, DPO等)の研究・実装経験 LLM-as-Judgeの校正・rubric設計の経験 AI安全性・Responsible AI・レッドチーミングに関する知識・経験 ベンチマーク設計・妥当性検証(IRT, construct validity)の経験 マルチエージェント・ワークフロー/ツール利用/ロングコンテキストの評価経験 大規模データ処理(Spark / BigQuery等)の経験 CI/CDパイプラインへのML/評価パイプライン組込み経験 論文読解・再現実装の能力 英語での技術コミュニケーション能力 開発環境 言語: Python (評価パイプライン・分析), TypeScript / React / Next.js (フロントエンド部) / NX 評価/ QA : pytest, LangSmith, Weights&Biases, custom eval frameworks データ: BigQuery, Spark, Pandas インフラ: GCP (コンテナ/ K8s), Docker, Terraform CI/CD : GitHub Actions ツール: Slack, Confluence, Linear, Google Workspace, GitHub, Notion AI開発支援: Claude Code MAX Plan, Cursor, ChatGPT, Devin 作業環境: Mac (Apple Silicon),デュアルモニタ対応 ※更なる詳細事項は、カウンセリング(面談)時にお伝えします。 |
||||||||||||||||
| 想定年収 | 800 万円 ~ 1600 万円 | ||||||||||||||||
| 勤務地 | 東京都新宿区西新宿6-8-1 住友不動産新宿オークタワー5/6階 | ||||||||||||||||
| 勤務時間 | 10:00~19:00 ※土日祝は休業日となります ※出向の場合は、出向先の規程に準じます |
||||||||||||||||
| 休日・休暇 | 完全週休二日制 所定休日:土・日・祝日 休暇:年次有給休暇、夏季休暇(3日)、年末年始休暇(12月31日~1月3日)、慶弔休暇 |
||||||||||||||||
| 試用期間 | 1か月 | ||||||||||||||||
| 加入保険 | 社会保険完備(健康保険:関東ITソフトウェア健康保険組合) | ||||||||||||||||
| 受動喫煙対策の有無 | 有 敷地内禁煙(屋外に喫煙場所設置) |
||||||||||||||||
| 企業データ |
|
||||||||||||||||
| 取材班による独自解説 | 広告プラットフォーム事業を中心に、企業のデジタルマーケティングを支援するSaaS事業を展開。テクノロジー企業を標榜し、生成AIを使ったサービスを手掛けるJAPAN AI株式会社を2023年に立ち上げたほか、北米の大手広告テクノロジー企業Zeltoを子会社化するなど事業拡大を図っている。 創業6年で国内トップクラス規模に拡大したアドプラットフォームを有し、DSPやDMP、マーケティングオートメーション領域についても、順調にシェアを伸ばしている。DSPは広告500社、SSPはメディア20000社ほどあり、業界No.1の地位を固くしている。 Web広告などで培ったアドテクノロジーのノウハウを活かし、DOOH(Digital Out of Home)という“屋外広告 × デジタル × データ活用”の世界に参入。これにより、ただの看板売りではなく、テック × データ × 広告のクロス領域での強みを持っている。 蓄積してきたデータを活かしたマーケティングSaaS事業も好調で、CRMの領域でシェアを伸ばしてきている。今後は海外展開を含め、さらに伸ばしていく方針。 エンジニアを内製化しているため、技術力の高さが売り。 | ||||||||||||||||
| Recruiting No. | 01008655000649 |
関連する業種から探す
エリートネットワークのおすすめの『転職体験記』
-
- ネットサービス会社に勤務しながら、博士号(情報科学)を取得した30歳プロダクトマネージャー。バーチャルから飛び出し、リアルに挑戦したく自動車メーカーの商品企画部へ
- 前職
- 【東証プライム上場 SNS、ゲーム、メタバース等インターネットサービス老舗企業】
グループ会社出向 プラットフォーム事業本部 プロダクトチーム 3Dアバター配信アプリのプロダクトマネージャー(イベント施策の企画・機能開発等)
→プラットフォーム事業本部 売上改善チーム シニアマネージャー(KPI策定・達成管理、開発進行管理、北米アートチームとの制作プロジェクトリード等)
→プラットフォーム事業本部 プロダクトマネジメントチーム マネージャー(新規事業の立ち上げ、後継マネージャーの育成)
※社内の最優秀賞、CEO賞受賞
- 現職
- 【東証プライム上場 完成車メーカー】
プロダクト企画部 デジタルプロダクト開発における商品企画・プロダクトマネジメント
転職体験記を読む -
- 統計解析を研究した博士29歳。任期1年の特定助教から、財閥系総合重機メーカーのデータサイエンティストに転職成功
- 前職
- 【旧帝国大学 大学院】
経済学研究科の特定助教(研究テーマ:統計解析、機械学習、計量経済学)
- 現職
- 【東証プライム上場 財閥系 総合重機メーカー】
AI・データサイエンティスト(機械学習、深層学習、大規模言語モデル)
転職体験記を読む -
- 工学博士29歳。バイオインフォマティクス解析技術を活かし、アカデミア(国立大学)から、AI活用データ解析に強みのテクノロジー企業に転職成功。
- 前職
- 【地方国立大学】
博士研究員(バイオインフォマティクス解析によるがん研究)
- 現職
- 【AIを活用したデータ解析や情報管理のソリューション企業】
AI事業本部 ライフサイエンス分野でのAI研究
転職体験記を読む