説明
Databricks Feature Store は、AI および機械学習モデルで使用される特徴量のセントラルレジストリとして機能します。Unity Catalog 内で特徴量テーブルとモデルを登録することにより、ユーザーは統合されたガバナンス、リネージ追跡、ポイントインタイム結合、およびワークスペース間での特徴量の共有と発見が可能になります。このプラットフォームは、データ取り込みと特徴量テーブルの作成から、モデルのトレーニングとバッチ推論まで、モデルトレーニングワークフロー全体を単一の環境で合理化します。
主な機能には、生データの取り込み、特徴量テーブルの作成、モデルのトレーニング、バッチ推論の実行のためのデータパイプラインが含まれます。また、ミリ秒単位のレイテンシでモデルおよび特徴量サービングエンドポイントへのワンクリックアクセスを提供し、データとモデルの監視も行います。Databricks Feature Store の特徴量がトレーニングに使用されると、モデルは自動的にリネージを追跡します。推論時には、モデルは最新の特徴量値を取得します。Feature Store は、リアルタイムアプリケーションのためのオンデマンド特徴量計算も処理し、トレーニングサービングスキューを排除し、すべての特徴量ルックアップと計算を管理することでクライアントサイドのコードを簡素化します。
Unity Catalog が有効になっているワークスペースでは、Databricks Feature Store は、特徴量の開発、発見、共有、およびサービングのための堅牢なツールセットを提供します。ユーザーは特徴量テーブルを作成および管理し、時間ウィンドウ集計を持つ宣言的な特徴量を定義し、オフライントレーニングまたはオンラインサービングのためにそれらをマテリアライズできます。特徴量の探索は、Catalog Explorer および Features UI を通じて容易になり、タグを使用して特徴量テーブルを分類および管理するためのサポートも提供されます。このプラットフォームは、トレーニングデータセットのポイントインタイムの正確性を保証し、ラベル観測時点の特徴量値を反映します。オンライン特徴量ストアは、Databricks Lakebase を利用して、オンラインアプリケーションおよびリアルタイム ML モデルに特徴量データをサービングするために利用できます。モデルサービングには、オンラインストアからの自動特徴量ルックアップが含まれ、特徴量サービングエンドポイントは外部アプリケーションに公開できます。推論時のオンデマンド特徴量計算は、リアルタイム機能をさらに強化します。ガバナンスとリネージは Unity Catalog を通じて管理され、アクセスを制御し、特徴量テーブル、モデル、および関数のリネージの可視性を提供します。
Databricks Feature Storeの主要機能
セントラル特徴量レジストリ
Unity Catalog 統合
組み込みガバナンス
特徴量リネージ追跡
ポイントインタイム結合
ワークスペース間特徴量共有
特徴量発見
統合モデルトレーニングワークフロー
特徴量エンジニアリングのためのデータパイプライン
バッチ推論機能
オンライン特徴量サービングエンドポイント
リアルタイムモデルサービング
オンデマンド特徴量計算
トレーニングサービングスキューの排除
クライアントサイドコードの簡素化
Databricks Feature Storeの使い方は?
特徴量の開発: 宣言型APIを使用して特徴量テーブルを作成および管理します。
特徴量マテリアライズ: オフライントレーニングまたはオンラインサービングのために宣言型特徴量を準備します。
特徴量の発見: Catalog Explorer および Features UI を通じて特徴量テーブルを探索および管理します。
モデルのトレーニング: 特徴量テーブルを使用して機械学習モデルをトレーニングします。
特徴量のサービング: リアルタイムアプリケーションのためにオンライン特徴量ストアをデプロイします。
データとモデルの監視: パフォーマンスを追跡し、ドリフトを検出します。
Databricks Feature Storeの使用例
- ML モデルトレーニング
- リアルタイム推論
- 特徴量管理
- データリネージ追跡
- 共同特徴量エンジニアリング
- バッチスコアリング
- 検索拡張生成





