Databricks CLI(コマンドラインツール)、アプリ、Lakebase、Model Serving、Lakeflow Jobs、Spark Declarative Pipelines(スパークの宣言型パイプライン)、Declarative Automation Bundles(DAB - 自動化設定パッケージ)、および従来型からサーバーレス型への移行に対応するスキル。
Databricks skills for the CLI, Apps, Lakebase, Model Serving, Lakeflow Jobs, Spark Declarative Pipelines, Declarative Automation Bundles (DABs), and classic-to-serverless migration.
エージェント・ブリックを作成する: - **ナレッジ・アシスタント(KA)**:文書への質問応答を行う知識支援機能 - **スーパーバイザー・エージェント**:複数のエージェント間の協調制御(マルチエージェント・オーケストレーション)を行う管理機能
**Databricks 組み込みAI機能** SQL と PySpark パイプライン(処理工程)に直接 AI 機能を追加できます。モデル(学習済みの予測システム)の実行環境を自分で管理することなく、以下の機能が利用可能です: - **分類・抽出・要約**: ai_classify(分類)、ai_extract(抽出)、ai_summarize(要約) …
Databricks AI Runtime (`air`) CLI ワークロード用のカスタム Docker イメージを構築します。 次のような場合に使用: ユーザーが独自の Docker コンテナイメージを `air` ワークロードに持ち込む必要がある場合。具体的には、Databricks ベースイメージまたはスクラッチからの Dockerfile 作成、…
Databricksの AI/BI ダッシュボード(データを見やすくまとめた分析画面)を作成します。Lakeview ダッシュボードの作成、更新、または配信時には必ず使用してください。Databricks ダッシュボードは特殊な JSON 構造を持っているためです。 【重要】配信する前に、すべての SQL クエリ(データベースへの問い合わせ)を CLI(コ…
Databricks Apps(AppKit/React)のデータ画面のUX設計 — KPI・概要ページ、レポート、チャート、表、Genie/チャットデータアシスタントなどを、具体的なAppKitコンポーネントにマッピングして設計します。 **次のような場合に使用:** - データを表示したり、データに関する質問に答えるAppKit/Reactアプリケーシ…
Databricks Appsプラットフォーム上でアプリケーションを構築します。 **次のような場合に使用:** データアプリ、分析ツール、またはカスタムインタラクティブ可視化ツールの作成を依頼されたとき **重要な注記:** 単に「ダッシュボードを作成してほしい」という依頼の場合は、AI/BIダッシュボード(Lakeview)管理ツール(databric…
Databricks アプリケーション(Databricks が提供するアプリ構築プラットフォーム)用の Python バックエンド(サーバー側の処理)— FastAPI(デフォルト)、Flask、Dash、Streamlit、Gradio、Reflex に対応しています。 **新しい Databricks アプリケーションのデフォルトは `databri…
Databricksの操作とDatabricks CLIの親スキル(エントリーポイント)です。認証、プロファイル選択、バンドル(設定パッケージ)の管理に対応しています。 CLIの操作、認証、プロファイル設定、バンドルタスクを行う場合は、まずこのスキルを読み込んでから、対応する各製品スキルを読み込んでください。 データの検索や閲覧、データに関する質問への回答…
Databricks Declarative Automation Bundle(DAB、以前は Databricks Asset Bundle と呼ばれていた、Databricks リソースを宣言的に管理できる仕組み)を作成、設定、検証、デプロイ(配置・展開)、実行、管理します。 ダッシュボード、ジョブ、パイプライン(データ処理の一連の流れ)、アラート、…
Genie(Genie One MCPのコマンドラインツール版)を通じて、Databricks のデータを探索・検索・照会します。 次のような場合に使用: - ユーザーがデータの検索や場所を特定したいとき(「Xにはどんなテーブルがあるか」「Xはどこにあるか」「Yはどのカタログやスキーマ(データベース内の整理単位)にあるか」など) - データについて自然言語…
Databricks SQL(DBSQL)の高度な機能とSQLウェアハウスの使い方に関するスキルです。 **必ず起動する場合:** 以下のいずれかを利用者が言及した時に、このスキルを起動する必要があります: 「DBSQL」「Databricks SQL」「SQL warehouse(データ保管施設)」「SQL scripting(スクリプト記述)」「sto…
Databricks(データ分析プラットフォーム)の公式ドキュメントを参照できるスキルです。llms.txt インデックスを通じて提供されます。 **次のような場合に使用:** - 他のスキルでカバーされていないトピックについて調べたい時 - Databricks の使い慣れていない機能について知りたい時 - API、設定、またはプラットフォーム機能に関す…
Databricks上でコードを実行し、計算環境を管理します。サーバレス・クラシック・インタラクティブ(対話的)など複数のクラスターを使用してPython、Scala、SQL、Rを実行できるほか、クラスター(計算資源の集合)やSQLウェアハウス(データ分析用の処理基盤)の作成、サイズ変更、削除も可能です。
Databricks Genie Agents(データベースごとに調整された自然言語エージェント、旧称Genie Spaces)を作成・管理・検索できます。エージェントの構築、エクスポート/インポート、ワークスペース間での移行、および特定のエージェントへの質問(Conversation APIを通じて)が可能です。 一般的なデータに関する質問やワークスペー…
Apache Iceberg tables on Databricks —Managed Iceberg tables、External Iceberg Reads(均一フォーマット)、Compatibility Mode、Iceberg REST Catalog(REST方式のカタログ)、Iceberg v3、Snowflakeとの相互運用、PyIceb…
Databricks上でLakeflow Jobsを開発・実行します。DABs(定義型インフラストラクチャ)、Python SDK、またはCLI(コマンドラインツール)を使って設定できます。 次のような場合に使用: - ノートブック、Pythonホイール、SQL、dbt、またはパイプラインを使ったデータ処理の自動化ジョブを作成する場合 実装を開始する前に、…
Databricks Lakebaseポストグレス(高機能なデータベースシステム):プロジェクト、スケーリング(拡張性)、接続性、Lakebase同期テーブル、Data API。 次のような場合に使用: - Lakebaseデータベースについて質問されたとき - OLTPストレージ(トランザクション処理に特化した保存方式)について尋ねられたとき - アプリ…
Lakeflow Connectを使用して、Databricksへのデータ取り込みパイプライン(管理されたデータ流通経路)を構築します。 次のような場合に使用: - SaaS(クラウドサービス)アプリ(Salesforce、Workday Reports、ServiceNow、Google Analytics 4、HubSpot、Confluence)から…
Unity Catalogメトリック表示: YAMLで統治されたビジネスメトリクス(事業の重要な数値指標)を定義・作成・検索・管理します。 次のような場合に使用: 標準化されたKPI(経営成績を測る主要指標)、売上メトリクス、注文分析、または複数のチーム・ツール間で一貫した定義が必要な再利用可能なビジネスメトリクスを構築する場合。
Databricks上でML(機械学習)モデルを訓練します。 **次のような場合に使用:** - **モデルの構築と最適化**: 分類・回帰・深層学習など様々な種類のモデルを、XGBoost、scikit-learn、LightGBM、PyTorchなどのフレームワークとOptunaという自動調整ツール(パラメータ最適化)を組み合わせて構築 - **本番運…
MLflow 3 GenAI エージェント評価 次のような場合に使用: mlflow.genai.evaluate() のコードを書く、@scorer 関数を作成する、組み込みスコアラー(ガイドライン遵守性、正確性、安全性、検索結果の根拠性)を利用する、トレース(AI システムの動作記録)からサンプルデータセットを構築する、トレース取り込みと本番環境の監視…
Databricks モデル提供エンドポイント(機械学習モデルを外部から利用できるようにする仕組み)のライフサイクル管理と運用。 次のような場合に使用: - 提供エンドポイントの作成・読み込み・更新・削除(CLI または MLflow デプロイメントクライアント経由) - A/B テスト(複数の案を同時に試す)やカナリアデプロイ(段階的な展開)のためのトラ…
Databricks上で Lakeflow Spark 宣言型パイプライン(以前のDelta Live Tables)を開発します。 Pythonまたははじめに、このスキルを呼び出してから実装を開始してください。 **次のような場合に使用:** - バッチ処理またはストリーミング(リアルタイムで流れてくるデータ)データパイプラインをPythonまたはSQL…
Databricks の開発に関する手引きで、Python SDK(ソフトウェア開発キット)、Databricks Connect(接続ツール)、CLI(コマンドラインインターフェース)、REST API(プログラムの連携仕様)に対応しています。 次のような場合に使用: databricks-sdk、databricks-connect、または Datab…
Databricks の処理を従来型コンピューティング(専用の計算リソース)からサーバーレス型コンピューティング(利用量に応じた自動スケーリング)に移行します。 次のような場合に使用: ノートブック・ジョブ・パイプライン・Scala JAR(spark_jar_task)を従来型クラスタ(固定リソースのグループ)からサーバーレス型に移す際、既存コードがサー…
Spark Structured Streamingの本番環境での活用に関する包括的なガイドです。 次のような場合に使用: ストリーミング・パイプライン(データを継続的に処理する仕組み)の構築、Kafka(分散メッセージング基盤)からのデータ取り込み、リアルタイムモード(RTM)の実装、トリガー設定(処理時間やデータ利用可能時の自動実行条件)の構成、ウォー…
Spark(分散処理フレームワーク)と Faker を使用して、現実的な合成データ(テスト用に作られた仮のデータ)を生成します。サーバーレス実行に対応し、複数の出力形式(Parquet/JSON/CSV/Delta)をサポートしています。数千行から数百万行まで幅広いデータ量に対応できます。小規模なデータセット(10,000行未満)の場合は、ローカル環境で生…
Unity Catalogの管理、アクセス制御、および監視機能を提供します。 以下のような用途に使用: アクセス権の付与・取り消し(GRANT/REVOKE)、特定のユーザーが何にアクセスできるかを判断する、行レベルのセキュリティ(細粒度のアクセス制限)と列マスク(データの一部を隠す機能)を設定する、外部のデータ保存場所と保存認証情報を作成する、カタログ・…
Databricks上でRAG(検索強化生成)や非構造化ドキュメント評価用データセット、デモドキュメント(例:Knowledge Assistant向け)を構築します。 具体的には以下の処理を実行します: - 合成PDFをローカルで生成する - Unity Catalogボリューム(データ保存領域)にアップロードする - 各ドキュメントに対して取得精度を評…
Databricks Vector Search を使用して、ベクトル検索(意味に基づいた検索)やRAG(生成AIに必要な情報を自動取得する仕組み)を実装するためのエンドポイント(接続窓口)とインデックス(検索用の索引)を提供します。 対応する内容: - インデックスの種類 - 検索モード - RAGの一連の実装パターン
Zerobus Ingest クライアントを構築して、gRPC(高速な通信プロトコル)経由でほぼリアルタイムのデータを Databricks Delta テーブルに取り込みます。 次のような場合に使用: - メッセージバス(データの流通管理システム)を使わずに Unity Catalog テーブルに直接書き込むプロデューサー(データ送信プログラム)を作成す…
原文・著作権は Anthropic および各プラグイン作者に帰属します。日本語訳は Claude API による自動翻訳です。