Instalación y uso de dbt-watsonx-spark
Esta sección cubre los pasos para instalar y utilizar dbt-watsonx-spark.
Antes de empezar
- Suscripción a watsonx.data en IBM Cloud.
- Provisión de motor Spark nativo en watsonx.data.
- Instalar Núcleo DBT.
Procedimiento
Crear un servidor de consultas Spark
Para que el motor Spark se integre con la herramienta dbt y funcione como motor de consultas, debes crear un servidor de consultas Spark. Consulte Crear un servidor de consultas Spark.
Recuperar los datos de conexión al servidor de consulta
Para configurar el archivo de perfil en la herramienta dbt, debe guardar los detalles de conexión del servidor de consulta. Consulte Recuperar los detalles de conexión del servidor de consultas.
Configurar profiles.yaml para la herramienta dbt
- Vaya al archivo
profiles.ymlque se encuentra en .dbt de su directorio personal. - Pegue los detalles de la conexión modificando los valores de los parámetros.
- Configure el archivo
profiles.yml. Para más información, consulte Configuración (creación de su perfil).
Instalar la herramienta dbt y verificar la conexión
-
Ejecute el siguiente comando en su sistema para instalar
dbt-watsonx-spark.pip install dbt-watsonx-spark -
Ejecute el siguiente comando para verificar la versión de dbt.
dbt --version -
Si desea crear un proyecto dbt, proporcione un <nombre_proyecto> y ejecute el siguiente comando .
dbt init <project_name>- El sistema le pedirá que seleccione la base de datos que desea utilizar. Seleccione
watsonx_spark. - Proporcione watsonx.data host, URI y esquema.
- El sistema le pedirá que seleccione la base de datos que desea utilizar. Seleccione
-
Para probar la conexión, ejecute:
cd <project_name> dbt debug -
Ejecute las semillas utilizando el siguiente comando para crear una tabla e insertar los datos.
cd <project_name> dbt run -
En
<project_name>/models, tienes los modelos que realizan las operaciones. Por defecto, dbt establece las operaciones comoview. Puede crear las tablas o vistas mediante uno de los siguientes métodos:-
Especificar dentro de los modelos (aplicable sólo para ese modelo)
{{ config(materialized='table/view') }}Si esta declaración se comenta utilizando (--), dbt sigue utilizando la configuración. Para desactivarlo, elimínelo por completo o coméntelo en estilo Jinja (
{# … #}). -
Especificar en dbt_project.yml (aplicable para todos los modelos)
models: <project_name>: <model_folders>: +materialized: table/viewPor ejemplo:
models: demo: example: +materialized: tableSólo se admiten sentencias select dentro de los modelos.
El carácter punto y coma (;) está restringido en los modelos.
-
-
Ejecute los modelos utilizando el siguiente comando para crear las tablas o vistas.
cd <project_name> dbt runTambién puede especificar las pruebas que desee:
models: - name: <model_name> description: "some description" columns: - name: <col_name> description: "some description" data_tests: - <test_name_1> - <test_name_2>Por ejemplo:
models: - name: my_first_dbt_model description: "A starter dbt model" columns: - name: id description: "The primary key for this table" data_tests: - unique - not_nullLos conectores deben soportar Crear tabla como selección (CTAS) para que funcionen las ejecuciones dbt.
-
Para generar los documentos sobre las acciones realizadas, ejecute:
cd <project_name> dbt docs generate dbt docs servePor defecto, se ejecuta en localhost:8080. Para cambiar el puerto, ejecute:
dbt docs serve –-port <port_number>