Trabalhando com o watsonx.ai Notebooks
Aplica-se a: Motor de faísca Motor de faísca acelerado com glúten
IBM® watsonx.data integra-se ao watsonx.ai para permitir uma experiência de trabalho baseada na Web com o Jupyter Notebook. Você pode usar a interface watsonx.ai para criar seu próprio código no Jupyter Notebook e executá-lo usando watsonx.data Spark como ambiente de tempo de execução.
Para obter mais informações sobre o Jupyter Notebook, consulte Notebooks.
Pré-requisitos
Assinatura do watsonx.ai no IBM Cloud.
Procedimento
Para executar o Jupyter Notebook em seu mecanismo watsonx.data spark, faça o seguinte:
-
Crie o projeto watsonx.ai. Para criar um projeto watsonx.ai, consulte Criando um projeto.
-
Crie um ambiente de mecanismo Spark. Para executar um Jupyter Notebook, você deve criar um modelo de ambiente de tempo de execução.
Para fazer isso, acesse o projeto watsonx. ai na interface do usuário. Vá para a guia Gerenciar. Criar um modelo. Para obter mais informações sobre a criação de modelos de ambiente, consulte Criação de modelos de ambiente. Ao criar o modelo, selecione Tipo como Spark e, na lista de mecanismos Spark, selecione o mecanismo Spark nativo que você provisionou na instância watsonx.data.
-
Crie um ativo Jupyter Notebook e acesse-o a partir da ferramenta de edição Jupyter Notebook. Para criar um arquivo de bloco de notas no editor de blocos de notas, consulte Criação de um arquivo de bloco de notas no editor de blocos de notas.
Ao criar o notebook, especifique o ambiente de tempo de execução que você criou para o mecanismo watsonx.data spark.
O bloco de notas é aberto no modo de edição. Você pode começar a trabalhar nisso. Para obter mais informações, consulte Criação de um arquivo de bloco de notas no editor de blocos de notas.
Acesso ao catálogo watsonx.data
Adicione o seguinte trecho de código na célula do notebook e execute-o. O trecho de código inclui as configurações necessárias para se conectar ao catálogo watsonx.data associado.
conf=spark.sparkContext.getConf()
spark.stop()
from pyspark.sql import SparkSession
from pyspark.sql.functions import col, to_utc_timestamp
import base64,getpass
wxd_username=getpass.getpass("Please enter your username with hms access:").strip() #Prompt for username
wxd_hms_username="ibmlhapikey_"+wxd_username
wxd_hms_password=getpass.getpass("Please enter your api key with hms access:").strip() #Prompt for api key
string_to_encode= wxd_hms_username+":"+wxd_hms_password
wxd_encoded_apikey="Basic " + base64.b64encode(string_to_encode.encode("utf-8")).decode("utf-8")
conf.setAll([("spark.hive.metastore.client.plain.username", wxd_hms_username), \
("spark.hive.metastore.client.plain.password", wxd_hms_password), \
("spark.hadoop.wxd.apikey", wxd_encoded_apikey)
])
spark = SparkSession.builder.config(conf=conf).enableHiveSupport().getOrCreate()
Você pode percorrer a célula de execução do notebook, selecionando Shift-Enter, ou pode executar o notebook inteiro. Ele solicita o nome de usuário e a senha. O nome de usuário é o ID do IBM Cloud do usuário cuja chave de API é usada para acessar o bucket de dados. A chave de API aqui é a chave de API do usuário que está acessando o armazenamento de objetos. Para gerar uma chave de API, faça login no console watsonx.data e navegue até Perfil > Perfil e configurações > Chaves de API e gere uma nova chave de API.
Você pode adicionar mais trechos de código com base em seu caso de uso e continuar. Para obter mais informações, consulte Criação de um arquivo de bloco de notas no editor de blocos de notas.