使用库集

创建库集后,可以在 Spark 应用程序中引用和使用该库集。 在 IBM Analytics Engine 实例中运行 Spark 应用程序时,库集将从实例主目录装入并可供 Spark 应用程序使用。

在 Spark 应用程序中使用 Spark 应用程序提交有效内容的 "conf" 部分中的 "ae.spark.librarysets" 参数来引用库集。

要在提交 Spark 应用程序时引用库集:

  1. 获取 IAM 令牌。 请参阅 检索 IAM 访问令牌

  2. 发出以下 cURL 命令:

    curl -X POST https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_applications --header "Authorization: Bearer <IAM token>" -H "content-type: application/json"  -d @submit-spark-app.json
    

    submit-spark-app.json:

    {
      "application_details": {
      "application": "cos://<bucket-name>.<cos-name>/my_spark_application.py",
      "arguments": ["arg1", "arg2"],
      "conf": {
        "spark.hadoop.fs.cos.<cos-name>.endpoint":"https://s3.us-south.cloud-object-storage.appdomain.cloud",
        "spark.hadoop.fs.cos.<cos-name>.access.key":"<access_key>",
        "spark.hadoop.fs.cos.<cos-name>.secret.key":"<secret_key>",
        "ae.spark.librarysets":"my_library_set"
        }
    }
    }
    

    目前,在 Spark 应用程序提交期间,只能在 "ae.spark.librarysets" 属性下引用一个库集。

    如果接受申请,您将收到类似如下的响应:

    {
      "id": "87e63712-a823-4aa1-9f6e-7291d4e5a113",
      "state": "accepted"
    }
    
  3. 通过调用应用程序状态 REST API 来跟踪应用程序的状态。 请参阅 获取应用程序的状态