VS 코드 개발 환경으로 작업하기

적용됩니다: 스파크 엔진 글루텐 가속 스파크 엔진

VS Code 개발 환경은 스파크 엔진에서 실행되는 스파크 클러스터에서 스파크 애플리케이션을 대화형으로 프로그래밍, 디버그, 제출 및 테스트할 수 있는 스파크 기반 개발 환경입니다.

Visual Studio Code 확장으로 사용할 수 있으며 로컬 시스템에 설치하여 Visual Studio Code를 사용하여 Spark IDE에 액세스할 수 있습니다. 개발 시간을 줄이고 사용성을 증가시킵니다.

시작하기 전에

  1. Cloud에서 watsonx.data 구독. 스파크 엔진을 생성하고 실행 중인지 확인합니다.

  2. Visual Studio Code의 데스크탑 버전을 설치하십시오.

  3. VS Code Marketplace 에서 watsonx.data 확장을 설치하십시오.

  4. Visual Studio Code marketplace 에서 Visual Studio Code 확장, Remote-SSH 를 설치하십시오.

    Spark 랩은 본질적으로 임시적이므로 업그레이드 또는 Spark 마스터 충돌 시 발생할 수 있는 데이터 손실을 방지하기 위해 주기적으로 저장된 데이터를 백업해야 합니다.

  5. Visual Studio Code 에서 무거운 애플리케이션 및 노트북으로 작업하는 사용자의 경우 기본 4GB 메모리 대신 최소 8GB의 메모리를 할당하는 것이 좋습니다. 이를 통해 리소스 집약적인 작업을 더 원활하게 처리하고 더 나은 성능을 보장합니다. 이는 노트북 사용과 같이 메모리를 많이 사용하는 일부 애플리케이션(예: SparkLabs )을 사용할 때 중요합니다. 이러한 시나리오에서 네트워크 연결이 끊어지면 세션을 다시 로드해야 하므로 추가적인 메모리 오버헤드가 발생합니다. 이러한 위험을 방지하려면 선제적으로 추가 메모리 공간을 할당해야 합니다.

프로시저

스파크 랩 설정

  1. watsonx.data 확장을 설치하십시오.

    a. Visual Studio Code 을 엽니다. 확장을 클릭하십시오.

    b. VS Code Marketplace 에서 watsonx.data 확장을 찾아보고 확장을 설치하십시오.

    c. 왼쪽 탐색 창에서 watsonx.data 아이콘을 볼 수도 있습니다. 아이콘을 누르십시오. Welcome to IBM watsonx.data 확장 프로그램 창이 열립니다.

  2. Welcome to IBM watsonx.data 확장 프로그램 창에서 연결 관리를 클릭합니다. 연결 관리 watsonx.data 창이 열립니다.

  3. 다음 세부 정보 중 하나를 구성합니다:

    • JSON 입력

    • 양식 입력

  4. JSON 입력을 구성하려면 JSON 입력을 클릭하고 다음 세부 정보를 지정합니다:

    • API 키: 플랫폼 API 키를 입력합니다. API 키를 생성하려면 API 키 생성하기 를 참조하세요.
    • 연결 JSON: watsonx.data 사용자 인터페이스에서 연결 세부 정보를 입력합니다. 그렇게 하려면:
      1. watsonx.data 페이지에 로그인합니다.

      2. 탐색 메뉴에서 연결 정보를 클릭합니다.

      3. VS 코드를 클릭합니다. VS Code 연결 구성 필드에서 구성을 복사하고 이를 연결 JSON 필드 값으로 사용합니다. 자세한 내용은 연결 정보 가져오기를 참조하세요.

  5. 양식 입력을 구성하려면 양식 입력을 클릭하고 다음 세부 정보를 지정합니다:

    • watsonx.data 콘솔의 호스트 주소: watsonx.data 설치의 호스트 IP 주소를 입력합니다. 호스트 IP 주소를 검색하려면 연결 정보 가져오기를 참조하세요.
    • 환경 유형: SaaS 를 선택합니다.
    • CRN: watsonx.data 인스턴스의 인스턴스 CRN 입니다. CRN을 검색하려면 연결 정보 가져오기 를 참조하세요.
    • 사용자 아이디: API 키를 사용하는 경우 이메일 아이디이거나 <Service-id>-<GUID> 형식이어야 합니다. 서비스 아이디 및 GUID 생성에 대한 자세한 내용은 서비스 아이디 생성하기 를 참조하세요.
    • API 키: 플랫폼 API 키를 입력합니다. API 키를 생성하려면 API 키 생성하기 를 참조하세요.
  6. 테스트 및 저장을 클릭합니다. Retrieved Spark Clusters 메시지가 표시됩니다. 사용 가능한 스파크 엔진은 WATSONX.DATA:ENGINES 섹션에 표시됩니다.

  7. Spark랩을 작성하십시오.

    a. 새 스파크 랩을 만들려면 섹션에서 WATSONX.DATA:ENGINES 섹션에서 필요한 Spark 클러스터를 선택하고 그 위에 + 아이콘(클러스터 추가)을 클릭합니다. 스파크 랩 만들기 창이 열립니다. 스파크 랩의 고유 이름을 지정하고 스파크 버전을 선택합니다. 기본 Spark 버전은 3.5 입니다. 필요한 경우 다른 선택적 필드를 수정할 수 있습니다.

    ' spark.hadoop.wxd.apikey ' 매개변수는 Spark 실습을 만들 때 기본적으로 Spark 구성 필드에 구성됩니다.

    b. 새로 고침을 클릭하면 왼쪽 창에 스파크 랩이 표시됩니다. 이는 애플리케이션 개발을 위한 전용 Spark 클러스터입니다.

    c. 클릭하여 파일 시스템, 터미널에 액세스하고 작업할 수 있는 Spark 실습 창을 엽니다.

    c. 탐색기 메뉴에서 파일을 업로드할 수 있는 파일 시스템을 확인하고 로그를 볼 수 있습니다.

    이미 실행 중인 스파크 랩을 삭제하려면 watsonx.data 왼쪽 탐색 창에서 스파크 랩의 이름 위로 마우스를 가져간 후 삭제 아이콘을 클릭합니다.

Spark 애플리케이션 개발

Spark랩에서 Spark 애플리케이션을 개발하십시오. 다음 방법 중 하나로 Spark 애플리케이션에 대해 작업할 수 있습니다.

사용자 고유의 Python 파일 작성

  1. Visual Studio Code 에서 Spark 실험실을 클릭합니다. 새 창이 열립니다.

  2. 새 Spark 실습 창에서 새 파일을 클릭합니다. 다음과 같은 파일 형식의 새 파일 프롬프트가 표시됩니다:

    • 텍스트 파일: 텍스트 파일을 만들려면 선택합니다.
    • Python 파일: Python 애플리케이션을 만들려면 선택합니다.
    • Jupyter Notebook: 선택하여 Jupyter Notebook 파일을 만듭니다.
  3. Python 파일을 선택합니다. 새 .py 파일이 열립니다. Python 파일에서 작업을 시작하고 나중에 저장할 수 있습니다.

    Python 애플리케이션 파일을 탐색기 페이지로 드래그할 수도 있습니다. Visual Studio Code 애플리케이션의 오른쪽 분할창에서 파일이 열립니다.

  4. 터미널에서 다음 명령을 실행하여 Python 애플리케이션을 실행합니다. 그러면 Python 세션이 시작되고 터미널에서 확인 메시지를 볼 수 있습니다.

    python <filename>
    

Jupyter 노트북 작성

  1. Visual Studio Code 에서 Spark 실험실을 클릭합니다. 새 창이 열립니다.

  2. 새 Spark 랩 창에 Jupyter 확장 프로그램을 설치해 Jupyter 노트북으로 작업하세요. 새 Spark 실습 창의 확장 프로그램 메뉴에서 Jupyter ( VS 코드 마켓플레이스에서도 찾을 수 있음)를 찾아 확장 프로그램을 설치합니다.

    새 Spark 실습 창에서 Jupyter 확장자를 설치해야 합니다.

  3. 탐색기 페이지에서 새 파일을 클릭합니다. 다음과 같은 파일 형식의 새 파일 프롬프트가 표시됩니다:

    • 텍스트 파일: 텍스트 파일을 만들려면 선택합니다.
    • Python 파일: Python 애플리케이션을 만들려면 선택합니다.
    • Jupyter Notebook: 선택하여 Jupyter Notebook 파일을 만듭니다.

    확장자가 .ipynb 인 파일 이름을 입력해 Jupyter Notebook 파일을 새로 만들거나 기존 노트북을 탐색기 페이지로 끌어다 놓을 수도 있습니다.

  4. 선택 Jupyter Notebook. 새 .ipynb 파일이 열립니다. Jupyter Notebook 파일에서 작업을 시작하고 나중에 저장할 수 있습니다.

  5. Jupyter Notebook 파일에서 커널 선택 링크를 클릭합니다.

  6. 파일을 실행하려면 Python 환경을 선택해야 합니다.

  7. conda/envs/python/bin/python 이 포함된 파일 경로를 선택합니다.

  8. 이제 Jupyter Notebook 을 사용할 준비가 되었습니다. 코드를 작성하고 셀 단위로 실행할 수 있습니다.

파일을 저장하면 다른 이름으로 저장 프롬프트에 파일 경로가 자동으로 표시됩니다. 경로를 수정하거나 확인을 클릭하여 저장할 수 있습니다.