이 문서는 IBM Watson® Knowledge Studio on IBM Cloud®에 대한 문서입니다. Knowledge Studio on IBM Marketplace의 이전 버전에 대한 문서를 보려면 이 링크를 클릭하십시오.

어노테이션 작성 부트스트래핑

작업공간 내의 문서에 어노테이션 미리 작성(pre-annotation)을 수행하여 사람 어노테이터의 작업을 단순화하십시오. 프리어노테이터(pre-annotator)는 멘션을 자동으로 찾아 어노테이션을 작성하기 위해 실행할 수 있는 Knowledge Studio 사전, 규칙 기반 모델 또는 기계 학습 모델입니다.

어노테이션 미리 작성은 단순한 어노테이션 작성을 처리하며 문서 어노테이션 작성 작업을 선행하여 진행하므로 사람 어노테이터의 작업을 용이하게 해 줍니다.

문서에 어노테이션 미리 작성을 수행하는 데 사용되는 방법은 결과 모델을 사용하는 방식을 제한하지 않습니다. 예를 들면, 문서에 어노테이션 미리 작성을 수행하는 데 Natural Language Understanding 서비스를 사용했다고 해서 빌드한 최종 기계 학습 모델을 Natural Language Understanding 서비스에 배치해야 하는 것은 아닙니다.

어노테이션 미리 작성 방법

다음 프리어노테이터를 사용할 수 있습니다.

  • Natural Language Understanding

    문서 내의 엔티티 멘션을 자동으로 찾는 데 사용할 수 있는 프리어노테이터입니다. 소스 문서에 일반적인 지식과 관련된 주제가 있는 경우에는 이 프리어노테이터를 사용하는 것이 좋습니다. 특허법 연구와 같은 특정 분야의 내용이 많은, 고도로 전문적인 문서에 대해 작업하는 경우에는 사전 프리어노테이터 또는 규칙 기반 모델을 사용하는 것이 더 좋습니다.

  • 사전

    사용자가 제공하는 용어 사전을 사용하여 엔티티 유형과 연관시킴으로써 문서 내의 해당 엔티티 유형에 대한 멘션을 찾습니다. 이 프리어노테이터는 기계 학습 프리어노테이터처럼 용어가 사용되는 컨텍스트를 분석하지 않으므로, 고유하거나 전문적인 용어를 사용하는 분야에 적합합니다. 대신 사용된 컨텍스트에 관계 없이 의미를 해석할 수 있을 정도로 용어가 고유해야 합니다. 예를 들면, 식물, 스포츠, 무엇인가를 부수는 것을 의미하는 동사를 가리킬 수 있는 squash의 엔티티 유형을 판별하는 것보다는 asbestos를 광물 엔티티 유형으로 인식하는 것이 더 쉽습니다.

    사전 프리어노테이터는 엔티티 하위 유형을 인식하지 않습니다. 사람 어노테이터는 어노테이션이 미리 작성된 문서로 어노테이션 작성 태스크 관련 작업을 수행하여 각각의 어노테이션이 미리 작성된 멘션의 엔티티 하위 유형을 지정할 수 있습니다.

  • 머신 러닝

    기계 학습 모델을 사용하여 문서에 자동으로 어노테이션을 작성합니다. 이 옵션은 Knowledge Studio를 사용하여 이미 기계 학습 모델을 작성한 경우에만 사용할 수 있습니다. 문서 세트를 추가하는 경우에는 이전에 작성한 기계 학습 어노테이터를 실행하여 새 문서에 어노테이션을 미리 작성할 수 있습니다. 새 문서 세트가 원래 기계 학습 어노테이터를 훈련시키는 데 사용된 문서와 유사한 경우에는 어노테이션 미리 작성을 위해 이 어노테이터를 선택하는 것이 가장 좋습니다.

  • 규칙

    규칙 기반 모델을 사용하여 문서에 자동으로 어노테이션을 작성합니다. 이 선택사항은 Knowledge Studio를 사용하여 이미 규칙 기반 모델을 작성한 경우에만 사용할 수 있습니다. 문서가 의미를 끌어낼 수 있는 공통 토큰 패턴을 포함하는 경우에는 이 모델을 선택하는 것이 좋습니다. 이 모델에서는 또한 문서에서 찾는 사전 용어의 클래스 유형을 식별함으로써 사전 프리어노테이터의 일부 기능을 사용할 수도 있습니다.

또는, 이미 어노테이션이 있는 문서를 업로드한 후 이를 사용하여 기계 학습 모델 훈련을 시작할 수 있습니다. 업로드하는 어노테이션이 있는 문서에 어노테이션 미리 작성을 실행하면 문서에서 기존 어노테이션이 제거되며 해당 프리어노테이터가 작성한 어노테이션만으로 대체되므로 이와 같이 해서는 안 됩니다.

여러 프리어노테이터 실행

Knowledge Studio에서는 여러 프리어노테이터를 한 번에 실행할 수 있습니다. 먼저, 사용할 어노테이션 미리 작성 방법을 준비해야 합니다. 자세한 정보는 다음 섹션을 참조하십시오.

프리어노테이터 순서 구성

여러 프리어노테이터가 사용되면, 다른 프리어노테이터가 나중에 순서대로 동일한 범위의 텍스트에 어노테이션을 작성하려고 시도하는 경우에도 텍스트 범위에 대한 첫 번째 어노테이션이 결과에 대해 저장됩니다. 이는 어노테이션 미리 작성 순서에 관계없이 보존되는 사람 어노테이션에는 적용되지 않습니다.

예를 들어, 예제 텍스트 IBM Watson을 고려하십시오. 첫 번째 순서인 사전이 IBM의 레이블을 Organization 엔티티 유형으로 지정하면, 두 번째 순서인 기계 학습 모델은 IBM Watson에 작성된 이전 어노테이션을 겹쳐쓰게 되므로 Software BrandIBM 엔티티 유형으로 어노테이션을 작성할 수 없습니다.

기계 학습 모델 > 어노테이션 미리 작성 페이지의 순서 열에서 프리어노테이터의 현재 순서를 볼 수 있습니다. 순서를 변경하려면 다음 단계를 완료하십시오.

  1. 순서 설정을 클릭하십시오.
  2. 위로 이동아래로 이동 화살표** 단추를 클릭하여 어노테이션 미리 작성 방법을 순서의 아래 위로 이동하십시오.
  3. 저장 을 클릭하십시오.
  4. 어노테이션 미리 작성 페이지의 순서 열을 다시 확인하여 원하는 순서와 일치하는지 확인하십시오.

프리어노테이터 실행

  1. 어노테이션 미리 작성 방법이 준비되고 프리어노테이터의 순서를 구성한 후 프리어노테이터 실행을 클릭하십시오.
  2. 사용할 프리어노테이터를 선택한 후 다음을 클릭하십시오.
  3. 프리어노테이터를 실행하기 전에 프리어노테이터에서 작성된 기존 어노테이션을 지우려면 어노테이션 미리 작성의 이전 결과 지우기를 선택하십시오. 사람 어노테이션은 선택된 경우에도 보존됩니다.
  4. 어노테이션을 미리 작성할 문서 세트를 선택하십시오.
  5. 실행을 클릭하십시오.

Natural Language Understanding을 사용하여 문서에 어노테이션 미리 작성 수행

Natural Language Understanding 서비스를 사용하여 말뭉치에 추가된 문서에 어노테이션 미리 작성을 수행할 수 있습니다.

시작하기 전에

Natural Language Understanding 프리어노테이터가 사용자의 유스 케이스에 대한 값을 추가할지 판별하십시오. 지원되는 Natural Language Understanding 서비스 엔티티 유형 및 하위 유형 목록을 검토하여 이러한 유형과 유형 시스템의 유형이 자연스럽게 겹치는지 판별하십시오. 겹치는 경우에는 이 프로시저를 계속하십시오. 그렇지 않은 경우에는 사용할 다른 프리어노테이터를 선택하십시오.

이 태스크에 대한 정보

Natural Language Understanding은 자연어 처리를 통한 텍스트 분석을 제공하는 서비스입니다. Natural Language Understanding 프리어노테이터를 사용하면 문서 내의 엔티티를 찾고 어노테이션을 작성하기 위해 Natural Language Understanding 서비스가 호출됩니다.

사용자는 Natural Language Understanding 엔티티 유형을 Knowledge Studio 유형 시스템에 추가한 해당 Knowledge Studio 엔티티 유형에 맵핑하여 서비스가 찾도록 할 엔티티 유형을 지정해야 합니다. 맵핑한 엔티티 유형의 멘션만 찾고 어노테이션을 작성할 수 있습니다.

프로시저

Natural Language Understanding 서비스를 사용하여 문서에 어노테이션 미리 작성을 수행하려면 다음 단계를 완료하십시오.

  1. Knowledge Studio 관리자로 로그인하여 작업공간을 선택하십시오.

  2. 기계 학습 모델 > 어노테이션 미리 작성 페이지로 이동하십시오.

  3. Natural Language Understanding 행의 오버플로우 메뉴 단추를 클릭한 다음 엔티티 유형 맵핑을 클릭하십시오.

    • Natural Language Understanding 엔티티 유형의 드롭 다운 목록은 Natural Language Understanding 서비스가 인식한 엔티티 유형으로 미리 채워져 있습니다.
    • 하나 이상의 엔티티 유형을 맵핑해야 합니다.
    • Natural Language Understanding 엔티티 유형을 Knowledge Studio 엔티티 역할에 맵핑할 수는 없으며, Knowledge Studio 엔티티 유형에만 맵핑할 수 있습니다.
    • 하나의 Natural Language Understanding 엔티티 유형에 둘 이상의 Knowledge Studio 엔티티 유형을 맵핑할 수 있으며, 반대의 경우도 가능합니다. 예를 들면, 다음 맵핑은 허용됩니다.

    표 1. 엔티티 유형의 샘플 맵핑| Watson Knowledge Studio 엔티티 유형 | Natural Language Understanding 엔티티 유형 | | --- | --- | | ENGINEER

    SCIENTIST | 개인 | | 위치 | CityTown

    국가 |

  4. 적용할 모든 엔티티 유형을 맵핑한 후 기계 학습 모델 > 어노테이션 미리 작성 페이지로 이동하십시오. 프리어노테이터 실행을 클릭하십시오.

  5. Natural Language Understanding을 선택한 후 다음을 클릭하십시오.

    하나 이상의 엔티티 유형을 맵핑할 때까지 Natural Language Understanding 어노테이터를 사용할 수 없습니다.

  6. 사전 어노테이터를 실행하는 경우 이전 사전 어노테이션 결과 삭제를 선택하십시오. 사람 어노테이션은 선택된 경우에도 보존됩니다.

  7. 어노테이션 미리 작성을 수행할 각 문서 세트에 대한 선택란을 선택하십시오.

    이 프리어노테이터를 처음 실행하는 경우에는 먼저 프리어노테이터가 맵핑된 엔티티를 예상대로 찾을 수 있는지 유효성 검증하십시오. 각 개별 데이터 소스의 대표적인 문서를 포함하는 하나의 문서 세트를 작성하십시오.

  8. 실행을 클릭하십시오.

    프리어노테이터의 유효성 검증을 수행하는 경우에는 어노테이션이 있는 문서를 열고 추가된 어노테이션을 검토하십시오. 충분한 수의 정확한 어노테이션이 작성되었는지 확인하십시오. 어노테이션이 정확한 경우에는 더 크고 많은 문서 세트에 대해 이 어노테이터를 다시 실행할 수 있습니다. 어노테이션이 정확하지 않은 경우에는 유형에 다른 Natural Language Understanding 엔티티 유형을 맵핑하는 것을 고려하십시오. 유형이 자연스럽게 겹치지 않는 경우에는 Natural Language Understanding 프리어노테이터가 아닌 다른 프리어노테이터를 사용하는 것이 좋습니다.

    어노테이션 미리 작성은 특정 문서가 속할 수 있는 다양한 문서 세트를 고려하지 않고 개별 문서에 적용됩니다. 선택한 문서 세트와 선택하지 않은 문서 세트 간에 겹치는 문서는 두 문서 세트 모두에서 어노테이션 미리 작성이 수행됩니다.

결과

Natural Language Understanding 서비스가 어노테이션 미리 작성을 수행한 문서에 의해 작성된 기준 실제값은 직접 Knowledge Studio 외부에서 사용할 수 없습니다. 사용자는 이 기준 실제값(읽을 수 없는 양식임)을 다운로드하여 한 Knowledge Studio 작업공간에서 다른 작업공간으로 이동해야 합니다. 그 후에는 기준 실제값 개발을 계속하며 이를 사용하여 Knowledge Studio 외부의 서비스에서 사용하기 위해 배치할 수 있는 기계 학습 모델 또는 규칙 기반 모델을 빌드할 수 있습니다.

Natural Language Understanding으로 어노테이션이 미리 작성된 문서는 다운로드 시 읽을 수 없는 형식으로 숨겨집니다. 그러나 이뿐만 아니라, 사람 어노테이터가 추가한 어노테이션을 비롯하여 이러한 문서의 모든 어노테이션은 숨겨집니다.

관련 정보:

Natural Language Understanding

사전을 사용하여 문서에 어노테이션 미리 작성 수행

사람 어노테이터가 어노테이션 작성 태스크를 시작하는 데 도움을 주기 위해, 사전을 작성하고 이를 사용하여 말뭉치에 추가된 문서에 어노테이션 미리 작성을 수행할 수 있습니다.

이 태스크에 대한 정보

사람 어노테이터가 어노테이션 미리 작성이 수행된 문서에 대해 작업을 시작할 때는 사전 항목을 기반으로 여러 멘션이 이미 엔티티 유형으로 표시되어 있을 가능성이 높습니다. 사람 어노테이터는 어노테이션 미리 작성된 엔티티 유형을 변경하거나 제거하고 어노테이션이 작성되지 않은 멘션에 엔티티 유형을 지정할 수 있습니다. 사전에 의한 어노테이션 미리 작성은 관계, 상호 참조에 어노테이션을 작성하지 않습니다. 관계 및 상호 참조는 사람 어노테이터가 어노테이션을 작성해야 합니다.

이 태스크는 편집 가능한 사전을 작성하는 방법을 보여줍니다. 문서를 업로드하고 읽기 전용 사전으로 이 문서에 어노테이션을 미리 작성하려는 경우, 사전 작성 단추 옆에 있는 메뉴 아이콘을 클릭한 다음 사전 업로드를 선택하십시오.

프로시저

편집 가능한 사전을 작성하고 문서에 어노테이션을 미리 작성하려면 다음 단계를 수행하십시오.

  1. Knowledge Studio 관리자로 로그인하여 작업공간을 선택하십시오.

  2. 자산 > 사전 페이지를 선택하십시오.

  3. 사전 작성을 클릭하고 이름을 입력한 후에 저장을 클릭하십시오.

  4. 엔티티 유형 목록에서 사전과 연관시킬 엔티티 유형을 선택하십시오.

    또한 기계 학습 모델 > 어노테이션 미리 작성 페이지에서 사전과 엔티티 유형을 연관시킬 수 있습니다. 페이지에서 사전 행의 오버플로우 메뉴 단추를 클릭한 다음 엔티티 유형 맵핑을 클릭하십시오.

  5. 사전의 항목을 추가하거나 사전 용어를 포함하는 파일을 업로드하십시오.

  6. 기계 학습 모델 > 어노테이션 미리 작성 페이지로 이동하십시오.

  7. 프리어노테이터 실행을 클릭하십시오.

  8. 사전을 선택한 후 다음을 클릭하십시오.

  9. 프리어노테이터를 실행하기 전에 프리어노테이터에서 작성된 기존 어노테이션을 지우려면 어노테이션 미리 작성의 이전 결과 지우기를 선택하십시오. 사람 어노테이션은 선택된 경우에도 보존됩니다.

  10. 어노테이션 미리 작성을 수행할 각 문서 세트에 대한 선택란을 선택하고 실행을 클릭하십시오.

    어노테이션 미리 작성은 특정 문서가 속할 수 있는 다양한 문서 세트 또는 어노테이션 세트를 고려하지 않고 개별 문서에 적용됩니다. 선택한 문서 세트와 선택하지 않은 문서 세트 간에 겹치는 문서는 두 문서 세트 모두에서 어노테이션 미리 작성이 수행됩니다.

관련 정보:

기계 학습 모델을 사용하여 문서에 어노테이션 미리 작성 수행

기존 기계 학습 모델을 사용하여 말뭉치에 추가된 문서에 어노테이션 미리 작성을 수행할 수 있습니다.

이 태스크에 대한 정보

10 - 30개의 문서에 어노테이션이 작성되고 나면 이러한 데이터를 사용하여 기계 학습 모델을 훈련시킬 수 있습니다. 프로덕션에서는 이러한 최소한으로 훈련된 모델은 사용하지 마십시오. 하지만 후속 문서의 사람 어노테이션을 빠르게 작성할 수 있도록 모델을 사용하여 문서에 어노테이션을 미리 작성할 수 있습니다. 예를 들어, 기계 학습 모델을 훈련시킨 후 말뭉치에 문서를 추가하는 경우에는 이 모델을 새 문서 세트에 어노테이션 미리 작성을 수행하는 데 사용할 수 있습니다. 사람이 어노테이션을 작성한 문서에 대해 프리어노테이터를 실행하지 마십시오. 프리어노테이터는 사람이 작성한 어노테이션을 제거합니다.

프로시저

기존 기계 학습 모델을 사용하여 문서에 어노테이션 미리 작성을 수행하려면 다음 작업을 수행하십시오.

  1. Knowledge Studio 관리자로 로그인하여 작업공간을 선택하십시오.

  2. 기계 학습 모델 > 어노테이션 미리 작성 페이지로 이동하십시오.

  3. 프리어노테이터 실행을 클릭하십시오.

  4. 기계 학습 모델을 선택한 후 다음을 클릭하십시오.

  5. 프리어노테이터를 실행하기 전에 프리어노테이터에서 작성된 기존 어노테이션을 지우려면 어노테이션 미리 작성의 이전 결과 지우기를 선택하십시오. 사람 어노테이션은 선택된 경우에도 보존됩니다.

  6. 어노테이션 미리 작성을 수행할 각 문서 세트에 대한 선택란을 선택하고 실행을 클릭하십시오.

    어노테이션 미리 작성은 특정 문서가 속할 수 있는 다양한 문서 세트 또는 어노테이션 세트를 고려하지 않고 개별 문서에 적용됩니다. 선택한 문서 세트와 선택하지 않은 문서 세트 간에 겹치는 문서는 두 문서 세트 모두에서 어노테이션 미리 작성이 수행됩니다.

규칙 기반 모델을 사용하여 문서에 어노테이션 미리 작성 수행

규칙 편집기는 2025년 6월 30일에 종료됩니다. 자세한 내용은 릴리스 노트를 참조하세요.

기존 규칙 기반 모델을 사용하여 말뭉치에 추가된 문서에 어노테이션 미리 작성을 수행할 수 있습니다.

프로시저

규칙 기반 모델을 사용하여 문서에 어노테이션 미리 작성을 수행하려면 다음 단계를 완료하십시오.

  1. Knowledge Studio 관리자로 로그인하여 작업공간을 선택하십시오.

  2. 기계 학습 모델 > 어노테이션 미리 작성 페이지로 이동하십시오.

  3. 페이지에 있는 규칙 기반 모델 행의 오버플로우 메뉴 단추를 클릭한 후 엔티티 유형 및 클래스 맵핑을 클릭하여 Knowledge Studio 유형 시스템에 정의한 엔티티 유형을 하나 이상의 규칙 기반 모델 클래스에 맵핑하십시오.

    규칙 기반 모델 > 버전 > 규칙 기반 모델 탭을 선택하여 맵핑 페이지를 열 수도 있습니다.

  4. 맵핑할 각 엔티티 유형에 대해 편집을 클릭하십시오.

    • 클래스 이름 열의 드롭 다운 목록은 규칙 기반 모델과 연관된 클래스로 미리 채워져 있습니다.
    • 하나 이상의 엔티티 유형을 클래스에 맵핑해야 합니다.
  5. 기계 학습 모델 > 어노테이션 미리 작성 페이지에서 프리어노테이터 실행을 클릭하십시오.

    하나 이상의 엔티티 유형을 클래스에 맵핑하기 전까지는 규칙 기반 모델 옵션을 사용할 수 없습니다.

  6. 프리어노테이터를 실행하기 전에 프리어노테이터에서 작성된 기존 어노테이션을 지우려면 어노테이션 미리 작성의 이전 결과 지우기를 선택하십시오. 사람 어노테이션은 선택된 경우에도 보존됩니다.

  7. 어노테이션 미리 작성을 수행할 문서 세트 또는 어노테이션 세트를 선택하십시오.

  8. 실행을 클릭하십시오.

    어노테이션 미리 작성은 특정 문서가 속할 수 있는 다양한 문서 세트를 고려하지 않고 개별 문서에 적용됩니다. 선택한 문서 세트와 선택하지 않은 문서 세트 간에 겹치는 문서는 두 문서 세트 모두에서 어노테이션 미리 작성된 것으로 표시됩니다.

어노테이션 미리 작성이 수행된 문서의 업로드

UIMA(Unstructured Information Management Architecture) 분석 엔진을 통해 어노테이션 미리 작성이 수행된 문서를 업로드하여 모델의 훈련을 빠르게 시작할 수 있습니다.

어노테이션 미리 작성이 수행된 문서의 형식은 UIMA CAS XMI(UIMA Common Analysis Structure의 XMI 직렬화)여야 합니다. 업로드하는 .zip 파일은 UIMA TypeSystem 디스크립터 파일과 UIMA 유형을 Knowledge Studio 유형 시스템의 엔티티 유형에 맵핑하는 파일을 포함해야 합니다.

UIMA CAS XMI는 Apache UIMA의 표준 형식입니다. IBM Watson Explorer의 분석된 콜렉션으로부터 올바른 형식으로 파일을 작성하는 방법에 대한 가이드라인이 제공됩니다. 다른 Apache UIMA 구현을 사용하는 경우에는 자신의 목적에 맞게 이러한 가이드라인을 변경하십시오. XMI 파일을 작성하는 방법에 관계없이 유형 시스템 맵핑 파일 및 .zip 파일 작성에 대한 요구사항은 모든 사용자에게 동일하게 적용됩니다.

가져온 문서를 사람 어노테이터에게 지정하면 문서가 기준 실제값 편집기에 어노테이션 미리 작성된 상태로 표시되며, 여러 멘션에 이미 어노테이션이 작성되어 있을 수 있습니다. 따라서 사람 어노테이터는 표시되지 않은 멘션에 어노테이션 가이드라인을 적용하는 데 집중할 수 있습니다. 또는, 사람에 의한 어노테이션 작성 단계를 건너뛰고 어노테이션 미리 작성이 수행된 문서를 사용하여 즉시 기계 학습 모델의 훈련 및 평가를 시작할 수 있습니다.

Watson Explorer Content Analytics에서 분석된 문서 내보내기

IBM Watson Explorer Content Analytics에서 크롤링되고 분석된 문서를 내보내고, 분석된 문서를 Knowledge Studio 작업공간에 XMI 파일로 업로드할 수 있습니다.

프로시저

Watson Explorer Content Analytics 콜렉션에서 분석된 문서를 가져오려면 다음 단계를 수행하십시오.

  1. 웹 브라우저에서 Content Analytics 관리 콘솔을 여십시오.

  2. 콜렉션 보기에서 문서를 내보낼 콜렉션을 펼치십시오. 구문 분석 및 색인화 분할창에서 구문 분석 및 색인화 프로세스가 실행 중인지 확인한 후 분석된 문서 컨텐츠 및 메타데이터 내보내기의 화살표 아이콘을 클릭하십시오.

  3. 분석된 문서 내보내기 옵션 영역에서 문서를 XML 파일로 내보내기를 선택하고, XMI 형식 내보내기로 CAS를 사용할 수 있도록 설정 선택란을 선택한 다음, 내보낸 데이터가 기록될 출력 경로를 지정한 후 확인을 클릭하십시오.

  4. 콜렉션에 대한 구문 분석 및 색인화 서비스를 중지한 후 다시 시작한 다음, 다음 단계 중 하나를 수행하십시오.

    • 콜렉션의 문서 캐시에 기계 학습 모델의 훈련에 사용할 색인화된 문서가 이미 포함되어 있는 경우에는 전체 색인 빌드를 다시 시작하십시오.
    • 콜렉션이 기계 학습 모델의 훈련에 사용할 색인화된 문서를 포함하고 있지 않은 경우에는 문서를 업로드하고, 문서를 크롤링할 하나 이상의 크롤러를 구성한 후 크롤러를 시작하십시오.
  5. 내보내기 영역에서 내보내기 요청의 상태를 확인하십시오. 진행상태는 얼마나 많은 문서를 내보냈는지를 나타냅니다.

  6. 내보내기 옵션을 구성할 때 지정한 출력 폴더로 이동하십시오. 문서를 XML 파일로 내보낼 때 출력 폴더 이름은 내보내기가 발생한 시점의 시간소인에 따라 지정됩니다. 이 출력 폴더는 XMI 파일(*.xmi)과 UIMA TypeSystem 디스크립터 파일(exported_typesystem.xml)을 포함합니다.

다음에 수행할 작업

UIMA 유형과 Knowledge Studio 엔티티 유형 간의 맵핑을 정의해야 합니다. 또한 분석된 데이터를 Knowledge Studio 작업공간에 업로드하는 데 필요한 모든 파일을 포함하는 .zip 파일을 작성해야 합니다.

관련 정보:

Content Analytics Studio에서 분석된 콜렉션 내보내기

Watson Explorer Content Analytics Studio에서 분석된 문서의 콜렉션을 내보내고, 분석된 문서를 Knowledge Studio 프로젝트에 XMI 파일로 업로드할 수 있습니다.

프로시저

Content Analytics Studio 콜렉션에서 분석된 문서를 가져오려면 다음 단계를 수행하십시오.

  1. Content Analytics Studio를 실행하고 스튜디오 프로젝트를 여십시오.
  2. 기계 학습 모델을 훈련시키는 데 사용할 문서를 포함하는 폴더를 마우스 오른쪽 단추로 클릭하고 콜렉션 분석을 선택하십시오.
  3. UIMA 파이프라인 구성 파일을 선택하십시오.
  4. 콜렉션 분석 보기로 이동하여 콜렉션 분석 보기에 있는 저장 아이콘을 클릭하십시오. 저장된 결과가 기록되는 폴더를 지정하고 파일 이름을 지정하십시오.
  5. 지정한 폴더를 여십시오. 저장된 파일의 파일 확장자는 .annotations입니다.
  6. .annotations 파일을 로컬 파일 시스템으로 복사한 후 파일 확장자를 .annotations에서 .zip으로 바꾸십시오.
  7. .zip 파일에서 모든 파일의 압축을 푸십시오. 압축이 풀린 컨텐츠에는 XMI 파일(*.xmi), UIMA TypeSystem 디스크립터 파일(TypeSystem.xml) 및 기타 파일이 포함되어 있습니다.

다음에 수행할 작업

UIMA 유형과 Knowledge Studio 엔티티 유형 간의 맵핑을 정의해야 합니다. 또한 분석된 데이터를 Knowledge Studio 작업공간에 업로드하는 데 필요한 모든 파일을 포함하는 .zip 파일을 작성해야 합니다.

UIMA 유형을 엔티티 유형에 맵핑

XMI 파일을 Knowledge Studio 작업공간에 업로드하기 전에, UIMA 유형과 Knowledge Studio 엔티티 유형 간의 맵핑을 정의해야 합니다.

시작하기 전에

Knowledge Studio 작업공간의 유형 시스템이 UIMA 유형에 맵핑할 엔티티 유형을 포함해야 합니다.

프로시저

UIMA 유형을 Knowledge Studio 엔티티 유형에 맵핑하려면 다음 단계를 수행하십시오.

  1. cas2di.tsv 또는 exported_typesystem.xml과 같은 UIMA TypeSystem 디스크립터 파일을 포함하는 폴더에 TypeSystem.xml라는 파일을 작성하십시오.

  2. cas2di.tsv 파일을 텍스트 편집기로 여십시오. 파일의 각 행은 하나의 맵핑을 지정합니다. 맵핑의 형식은 맵핑할 어노테이터의 어노테이션에 따라 달라집니다.

    • 기본 형식을 사용하여 맵핑을 작성할 수 있습니다.

      UIMA_Type_Name[TAB]WKS_Entity_Type

      다음 예는 Watson Explorer Content Analytics의 개체명 인식 어노테이터에 의해 작성된 UIMA 유형과 Knowledge Studio 유형 시스템에 정의된 엔티티 유형 간의 맵핑을 정의합니다.

      com.ibm.langware.Organization  ORGANIZATION
      com.ibm.langware.Person  PERSON
      com.ibm.langware.Location  LOCATION
      

      또 다른 다음 예는 Watson Explorer Content Analytics Studio에서 사용자 정의 어노테이터에 의해 작성된 UIMA 유형과 Knowledge Studio 엔티티 유형 간의 맵핑을 정의합니다.

      com.ibm.Person  PERSON
      com.ibm.Date  DATE
      
    • Watson Explorer Content Analytics에서는 패턴 일치 어노테이터 또는 사전 검색 어노테이터에서 사용하는 패싯에 따라 맵핑을 작성할 수 있습니다. 텍스트 분석 규칙 파일(*.pat)에서 패싯은 카테고리 속성으로 표현됩니다. 맵핑을 정의하려면 다음 구문을 사용하십시오.

      com.ibm.takmi.nlp.annotation_type.ContiguousContext:category={FACET_PATH}[TAB]{WKS_ENTITY_TYPE}
      

      패턴 일치 및 사전 검색 어노테이터를 적용하는 다음 예는 카테고리 $.mykeyword.product와 Knowledge Studio 엔티티 유형 PRODUCT 간의 맵핑을 정의합니다.

      com.ibm.takmi.nlp.annotation_type.ContiguousContext:category=$.mykeyword.product PRODUCT
      

다음에 수행할 작업

분석된 데이터를 Knowledge Studio 작업공간에 업로드하는 데 필요한 모든 파일을 포함하는 .zip 파일을 작성해야 합니다.

관련 정보:

UIMA CAS XMI 파일을 작업공간에 업로드

어노테이션이 미리 작성된, 다운로드한 문서를 모델 훈련에 사용하려면 XMI 파일을 업로드하는 데 필요한 모든 파일을 포함하는 .zip 파일을 작성한 후 이 .zip 파일을 Knowledge Studio 작업공간에 업로드해야 합니다.

시작하기 전에

.zip 파일을 업로드하기 전에, Knowledge Studio 작업공간의 유형 시스템이 UIMA 유형에 맵핑한 엔티티 유형을 포함하는지 확인하십시오.

UIMA 분석 엔진은 여러 문장에 걸친 어노테이션을 허용합니다. Knowledge Studio에서 어노테이션은 하나의 문장 경계 내에 존재해야 합니다. 업로드하는 XMI 파일이 여러 문장에 걸친 어노테이션을 포함하는 경우 이러한 어노테이션은 기준 실제값 편집기에 표시되지 않습니다.

프로시저

어노테이션이 미리 작성된 문서를 Knowledge Studio 작업공간에 업로드하려면 다음 단계를 수행하십시오.

  1. Knowledge Studio에서 필요로 하는 모든 파일을 포함하는 .zip 파일을 작성하십시오.

    1. XMI 파일, UIMA TypeSystem 디스크립터 파일 및 cas2di.tsv 파일을 포함하는 폴더를 선택하거나, 이 폴더 내의 모든 파일을 선택하십시오.

    2. 모든 파일을 포함하는 .zip 파일을 작성하십시오. cas2di.tsv 및 UIMA 유형 시스템 디스크립터 파일이 .zip 파일의 루트 디렉토리에 저장되도록 하십시오. 이러한 파일을 .zip 파일 내의 서브폴더에 저장하면 Knowledge Studio가 이를 읽을 수 없으며, 아무것도 가져오지 않습니다.

      Windows에서는 마우스 오른쪽 단추로 클릭한 후 보내기 > 압축(ZIP) 폴더를 선택할 수 있습니다.

  2. .zip 파일을 Knowledge Studio 작업공간에 업로드하십시오.

    1. Knowledge Studio 관리자 또는 프로젝트 관리자로 로그인하여 문서를 추가할 작업공간을 열고 자산> 문서 페이지를 여십시오.
    2. 문서 세트 업로드를 클릭하십시오.
    3. 작성한 .zip 파일을 끌어오거나, 클릭하여 이 파일을 찾아 선택하십시오.
    4. 선택란을 선택하여 .zip 파일이 UIMA CAS XMI 파일을 포함하고 있음을 표시하십시오.
    5. 업로드를 클릭하십시오.