이 문서는 IBM Watson® Knowledge Studio on IBM Cloud®에 대한 문서입니다. Knowledge Studio on IBM Marketplace의 이전 버전에 대한 문서를 보려면 이 링크를 클릭하십시오.

문서에 어노테이션 작성

이 절의 정보는 업계 문서에 어노테이션을 작성하도록 요청을 받은 주제 관련 전문가가 기준 실제값 편집기를 사용하여 이 태스크를 완료하는 데 도움을 줍니다.

작업공간 액세스

사용자는 다른 사용자가 작업공간을 작성하고 사용자에게 그에 대한 액세스 권한을 부여하기 전까지 작업공간을 볼 수 없습니다.

관리자가 사용자를 Knowledge Studio의 인스턴스에 추가하면 사용자가 사람 어노테이터 역할에 추가됩니다. 이 역할로는 작업공간을 작성할 수 없습니다. 작업공간에 대한 액세스 권한을 얻으려면 관리자가 작업공간을 작성해야 합니다. 그 후 관리자, 또는 관리자가 작업공간과 연관시킨 프로젝트 관리자가 다음 단계를 수행해야 합니다.

  1. 어노테이션 세트를 작성하고 이를 사용자와 연관시킵니다.
  2. 사용자에게 세트 내의 문서에 어노테이션을 작성하도록 지정하는 태스크를 작성합니다.

사용자에게 어노테이션 작성 태스크가 지정되어야 사용자가 작업공간을 볼 수 있습니다.

Knowledge Studio 작업공간에 참여하도록 초대받았으나 작업공간 페이지에 작업공간이 표시되지 않는 경우에는 초대한 사람에게 문의하여 필요한 단계를 수행하도록 요청하십시오.

어노테이션 작성 우수 사례

다음 어노테이션 작성 우수 사례는 문서에 어노테이션 작성을 시작할 때 참고할 수 있는 몇 가지 지침 및 예를 제공합니다.

  • 모든 문서에 완전히 어노테이션을 작성하십시오.

    기계 학습에서는 어노테이션을 작성한 항목 뿐만 아니라 작성하지 않은 항목, 반례를 통해서도 학습이 이뤄집니다. 그러므로 어느 항목에 어노테이션을 작성할지는 신중히 판단하되, 완전한 작업을 수행하십시오. 세트 내의 10개 문서 중 5개에만 철저히 어노테이션을 작성하면, 모델은 남은 5개 문서에서 캡처하지 않은 어노테이션으로부터 이러한 문서에서 누락된 엔티티 및 관계 멘션을 무시하도록 학습하게 됩니다. 이렇게 되면 처음 5개 문서에서 수행한 철저한 작업이 무의미한 작업이 될 수 있습니다.

  • 일관된 어노테이션 작성은 올바른 어노테이션 작성만큼 중요합니다.

    어노테이션 가이드라인과 관련된 몇 가지 의사결정은 사용자의 재량을 따릅니다(예: Camry 또는 Camry LX와 같이 트림군을 모델 이름의 일부로 간주할 것인지 등). 어느 정책을 선택하느냐보다는 프로젝트 팀이 둘 중 한 쪽을 선택하는 것에 동의하고 해당 정책에 따라 어노테이션을 일관되게 작성하는 것이 훨씬 중요합니다.

  • 멘션 발견 검색은 단어-토큰 단위 레벨에서만 작동하므로, 단어-토큰 경계만을 기준으로 엔티티 멘션에 레이블을 지정하십시오.

  • 가능하면 항상 하나 또는 두 개의 인접 단어로 제한된 엔티티 멘션에 레이블을 지정하십시오.

    이것이 항상 가능하거나 쉬운 것은 아닙니다. 다음 예를 생각해 보십시오.

    • 소스 문서에 다음 문장이 포함되어 있으며, 사용자는 유형 시스템을 사용하는 애플리케이션의 목적을 위해 이 문장에서 문제점 및 해당 원인에 어노테이션을 작성하려 합니다.

      The electronic module was burnt because the wrong voltage was applied.
      

      이 문장을 보면 다음과 같이 문제점과 원인에 어노테이션을 작성하려 할 수 있습니다.

                  [PROBLEM]                           [CAUSE]
      
      [The electronic module was burnt] [because the wrong voltage was applied].
      

      그러나 이러한 긴 구문을 엔티티 유형으로 어노테이션 작성하는 것은 좋은 방법이 아닙니다. 대신 중요 엔티티를 찾고 관계 멘션을 정의하여 이들이 어떻게 서로 연관되어 있는지 식별하십시오.

             [LOCATION]          [SYMPTOM]                [CAUSE]
      
      The [electronic module] was [burnt] because the [wrong voltage] was applied.
      
                    ^---isStatusOf--| |------causedBy-------^
      
    • 소스 문서에 어노테이션을 작성할 분할된 동사가 포함된 경우가 있습니다. 서로 인접하지 않은 텍스트를 어떻게 하나의 엔티티 유형으로 어노테이션 작성할 수 있을까요? 이 경우에는 각 엔티티 멘션에 어노테이션을 작성하고, 관계 멘션을 사용하여 이들을 서로 관련된 항목으로 식별할 수 있습니다.

                [EVENT_ANSWER]      [EVENT_ANSWER]
      
      All of the phones were ringing, but he knew he should [pick] the red phone [up] first.
      
                          ^----splitType-----^
      
  • 겹치는 멘션(문서 내의 한 구문에 적용된 서로 다른 두 엔티티 유형 레이블)을 작성하지 마십시오. 예를 들면, She donated her father's journals to the JFK Library. 문장이 주어진 경우 하나의 구문 JFKJFK LibraryPERSON에 대해 JFK Library=LOCATION 및 *=*의 어노테이션을 작성하면 멘션이 겹쳐집니다. 해당 용어는 이 문장에서 사람이 아니라 도서관을 의미하므로 후자의 어노테이션만 적용해야 합니다.

    멘션 발견은 각 단어 토큰에 하나의 레이블만 있는 경우 또는 레이블이 없는 경우를 찾으므로 이러한 구조를 디코드하려면 기계 학습 모델의 여러 병렬 호출이 필요합니다.

  • 팀에서 연속된 텍스트의 목록 및 복수형을 어떻게 처리할지 결정하십시오. 예를 들어, KLUE 유형 시스템에는 단수와 복수를 구분하는 PERSONPEOPLE 엔티티 유형이 있습니다. 목록 Barack, Michelle, Malia, and Sasha Obama에는 다음 중 한 가지 방법으로 어노테이션을 작성할 수 있습니다.

    • 목록 내의 각 항목을 단수 엔티티 멘션으로 어노테이션 작성합니다(Barack, Michelle, MaliaSasha Obama가 각각 PERSON 멘션임).
    • 전체 구문을 하나의 복수 엔티티 멘션으로 어노테이션 작성합니다(Barack, Michelle, Malia, and Sasha Obama가 하나의 PEOPLE 멘션임).

    하나의 접근 방법이 다른 것보다 반드시 좋지는 않습니다. 팀이 이들 중 하나를 선택하고 문서에서 발생하는 목록에 이를 일관되게 적용하도록 하십시오.

  • 상호 참조는 여러 멘션이 동일한 실제 엔티티를 가리키는 경우 사용됩니다. 관계는 별개의 엔티티 간에 사용됩니다. 그러므로 두 멘션이 상호 참조와 관계로 동시에 연결되어서는 안 됩니다.

기준 실제값 편집기를 사용한 어노테이션 작성

사람 어노테이터가 문서에 어노테이션을 작성하면 문서가 기준 실제값 편집기에서 열립니다. 기준 실제값 편집기는 사람 어노테이터가 텍스트에 레이블을 적용하는 데 사용하는 시각적 도구입니다.

사람에 의한 어노테이션 작성의 목표는 기계 학습 모델이 새로운 텍스트에서 멘션, 관계 및 상호 참조를 발견하도록 훈련될 수 있게 이러한 패턴에 레이블을 지정하는 것입니다. 적어도 이 도구를 사용하여 엔티티 멘션만은 어노테이션 작성해야 합니다. 결과 모델을 사용할 애플리케이션에서 상호 참조 및 관계 멘션을 찾고 추출할 필요가 없는 경우에는 상호 참조 및 관계 멘션을 어노테이션 작성할 필요가 없습니다.

용어 색인은 사람 어노테이터가 빠르게 반복 멘션의 어노테이션 작성을 수행하는 데 사용할 수 있는 선택적 도구입니다.

수동으로 문서에 어노테이션을 작성할 때 사용할 모드를 선택하십시오.

  • 멘션 모드

    이 모드에서, 사람 어노테이터는 엔티티 유형을 유형 시스템에 정의된 바와 같이 텍스트의 의미 있는 단어 또는 구문과 연관시킵니다. 예를 들면, 사람 이름에 대한 모든 멘션은 PERSON이라는 엔티티 유형과 연관될 수 있습니다. 멘션에 대한 어노테이션 작성은 필수이며, 관계 유형에 어노테이션을 작성하거나 멘션을 상호 참조로 어노테이션 작성하기 전에 수행해야 합니다.

    사람 어노테이터는 선택적으로 용어 색인 도구를 사용하여 문서 및 어노테이션 세트 전체에서 동일한 멘션이 동일한 엔티티 유형으로 어노테이션이 작성되도록 할 수 있습니다.

  • 관계 모드

    이 모드에서, 사람 어노테이터는 유형 시스템에 정의된 바와 같이 관계 유형을 연관시켜 멘션을 연결합니다. 예를 들어, 멘션 John Smith는 관계 유형 IBM에 의해 멘션 employedBy에 연결될 수 있습니다. 관계 유형에 대한 어노테이션 작성은 선택사항이며 멘션을 상호 참조로 어노테이션 작성하기 전 또는 후에 수행할 수 있습니다.

  • 상호 참조 모드

    이 모드에서 사람 어노테이터는 동일한 항목을 의미하는 멘션을 식별하여 이러한 단어가 서로 동일하지 않은 경우에도 일관성을 지킬 수 있게 도와줍니다. 예를 들어, 첫 번째 문장의 IBM에 대한 멘션, International Business Machines에 대한 멘션, 그리고 그 이후 문장의 IBM에 대한 멘션은 모두 동일한 항목을 가리키며 모두 ORGANIZATION과 같은 동일한 엔티티 유형으로 레이블 지정됩니다. 멘션을 상호 참조로 어노테이션 작성하는 것은 선택사항이며 관계 유형으로 어노테이션 작성하기 전 또는 후에 수행할 수 있습니다.

편집기 사용 팁

  • 작업을 저장하면서 진행하십시오.
  • 실수한 경우에는 Ctrl+Z를 눌러서 이전 조치를 실행 취소할 수 있습니다. 실행 취소한 후에 조치를 다시 실행하려면 Ctrl+Y를 누르십시오. 현재 문서를 편집하는 동안 수행한 이전의 10개의 조치를 실행 취소할 수 있습니다. 조치는 문서를 닫는 즉시 유실됩니다. 조치는 역순으로 실행 취소되어야 하며 특정 조치를 실행 취소할 때는 해당 조치를 수행할 당시의 모드로 전환해야 합니다. 용어 색인 도구 조치는 실행 취소하고 다시 실행할 수 없습니다.

엔티티 멘션에 어노테이션 작성

엔티티 멘션에 어노테이션을 작성하는 경우, 사람 어노테이터는 텍스트 내의 텍스트 문자열을 선택한 후 해당 텍스트 문자열이 나타내는 항목을 가장 적절히 설명하는 레이블을 적용합니다. 적용할 수 있는 레이블은 작업공간의 유형 시스템에 정의된 엔티티 유형입니다.

이 태스크에 대한 정보

문서 내의 엔티티 멘션에 어노테이션 작성을 시작하기 전에는 전체 문서를 읽는 것이 좋습니다. 이렇게 하면 전체 컨텍스트를 이해한 상태로 어노테이션을 작성할 수 있으며, 이는 이후의 문서 관련 작업에서 엔티티 멘션이 서로 어떻게 관계되어 있으며 어떤 멘션을 상호 참조로 설정해야 하는지에 대해 정보를 얻는 데 도움이 됩니다.

문서에 어노테이션을 작성하기 위해 이를 열 때는 용어 색인 도구를 사용하여 반복되는 엔티티 멘션에 먼저 어노테이션을 작성한 후 개별 엔티티 멘션에 어노테이션을 작성할 수 있습니다. 그 후에는 원하는 순서대로 관계 멘션 및 상호 참조에 어노테이션을 작성하거나, 하지 않을 수 있습니다. 엔티티 멘션 어노테이션 작성은 필수입니다. 관계 멘션 및 상호 참조 어노테이션 작성 여부는 모델의 용도 및 도메인의 요구사항에 따라 달라집니다. 그러나 상호 참조를 식별할 때까지 각 엔티티 멘션은 별개의 엔티티를 나타내는 것으로 간주됩니다.

  • 기계 학습 모델은 짧은 패턴을 더 잘 인식하고 올바른 어노테이션 토큰을 추가하므로 훈련을 위해서는 짧은 엔티티 멘션이 더 바람직하다는 점을 기억하십시오.

  • 작업공간에서 사전 기반 토크나이저를 사용하도록 선택했으며 훈련 데이터의 복합 용어 및 구두점을 처리하려 하는 경우에는 이러한 용어를 사전에 추가하고 발생에 어노테이션 미리 작성을 수행하기 위한 사전 어노테이터를 작성할 수 있습니다. 예를 들어, 구두점이 포함된 용어의 문장 경계 나누기를 피하려면Yahoo! 및 Dr.와 같은 용어를 사전에 추가하십시오. 마찬가지로, 훈련 데이터가 하이픈이 삽입된 단어 또는 영숫자 약어를 포함하면(예: Hi-C 또는 MS-60-70) 해당 용어를 사전에 추가하십시오. 대소문자에 관계 없이 발생에 어노테이션을 작성하려면 용어를 소문자로 추가하십시오(예: hi-c). 변형에 어노테이션을 작성하려면 변형을 표층형으로 추가하십시오(MS-60-70MS 60 70).

    기본 토크나이저를 사용하는 경우에는 이 접근법을 사용하지 마십시오.

프로시저

문서 내의 엔티티 멘션에 어노테이션을 작성하려면 다음 작업을 수행하십시오.

  1. 사람 어노테이터(또는 어노테이션을 작성할 문서가 지정된 관리자)로 로그인하십시오. 사용자에게 지정된 태스크를 포함하는 작업공간이 표시됩니다.

  2. 작업공간을 열고 기계 학습 모델 > 어노테이션을 클릭한 후 어노테이션 작성 태스크 탭을 클릭하십시오. 사용자에게 지정된 어노테이션 작성 태스크가 표시됩니다.

  3. 작업할 어노테이션 작성 태스크를 여십시오. 사용자에게 지정된 어노테이션 세트가 표시됩니다.

  4. 어노테이션 작성을 클릭하여 작업할 어노테이션 세트를 여십시오. 어노테이션 세트의 문서가 표시됩니다.

  5. 어노테이션을 작성할 문서를 여십시오. 기본적으로, 문서는 엔티티 멘션의 어노테이션을 작성할 때 사용하는 모드인 멘션 모드에서 열립니다.

  6. 엔티티 멘션의 어노테이션 작성을 시작하십시오.

    1. 유형 시스템의 특정 엔티티 유형에 대한 멘션으로 인식한 텍스트 내의 단어를 클릭하십시오. 둘 이상의 단어로 구성된 엔티티 멘션의 경우에는 다른 단어를 클릭하거나 선택 상자 모서리를 끌어 다중 단어 또는 복합 단어를 선택하십시오.

    2. 오른쪽 분할창에서 적용할 엔티티 유형을 선택하거나, 엔티티 유형에 대한 키보드 단축키를 입력하십시오.

      이전에 어노테이션 가이드라인이 작업공간에 연결되어 있었으며 적용할 어노테이션을 선택하는 데 도움이 필요한 경우에는 가이드라인 보기를 클릭하십시오. 가이드라인이 호스팅되는 사이트에 설정된 액세스 권한에 따라, 가이드라인을 연 후 이를 업데이트(예: 설명 및 예 추가)할 수도 있습니다.

    3. 겹치는 멘션을 작성하지 마십시오. 그러나 유효한 겹치는 멘션이 필요한 경우에는 대체를 클릭하여 더 쉽게 이를 추가하십시오. 하나의 엔티티 멘션에 둘 이상의 레이블을 적용하면 겹침이 발생합니다. 다음 제안사항을 검토하십시오.

      • 단지 Saharan 또는 Sub가 아닌 단일 멘션으로 Sub-Saharan의 어노테이션을 작성하십시오.
      • PERSONJFK International Airport*의 JFK 참조에 대해 겹치는 * 어노테이션을 작성하지 마십시오. 전체 JFK International Airport 멘션을 FACILITY로서만 레이블 지정해야 합니다.
      • 텍스트 CEOs의 경우, PERSONCEO*의 어노테이션 및 PEOPLECEOs의 * 어노테이션을 작성하지 마십시오. CEOsPEOPLE 엔티티 유형으로만 어노테이션 작성하십시오.

      일반적으로 겹치는 멘션이 너무 많은 경우는 어노테이션 가이드라인이 모호하며 소스 데이터의 복합 단어를 처리하는 방법에 대해 더 나은 예를 제공할 수 있도록 개선해야 함을 의미합니다.

    4. 방금 추가한 어노테이션을 제거하려면 Ctrl+Z를 눌러서 조치를 실행 취소하십시오. 엔티티 멘션을 나중에 제거하려는 경우에는 멘션을 마우스 왼쪽 단추로 클릭하고 Delete 키를 누르거나, 세부사항 보기를 클릭한 후에 멘션에 지정된 엔티티 유형 옆의 X를 클릭할 수 있습니다.

  7. 유형 시스템에 따라 엔티티 역할, 하위 유형, 멘션 클래스 또는 유형을 지정하는 것과 같이 엔티티 멘션의 속성을 구성할 수도 있습니다. 이러한 경우에는 멘션을 선택하고 속성 보기를 클릭하십시오.

  8. 언제든지 작업을 저장하려면 저장을 클릭하십시오.

다음에 수행할 작업

모든 엔티티 멘션, 관계 멘션 및 상호 참조에 적절하게 어노테이션을 작성한 후에는 문서 상태를 진행 중에서 완료됨으로 변경하고 저장을 클릭한 후 문서를 닫으십시오.

모든 문서에 어노테이션을 작성하고 문서를 완료됨으로 표시하면 어노테이션 세트의 상태가 제출됨으로 변경됩니다. 이러한 방법으로 프로젝트 관리자는 어노테이터 간 일치에 대해 문서를 평가하고 문서를 거부 또는 승인하며 이를 기준 실제값으로 승격하는 작업을 시작할 수 있음을 알게 됩니다.

반복 멘션에 어노테이션 작성

선택적으로 용어 색인 도구를 사용하여 특정 멘션의 여러 발생을 한 번에 레이블 지정할 수 있습니다. 이 도구는 문서 및 어노테이션 세트 전체에서 동일한 텍스트를 동일한 엔티티 유형으로 어노테이션 작성할 수 있게 해 줍니다. 이 도구를 사용하면 여러 문서 간에 어노테이션 일관성을 유지하는 데 도움이 됩니다. 예를 들면, 사용자는 멘션 모드에서 암호화 멘션의 각 발생을 개별적으로 레이블 지정하거나 용어 색인 도구를 사용하여 암호화 멘션의 모든 발생을 레이블 지정할 수 있습니다. 두 방법 모두 모델은 사용자가 멘션에 지정하는 엔티티 유형으로부터 학습을 수행합니다.

이 태스크에 대한 정보

용어 색인 도구는 선택사항이지만, 개별 문서 내의 멘션에 어노테이션을 작성하기 전에 용어 색인 도구를 사용하여 하나의 문서 또는 여러 문서 내의 멘션에 어노테이션을 작성하는 것이 좋습니다. 용어 색인 도구를 사용하여 멘션에 엔티티 유형을 적용하면 시스템이 모든 일치하는 멘션에 엔티티 유형을 적용하며 일치하는 멘션에 지정되어 있던 기존 엔티티 유형을 대체합니다. 충돌을 방지하기 위해, 용어 색인 도구가 새 엔티티 유형을 적용할 때는 기존 엔티티 유형에서 속성(역할 또는 하위 유형 등)이 제거됩니다.

프로시저

반복 멘션에 어노테이션을 작성하려면 다음 작업을 수행하십시오.

  1. 사람 어노테이터(또는 어노테이션을 작성할 문서가 지정된 관리자나 프로젝트 관리자)로 로그인하십시오. 사용자에게 지정된 태스크를 포함하는 작업공간이 표시됩니다.
  2. 작업공간을 열고 기계 학습 모델 > 어노테이션을 클릭하십시오. 어노테이션 작성 태스크 탭을 클릭하십시오. 사용자에게 지정된 어노테이션 작성 태스크가 표시됩니다.
  3. 작업할 어노테이션 작성 태스크를 여십시오. 사용자에게 지정된 어노테이션 세트가 표시됩니다.
  4. 어노테이션 작성을 클릭하여 작업할 어노테이션 세트를 여십시오. 어노테이션 세트의 문서가 표시됩니다.
  5. 어노테이션을 작성할 문서를 여십시오. 기본적으로, 문서는 엔티티 멘션의 어노테이션을 작성할 때 사용하는 모드인 멘션 모드에서 열립니다.
  6. 아직 어노테이션을 추가하지 않은 경우에는 하나 이상의 어노테이션을 추가하십시오. 유형 시스템에 있는 엔티티 유형의 멘션을 나타내는 단어 또는 단어 구문을 선택하고 적절한 유형을 지정하십시오. 저장을 클릭하여 어노테이션을 저장하십시오.
  7. 어노테이션을 작성할, 반복 텍스트의 한 발생을 선택한 후 용어 색인을 클릭하십시오.
  8. 선택한 엔티티 유형을 적용할 문서를 선택하십시오. 사용자는 자신이 어노테이션 작성하도록 지정된 모든 문서, 어노테이션 작성을 시작한 모든 문서 또는 어노테이션 작성을 아직 시작하지 않은 모든 문서에 어노테이션을 작성할 수 있습니다.
  9. 미리보기를 클릭하여 추가되는 어노테이션을 보십시오.

어노테이션을 더 큰 컨텍스트에서 보려면 아이콘을 클릭하여 문서 컨텐츠를 미리 보거나 문서를 새 창에서 여십시오.

  1. 선택한 엔티티 유형을 선택한 문서의 멘션에 적용하려면 적용 및 검토를 클릭하십시오. 이 시점에서는 아직 추가될 어노테이션을 검토할 수 있습니다. 특정 컨텍스트에서 어노테이션이 부정확한 경우에는 편집 아이콘을 클릭하여 해당 발생을 제거한 후 해당 멘션에 대한 엔티티 유형 지정을 제거할 수 있습니다.
  2. 어노테이션 목록이 만족스러우면 기준 실제값 편집기로 되돌아가기를 클릭하십시오.

결과

문서 내의 멘션에 어노테이션이 작성됩니다. 용어 색인을 통해 추가한 멘션 세트를 한 번에 제거하는 방법은 없습니다. 사용자는 각 멘션을 한 번에 하나씩 제거해야 합니다.

멘션을 상호 참조로 어노테이션 작성

멘션을 동일한 엔티티에 대한 상호 참조로 어노테이션 작성하려는 경우 사람 어노테이터는 동일한 항목을 가리키는 특정 멘션의 모든 발생을 선택합니다. 상호 참조는 미국의 주와 해당 약어, 회사 이름과 해당 약어, 사람 이름과 그 사람을 가리키는 대명사와 같이 다양한 방식으로 언급된 엔티티를 동일한 엔티티로 연관시켜야 함을 모델이 인식하도록 하는 데 도움을 줍니다.

시작하기 전에

상호 참조를 식별하려면 먼저 문서 내의 멘션에 어노테이션을 작성해야 합니다.

이 태스크에 대한 정보

멘션을 상호 참조로 어노테이션 작성하면 시스템이 상호 참조 체인을 작성합니다. 이 체인은 특정 컨텍스트의 모든 멘션을 보고 모든 발생이 동일한 엔티티에 속하는지 확인하는 수단을 제공합니다. 예를 들어 "Barack", "Michelle", "he" 및 "she"는 모두 동일한 엔티티 유형 PERSON이지만, 여기서 "Barack"과 "he"는 하나의 엔티티이며 "Michelle"과 "she"는 또 하나의 엔티티입니다. 이 예에서는 두 개의 상호 참조 체인을 작성합니다.

상호 참조 체인을 작성할 때는 동일한 엔티티 유형으로 표시된 멘션을 선택해야 합니다. 그러나 가끔은 다른 유형의 멘션을 동일한 상호 참조 체인에 포함시키려는 경우가 있습니다. 이를 수행하려면 여러 체인을 작성한 후 병합해야 합니다. 예를 들면, 사람들이 텍스트에서 동일한 단어를 반복하지 않기 위해 점차 약칭을 사용하는 경우를 생각해 보십시오. 교통 사고 보고서에서 차량에 대한 첫 번째 언급은 "2004 Honda Accord Sedan"과 같을 수 있습니다. 이후 작성자는 이 차량을 "Accord", 또는 단순히 "차량"으로 언급할 수도 있습니다. 유형 시스템이 차량 제조업체, 모델 및 유형에 대한 항목을 포함하는 경우에는 엔티티 유형당 여러 상호 참조를 작성한 후 이를 병합하여 통합된 체인을 작성할 수 있습니다. 병합된 체인은 이러한 모든 멘션이 동일한 항목을 가리킴을 인식하도록 기계 학습 모델을 훈련시키는 데 도움을 줍니다.

서로 다른 엔티티 유형의 멘션을 결합하는 또 다른 방법은 한 엔티티 유형의 멘션으로 체인을 작성하는 것입니다. 그 후 다른 엔티티 유형의 멘션을 클릭하고 작성한 체인을 클릭하여 해당 체인에 멘션을 추가할 수 있습니다.

어노테이션 가이드라인에 따라, 여러 동사 멘션이 동일한 조치 인스턴스를 가리키는 경우에는 명사뿐만 아니라 동사의 상호 참조 체인도 작성할 수 있습니다. 예를 들어, 동사 "encrypts"의 두 멘션이 동일한 암호화 발생을 가리키는 경우에는 이러한 멘션을 상호 참조할 수 있습니다. 그러나 "encrypts"에 대한 한 쪽의 언급이 일반적인 언급이거나, 두 발생이 서로 다른 두 암호화 조치를 가리키는 경우에는 이들을 상호 참조하지 않습니다. 서로 다른 두 동사가 동일한 조치 발생을 가리키는 경우에는 멘션을 상호 참조할 수 있습니다. 예를 들어, "그는 문서를 암호화했고 그 처리 후에 그는 파일을 보냈습니다... "에서 "암호화"와 "처리"라는 언급은 동일한 작업 인스턴스를 참조하기 때문에 상호 참조될 수 있습니다.

가장 중요한 것은 일관성입니다. 상호 참조의 어노테이션을 어떻게 작성할지 결정하고, 어노테이션 가이드라인에 예를 포함하는 규칙을 명확하게 지정하십시오.

프로시저

멘션을 상호 참조로 어노테이션 작성하려면 다음 작업을 수행하십시오.

  1. 사람 어노테이터(또는 어노테이션을 작성할 문서가 지정된 관리자나 프로젝트 관리자)로 로그인하십시오. 사용자에게 지정된 태스크를 포함하는 작업공간이 표시됩니다.

  2. 작업공간을 열고 기계 학습 모델 > 어노테이션을 클릭하십시오. 어노테이션 작성 태스크 탭을 클릭하십시오. 사용자에게 지정된 어노테이션 작성 태스크가 표시됩니다.

  3. 작업할 어노테이션 작성 태스크를 여십시오. 사용자에게 지정된 어노테이션 세트가 표시됩니다.

  4. 어노테이션 작성을 클릭하여 작업할 어노테이션 세트를 여십시오. 어노테이션 세트의 문서가 표시됩니다.

  5. 어노테이션을 작성할 문서를 여십시오. 기본적으로, 문서는 엔티티 멘션의 어노테이션을 작성할 때 사용하는 모드인 멘션 모드에서 열립니다.

  6. 상호 참조를 클릭하십시오.

  7. 상호 참조 체인을 작성하십시오.

    1. 문서 전체를 탐색하면서 동일한 항목을 의미하며 동일한 엔티티 유형으로 레이블 지정된 각 멘션을 클릭하십시오. 예를 들어, IBM, International Business MachinesIBM Corp.의 각 발생을 클릭하십시오. 여기서는 이러한 모든 멘션의 엔티티 유형이 ORGANIZATION이라고 가정합니다.
    2. 체인에 추가할 마지막 멘션을 두 번 클릭하십시오. 측면 패널에 상호 참조 체인이 작성됩니다. 체인의 이름은 선택한 첫 번째 멘션과 일치합니다.
    3. 컨텍스트 내에서 검토하기 위해 체인의 모든 멘션을 강조표시하려면 측면 분할창에서 체인의 이름 위로 마우스 커서를 이동하십시오.
  8. 단일 멘션 목록는 어노테이션이 작성되었으나 체인에 추가되지 않은 문서 내의 용어를 표시합니다. 특정 체인에 속하는 멘션을 목록에서 발견하는 경우에는 여기서 이를 체인에 추가할 수 있습니다.

    1. 측면 패널의 단일 멘션 목록에서 멘션을 클릭하십시오.
    2. 멘션 설명 아래의 드롭 다운 목록에서 멘션을 추가할 체인을 나타내는 숫자를 선택하십시오.
    3. 병합을 클릭하여 멘션을 체인에 추가한 후 확인을 클릭하십시오.

    멘션이 단일 멘션 목록에서 제거되며 현재 소속된 체인의 번호가 문서의 멘션 아래에 표시됩니다.

  9. 다음 방법을 사용하여 작업을 실행 취소할 수 있습니다.

    • 방금 추가한 상호 참조 체인을 제거하려면 Ctrl+Z를 눌러서 조치를 실행 취소하십시오.
    • 나중에 상호 참조 체인을 제거하려면 상호 참조 페인 측면 패널에서 제거할 체인 옆의 X를 클릭하십시오.
    • 체인에서 하나의 멘션을 제거하려는 경우에는 상호 참조 ID를 클릭하여 체인 내의 멘션 목록을 표시하는 창을 연 후 제거할 멘션 옆에 있는 X를 클릭하십시오.
  10. 언제든지 작업을 저장하려면 저장을 클릭하십시오.

다음에 수행할 작업

모든 엔티티 멘션, 관계 멘션 및 상호 참조에 적절하게 어노테이션을 작성한 후에는 문서 상태를 진행 중에서 완료됨으로 변경하고 저장을 클릭한 후 문서를 닫으십시오.

모든 문서에 어노테이션을 작성하고 문서를 완료됨으로 표시하면 어노테이션 세트의 상태가 제출됨으로 변경됩니다. 해당 상태는 프로젝트 관리자가 어노테이터 간 일치에 대해 문서를 평가하고 이를 거부 또는 승인하며 이를 기준 실제값으로 승격하는 작업을 시작할 수 있음을 아는 방법입니다.

관계에 어노테이션 작성

관계 멘션에 어노테이션을 작성하는 경우, 사람 어노테이터는 문장에 있는 두 엔티티 멘션 간의 관계에 대한 텍스트 증거를 찾은 후 관계 유형을 가장 적절히 설명하는 레이블을 적용합니다. 적용할 수 있는 레이블은 작업공간의 유형 시스템에 정의된 관계 유형입니다.

시작하기 전에

엔티티 멘션 간의 관계 유형을 정의하려면 먼저 문서 내의 엔티티 멘션에 어노테이션을 작성해야 합니다.

이 태스크에 대한 정보

관계 멘션은 텍스트가 두 엔티티 멘션 간의 관계를 명시적으로 나타내는 경우에만 정의할 수 있습니다. 명시적 텍스트 증거에는 소유격, 주어-동사-목적어 구조 또는 동격 등이 포함됩니다. 예를 들어, 다음 문장에서 ownedBydog 간에 owner 관계 멘션을 추가하는 것은 올바르지 않습니다.

NOT VALID: The dog got a treat from its owner.

유효한 관계는 its과(와) owner사이에 있습니다. 이 부분은 텍스트가 개와 해당 소유자 간의 관계를 명시적으로 정의하는 문장의 일부이기 때문입니다. Owner은(는) 홈 소유자이거나 다른 개의 소유자일 수 있지만, 이 텍스트는 문장의 시작 부분에 언급된 동일한 개가 이 사용자가 소유하고 있음을 분명히 합니다.

VALID: The dog got a treat from its owner.
                                |ownedBy^

하나의 문장에 두 엔티티, 그리고 이들 간의 관계를 정의하는 텍스트가 모두 있어야 한다는 요구사항이 엄격해 보일 수도 있습니다. 그러나 위 예와 같이, 사용자는 문서 내의 상호 참조를 동시에 식별하는 한 대명사와 같이 더 비공식적인 엔티티 멘션 역할을 수행하는 단어를 포함하는 문장의 관계 멘션을 식별할 수 있습니다. 예를 들어, Mary is a scientist. She works for IBM. 의 두 번째 문장은 Mary와 IBM간의 employedBy 관계에 대한 유효한 텍스트 증거를 포함합니다. 상호 참조 ShePERSON 엔티티 유형 Mary에 대한 참조로 이해됩니다. 이는 MaryShe 간의 상호 참조에 대한 식별인 동시에 SheIBM 간의 관계 멘션에 대한 식별이며, 이들은 함께 이 관계 전체를 나타냅니다. 이 관계 멘션에 어노테이션을 작성하는 올바른 방법은 다음과 같습니다.

Mary [#1]는 과학자입니다. 그녀는[#1]는 IBM에서 일합니다.
                         |----employedBy----^

여기서 아래 첨자 [#1]은 MaryShe이(가) 문서의 첫 번째 상호 간섭 체인의 멤버임을 표시합니다.

프로시저

문서 내 엔티티 멘션 간의 관계 멘션에 어노테이션을 작성하려면 다음 작업을 수행하십시오.

  1. 사람 어노테이터(또는 어노테이션을 작성할 문서가 지정된 관리자나 프로젝트 관리자)로 로그인하십시오. 사용자에게 지정된 태스크를 포함하는 작업공간이 표시됩니다.

  2. 작업공간을 열고 기계 학습 모델 > 어노테이션을 클릭하십시오. 어노테이션 작성 태스크 탭을 클릭하십시오. 사용자에게 지정된 어노테이션 작성 태스크가 표시됩니다.

  3. 작업할 어노테이션 작성 태스크를 여십시오. 사용자에게 지정된 어노테이션 세트가 표시됩니다.

  4. 어노테이션 작성을 클릭하여 작업할 어노테이션 세트를 여십시오. 어노테이션 세트의 문서가 표시됩니다.

  5. 어노테이션을 작성할 문서를 여십시오. 기본적으로, 문서는 엔티티 멘션의 어노테이션을 작성할 때 사용하는 모드인 멘션 모드에서 열립니다.

  6. 관계를 클릭하십시오.

  7. 관계에 어노테이션을 작성하려면 다음 작업을 수행하십시오.

    1. 텍스트의 엔티티 멘션을 클릭한 후 두 번째 엔티티 멘션을 클릭하십시오.

    2. 오른쪽 분할창에서 적용할 관계 유형을 선택하거나, 관계 유형에 대한 키보드 단축키를 입력하십시오. 사용 가능한 관계 유형의 목록은 선택한 첫 번째 엔티티 멘션에 의해 제한되며, 두 번째 엔티티 멘션에 의해 추가로 제한됩니다. 일부 경우에는 하나의 관계 유형만 남지만, 사용자는 여전히 적용할 관계 유형을 명시적으로 선택해야 합니다.

      이전에 어노테이션 가이드라인이 작업공간에 연결되어 있었으며 적용할 어노테이션을 선택하는 데 도움이 필요한 경우에는 가이드라인 보기를 클릭하십시오. 가이드라인이 호스팅되는 사이트에 설정된 액세스 권한에 따라, 가이드라인을 연 후 이를 업데이트(예: 설명 및 예 추가)할 수도 있습니다.

  8. 방금 추가한 관계 멘션을 제거하려면 Ctrl+Z를 눌러서 조치를 실행 취소하십시오. 관계 멘션을 나중에 제거하려는 경우에는 관계 멘션을 마우스 왼쪽 단추로 클릭한 후 삭제 키를 누르거나, 관계 유형 옆에 있는 X를 클릭할 수 있습니다.

  9. 언제든지 작업을 저장하려면 저장을 클릭하십시오.

다음에 수행할 작업

모든 엔티티 멘션, 관계 멘션 및 상호 참조에 적절하게 어노테이션을 작성한 후에는 문서 상태를 진행 중에서 완료됨으로 변경하고 저장을 클릭한 후 문서를 닫으십시오.

모든 문서에 어노테이션을 작성하고 문서를 완료됨으로 표시하면 어노테이션 세트의 상태가 제출됨으로 변경됩니다. 이렇게 하면 프로젝트 관리자는 어노테이터 간 일치에 대해 문서를 평가하고, 문서를 거부하거나 승인하여 기준 실제값으로 승격하기 위해 작업을 시작할 수 있음을 알게 됩니다.

관련 정보