사용자 정의 어노테이터 작성

사전, 정규식 또는 기계 학습 어노테이터를 작성하여 데이터를 분석하는 데 도움이 될 수 있는 새 패싯을 생성할 수 있습니다.

시작하기 전에 다음 데이터를 준비하십시오.

사용자 정의 어노테이터 전제조건 데이터
어노테이터 유형 설명 데이터
사전 정의하거나 업로드하는 사전 항목과 일치하는 용어에 패싯을 지정합니다. 선택적으로 사전 용어의 파일을 업로드할 수 있습니다.
머신 러닝 업로드하는 기계 학습 모델이 인식하는 멘션에 패싯을 지정합니다. 기계 학습 모델의 압축 파일이 필요합니다.
정규식 정의하거나 업로드하는 Java 정규식 패턴과 일치하는 텍스트에 패싯을 지정합니다. 선택적으로 정규식 패턴을 포함하는 JSON 파일을 업로드할 수 있습니다.

맞춤형 주석 기능을 생성하려면 다음 단계를 완료하십시오

  1. 콜렉션의 분석 보기에서 이동 경로의 콜렉션 링크를 클릭하여 컨텐츠 마이닝 애플리케이션의 분석 솔루션에 대한 콜렉션 작성 페이지를 여십시오.

  2. 어노테이터를 작성하려면 콜렉션을 클릭한 후 목록에서 사용자 정의 어노테이터 를 선택하십시오.

    caption-side=bottom"
    컬렉션
    표시합니다

  3. 맞춤형 주석 작성자 만들기를 클릭 합니다.

  4. 주석 작성자를 지정한 다음, 설명을 추가할 수 있습니다.

  5. 어노테이터 유형을 선택한 후 다음을 클릭하십시오.

  6. 화면에 표시되는 지시사항에 따르십시오.

    각 어노테이터 유형을 구성하는 방법에 대한 자세한 정보는 다음 섹션 중 하나를 참조하십시오.

사전 구성

기존 사전을 업로드하여 가져오거나 한 번에 하나씩 용어를 추가하여 사전을 작성할 수 있습니다.

사전을 가져오려면 사전 용어를 CSV 파일에 정의해야 합니다. 각 용어 및 동의어를 별도의 행에 지정하십시오. 다음 구문을 사용하여 각 용어를 지정하십시오.

{term},{synonym},{synonym},...

사전을 추가하려면 다음 단계를 완료하십시오

  1. 다음 중 하나를 수행하십시오.

    • 사전 용어를 가져오려면 다음을 수행하십시오.

      1. 가져오기를 클릭한 후 사전 용어가 있는 파일을 찾아보십시오.
      2. 가져오기를 클릭하십시오.
    • 사전 용어를 정의하려면 다음을 수행하십시오.

      1. 추가 를 클릭하십시오.
      2. 사전 용어를 추가하려면 단어 목록 을 클릭하십시오.
      3. 추가를 클릭한 후 기본 단어 필드에 용어를 추가하고 기타 단어 필드에서 용어에 대해 정의할 동의어를 추가하십시오. 여러 개의 동의어를 쉼표로 구분합니다. 확인을 클릭하십시오.
      4. 이전 단계를 반복하여 더 많은 사전 용어를 추가합니다.
      5. 사전 용어 추가를 완료한 후 기본 설정을 클릭하십시오.
  2. 사전의 이름을 지정하십시오.

  3. 명사가 아닌 품사를 사용하여 용어를 정의하려는 경우 품사를 지정하십시오.

    선택한 언어가 중국어, 일본어, 한국어 또는 히브리어인 경우 품사에 명사만 지정할 수 있습니다.

  4. 케이스 처리 방법을 결정하십시오.

    대소문자가 무시되면 Sat, SATsat 용어가 모두 Sat 사전 용어의 발생으로 레이블 지정됩니다.

    대소문자 구분 안함 선택란을 선택 취소하여 대소문자 구분 사전을 작성하면 대문자 일치가 있는 용어의 표면 양식이 사용됩니다. 주석은 작성된 그대로의 용어 및 문자가 대문자인 용어의 변형에 대해 추가됩니다.

    예를 들어, 사전의 sat 항목은 sat, Sat 또는 SAT 멘션이 텍스트에서 발생할 때 이에 대한 어노테이션을 생성합니다. 사전에 있는 Sat 항목의 경우, SatSAT 의 발생에 대해 어노테이션이 추가되지만 sat 에 대해서는 추가되지 않습니다.

  5. 이 사전에 사용할 패싯 이름을 식별하십시오.

    어노테이터에 대해 지정하는 패싯 이름은 콜렉션 검색 뷰에서 표시되는 패싯 이름입니다.

    패싯 이름에 마침표 (.) 를 포함하여 계층 패싯을 작성할 수 있습니다. 예를 들어, 패싯 경로가 Food.Vegetables 인 사전과 패싯 경로가 Food.FruitsFood.Proteins 인 사전을 하나 작성할 수 있습니다. 기간이 더 많은 패싯 그룹을 더 추가하십시오. 예를 들어, Food.Proteins.NutsFood.Proteins.Meats 를 추가하여 단백질을 더 분류할 수 있습니다.

    Shows how to add a dictionary
    Adding a dictionary

  6. 사용자가 루트 패싯을 필터링할 때 서브패싯에 대해 리턴되는 문서가 포함되도록 하려면 단어 올림을 선택하십시오.

    예를 들어, Food.Vegetables 가 아닌 Food.FruitsFood.Proteins 에 대해 단어 올림 을 사용으로 설정할 수 있습니다. 따라서 사용자가 음식 패싯을 클릭하면 리턴된 문서에는 과일 및 고기 사전에 포함된 용어 (예: 사과쇠고기) 를 언급하는 문서가 포함됩니다.

    식품 패싯을 선택하면 채식주의자 사전에 있는 용어를 제외한 모든 용어가 포함된 문서가 리턴됨을 표시합니다.
    Dictionary enrichment application

    그러나 사용자는 식품 > 야채 패싯을 명시적으로 눌러서 상추와 같은 야채 사전의 용어를 언급하는 문서가 리턴되도록 해야 합니다.

    야채 패싯을 선택하면 야채를 언급하는 문서만 리턴됨을 표시합니다.
    Subfacets

  7. 사전을 더 추가하려면 이전 단계를 반복하십시오.

  8. 저장 을 클릭하십시오.

사용자 정의 어노테이터 페이지에서 비컨텐츠 마이닝 프로젝트를 포함하여 다른 프로젝트에서 작성된 사전을 볼 수 있습니다. 다른 프로젝트 유형의 사전은 인리치먼트 이름을 어노테이터 이름으로 표시합니다. 대소문자 구분 안 함단어 올림 설정은 사용 불가능하며 사전의 이름은 custom dict 입니다.

사전 한계

사전 계획 한계
플랜 서비스 인스턴스당 사전 수 사전당 기본 단어 수 제안을 생성할 수 있는 용어 수
Cloud Pak for Data 무제한 무제한 1,000시간
프리미엄 2억 10,000 1,000시간
구축 2억 10,000 1,000시간

총계에는 이 컨텐츠 마이닝 프로젝트 및 동일한 서비스 인스턴스의 다른 프로젝트에서 작성하는 인리치먼트가 포함됩니다.

기계 학습 구성

기존 기계 학습 모델을 가져올 수 있습니다.

Discovery 를 사용하여 모델을 작성하려면 엔티티 추출기 를 참조하십시오.

모델을 가져오려면 다음 단계를 완료하십시오

  1. 파일 선택을 클릭한 후 기계 학습 모델 파일을 찾아보십시오.

  2. 패싯 경로 필드에서 모델에 사용할 루트 패싯 이름을 지정하십시오.

    어노테이터에 대해 지정하는 패싯 이름은 콜렉션 검색 뷰에서 표시되는 패싯 이름입니다.

  3. 저장 을 클릭하십시오.

기계 학습 모델 한계

ML 모델 계획 한계
플랜 서비스 인스턴스당 mL 모델
Cloud Pak for Data 무제한
프리미엄 1,000만
구축 1,000만

총계에는 이 컨텐츠 마이닝 프로젝트 및 동일한 서비스 인스턴스의 다른 프로젝트에서 작성하는 인리치먼트가 포함됩니다.

정규식 구성

JSON 파일에 업로드하여 기존 패턴을 가져오거나 패턴을 추가할 수 있습니다.

패턴을 추가하려면 다음 단계를 완료하십시오

  1. 정규식 패턴을 새 패턴 필드에 추가한 후 추가를 클릭하십시오.

  2. 패턴의 이름을 지정한 후 이 패턴에 사용할 패싯 이름을 식별하십시오.

    어노테이터에 대해 지정하는 패싯 이름은 콜렉션 검색 뷰에서 표시되는 패싯 이름입니다.

  3. 선택사항: 패싯 값을 지정하십시오. 표에 설명된 옵션에서 값을 지정할 수 있습니다.

    정규식 패싯 값 옵션
    패싯 값 설명
    $0 일치하는 텍스트를 있는 그대로 표시합니다.
    $n 정규식 패턴에 그룹이 포함된 경우 패턴 그룹에서만 일치하는 텍스트를 리턴하도록 그룹 번호를 지정할 수 있습니다. 예를 들어, 정규식이 미국 전화번호 패턴을 정의하는 3개의 그룹 (예: (\d{3})-(\d{3})-(\d{4})) 으로 구성되고 전화번호의 지역 코드 부분만 리턴하려는 경우 $1 를 지정할 수 있습니다. 일치하는 텍스트가 212-555-1234 인 경우 패싯 값이 212 로 표시됩니다. 일치를 리턴하는 것으로 알고 있는 패턴의 패싯 값으로만 그룹을 지정하십시오.
    {prefix-text}:$0 패싯 이름 앞에 하드코딩된 텍스트를 추가합니다. 이 정규식에 의해 생성되는 패싯을 유사하지만 다른 방식으로 생성되는 패싯과 구별하려는 경우 이 옵션을 사용할 수 있습니다. 예를 들어, MyRegex:$0MyRegex:212-555-1234 라는 패싯을 생성합니다.
  4. 저장 을 클릭하십시오.

패턴을 가져오려면 다음 단계를 완료하십시오

  1. JSON 파일에 추가할 패턴을 정의하십시오.

    패턴 정의는 다음 구문을 사용해야 합니다.

    [
      {
        "name": "US Phone number",
        "description": "US mobile phone number",
        "pattern": "(\\d{3})-(\\d{3})-(\\d{4})",
        "facetPath": ".regex.usphonenumber",
        "facetValue": "$0"
      }
    ]
    

    다음 사항을 염두에 두십시오

    • 하나의 패턴만 정의하려는 경우에도 패턴을 배열에 정의해야 합니다.
    • 백슬래시 (\) 문자를 백슬래시로 이스케이프하십시오.
    • 패싯 값 옵션에 대한 자세한 정보는 정규식 패싯 값 옵션 테이블을 참조하십시오.
  2. 가져오기를 클릭한 후 패턴이 정의된 JSON 파일을 선택하십시오.

  3. 저장 을 클릭하십시오.

정규식 한계

정규식 플랜 한계
플랜 서비스 인스턴스당 Regex 인리치먼트 서비스 인스턴스당 Regex 패턴
Cloud Pak for Data 무제한 무제한
프리미엄 100년 50
구축 100년 50

총계에는 이 컨텐츠 마이닝 프로젝트 및 동일한 서비스 인스턴스의 다른 프로젝트에서 작성하는 인리치먼트가 포함됩니다.

어노테이터 적용

어노테이터가 작성된 후에는 이를 콜렉션에 적용해야 합니다.

  1. 컨텐츠 마이닝 애플리케이션의 분석 솔루션에 대한 사용자 정의 어노테이터 작성 페이지에서 사용자 정의 어노테이터를 클릭한 후 목록에서 콜렉션 을 선택하십시오.

  2. 콜렉션의 타일에서 옵션 아이콘을 클릭하고 콜렉션 편집을 선택하십시오.

  3. 보강 탭 을 클릭한 다음, 생성한 주석자를 선택합니다.

    스크롤을 내려야 찾을 수 있을 수도 있습니다.

  4. 저장을 클릭한 다음, 작업을 확인합니다.

재빌드할 인덱스 시간을 제공하십시오.

패싯을 사용하여 문서 필터링

  1. 콜렉션 타일을 클릭하여 데이터 분석 페이지에서 콜렉션을 여십시오.

  2. 다음 중 하나를 수행하십시오.

    • 사용자 정의 패싯은 패싯 뷰에 나열됩니다. 패싯이 표시될 때까지 스크롤하여 계속 로드 를 반복적으로 클릭하십시오.

    • 모든 문서를 리턴하려면 비어 있는 검색을 제출하십시오. 패싯 분석 분할창에서 작성한 패싯을 선택하십시오.

    • 사용자 정의 패싯에 더 빠르게 액세스하려면 사용자 정의 보기에 추가하십시오. 사용자 정의 를 보기로 선택한 후 편집을 클릭하십시오. 보기에 추가할 하나 이상의 패싯을 선택한 후 저장을 클릭하십시오.

      caption-side=bottom"
      사용자 지정 보기*