문서 분류

문서 분류자 기계 학습 모델은 문서를 분석하고 사용자가 정의하는 레이블 세트의 적절한 레이블로 문서에 태그를 지정합니다.

문서 분류는 많은 문서를 프로그래밍 방식으로 그룹으로 정렬하려는 경우에 유용합니다. 예를 들어, 판매하는 상품에 대한 고객 설명을 포함하는 콜렉션이 있을 수 있습니다. 피드백을 자동으로 클래스로 정렬할 수 있는 경우 고객이 언급하는 긴급한 문제를 분리하고 먼저 해결할 수 있습니다. 이전 피드백을 기반으로 다음 레이블과 같은 클래스를 정의할 수 있습니다.

  • 올바르게 작동하지 않음
  • 광고하지 않은 기능
  • 사용하기 어려움
  • 누락된 파트
  • 배송된 부품이 어셈블리 지시사항의 부품 목록과 일치하지 않습니다.

문서 분류자를 작성하기 위해 자연어로 지정된 고객 피드백 지점을 가장 잘 캡처하는 클래스를 인식할 수 있는 기계 학습 모델을 빌드합니다. 비즈니스에 적합한 실제 시나리오를 나타내는 클래스 레이블과 쌍을 이룹니다.

문서 분류자와 텍스트 분류자의 차이점은 무엇입니까?
문서 분류자는 본문 텍스트 필드에서 추출된 단어 및 구문을 기반으로 문서를 분류할 수 있습니다. 여기에는 해당 품사의 정보와 본문 텍스트에 적용되는 기타 인리치먼트가 고려됩니다. 본문이 아닌 다른 필드의 정보도 사용됩니다. 텍스트 분류자는 본문 텍스트에서 추출된 단어 및 구문을 기반으로 문서를 분류할 수 있으며, 여기에는 품사 정보가 고려됩니다. 텍스트 분류자 작성 방법에 대한 자세한 정보는 분류자 를 참조하십시오.

시작하기 전에

문서 분류자 모델을 훈련시키려면 적절하게 레이블이 지정된 샘플 문서를 제공해야 합니다. 다음 파일을 준비하십시오.

훈련 데이터

필수입니다. 문서 분류자 기계 학습 모델을 훈련시키는 데 사용되는 CSV 파일입니다. 파일에는 열당 키 데이터 점이 포함될 수 있습니다. 데이터 점은 다양할 수 있지만 파일에는 다음 열이 포함되어야 합니다.

  • 분류하거나 레이블을 지정할 자연어 텍스트입니다.
  • 문서 텍스트에 표시되는 아이디어를 분류하는 레이블 또는 클래스 이름입니다. 텍스트 샘플에 둘 이상의 레이블을 적용할 수 있습니다. 여러 개의 레이블 값을 세미콜론으로 구분하십시오.
테스트 데이터

선택사항. 훈련된 후 문서 분류자 기계 학습 모델을 테스트하는 데 사용되는 CSV 파일입니다. 테스트를 위해 별도의 파일을 지정하지 않으면 훈련 데이터 컨텐츠의 서브세트가 테스트 용도로 사용됩니다.

대상 데이터

필수입니다. 분류할 데이터가 있는 CSV 파일입니다.

모든 CSV 파일 (훈련, 테스트 및 대상) 의 열 이름은 동일해야 합니다. 열의 데이터에는 동일한 데이터 유형 (예: 문자열, 숫자 등) 이 있어야 합니다.

컨텐츠 마이닝 프로젝트를 작성할 때 업로드한 CSV 파일을 사용하거나 새 콜렉션을 작성할 수 있습니다.

자세한 정보는 다음 주제를 참조하십시오.

문서 분류자 훈련 데이터 샘플

다음 표는 문서 분류자를 훈련시키는 데 사용되는 CSV 파일에 저장될 수 있는 컨텐츠 유형의 예를 보여줍니다.

CSV 파일용 샘플 데이터
청구 ID 날짜 제품_라인 제품 클라이언트 세그먼트 클라이언트 위치 클라이언트 연령 피드백 레이블
0 2016/1/1 레몬 차 구성원 아님 맨해튼 20 빨대가 주스팩에서 벗겨졌다. 패키지 컨테이너
1 2016/1/2 아이스크림 바닐라 아이스크림 실버 멤버 퀸즈 20 아이들을 위해 아이스크림을 좀 샀지만, 컵 안에 실 같은 것이 있었어요. 오염 변조

두 개의 필수 필드가 샘플에 있습니다. 필수 필드의 이름은 다음과 같습니다.

  • Feedback: 레이블을 지정할 자연어 텍스트입니다.
  • Label: 피드백에 적용할 레이블입니다.

콘텐츠 마이닝 애플리케이션 열기

이를 수행하지 않은 경우 프로젝트를 작성하고 콜렉션을 추가하십시오. 프로젝트 및 콜렉션을 이미 작성한 경우 이 프로시저를 건너뛰고 문서 분류자를 작성 할 수 있습니다.

  1. Discovery에서 컨텐츠 마이닝 프로젝트를 작성하십시오.

  2. 콜렉션을 작성하기 위해 데이터를 업로드하도록 선택하십시오. 콜렉션의 이름을 지정하고 다음을 클릭하십시오.

  3. 훈련 데이터가 포함된 CSV 파일을 업로드하세요.

    훈련 데이터 파일은 최소한 다음 정보를 포함해야 합니다.

    • 분류하려는 샘플 텍스트를 포함하는 열입니다. 예를 들어, 샘플 텍스트는 제품 검토일 수 있습니다.
    • 샘플 텍스트에 지정된 클래스 또는 범주 레이블을 포함하는 열입니다.
  4. 수집 처리가 완료된 후, 애플리케이션 실행을 클릭하여 콘텐츠 마이닝 애플리케이션을 엽니다.

    콜렉션에 대한 패싯 세부사항이 표시됩니다.

문서 분류자 작성

문서 분류기를 생성하려면 다음 단계를 완료하십시오

  1. 컨텐츠 마이닝 애플리케이션의 이동 경로에서 콜렉션 링크를 클릭하여 콜렉션 작성 페이지를 여십시오.

    인덱스 작성 상태가 표시됩니다. 이 프로시저를 계속하기 전에 콜렉션이 완전히 색인화될 때까지 기다리십시오.

  2. 클래스류를 작성하려면 콜렉션을 클릭한 후 목록에서 클래스류 를 선택하십시오.

    caption-side=bottom"
    컬렉션
    표시합니다

  3. 분류자 작성을 클릭하십시오.

  4. 클래스류의 이름을 지정하십시오.

    나중에 모델을 인리치먼트로 배치할 때 인리치먼트에 {classifier name} - {model name}형식의 이름이 제공됩니다. 예를 들어, 클래스류의 이름이 Product reviews 이고 모델의 이름이 v0.1 인 경우 인리치먼트 이름은 Product reviews - v0.1 입니다.

    선택적으로 설명을 추가하고 언어 필드에서 선택하여 훈련 데이터의 언어를 식별하십시오.

  5. 다음을 클릭하십시오.

  6. 훈련 데이터 페이지의 목록에서 이전에 업로드한 파일을 선택한 후 다음을 클릭하십시오.

    또는 훈련 데이터를 포함하는 CSV 파일을 업로드할 수 있습니다.

    필드 페이지가 표시됩니다. 추가한 파일에서 생성된 필드에 대한 세부사항을 표시합니다. 일반적으로 CSV 파일의 각 열은 필드로 변환되며 열 헤더에서 복사되는 이름이 지정됩니다.

  7. 문서 분류자가 학습할 데이터 세트에서 제외할 메타데이터 필드를 선택 취소하고 다음을 클릭하십시오.

    포함하는 필드는 분류에서 추가 기능으로 사용됩니다. 모든 필드가 기본적으로 선택되어 있습니다. 모든 필드를 검토하기 위해 수평으로 스크롤해야 할 수 있습니다.

  8. 분류자 페이지에서 기계 학습 훈련 및 예측에 사용할 필드를 지정하십시오.

    응답 필드
    분류 레이블이 있는 훈련 데이터 파일에서 필드를 선택하십시오. 이전 예제에서 Label 필드를 선택하는 것이 가장 좋습니다.
    예측 필드
    예측 클래스 값에 대해 생성되는 패싯의 이름입니다. 기본적으로 패싯 이름의 구문은 <Answer field value>_predicted 입니다. 예: Label_predicted.
    데이터 세트 테스트
    분류자 모델을 테스트하는 데 사용할 데이터 세트를 지정합니다. 기본적으로 업로드하고 구성한 훈련 데이터 CSV 파일은 각각 훈련, 유효성 검증 및 테스트에 사용되는 세 개의 데이터 세트로 분할됩니다. 그러나 선택적으로 모델 테스트에 사용할 별도의 데이터 세트를 지정할 수 있습니다.
    연합 모델 훈련
    데이터 세트에 있는 특정 필드의 값을 기반으로 둘 이상의 모델을 작성합니다. 예를 들어, 문서에 Product 필드가 있는 경우 필드에 지정된 각 제품 이름 값에 대해 별도의 클래스류 모델을 작성하도록 클래스류를 구성할 수 있습니다. 기본적으로 분류자는 하나의 기계 학습 분류자 모델을 작성합니다.

    분류할 텍스트를 포함하는 필드를 지정할 필요가 없습니다. 시스템이 이 필드를 자동으로 발견합니다. 분석 가능한 텍스트가 추출되는 필드를 확인하고 이를 변경하거나 다른 필드의 색인 유형을 변경하여 기능을 보강할 수 있습니다. 자세한 정보는 텍스트 필드 식별 을 참조하십시오.

    다음 을 클릭하십시오.

  9. 훈련 데이터의 텍스트에 인리치먼트를 적용하려면 인리치먼트를 적용할 대상 필드 목록에서 하나 이상의 필드를 선택하십시오.

    일반적으로 분류하려는 텍스트의 본문을 포함하는 필드를 선택하려고 합니다. 이전 예제에서 Feedback 필드를 선택하는 것이 가장 좋습니다.

    그런 다음 대상 필드에서 텍스트를 강화하기 위해 적용할 어노테이터를 선택하고 다음을 클릭하십시오.

    품사 어노테이터는 기본적으로 선택되어 있습니다.

  10. 확인 페이지에서 분류자 구성 설정을 검토하십시오. 변경하려면 뒤로 단추를 사용하십시오. 그렇지 않으면 저장을 클릭하십시오.

    개요 페이지가 표시됩니다.

  11. 새 모델 을 클릭하여 기계 학습 모델을 작성하고 훈련시키십시오.

  12. 선택적으로 모델의 이름을 변경하고 설명을 추가할 수 있습니다.

    다음 데이터 세트에 대해 지정된 기본 비율 값을 변경할 수 있습니다.

    • 훈련 데이터 세트: 훈련 모델의 가중치를 업데이트합니다.
    • 유효성 검증 세트: 훈련 중 훈련 모델의 정확도를 모니터합니다. 정확도 결과는 훈련 손실 그래프를 그리는 데 사용됩니다.
    • 테스트 데이터 세트: 훈련된 모델의 점수를 계산합니다.
  13. 작성을 클릭하십시오.

    모델 훈련이 완료되는 데 몇 분 정도 소요될 수 있습니다.

문서 분류자 모델 배치

모델이 훈련된 후 모델을 인리치먼트로 배치하십시오.

  1. 조치 열에서 오버플로우 메뉴 아이콘을 클릭한 후 모델 배치를 클릭하십시오. 이름 및 기타 세부사항을 지정한 후 배치를 클릭하십시오.

  2. 다음 중 하나를 수행하십시오.

    • 컨텐츠 마이닝 프로젝트의 콜렉션에 문서 분류자를 적용하려면 콜렉션 강화 를 참조하십시오.

    • 문서 분류자를 다른 프로젝트의 콜렉션에 적용하려면 다음 단계를 완료하십시오.

      1. Discovery에서 분류할 문서가 있는 콜렉션을 작성하거나 여십시오.

        인리치먼트를 적용하는 콜렉션의 데이터에는 모델을 훈련하는 데 사용한 콜렉션과 동일한 필드가 있어야 합니다.

      2. 강화 탭의 이름 열에서 분류자를 찾으십시오. 강화할 필드 필드에서 모델을 훈련하는 데 사용된 것과 동일한 텍스트 필드를 선택하십시오. (이 필드는 시스템에 의해 판별되며 분석 가능한 텍스트 컨텐츠 필드로 인덱싱됩니다. 자세한 정보는 텍스트 필드 식별 을 참조하십시오.)

      3. 변경사항 적용 및 재처리를 클릭하십시오.

분류 결과

인리치먼트가 콜렉션에 적용된 후에는 예측 클래스를 찾는 데 사용할 수 있는 패싯이 생성됩니다. 이 예제에서 예측 필드의 이름은 label_answer_predicted 입니다.

문서 분류기 보강이
적용된 후 생성된 패싯을 표시합니다*라벨_답변_예측된 패싯이

분류별로 문서를 필터링하고 문서의 서브세트를 분석하려면 생성된 패싯을 사용하십시오. 이렇게 하면 패턴을 찾고 다른 인사이트를 발견하는 데 도움이 됩니다. 이러한 대상 문서를 내보내서 팀 구성원과 공유하거나 추가로 분석할 수 있습니다. 자세한 정보는 데이터 내보내기 를 참조하십시오.

문서 분류자는 문서를 분류할 때 document_level_enrichment.classes.class_name 필드에 분류를 저장합니다.

예를 들어, 다음 JSON 발췌 부분은 package_container 클래스로 분류된 문서를 표시합니다.

package_container 클래스로 분류된 문서의 JSON 소스를 표시합니다.
Document classifier enrichment syntax

문서 분류자 한계

서비스 인스턴스당 작성할 수 있는 문서 분류자 및 레이블 수는 Discovery 플랜 유형에 따라 다릅니다.

문서 분류자 계획 한계
한계 구축 프리미엄 Cloud Pak for Data
서비스 인스턴스당 문서 분류자 수 20 20 무제한
레이블된 데이터 행 수 20,000개 이상 20,000개 이상 20,000개 이상
강화 후 훈련 데이터의 최대 크기 (MB) 1,024 1,024 1,024
레이블 수 1,000시간 1,000시간 1,000시간
대상 필드 수 50 50 50