텍스트 분류
문서의 텍스트를 분류할 수 있는 카테고리를 정의하세요.
이 주제에서는 텍스트를 분류하는 방법에 대해 설명합니다. 문서를 분류하려면 콘텐츠 마이닝 애플리케이션을 사용하세요. 더 자세한 정보를 원하시면 분류기 유형을 참고하세요.
텍스트 분류기를 추가하여 컬렉션에 있는 문서의 텍스트를 카테고리로 할당하세요. Discovery는 사용자가 제공한 레이블과 텍스트 예시를 사용하여 컬렉션의 텍스트 카테고리를 예측합니다.
텍스트 분류기를 생성하려면 다음 단계를 완료하십시오
-
예제 텍스트와 해당 카테고리 레이블이 한 줄씩 포함된 CSV 파일을 만듭니다.
CSV 파일은 UTF-8 인코딩 형식이어야 하며 다음 요구 사항을 충족해야 합니다:
-
형식은
text,label이어야 합니다.text는 예제 텍스트이고,label는 카테고리 이름입니다.완전한 문장을 텍스트 항목으로 추가합니다. CSV 파일에 빈 줄을 포함하지 마세요.
labeltext열에 있는 문장에 두 개 이상의 라벨을 적용해야 하는 경우, 더 많은 라벨 열을 추가할 수 있습니다. 예:text,label,label. -
파일에는 헤더가 없는 열이 두 개 이상 있어야 합니다.
-
정의하려는 각 카테고리에 대해 10개 이상의 항목을 추가합니다. 카테고리당 필요한 최소 항목 수는 3개입니다. 각 카테고리에 더 많은 예시를 제공할수록 분류기가 컬렉션에 있는 다른 콘텐츠의 카테고리를 더 잘 예측할 수 있습니다.
다음 예제는
facility_temperature및catering라는 두 개의 카테고리를 정의하는 CSV 파일입니다. 예제 텍스트는 회의 참석자의 피드백으로 구성되어 있습니다.The rooms were too cold.,facility_temperature Breakfast did not include gluten-free options.,catering The rooms were too warm.,facility_temperature I was very comfortable in the session rooms.,facility_temperature The awards dinner was delicious.,catering Coffee ran out during one of the breaks.,catering The temperature was not comfortable.,facility_temperature I was very happy with the selection at lunch.,catering It was nice that you provided tea and coffee. Tea drinkers are often ignored.,catering Can you turn up the air conditioning? I was very warm.,facility_temperature My teeth were chattering because I was so cold.,facility_temperature The speaker left the room to find someone to adjust the temperature.,facility_temperature Would you consider an all-vegan menu next year?,catering I would like lemonade and iced tea to be served during the breaks.,catering The lunch staff was excellent.,catering Appreciated the fresh blueberry muffins at breakfast.,catering The hotel staff adjusted the temperature in my session room as soon as I asked. Excellent service!,facility_temperature Every meal was delicious and there was something for everyone.,catering The seats under the skylights were not comfortable. Too hot.,facility_temperature I was comfortable everywhere in the conference center. I never needed my emergency sweater.,facility_temperature -
-
도메인 개념 가르치기 섹션의 개선 도구 패널에서 텍스트 분류기를 클릭합니다.
-
업로드를 클릭하십시오.
-
분류기의 이름을 지정한 다음 CSV 파일에 사용된 언어를 선택합니다.
-
업로드를 클릭하여 이전에 생성한 CSV 파일을 찾습니다.
-
작성을 클릭하십시오.
사용자가 제공한 학습 데이터를 기반으로 분류자 보강이 생성됩니다.
-
텍스트 분류기 보강 기능을 적용하려는 컬렉션과 필드를 선택한 다음 적용를 클릭합니다.
다음 예는 샘플 CSV 파일을 학습 데이터로 사용하여 생성된 보강이 문서의 텍스트를 분류하는 방법을 보여줍니다. 출력에서 분류기 강화는 문서 텍스트에 facility_temperature 레이블을 적용합니다. label 는 enriched_{field_name} 배열 내 classes 배열에 저장됩니다.
{
"enriched_text": [
{
"classes": [
{
"confidence": 0.999692440032959,
"label": "facility_temperature"
}
]
}
],
"text": [
"I think more attendees would stay awake in the sessions if the rooms were colder."
]
}
분류기 유형
Discovery 사용자 인터페이스에서 추가하는 분류기는 텍스트 분류기입니다. 텍스트 분류기는 품사 정보를 고려하여 본문 텍스트에서 추출한 단어와 구를 기반으로 문서를 분류할 수 있습니다.
배포된 콘텐츠 마이닝 애플리케이션에서만 다른 분류기 유형인 문서 분류기를 만들 수 있습니다. 문서 분류기는 본문 텍스트 필드에서 추출된 단어와 구문을 기반으로 품사 정보 및 본문 텍스트에 적용된 기타 보강 정보를 고려하여 문서를 분류할 수 있습니다. 신체가 아닌 다른 필드의 정보도 사용됩니다.
콘텐츠 마이닝 프로젝트가 아닌 다른 프로젝트 유형의 컬렉션에 문서 분류기를 적용할 수 있습니다. 이렇게 하려면 배포된 콘텐츠 마이닝 애플리케이션에서 분류기를 생성하고 내보내야 합니다. 그런 다음 분류기를 가져와서 컬렉션에 보강 기능으로 적용할 수 있습니다. 자세한 내용은 문서 분류기 만들기 및 적용하기 를 참조하세요.
텍스트 분류기는 품사 강화가 프로젝트에 적용되었는지 여부와 관계없이 품사 정보를 사용합니다.
한 프로젝트에 추가한 텍스트 분류기는 콘텐츠 마이닝 프로젝트를 포함한 다른 프로젝트에서 사용할 수 있습니다.
텍스트 분류기는 신뢰도 점수가 0.5보다 낮은 대상 텍스트 필드를 분류하지 않습니다. 텍스트 분류기에서 사용하는 신뢰도 임계값은 변경할 수 없습니다. 특정 유형의 구절이 분류될 것으로 예상했지만 분류되지 않은 경우, 유사한 특성을 가진 구절을 학습 데이터에 추가하고 다른 분류기를 학습시킬 수 있습니다.
텍스트 분류기 제한
서비스 인스턴스당 만들 수 있는 텍스트 분류기 및 레이블의 수는 Discovery 요금제 유형에 따라 다릅니다.
| 한계 | 추가 | 구축 | 프리미엄 | Cloud Pak for Data |
|---|---|---|---|---|
| 서비스 인스턴스당 텍스트 분류기 수 | 5 | 20 | 20 | 무제한 |
| 레이블이 지정된 데이터 행 수 | 2,000 | 20,000개 이상 | 20,000개 이상 | 20,000개 이상 |
| 강화 후 학습 데이터의 최대 크기(MB) | 그림 16 | 1,024 | 1,024 | 1,024 |
| 레이블 수 | 100년 | 1,000시간 | 1,000시간 | 1,000시간 |