기본 제공 Watson NLP를 사용하여 공통 용어 찾기
문서에 사전 빌드된 인리치먼트를 추가하여 수상 경력이 있는 Watson NLP (Natural Language Processing) 기능을 활용하십시오.
Watson NLP를 사용하면 콜렉션에서 의미 있는 정보를 식별하고 태그를 지정할 수 있으므로 모든 의미를 이해하고 더 많은 정보를 기반으로 의사결정을 내릴 수 있습니다.
다음 Watson NLP 인리치먼트를 사용할 수 있습니다.
- 엔티티: 컨텐츠에 언급된 사람, 도시 및 조직과 같은 적절한 명사를 인식합니다.
- 키워드: 컨텐츠에서 중요한 용어를 인식합니다.
- Part of Speech: 컨텐츠에서 품사 (예: 명사 및 동사) 를 식별합니다.
- 감성: 컨텐츠의 전체 감성을 이해합니다.
다음 기타 사전 훈련된 인리치먼트는 Discovery에서 사용 가능합니다.
Watson NLP 인리치먼트
예를 들어, 다음 화면 캡처는 엔티티 및 키워드 인리치먼트가 사용으로 설정된 Discovery 콜렉션에 추가된 미국 독립 선언의 대화 내용을 표시합니다. 인리치먼트에서 인식되는 멘션은 문서 텍스트에서 강조표시됩니다.
일부 NLP 인리치먼트는 프로젝트에 자동으로 적용됩니다. 이러한 프로젝트 유형 중 하나를 사용하는 경우에는 직접 적용할 필요가 없습니다.
프로젝트 유형별 기본 인리치먼트
일부 사전 빌드된 인리치먼트는 프로젝트 유형에 따라 프로젝트의 콜렉션에 자동으로 적용됩니다. 다음 표는 각 프로젝트 유형에 적용되는 기본 인리치먼트를 표시합니다.
| 보강 | 문서 검색 | 계약에 대한 문서 검색 | 대화식 검색 | 컨텐츠 마이닝 |
|---|---|---|---|---|
| 계약 | ||||
| 엔티티 | ||||
| 키워드 | ||||
| 품사 | ||||
| 문서의 감성 | ||||
| 테이블 이해 |
다음 사전 빌드된 인리치먼트에 대한 자세한 정보는 다음 주제를 참조하십시오.
사용자 정의 인리치먼트를 작성하는 방법에 대한 자세한 정보는 도메인 특정 리소스 추가 를 참조하십시오.
인리치먼트를 최대한 활용하는 방법에 대한 자세한 정보는 문서를 강화하면 검색을 보다 효과적으로 수행할 수 있음 블로그 게시물을 참조하십시오.
API를 사용하여 인리치먼트를 적용하는 방법에 대한 자세한 정보는 API를 사용하여 인리치먼트 적용 을 참조하십시오.
인리치먼트 추가
NLP 보강을 추가하려면 다음 단계를 완료하십시오
-
프로젝트를 열고 콜렉션 관리 페이지로 이동하십시오.
-
강화할 콜렉션을 열려면 클릭하십시오.
-
강화 탭을 엽니다.
-
문서에 적용할 NLP 인리치먼트를 찾으려면 스크롤하십시오.
기본 제공 인리치먼트 및 사용자 정의 인리치먼트가 모두 나열됩니다. 기본 제공 인리치먼트의 유형 값은
System입니다. -
인리치먼트를 적용할 하나 이상의 필드를 선택하십시오.
업로드된 JSON 또는 CSV 파일이나 SDU (Smart Document Understanding) 도구에서 추가된 사용자 정의 필드 및
text및html필드에 인리치먼트를 적용할 수 있습니다. -
변경사항 적용 및 재처리를 클릭하십시오.
사용으로 설정하는 인리치먼트는 무작위 순서로 문서에 적용됩니다. 인리치먼트를 제거하는 방법에 대한 정보는 인리치먼트 관리 를 참조하십시오.
엔티티
엔티티를 식별합니다. 엔티티 는 일반적으로 데이터 콜렉션에서 언급되는 사람, 도시 및 조직과 같은 적절한 명사를 나타내는 용어입니다. Discovery 는 Watson NLP (Natural Language Processing) 서비스에서 정의하는 엔티티 유형 시스템의 일부인 엔티티를 인식할 수 있습니다.
비즈니스에 중요한 일반적이지 않은 용어를 식별하려면 사용자 정의 엔티티를 인식하도록 자체 모델을 훈련할 수 있습니다. 자세한 정보는 엔티티 추출기 를 참조하십시오.
Discovery에서 사용되는 Watson NLP 엔티티 추출기 서비스를 NLU 유형 시스템이라고 합니다. 이 이름은 Watson Discovery 서비스 외에 Watson Natural Language Understanding (NLU) 서비스에서 유형 시스템을 사용한다는 사실에서 비롯됩니다. 그러나 이는 Watson NLU 구현이 아니라 Discovery에서 직접 사용하는 유형 시스템의 Watson NLP 구현입니다. 결과적으로, 2개의 구현들은 상이한 결과들을 생성할 수 있다. 서비스가 인식하는 엔티티 유형에 대한 일반적인 아이디어를 얻으려면 엔티티를 참조하십시오.
다음 화면 캡처는 엔티티 인리치먼트가 정부의 시스템 및 영국의 왕 이라는 용어를 인식하고 이를 엔티티 멘션으로 태그 지정하는 것을 보여줍니다.
문서의 JSON 보기에서 엔티티 멘션의 기본 JSON 구조를 볼 수 있습니다.
{: caption="식별된 시스템 오브 정부 및 영국 국왕 엔티티의 JSON 보기를 표시합니다인식된 엔티티 " caption-side="bottom"} JSON 표현
예를 들어, 조직 엔티티 유형을 검색하려는 경우 모든 JSON 컨텐츠를 텍스트 편집기에 복사하고 Organization 를 검색할 수 있습니다. JSON 트리 보기의 루트에서 복사 아이콘을 클릭하십시오.
예
입력
"IBM is an American multinational technology company headquartered in Armonk."
응답
JSON 출력에서:
text= 문자열. 엔티티 텍스트type= 문자열. 엔티티 유형입니다 (예:Organization,Location,Person,Number).mentions= 배열. 엔티티 언급 및 위치model_name= 문자열. 사용자 정의 모델의 경우, 이 필드에는 사용자가 제공한 모델 이름이 포함됩니다. 그렇지 않으면 이 필드에는 모델의 기본 이름이 포함됩니다(예:watson_knowledge_studio,dictionary,character_pattern, 또는natural_language_understanding
{
"entities": [
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.8317045,
"location": {
"end": 3,
"begin": 0
},
"text": "IBM"
}
],
"text": "IBM",
"type": "Organization"
},
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.6114863,
"location": {
"end": 75,
"begin": 69
},
"text": "Armonk"
}
],
"text": "Armonk",
"type": "Location"
}
]
}
키워드
컨텐츠에서 중요한 키워드를 리턴합니다.
예를 들어, 다음 화면 캡처는 키워드 인리치먼트로 인식되는 미국 독립 선언의 강조표시된 용어를 표시합니다.
{: caption="인식된 키워드를 표시합니다키워드 " caption-side="bottom"} 인식된 용어
문서의 JSON 보기에서 Declaration 키워드 멘션의 기본 JSON 구조를 볼 수 있습니다.
예
입력
"Watson Discovery is an award-winning AI search technology."
응답
JSON 출력에서:
text= 키워드 텍스트mentions= 엔티티 언급 및 위치
{
"keywords": [
{
"mentions": [
{
"location": {
"end": 157,
"begin": 141
},
"text": "Watson Discovery"
}
],
"text": "Watson Discovery",
"relevance": 0.503613
},
{
"mentions": [
{
"location": {
"end": 177,
"begin": 164
},
"text": "award-winning"
}
],
"text": "award-winning",
"relevance": 0.728722
},
{
"mentions": [
{
"location": {
"end": 198,
"begin": 181
},
"text": "search technology"
}
],
"text": "search technology",
"relevance": 0.779356
}
]
}
키워드 한계
키워드 인리치먼트는 문서당 각각 하나 이상의 멘션이 있는 최대 50개의 키워드를 식별할 수 있습니다.
품사
명사, 동사, 형용사, 부사, 접속사, 삽입 및 숫자를 포함하여 품사를 인식하고 태그를 지정합니다.