가져온 ML 모델을 사용하여 사용자 정의 항 찾기
규칙 또는 컨텍스트를 사용하여 엔티티를 인식하고 태그를 지정하는 사용자 정의 Machine Learning 모델을 사용하십시오.
사용자 고유의 유형 시스템을 정의하는 데 사용할 수 있는 IBM 도구를 사용하여 작성한 Machine Learning 모델을 추가하십시오.
추가할 수 있는 모델 유형은 배치에 따라 다릅니다.
-
IBM Cloud Pak for Data 노즈비 IBM Software Hub Watson Explorer Content Analytics Studio 모델 또는 IBM Cloud Pak® for Data 또는 IBM Cloud 에 호스팅된 IBM Watson® Knowledge Studio 인스턴스로 만든 모델을 추가할 수 있습니다. 4.6.2 릴리스부터, Discovery 의 다른 인스턴스에서 생성되고 그곳에서 내보낸 사용자 지정 엔티티 추출기 모델을 추가할 수도 있습니다.
-
IBM Cloud IBM Cloud 에서만 호스팅되는 IBM Watson® Knowledge Studio 인스턴스로 작성된 모델을 추가할 수 있습니다.
IBM Cloud Pak for Data에서 Knowledge Studio 를 사용하여 빌드된 Knowledge Studio 모델을 사용하려면 기준 실제값을 Knowledge Studio의 IBM Cloud 인스턴스로 마이그레이션한 후 모델을 다시 훈련하십시오.
다음 유형의 모델이 지원됩니다:
- 사용자가 정의한 규칙을 기반으로 문서에서 엔티티를 찾는 Knowledge Studio로 작성된 규칙 기반 모델 (파일 형식: .pear)
- Knowledge Studio 에서 생성된 머신 러닝 모델로, 언어의 미묘한 뉘앙스, 의미, 그리고 특정 산업에 특정한 관계를 이해합니다(파일 형식: .zip)
- Discovery에서 작성되고 내보낸 사용자 정의 엔티티 추출기입니다. (파일 형식: .ent)
- Discovery에서 작성되고 내보내는 문장 분류자입니다. (파일 형식: .sc)
- IBM Cloud Pak for Data 노즈비 IBM Software Hub Watson Explorer Content Analytics Studio에서 만든 사용자 정의 UIMA 텍스트 분석 모델. (파일 형식: .pear)
설치된 배치에서 엔티티 추출기 모델 가져오기에 대한 지원이 4.6.2 릴리스와 함께 추가되었습니다.
발견은 Knowledge Studio 모델에 의해 정의된 엔티티 하위 유형을 식별할 수 없습니다.
Machine Learning 모델을 추가하려면 다음 단계를 완료하십시오
-
모델을 작성하고 이를 작성하는 데 사용하는 도구에서 내보내십시오.
자세한 정보는 다음 문서를 참조하십시오.
-
Knowledge Studio for IBM Cloud Pak® for Data
-
Knowledge Studio용 IBM Cloud
-
Watson Explorer Content Analytics Studio
Watson Explorer Content Analytics Studio에서 모델을 UIMA PEAR 파일로 내보내야 합니다. 자세한 정보는 어휘 분석 스트림에서 사용할 사용자 정의 PEAR 파일 작성을 참조하십시오.
-
-
개선 도구 패널의 조정 도메인 개념 섹션에서 기계 학습 모델 가져오기를 클릭하십시오.
-
모델의 이름을 지정한 후 모델을 정의하는 데 사용된 언어를 선택하십시오.
-
업로드 를 클릭하여 이전에 내보낸 파일을 찾아보십시오.
-
작성을 클릭하십시오.
-
모델에서 인리치먼트를 적용할 콜렉션 및 필드를 선택한 후 적용을 클릭하십시오.
모델이 너무 커서 제품 사용자 인터페이스에서 업로드할 수 없는 경우 API의 인리치먼트 작성 메소드를 사용하여 파일을 가져올 수 있습니다.
규칙 기반 모델 예제
예를 들어, 기계 학습 모델이 필드에 보강으로 적용될 때, 규칙 기반 모델( Knowledge Studio )에 명시된 해당 필드의 모든 엔티티 유형을 추출합니다. 모델이 person, surname 및 job title 와 같은 엔티티 유형을 인식하는 경우 문서에서 인식되고 태그 지정됩니다.
출력에서 entities 배열 내의 enriched_{field_name} 배열에 있는 Machine Learning 인리치먼트에 의해 추출되는 정보입니다. 이 예제에서 인리치먼트를 위해 선택되는 필드는 text 입니다.
{
"enriched_text": [
{
"entities": [
{
"path": ".wksrule.entities.PERSON",
"text": "George Washington",
"type": "PERSON"
},
{
"path": ".wksrule.entities.GIVENNAME",
"text": "George",
"type": "GIVENNAME"
},
{
"path": ".wksrule.entities.SURNAME",
"text": "Washington",
"type": "SURNAME"
},
{
"path": ".wksrule.entities.POSITION",
"text": "politician",
"type": "POSITION"
},
{
"path": ".wksrule.entities.POSITION",
"text": "soldier",
"type": "POSITION"
},
{
"path": ".wksrule.entities.JOBTITLE",
"text": "President of the United States",
"type": "JOBTITLE"
}
],
"text": [
"George Washington (February 22, 1732‚ December 14, 1799) was an American politician and soldier who served as the first President of the United States from 1789 to 1797 and was one of the Founding Fathers of the United States."
]
}
]
}
따라서 누군가가 API를 사용 하여 enriched_{field_name}.entities.type:jobtitle 인리치먼트의 발생을 찾기 위해 Discovery 조회 언어 조회를 제출하는 경우, 개인의 직위를 설명하는 구절이 리턴됩니다.
기계 학습 모델 예제
이 예제에서 기계 학습 모델은 엔티티 유형 (예: person, oranization 및 date) 및 엔티티 간 관계에 대한 정보를 추출합니다. 이 ML 모델이 필드에 보강으로 적용되면, 기계 학습을 통해 문서에 언급된 언어적 뉘앙스, 의미, 관계를 이해합니다.
출력에서 entities 및 relations 배열 내의 enriched_{field_name} 배열에서 Machine Learning 인리치먼트에 의해 추출되는 정보입니다. 이 예제에서 인리치먼트를 위해 선택되는 필드는 text 입니다.
{
"enriched_text": [
{
"entities": [
{
"count": 1,
"text": "Democratic Party",
"type": "ORGANIZATION"
},
{
"count": 1,
"text": "March 15, 1767",
"type": "DATE"
},
{
"count": 1,
"text": "President",
"type": "POSITION"
},
{
"count": 1,
"text": "Andrew Jackson",
"type": "PERSON"
}
],
"relations": [
{
"sentence": "Andrew Jackson (March 15, 1767‚ June 8, 1845) was an American soldier and statesman who served as the seventh President of the United States from 1829 to 1837 and was the founder of the Democratic Party."
}
]
}
]
}
기계 학습 모델 한계
서비스 인스턴스당 작성할 수 있는 Machine Learning (ML) 모델의 수는 Discovery 플랜 유형에 따라 다릅니다.
| 플랜 | 서비스 인스턴스당 mL 모델 |
|---|---|
| Cloud Pak for Data | 무제한 |
| 프리미엄 | 1,000만 |
| 구축 | 1,000만 |
| Plus (평가판 포함) | 3 |
각 Knowledge Studio 기계 학습 모델에 대해 발견할 수 있는 최대 엔티티 수는 50입니다.
고급 규칙 모델
고급 규칙 모델을 추가하여 IBM Watson® Knowledge Studio 의 고급 규칙 편집기에서 작성되고 내보낸 텍스트 추출 모델을 콜렉션에 적용하십시오.
적절한 Knowledge Studio 배치를 사용하여 모델을 작성해야 합니다.
-
IBM Cloud Pak for Data 노즈비 IBM Software Hub 다음 위치에서 생성 및 내보낸 모델을 추가할 수 있습니다
- 4.5 릴리스 이전의 IBM Cloud Pak® for Data 배치로 빌드된 IBM Watson® Knowledge Studio.
- IBM Cloud 에서 호스팅되는 IBM Watson® Knowledge Studio
- 오픈 소스 데이터 및 AI 기술 센터에 대한 컨트리뷰터가 빌드한 NLP 편집기
-
IBM Cloud IBM Cloud 에서만 호스팅되는 IBM Watson® Knowledge Studio 인스턴스로 작성된 모델을 추가할 수 있습니다.
Knowledge Studio 에서 제거
Knowledge Studio 에서 베타 고급 규칙 편집기를 사용하여 모델을 빌드하기 위한 지원이 종료되었습니다. 지원 종료 날짜 이전에 Knowledge Studio 에서 내보낸 모든 규칙 모델은 Discovery에서 계속 사용할 수 있습니다.
지원 종료 날짜는 배치 유형에 따라 다릅니다.
- IBM Cloud 2022년 6월 30일
- IBM Cloud Pak for Data IBM Cloud Pak for Data 2022년 8월 3일에 4.5.1 릴리스합니다.
IBM Cloud Knowledge Studio 고급 규칙 편집기에서 생성된 모델을 사용하는 대신패턴 강화를 추가 하여 규칙을 정의할 수 있습니다.
기존 모델 추가
고급 규칙 모델을 추가하려면 다음 단계를 완료하십시오.
-
모델을 작성하고 모델 자원을 포함하는 ZIP 파일을 내보내십시오.
모델을 내보내는 방법에 대한 자세한 정보는 모델 소스에 대한 지시사항을 참조하십시오.
-
개선 도구 패널의 조정 도메인 개념 섹션에서 고급 규칙 모델을 선택하십시오.
-
업로드를 클릭하십시오.
-
모델의 이름을 지정한 후 모델을 정의하는 데 사용된 언어를 선택하십시오.
-
이 인리치먼트의 출력이 저장될 색인의 필드인 결과 필드의 이름을 지정하십시오.
-
업로드 를 클릭하여 이전에 내보낸 ZIP 파일을 찾아보십시오.
-
작성을 클릭하십시오.
-
모델에서 인리치먼트를 적용할 콜렉션 및 필드를 선택한 후 적용을 클릭하십시오.
고급 규칙의 출력 형식
Knowledge Studio 는 AQL (Annotation Query Language) 을 사용하여 고급 규칙 모델에서 규칙을 정의합니다. 각 모델은 하나 이상의 보기로 정의됩니다. 각 보기는 여러 데이터 레코드를 포함하는 관계형 데이터 구조입니다. 각 레코드는 보기의 스키마에 의해 정의되는 열의 값으로 구성됩니다. 사용자 정의되어 다양한 스키마가 있는 이러한 모델을 쉽게 표시하기 위해 균일한 JSON 출력 스키마가 사용됩니다.
- 각 JSON 오브젝트는 AQL (Annotation Query Language) 보기를 나타냅니다.
- JSON 오브젝트의 이름 및 값 쌍은 보기에 있는 속성의 이름 및 값을 나타냅니다.
- AQL 뷰의 튜플은 뷰의 각 튜플에 대해 하나의 객체를 갖는 JSON 객체의 배열로 표시됩니다.
다음 표는 AQL 데이터 유형이 JSON 구문으로 어떻게 표현되는지를 설명합니다.
| AQL 데이터 유형 | JSON 구문 | JSON 예 |
|---|---|---|
| 정수 | 수 | 5 |
| 부동 소수점 | 수 | 4.13 |
| 부울 | 부울 | true |
| 텍스트 | 문자열 | "some string" |
| Span | {"text": String, "location": {"begin": Integer, "end": Integer}} 양식의 오브젝트 |
{ "text": "Jane", location": {"begin": 5, "end": 9} } |
| 특수한 경우: 널 (NULL) 값 | null | null |
| 정수 목록 | 숫자 값의 배열 | [ 1, 2, 3, 4, 5] |
| Float 목록 | 숫자 값의 배열 | [ 4.13, 4.5 ] |
| 부울 목록 | 부울 값의 배열 | [ true, true, false] |
| 텍스트 목록 | 문자열 값의 배열 | [ "some string", "another string" ] |
| 보안 범위 목록 | {"text":String, "location": {"begin": Integer, "end": Integer}} 양식의 오브젝트 배열 |
[{ "text":"Jane", "location": {"begin": 5, "end": 9} }, { "text":"...", "location": {"begin": 15, "end": 40} }] |
| 특수 케이스: 비어 있는 목록 | 0개요소가 있는 배열 | [ ] |
고급 규칙 모델 한계
서비스 인스턴스당 정의할 수 있는 고급 규칙 모델의 수는 Discovery 플랜 유형에 따라 다릅니다.
| 플랜 | 서비스 인스턴스당 고급 규칙 모델 |
|---|---|
| Cloud Pak for Data | 무제한 |
| 프리미엄 | 3 |
| 구축 | 3 |
| Plus (평가판 포함) | 1 |