이 문서는 IBM Watson® Knowledge Studio on IBM Cloud®에 대한 문서입니다. Knowledge Studio on IBM Marketplace의 이전 버전에 대한 문서를 보려면 이 링크를 클릭하십시오.
사전 작성
사전은 Knowledge Studio 기계 학습 모델이 도메인의 언어를 이해하도록 도움을 줍니다.
사전
기계 학습에서, 사전은 공통점이 있는 단어 및 구문을 함께 그룹화합니다. 사전의 항목은 항목 내의 모든 단어가 동일한 것을 의미하지는 않지만, 해당 단어가 모델에 의해 동격으로 취급됨을 나타냅니다.
사전은 정보 추출 목적에 있어서 동격으로 취급되는 단어 또는 구문의 목록이며, 이는 이들을 엔티티 및 관계 멘션 식별 목적으로 교차 사용할 수 있음을 의미합니다.
다음과 같은 예를 생각해 보십시오. 사전 항목이 일곱 요일을 포함하고 있습니다. 문서에 어노테이션을 작성하기 위해 사람 어노테이터는 텍스트에서 DAY_OF_WEEKMonday* 및 Friday의 멘션에 엔티티 유형 *를 지정합니다. 사전이 일곱 요일을 동일시하므로, 이는 런타임 시에 보지 않은 문서에 Tuesday, Wednesday 및 기타 요일이 존재할
때 기계 학습 모델이 이에 올바은 어노테이션을 작성하도록 도움을 줍니다. 또한 이러한 단어를 동일시하는 것은 주변 텍스트에서의 정보 추출에도 도움이 됩니다. 사전에서 이러한 용어가 정보 추출 용도로 동등함을 기술하므로, 기계 학습 모델이 Monday 및 Friday 주변 텍스트에 대한 훈련 예제에서 학습하는 내용은 기계 학습 모델이 기타 요일 주변에서 보는 텍스트에 적용됩니다.
요일 정보를 포함하는 사전을 작성할 필요는 없습니다. 이과 같은 몇몇 범용 사전은 애플리케이션에 빌드되어 있습니다. 기타 기본 제공 사전에는 국가, 지명, 숫자 단어, 동물, 식물, 질병, 측정 단어( 온스, 미터 등), 인사말 제목 단어( 미스터, 미세스 등) 등이 있습니다. 기본 제공 사전은 사용 안함으로 설정하거나 편집할 수 없습니다.
여러 의미가 있는 항목을 추가하지 마십시오. 예를 들어, 자동차 경주에 대한 도메인의 경우에는 텍스트에서 금융 기관이 자주 언급되지 않는 경우에만 도로 특성을 가리키는 뱅크라는 용어를 포함시킬 수 있습니다. 단어의 두 의미가 모두 소스 문서에서 자주 발생하는 경우에는 두 유형의 사전(도로 특성과 연관된 사전 및 금융 기관과 연관된 사전) 모두에서 이를 제외하는 것이 좋습니다.
개별 항목을 수동으로 추가하여 Knowledge Studio에서 사전을 작성할 수 있습니다. Knowledge Studio은(는) 여러 유형의 사전 파일을 업로드하는 기능도 지원합니다.
사전이 사용되는 방식
사전은 몇 가지 방식으로 사용될 수 있으며, 이들은 모두 선택사항입니다. 사전은 정보 추출 목적에 있어서 동격인 단어 또는 구문을 제공하고, 어노테이션 미리 작성 중에 어노테이션 작성 작업을 부트스트랩하기 위해 기계 학습 모델에 의해 사용됩니다.
-
기계 학습에서의 사용
사전과 연관시킨 엔티티 유형은 기계 학습 모델의 규칙을 정의하는 데 사용되지 않습니다. 기계 학습은 문서 내의 멘션을 독립적으로 평가합니다. 멘션이 특정 엔티티 유형과 연관된 사전 항목과 일치한다고 해서 이 멘션이 해당 엔티티 유형이라고 가정하지는 않습니다. 기계 학습은 이 정보를 고려하지만, 언어 분석 중에 수집하는 여러 정보 중 하나로 취급합니다. 사실, 사전 내의 용어가 기준 실제값 문서에서 발생하지 않는 경우에는 기계 학습 모델에서 해당 사전을 전혀 사용하지 않습니다.
-
어노테이션 미리 작성에서의 사용
사전은 다음 어노테이션 미리 작성 프로세스에서 중요합니다.
- 사전 프리어노테이터: 사전 프리어노테이터(pre-annotator)를 실행할 때는 사전을 유형 시스템의 엔티티 유형과 연관시킵니다.
- 규칙 기반 모델: 선택적으로 사전을 규칙 클래스와 연관시킬 수 있습니다. 그 후 이러한 클래스는 문서에 어노테이션 미리 작성을 수행하기 위해 규칙 기반 모델을 실행할 때 유형 시스템의 엔티티 유형에 맵핑됩니다. 따라서 사전 용어는, 멀리 돌아간 형태이긴 하지만, 규칙 기반 모델의 엔티티 유형에도 맵핑됩니다.
두 경우 모두 사전은 시스템이 찾아 멘션으로 어노테이션을 작성할 수 있는 용어를 제공합니다. 이는 각 멘션에 용어를 포함하는 사전과 연관된 엔티티 유형을 지정합니다. 사람 어노테이터가 어노테이션 미리 작성이 수행된 새 문서에 대해 작업을 시작할 때는 사전 항목을 기반으로 많은 멘션이 이미 어노테이션이 작성되어 있습니다. 따라서 사람 어노테이터는 더 자세한 분석을 필요로 하는 멘션에 엔티티 유형을 지정하는 데 집중할 수 있습니다.
언어 고려사항
- 포르투갈어(브라질), 영어, 프랑스어, 독일어, 이탈리아어 및 스페인어의 경우에 Knowledge Studio는 현재 대소문자 구분 없는 사전 일치 지정 옵션을 제공하지 않지만, 사전 항목은 포함된 문자의 대소문자가 동일하거나 대문자인 텍스트와 일치합니다. 예를 들어, 사전의 vehicle은 텍스트의 vehicle, Vehicle 또는 VEHICLE과 일치합니다. 한편 사전의 Sat는 텍스트의 Sat 또는 SAT와 일치하지만 sat와는 일치하지 않습니다.
- 일본어 및 한국어의 경우 어노테이션 미리 작성 중 사전 일치가 대소문자를 구분합니다.
- 아랍어의 경우 Knowledge Studio는 아랍어 텍스트가 원형으로 저장되어 있다고 가정하며 숫자 형태 변형을 저장 레벨 특성으로 간주합니다. Knowledge Studio에서 아랍 문자 형태 변형 및 숫자 형태 변형을 어떻게 처리하는지에 대한 세부사항은 아랍어 지원 구성을 참조하십시오.
CSV 파일 사전
표준 사전 형식이라고도 하는, 쉼표로 구분된 값(CSV) 형식의 사전은 업로드한 후 편집할 수 있는 파일입니다. 업로드할 수 있는 CSV 파일의 최대 크기는 1MB입니다. 이보다 더 큰 파일을 보유한 경우에는 여러 파일로 분할한 후 이들을 Knowledge Studio 작업공간에 있는 단일 사전으로 한 번에 하나씩 업로드하십시오.
요구사항을 요약하면, 사용자는 CSV 파일을 작성하는 데 Microsoft Excel과 같은 소프트웨어가 아니라 텍스트 편집기를 사용해야 하며, 이 파일은 텍스트 스트림의 시작 부분에 바이트 순서 문자(BOM)를 포함하지 않는 UTF-8 인코딩을 사용해야 합니다. 이 파일의 첫 번째 행은 다음 열 헤더를 지정해야 합니다.
lemma,poscode,surface
파일의 나머지 행은 사전 항목을 지정하며, 여기서
-
표제어(lemma)
항목의 가장 대표적인 단어 형태를 지정합니다.
-
poscode(아랍어, 포르투갈어(브라질), 영어, 프랑스어, 독일어, 이탈리아어 및 스페인어)
품사를 식별하는 코드를 지정합니다. 이 품사 정보는 문장 토큰화에 도움을 주기 위해 사전 어노테이터가 사용합니다.
-
0- 알 수 없음이 코드는 각 항목에 품사 정보를 포함하지 않는 대규모의 시스템 생성 사전을 업로드하는 시나리오를 지원합니다. 사용자는 기본적으로 모든 항목에 unknown을 지정할 수 있습니다. 가능하면 이 코드를 사용하지 마십시오.
-
1- 대명사 -
2- 동사 -
3- 명사 -
4- 형용사 -
5- 부사 -
6- 전치사 -
7- 감탄사 -
8- 접속사 -
9- 한정사 -
10- 수량사
영어에서는 명사(
3), 동사(2) 및 형용사(4)가 사전 항목에 사용되는 가장 일반적인 품사입니다.품사에 따라 멘션의 유형이 자동으로 결정되지는 않습니다. 모든 명사는 엔티티 유형 멘션과 일치하고 모든 동사는 관계 유형 멘션과 일치한다고 간주하지 마십시오. 예를 들어 American은 형용사이지만, 엔티티 유형 GPE(지정학적 엔티티) 또는
PERSON으로 어노테이션을 작성하는 것이 가장 좋을 수 있습니다. Met은 동사이지만EVENT_MEETING으로 어노테이션을 작성하는 것이 가장 좋을 수 있습니다.복합어를 사용하는 독일어와 같은 기타 언어에서는 단어 경계를 판별하는 데 있어서 품사 정보의 정확성이 더욱 중요합니다.
-
-
poscode(중국어)
품사를 식별하는 코드를 지정합니다. 단어 경계를 나타내는 데 공백을 사용하지 않는 중국어(중국어 및 대만어)와 같은 언어에서는 텍스트 토큰화 및 어노테이션 미리 작성을 위해 품사 값이 중요합니다.
32- 명사31- 명사(성)35- 명사(조직)34- 명사(기타)33- 명사(사람 이름)
-
poscode(일본어)
품사를 식별하는 코드를 지정합니다. 단어 경계를 나타내는 데 공백을 사용하지 않는 일본어와 같은 언어에서는 텍스트 토큰화 및 어노테이션 미리 작성에서 품사 값이 중요합니다.
19- 명사23- 공통 접두사24- 공통 접미사140- 고유명사(성)141- 고유명사(이름)146- 고유명사(사람 이름)142- 고유명사(조직)144- 고유명사(장소 이름)143- 고유명사(지역)145- 고유명사(기타)
-
poscode(한국어)
품사를 식별하는 코드를 지정합니다. 단어 경계를 나타내는 데 공백을 사용하지 않는 한국어와 같은 언어에서는 텍스트 토큰화 및 어노테이션 미리 작성에서 품사 값이 중요합니다.
10010- 명사10300- 고유명사(성)10310- 고유명사(이름)110360- 고유명사(사람 이름)10320- 고유명사(조직)10340- 고유명사(장소 이름)10330- 고유명사(지역)10350- 고유명사(기타)
-
surface
표층형이라고도 하는 동격 용어를 지정합니다. 표층형으로서 표제어를 반복한 후 쉼표를 사용하여 여러 표층형을 구분하십시오. 표층형이 쉼표를 포함하는 경우에는 표층형을 따옴표로 묶으십시오.
예를 들어, 다음과 같습니다.
lemma,poscode,surface
IBM,3,IBM Corp.,IBM,"International Business Machines, Inc."
Department of Energy,3,DOE,Department of Energy
premium,4,premium,premium-grade
관련 개념:
관련 태스크:
작업공간에 사전 추가
사전 추가는 모델 작성의 선택적 단계입니다. 사전은 어노테이션 작성 프로세스를 미리 진행할 수 있도록 해 주어 유용합니다.
이 태스크에 대한 정보
사전을 제공하는 경우에는 문서에 대해 사전 프리어노테이터를 실행할 수 있습니다. 프리어노테이터는 사전에 나타나 있는 용어를 찾아 여기에 자동으로 어노테이션을 작성합니다. 문서에 대해 이러한 초기 처리를 수행하면 사람 어노테이터가 프리어노테이터가 추가한 어노테이션을 검토하고 이를 정정하거나 여기에 내용을 추가하기만 하면 되므로 작업이 단순해집니다. 사람 어노테이터가 이 작업을 처음부터 시작할 필요가 없습니다.
사전에는 다음 제한사항이 적용됩니다.
-
사전당 최대 15,000개 항목
참고: 이 한계는 사전
CSV파일로 업로드하는 사전에는 적용되지 않습니다. 읽기 전용 사전은 더 많은 항목을 포함할 수 있습니다. -
작업공간당 최대 64개 사전
프로시저
작업공간에 사전을 추가하려면 다음 작업을 수행하십시오.
-
Knowledge Studio 관리자 또는 프로젝트 관리자로 로그인하여 자산 > 사전 페이지를 여십시오.
-
다음 태스크 중 하나를 수행하십시오.
- 사전 작성 단추 옆의 메뉴 아이콘을 클릭한 후에 사전 업로드를 선택하십시오. 사전을 선택하고 업로드를 클릭하십시오. 사전을 업로드한 후에는 이를 선택하여 해당 사전을 보고 이를 엔티티 유형과 연관시키십시오.
다른 Knowledge Studio 작업공간에서 다운로드한 사전을 포함하는 ZIP 파일을 업로드할 수 있습니다. 사전 파일을 업로드하려면 먼저 다른 작업공간에서 다운로드한 JSON 형식의 해당 유형 시스템을 업로드해야 합니다. 다른 Knowledge Studio 작업공간의 재사용 사전을 편집하고 여기에 항목을 추가할 수 있습니다. 세부사항은 다른 작업공간의 리소스 업로드를 참조하십시오.
CSV 파일 업로드 또한 지원되지만, 이를 사전으로 직접 업로드하면 편집하거나 다운로드할 수 없는 미리보기 전용 사전이 작성됩니다. 편집하고 다운로드할 수 있는 CSV 파일을 업로드하려면, 사전 작성를 클릭하여 우선 비어 있는 사전을 작성한 후에 새로 작성된 해당 사전에 항목으로서 CSV 컨텐츠를 업로드하십시오.
- 사전 작성 단추를 클릭하여 나중에 사전 항목을 추가할 수 있는 비어 있는 사전을 작성하십시오. 사전에 대한 설명 이름을 지정한 다음 저장을 클릭하십시오.
-
사전에 항목을 추가하려면 다음 태스크 중 하나를 수행하십시오.
- 항목 추가를 클릭하여 사전 항목을 추가하십시오. lemma(용어의 가장 대표적인 단어 형태)를 지정하십시오.
- 업로드를 클릭하여 사전 항목을 포함하는
CSV파일을 업로드한 후 찾아보기로 이 파일을 선택하십시오.CSV파일은 1MB보다 작아야 합니다. - 항목 제안사항 분할창에 제공된 목록에서 제안된 항목을 추가하십시오. Knowledge Studio는 작업공간의 문서와 사전의 기존 항목을 사용하여 새 항목을 제안합니다.
-
항목을 업로드하거나 추가한 후에는 항목을 편집할 수 있습니다.
항목을 열어서 surface forms라고 하는 동격 용어를 지정하십시오. 각 표층형은 256자 이하의 길이여야 합니다. 표층형 중 표제어로 사용할 항목을 지정할 수 있습니다. 예를 들어, 표제어 IBM에는 IBM Corp. 및 *International Business Machines, Inc.*와 같은 표층형이 있을 수 있습니다.
-
사전에 있는 각 표제어 및 표층형의 적절한 품사를 선택하십시오.
품사 정보는 어노테이션 미리 작성 중에 토크나이저가 사용합니다.
-
저장을 클릭하여 변경사항을 저장하십시오.
다음에 수행할 작업
작성한 사전을 사용하여 소스 문서에 대한 사전 처리를 수행하고 여기에 어노테이션을 작성하는 프리어노테이터를 실행하십시오.
사전 제안사항 추가
편집기 UI의 사전 추천 기능은 2025년 6월 30일에 종료됩니다. 자세한 내용은 릴리스 노트를 참조하세요.
사전에 항목을 추가할 때 Knowledge Studio는 작업공간의 문서에서 유용한 유사 사전 항목을 검색합니다.
- 제안을 받으려면
Documents탭에서 문서를 업로드해야 합니다. - 문서를 업로드한 후 제안 엔진을 준비하는 데 어느 정도 시간이 소요될 수 있습니다.
제안된 항목은 항목 제안사항 분할창에 제공됩니다.

항목 제안사항 분할창에서 다음 옵션을 사용할 수 있습니다.
- 제안된 항목의 이름을 클릭하면 문서에서 용어 발생을 표시하는 창이 열립니다. 이는 제안된 항목을 추가할지 아니면 제외할지를 결정하는 데 도움이 될 수 있습니다.
- 이 항목 추가(
+)를 사용하면 사전에 항목 제안을 추가할 수 있습니다. - 이 항목 제외(
-)를 사용하면 제안된 항목 목록에서 항목을 제거하고 제외된 용어에 추가할 수 있습니다. - 모두 추가를 사용하면 사전에 제안된 항목의 전체 목록을 추가할 수 있습니다(이 경우 제외된 용어 아래에 나열된 항목은 추가되지 않음).
- 모두 제외를 사용하면 제외된 용어로 현재 모든 항목 제안사항을 이동할 수 있습니다.
관련 태스크:
관련 참조: