이 문서는 IBM Watson® Knowledge Studio on IBM Cloud®에 대한 문서입니다. Knowledge Studio on IBM Marketplace의 이전 버전에 대한 문서를 보려면 이 링크를 클릭하십시오.

용어집

이 용어집에는 Knowledge Studio에서 사용하는 용어 및 정의가 포함되어 있습니다.

이 용어집에서는 다음과 같은 상호 참조가 사용됩니다.

  • 참조하십시오는 용어부터 기본 동의어 또는 두문자어나 약어부터 정의된 전체 양식까지 참조하라는 의미입니다.
  • 도 참조하십시오는 관련되거나 대조적인 용어를 포괄합니다.

A B C D E F G H I K L M N O P R S T

A

  • 정확도

    기계 학습 모델을 통해 생성된 어노테이션의 정확도입니다. 정밀도(precision)재현율(recall)도 참조하십시오.

  • 정확도 분석(accuracy analysis)

    기계 학습 모델 점수를 분석하여 변경사항의 정확도를 향상시켜야 할지 결정합니다.

  • 판정

    서로 다른 사용자 어노테이터별로 동일한 문서에 추가된 어노테이션을 비교하여 어노테이션 충돌을 해결하는 반복 프로세스입니다.

  • 분석 엔진(analysis engine)

    문서와 같은 아티팩트를 분석하고 아티팩트에 관한 정보를 추론하며, UIMA 분석 엔진 인터페이스 사양을 구현하는 프로그램입니다. 분석 엔진은 어노테이터라고 하는 구성 요소로 구성됩니다. 분석 엔진에는 기본 분석 엔진이라고하는 단일 어노테이터 또는 집계 분석 엔진이라고 하는 여러 어노테이터가 포함될 수 있습니다.

  • 어노테이션

    텍스트 범위에 관한 정보입니다. 예를 들어 어노테이션을 통해 텍스트의 범위가 회사 이름을 표시함을 나타낼 수 있습니다.

  • 어노테이션 세트(annotation set)

    사용자 어노테이션에서 다중 사용자 어노테이터가 워크로드를 공유할 수 있도록 말뭉치에서 추출한 문서의 콜렉션입니다. 시스템 기반 어노테이션에서 블라인드(blind) 데이터, 교육 데이터 또는 테스트 데이터로 사용할 수 있는 문서의 콜렉션입니다.

  • 어노테이션 프로세스 관리자(annotation process manager)

    작업공간에서 전체 어노테이션 라이프사이클 활동의 관리를 담당하는 역할입니다. 일반적으로 작업공간에 추가되는 프로젝트 관리자가 어노테이션 프로세스 관리자의 활동을 수행합니다.

  • 어노테이터

    사람 어노테이터(human annotator)기계 학습 어노테이터(machine learning annotator)를 참조하십시오.

  • 속성

    엔티티를 설명하는 엔티티의 특징 또는 특성입니다. 예를 들어, 직원의 전화번호는 직원 속성 중 하나입니다.

B

  • 블라인드 데이터(blind data)

    질문과 답변 쌍, 시맨틱 어노테이션 및 구절 판단과 같은 기준 실제값으로 어노테이션이 작성된 문서 세트입니다. 블라인드 데이터는 개발자가 공개하거나 볼 수 없으며 표시되지 않는 데이터의 성과를 평가하기 위해 주기적으로 시스템을 테스트하는 데 사용합니다. 블라인드 데이터에 대한 테스트를 수행하면 알려진 질문 세트 또는 어노테이션에 대한 과적합으로 인해 정확도가 오염되는 것을 방지할 수 있습니다. 보고된 결과는 블라인드 데이터에 대해 실행된 테스트만의 결과여야 합니다. 테스트 데이터(testing data)훈련 데이터(training data)도 참조하십시오.

C

  • 용어 색인(concordance)

    문서 및 어노테이션 세트 전체에서 동일한 멘션이 동일한 엔티티 유형으로 어노테이션 작성될 수 있도록 하는 수단을 제공합니다. 용어 색인은 사람 어노테이터가 특정 멘션의 각 발생에 수동으로 레이블을 지정할 필요 없이 해당 멘션의 여러 발생에 대해 일관성을 유지할 수 있도록 도와줍니다.

  • 혼동 매트릭스

    어노테이션이 있는 문서 세트의 자세한 숫자 분석을 제공하는 테이블입니다. 테이블은 시스템 학습 모델을 통해 추가한 어노테이션을 기준 실제값과 비교하는 데 사용됩니다. 이 표는 거짓 긍정(false positive), 거짓 부정(false negative), 참 긍정(true positive)참 부정(true negative)의 수를 보고합니다.

  • 동일 지시어(coreference)

    둘 다 동일한 사람이나 사물을 가리키고 한 용어가 다른 용어의 이전 표현을 나타나는 두 단어 또는 문구 사이의 관계입니다. 예를 들어 "She taught herself" 문구의 두 대명사 사이에는 동일 지시어가 있지만, "She taught her" 문구에는 없습니다. 동일 지시어는 같은 텍스트에 있는 두 개의 동등한 엔티티를 링크합니다.

  • 동일 지시어 체인(coreference chain)

    동일 지시어로 어노테이션이 작성된 엔티티 목록입니다. 멘션을 상호 참조로 어노테이션 작성하면 시스템이 상호 참조 체인을 작성합니다. 이 체인은 특정 컨텍스트의 모든 멘션을 보고 모든 발생이 동일한 엔티티 유형에 속하는지 확인하는 수단을 제공합니다.

  • 말뭉치(corpus)

    작업공간에 추가되어 기계 학습 모델을 훈련시키는 데 사용되는 소스 문서의 콜렉션입니다.

  • 큐레이팅

    특정 주제와 관련된 컨텐츠를 선택, 수집, 보존 및 유지보수합니다. 관리에서는 값을 설정하고 유지보수하며 데이터에 추가하고, 데이터를 신뢰할 수 있는 정보와 지식으로 변환합니다.

D

  • 사전

    문서의 어노테이션을 미리 작성하는 데 사용할 수 있는 단어 콜렉션입니다. 사전의 용어와 일치하는 문서 텍스트의 단어마다 새 어노테이션이 작성됩니다. 기계 학습 모델은 하나 이상의 독립적인 사전으로 구성할 수 있습니다. 이 사전은 일반적으로 도메인별로 다릅니다(예: 약학 사전 및 자산 관리 사전). 표제어(lemma)표층형(surface form)도 참조하십시오.

  • 사전 어노테이션 미리 작성(dictionary pre-annotator)

    텍스트에서 특정 단어 세트와 일치하는 멘션을 식별하는 구성요소입니다. 도메인별 용어를 사용하여 텍스트의 어노테이션을 미리 작성하면 사전 어노테이션을 미리 작성하는 어노테이터를 통해 기준 실제값 문서 세트를 준비하는 사용자 어노테이터의 능력을 가속화할 수 있습니다.

  • 문서 세트(document set)

    문서의 콜렉션입니다. 함께 가져온 문서는 문서 세트가 됩니다. 훈련 용도(테스트, 훈련, 블라인드)로 함께 그룹화되는 어노테이션 작성된 문서는 문서 세트로 생성됩니다.

E

  • 엔티티

    1. 엔티티 유형으로 어노테이션이 작성되는 멘션입니다.
    2. 정보 저장의 대상이 되는 사용자, 오브젝트 또는 개념입니다.
    3. 사람, 위치 또는 은행 계좌와 같은 실제 오브젝트에 대해 보유되는 세부사항 세트입니다. 엔티티는 일종의 항목입니다.
  • 엔티티 유형

    컨텍스트를 고려하지 않고 멘션이 표시하는 엔티티 유형입니다. 예를 들어, 멘션 IBM은 엔티티 유형 ORGANIZATION으로 어노테이션 작성될 수 있습니다.

    엔티티 관계 모델에서 엔티티 유형은 모델링 중인 항목이거나 멘션이 참조하는 항목(예: 사용자 또는 장소의 이름)입니다. 각기 다른 엔티티 유형에는 서로 다른 속성 세트(예: "성" 또는 "고향")가 있으며 "거주지"와 같은 관계를 통해 연결됩니다. 엔티티 유형은 개별적으로 존재하며 고유하게 식별할 수 있습니다.

F

  • F1 점수(F1 score)

    정밀도와 재호출을 모두 고려하여 점수를 계산하는 테스트의 정확도입니다. F1 점수는 정밀도 및 재호출 값의 가중 평균으로서 해석할 수 있습니다. F1 점수는 1이 최고값이고 0이 최저값입니다.

  • 거짓 부정

    올바르지만 잘못된 것으로 예측된 응답 또는 어노테이션입니다.

  • 거짓 긍정

    잘못되었지만 올바른 것으로 예측된 응답 또는 어노테이션입니다.

  • 기능

    데이터 멤버 또는 유형의 속성입니다.

  • Fleiss Kappa 점수(Fleiss Kappa score)

    겹치는 문서에서 여러 개의 사용자 어노테이터가 얼마나 일관되게 동일한 어노테이션을 적용했는지 나타내는 수치입니다. Fleiss Kappa 점수의 최고값은 1이고 최저값은 0입니다.

G

  • 기준 실제값(ground truth)

    기계 학습 모델을 특정 도메인에 맞게 조정하는 데 사용되며 사용자 어노테이터가 추가한 어노테이션으로 구성되어 있는 감사된 데이터 세트입니다. 기준 실제값은 기계 학습 모델을 훈련시키고, 모델 성능을 측정하며(정밀도와 재호출), 여유 공간을 계산하여 성능을 향상시키기 위해 개발 팀이 주력해야 할 부분을 결정하는 데 사용됩니다. 기준 실제값의 부정확성은 기준 실제값을 사용하는 컴포넌트의 부정확성과 서로 관련되어 있으므로 기준 실제값의 정확도가 중요합니다.

H

  • 여유 공간 분석(headroom analysis)

    정확도 분석을 수행하는 중에 식별된 일부 문제점 클래스를 해결하여 정확성, 정밀도 또는 재호출을 얼마나 개선할 수 있는지 판별하는 프로세스입니다.

  • 사용자 어노테이터(human annotator)

    멘션, 엔티티 유형 관계 및 멘션 동일 지시어를 식별하여 미리 어노테이션을 지정한 결과를 검토하고 수정하며 보강하는 주제별 전문가입니다. 사용자 어노테이터가 컨텍스트의 텍스트를 검사하여 기준 실제값을 판별하고 기계 학습 모델의 정확도를 높일 수 있습니다.

I

  • 상호 어노테이터 계약(inter-annotator agreement)

    두 개 이상의 문서 세트에서 유사한 문서의 어노테이션을 작성하는 방법의 측정입니다.

K

  • 지식 그래프(knowledge graph)

    지정된 도메인의 개념 조직을 나타내기 위해 유형이 지정된 엔티티, 해당 관계, 특성 및 계층 구조 분류를 통합하는 모델입니다. 구조화된 데이터 소스 및 비구조화된 데이터 소스의 입력과 함께 지식 그래프 저장소를 로드하고 나면 사용자와 애플리케이션이 지식 그래프에 액세스하여 특정 도메인의 주요 지식 요소를 탐색하고 상호작용을 알아보고 추가 관계를 검색할 수 있습니다.

L

  • 표제어(lemma)

    단어의 정규 양식 또는 표준 양식입니다. 일반적으로 표제어는 명사 또는 동사의 파생되지 않고 어미 변화가 없는 양식입니다. 예를 들어, 용어 'organizing' 및 'organized'의 표제어는 'organize'입니다. 사전(dictionary)표층형(surface form)도 참조하십시오.

M

  • 기계 학습

    과거 데이터에서 반복적으로 학습하고 새 데이터에 노출될 때 개별적으로 조정되는 데이터 분석 방법입니다. 기계 학습의 핵심에 있는 수학적 모델은 기준 실제값 입력을 사용하여 빌드됩니다. 예제 입력 데이터의 훈련 및 세분화를 통해 모델에서는 새 데이터를 분석할 때 정확하고 반복 가능한 결과를 제공할 수 있습니다.

  • 기계 학습 어노테이터(machine learning annotator)

    기계 학습 모델(machine learning model)을 참조하십시오.

  • 기계 학습 모델

    실측 자료를 기반으로 하는 통계 모델에 따라 엔티티와 엔티티 관계를 식별하는 컴포넌트입니다. 모델은 교육 데이터와 같은 과거 경험을 적용하여 데이터 특성에 따라 향후 경험의 올바른 결과를 판별하거나 예측합니다. 이 과거 경험은 각 후보 응답 또는 증거의 기능 점수를 계산하고 알려진 결과와 결합하여 모델의 형식으로 캡처합니다. 이는 기계 학습 어노테이터라고도 합니다.

  • 멘션

    도메인 데이터와 관련이 있다고 간주하는 텍스트 범위입니다. 예를 들어 자동차의 입력 시스템에서는 "에어백", "포드 익스플로러" 및 "아동 보호 장치"가 관련 멘션일 수 있습니다.

N

  • 이름 지정된 엔티티

    조직, 위치, 작가 또는 질병 이름과 같이 잘 정의된 카테고리에 속하는 도메인 내의 개념입니다.

  • 자연어 처리

    컴퓨터에서 자연어를 이해하는 기능을 향상시키기 위해 자연어 처리 및 조작과 관련된 고유한 문제점을 연구하는 인공 지능과 언어학의 분야입니다.

O

  • 온톨로지

    일부 관심 영역에 존재할 수 있는 오브젝트, 개념 및 기타 엔티티의 표현과 이들 간의 관계에 대한 명시적인 공식 사양입니다.

P

  • 품사(POS, part of speech)

    사전에서, 개별 어휘 항목에는 품사(POS) 태그가 지정됩니다. 예를 들면, 단어 'fly'는 동사 또는 명사로 식별될 수 있습니다.

  • 성능

    질문에 대한 응답, 관계 발견 또는 텍스트에 대한 어노테이션 작성과 같은 작업에 대한, Watson 시스템의 정확도, 정밀도 및 재현율 수치입니다.

  • 사전 어노테이션(pre-annotation)

    사용자 어노테이션에 앞서 일련의 문서에 어노테이션을 작성하는 프로세스입니다. 문서에는 규칙 기반 모델, 기계 학습 모델, IBM Watson® Natural Language Understanding 또는 사전을 사용하여 어노테이션 미리 작성을 수행할 수 있습니다. 사전 어노테이션은 사용자 어노테이터가 근거 정보 문서 세트를 더욱 빠르게 준비하는 데 도움이 될 수 있습니다.

  • 정밀도

    관련 결과의 비율을 지정하는 측정치입니다. 정밀도는 양의 예측 값으로서, 올바른 정상적인 결과 수를 모든 정상적인 결과 수로 나눈 값으로 판별됩니다. 정확도는 정밀도와 재호출을 모두 사용하면 가장 정확하게 측정할 수 있습니다. 정확도(accuracy)재현율(recall)도 참조하십시오.

  • 처리 엔진 아카이브(PEAR)

    UIMA(Unstructured Information Management Architecture) 분석 엔진과 이를 사용자 정의 분석에 사용하는 데 필요한 모든 리소스를 포함하는 .pear 아카이브 파일입니다.

R

  • 재호출

    사용 가능한 관련 결과 중에서 리턴되는 관련 결과의 백분율을 지정하는 측정치입니다. 민감도의 척도인 재호출은 올바른 정상적인 결과 수를 리턴해야 하는 정상적인 결과 수로 나눈 값으로 판별합니다. 정확도는 정밀도와 재호출을 모두 사용하면 가장 정확하게 측정할 수 있습니다. 정확도(accuracy)정밀도(precision)도 참조하십시오.

  • relation

    일반적으로 엔티티가 서로 관련된 방식을 나타내는 동사입니다. 예를 들어, "lives in"은 사람과 도시 사이의 관계입니다. 관계는 같은 문장에 있는 두 개의 서로 다른 엔티티를 링크합니다.

  • 관계 유형

    두 엔티티 간의 2진 단방향 관계입니다. 예를 들어, Mary employedBy IBM은 유효한 관계이지만 IBM employedBy Mary는 유효한 관계가 아닙니다.

  • 역할

    멘션의 컨텍스트 의미를 제공하는 속성입니다. 예를 들어 "I went to IBM today"라는 문구에서 IBM은 멘션이고 Organization은 엔티티 유형이며 Facility는 엔티티 유형의 역할입니다.

  • 규칙 세트

    텍스트에 어노테이션을 작성하는 패턴을 정의하는 규칙 세트입니다. 패턴이 적용되면 일치하는 어노테이션에서 규칙의 조치가 수행됩니다. 일반적으로 규칙은 일치해야 하는 조건, 선택적 수량사, 일치하는 텍스트가 이행해야 하는 추가 제한조건 목록 및 일치하면 수행할 조치(예: 새 어노테이션 작성 또는 기존 어노테이션 수정)를 지정합니다.

S

  • 하위 유형

    다른 유형(상위 유형)을 확장하거나 구현하는 유형입니다.

  • 표면 형식(surface form)

    말뭉치에 있는 단어 또는 다중 단어 단위 양식입니다. 예를 들어 표제어 'organize'의 일부 표면 형식은 'organizing' 및 'organized'라는 용어입니다. dictionary(사전)표제어(lemma)도 참조하십시오.

T

  • 테스트 데이터(testing data)

    수집 및 교육 이후 시스템 메트릭을 평가하는 데 사용할 수 있는 어노테이션이 있는 문서 세트입니다. 블라인드 데이터(blind data)훈련 데이터(training data)도 참조하십시오.

  • 교육(train)

    시스템이 특정 도메인에서 기능할 수 있도록 해 주는 컴포넌트(예: 말뭉치 컨텐츠, 기계 학습 모델을 생성하는 훈련 데이터, 프로그래밍 방식 알고리즘 또는 기타 기준 실제값 컴포넌트)를 사용하여 Watson 인스턴스를 설정한 후에 정확도 분석에 따라 이러한 컴포넌트를 개선하고 업데이트하는 프로세스입니다.

  • 교육 데이터

    기계 학습 모델을 교육하는 데 사용할 수 있는 어노테이션이 작성된 문서 세트입니다. 블라인드 데이터(blind data)테스트 데이터(testing data)도 참조하십시오.

  • 참 부정(true negative)

    실제로 잘못되었으며 잘못된 것으로 예측된 응답 또는 어노테이션입니다.

  • 참 긍정(true positive)

    실제로 올바르고 올바른 것으로 예측된 응답 또는 어노테이션입니다.

  • 유형 시스템

    유형 시스템은 문서에서 발견할 수 있는 오브젝트의 유형을 정의합니다. 유형 시스템은 가능한 모든 엔티티 유형과 이러한 엔티티 유형 간의 관계를 정의합니다. 유형 시스템에는 다양한 유형을 원하는 만큼 정의할 수 있습니다. 유형 시스템은 일반적으로 도메인 및 애플리케이션에 대해 고유합니다.