사용자 훈련 SDU 모델 정의

문서의 구조를 기반으로 문서의 컨텐츠에 대해 학습하는 SDU (Smart Document Understanding) 모델을 작성합니다.

Smart Document Understanding 도구를 사용하여 콜렉션에 사용자 정의 필드를 추가하면 다음을 수행할 수 있습니다.

  • 문서의 특정 섹션에서 사전 빌드되거나 사용자 정의된 인리치먼트를 대상으로 합니다.
  • 큰 문서를 작은 문서로 나누십시오.

SDU가 유스 케이스를 지원할 수 있는지 여부를 결정하는 데 도움을 받으려면 Smart Document Understanding 사용 시기 를 읽으십시오.

테이블에서 정보를 캡처하는 것이 유스 케이스에 중요한 경우 사전 훈련된 모델 사용을 고려하십시오. 사전 훈련된 SDU 모델 작성에 대한 자세한 정보는 사전 훈련된 SDU 모델 적용 을 참조하십시오.

Smart Document Understanding 사용 시기

SDU (Smart Document Understanding) 도구는 일부 프로젝트 유형에서 더 잘 작동합니다.

  • 이 도구는 문서 검색 프로젝트와 함께 사용할 때 가장 유용합니다. 이 도구를 사용하여 문서를 더 작고 사용하기 쉬운 정보 단위로 나누십시오. Discovery 에서 문서의 올바른 정보 세트를 색인화하는 데 도움을 줄 때 애플리케이션이 찾고 리턴할 수 있는 응답을 개선합니다.

    예를 들어, 문서에 H4 표제가 있는 섹션에 표시되는 팁이 포함될 수 있습니다. 이러한 팁에서 별도로 정보를 추출하려는 경우 tips 라는 필드를 추가하고 이를 인식하도록 모델을 학습할 수 있습니다. 콜렉션에 모델을 적용한 후 tips 필드에만 인리치먼트를 적용할 수 있습니다. 나중에 tips 필드에서만 컨텐츠를 리턴하도록 검색을 제한할 수 있습니다.

    또는 서브섹션을 포함하는 매우 큰 문서가 있을 수 있습니다. 이러한 하위 섹션을 인식하도록 SDU 모델을 학습한 후 이러한 하위 섹션 중 하나로 시작하는 여러 개의 더 작고 관리하기 쉬운 문서로 대형 문서를 분할할 수 있습니다.

  • 대화식 검색 프로젝트에서 사용할 콜렉션을 준비하는 가장 좋은 방법은 개별 질문/응답 쌍을 식별하는 것입니다. SDU 도구를 사용하여 찾고 어노테이션을 작성할 수 있습니다. 응답 필드에 응답을 포함하도록 프로젝트를 구성하는 경우, watsonx Assistant 에서 검색 구성을 업데이트하여 사용자 정의 응답 필드에서 응답의 본문을 가져와야 합니다.

  • 사전 훈련된 SDU 모델은 계약에 대한 문서 검색 프로젝트에 자동으로 적용됩니다. 사전 훈련된 SDU 모델은 계약에 중요한 용어 및 개념을 인식하는 방법을 알고 있습니다. 따라서 사용자 훈련 SDU 모델을 이 프로젝트 유형에 적용할 수 없지만 적용할 필요도 없습니다.

  • SDU 도구는 Content Mining 프로젝트에서 거의 사용되지 않습니다.

SDU 도구를 사용하여 다음 파일 유형에만 어노테이션을 작성할 수 있습니다.

  • 이미지 파일 (PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Discovery 가 지원하는 파일 유형의 전체 목록은 지원되는 파일 유형 을 참조하십시오.

Smart Document Understanding 도구는 OCR (Optical Character Recognition) 을 사용하여 분석하는 파일의 이미지에서 텍스트를 추출합니다. 이미지는 OCR에서 지원하는 최소 품질 요구사항을 충족해야 합니다. 자세한 정보는 OCR(Optical Character Recognition) 을 참조하십시오.

도구는 다음 특성이 있는 문서를 읽을 수 없습니다. 시작하기 전에 콜렉션에서 문서를 제거하십시오.

  • 다른 텍스트를 덮는 텍스트가 있는 것으로 보이는 문서는 이중으로 겹쳐진 것으로 간주되어 주석을 달 수 없습니다.
  • 단일 페이지에 여러 열의 텍스트가 포함된 문서에는 어노테이션을 작성할 수 없습니다.

맞춤형 스마트 문서 이해 모델을 구축할 때, AI 모델을 문서에 적용하는 데 필요한 리소스로 인해 컬렉션의 변환 시간이 늘어날 수 있습니다.

대표 문서로 시작

문서는 모든 형태와 크기로 제공됩니다. 콜렉션에 여러 문서 구조가 혼합되어 있을 수 있습니다. 단일 콜렉션의 문서에 유사한 스타일 특성이 있는 경우 Smart Document Understanding이 가장 잘 작동합니다. 예를 들어, 문서는 제목 및 헤더에 대해 일관된 글꼴 크기 및 색상을 사용하고 문서의 테이블에는 유사한 레이아웃이 있습니다. 콜렉션에 가장 적합한 모델을 작성하려면 다음 전제조건 단계를 수행하십시오.

  1. 문서를 검토하여 스타일 및 레이아웃 패턴을 찾은 후 해당 스타일에 따라 문서를 그룹으로 분리하십시오.

    예를 들어, 데이터에 네 개의 서로 다른 형식화 스타일을 따르는 문서가 포함되어 있는 경우 문서를 각 스타일에 대해 하나씩 네 개의 개별 콜렉션으로 나누십시오. 균일한 레이아웃 및 스타일의 문서를 각 콜렉션에 추가하십시오. 콜렉션당 좋은 대상 크기는 40개의 문서입니다.

  2. SDU 도구를 사용하여 이 대표적인 문서 세트에 어노테이션을 작성하고 데이터에서 사용자 정의 컨텐츠를 인식하도록 Watson 을 훈련하십시오.

  3. 사용자 정의 SDU 모델을 전체 콜렉션에 적용하십시오. 자세한 정보는 SDU 모델 재사용 을 참조하십시오.

모델 작성

사용자 훈련 Smart Document Understanding 모델을 콜렉션에 적용하려면 다음 단계를 완료하십시오.

  1. 탐색 패널에서 콜렉션 관리 페이지를 여십시오.

  2. 프로젝트에 둘 이상의 콜렉션이 있는 경우 어노테이션을 작성할 문서가 있는 콜렉션을 선택하십시오.

  3. 필드 식별 페이지 로 이동합니다.

  4. 사용자 훈련 모델을 선택하십시오.

    텍스트 추출 전용 옵션은 기본적으로 사용됩니다. 이 모델을 사용하면 소스 문서에서 인식되는 모든 텍스트가 text 필드에서 인덱싱됩니다.

  5. 제출을 클릭한 후 변경사항 적용 및 재처리를 클릭하십시오.

문서의 서브세트를 사용하여 어노테이션을 작성할 수 있습니다. 20-50개의 문서 세트가 목록에 표시됩니다. 사용 가능한 문서 수는 콜렉션에 있는 전체 문서 수 및 지원되는 파일 유형 수를 포함하여 여러 요소에 따라 다릅니다.

SDU 모델 훈련에 사용되는 훈련 문서가 Discovery 에서 레이아웃 또는 구조 변경을 거치면, 이전 주석이 더 이상 유효하지 않습니다. SDU 모델을 업데이트하려면 업데이트된 문서를 수집한 후 다시 주석을 달아야 합니다. 그렇지 않으면 이전 주석이 텍스트 내용에 잘못 매핑되어 UI의 해당 주석 페이지가 혼란스러워집니다.

비디오 레이블링

다음 비디오는 레이블을 선택한 후 문서의 텍스트 표시에 적용하는 방법을 보여줍니다.

비디오에서 사용자는 title 필드 레이블을 클릭한 후 목차 페이지 제목을 나타내는 텍스트 블록을 클릭하여 텍스트를 제목으로 레이블 지정합니다. 그런 다음 사용자는 table_of_contents 필드 레이블을 클릭하고 목차 텍스트 블록을 선택하여 레이블을 지정합니다. 그런 다음 사용자가 footer 필드 레이블을 클릭하고 페이지 바닥글을 나타내는 텍스트 블록을 클릭합니다. 텍스트에 레이블이 지정되면 사용자가 페이지 제출 단추를 클릭합니다.

문서 레이블 지정

시작하기 전에 어노테이션을 작성할 계획인 문서의 구조를 파악하십시오. 응답마다 Discovery가 리턴하도록 할 하위 제목이 있는 섹션이 있습니까? 그렇다면 모든 부제목을 식별하십시오. 나중에 각각 하위 제목으로 시작하는 개별 하위 문서로 문서를 분할할 수 있습니다. 자세한 정보는 Smart Document Understanding 사용 시기 를 참조하십시오.

문서에 레이블을 지정하려면 다음 단계를 완료하십시오.

  1. 문서 미리보기를 검토하십시오.

    원래 문서의 보기가 문서의 표시와 함께 표시됩니다. 여기서 텍스트는 블록으로 대체됩니다.

    모든 현재 텍스트가 표준 텍스트로 간주되고 text 필드에서 인덱싱되므로 블록은 모두 text 필드 레이블의 색상입니다.

    제목 또는 페이지 바닥글과 같은 특정 유형의 정보를 다른 필드 레이블과 함께 표시하는 레이블 블록입니다. 예를 들어, 텍스트로 인덱싱되는 문서 제목에 제목 필드 레이블을 적용할 때 문서 컨텐츠의 보다 정확한 표시를 정의합니다.

    레이블을 사용하여 문서 구조의 다른 부분을 식별하는 프로세스를 문서 어노테이션 작성 이라고 합니다.

  2. 문서에 어노테이션을 작성하는 데 사용할 수 있는 필드 레이블을 검토하십시오. 필드 레이블 패널에 표시됩니다.

    필드 목록 및 해당 설명은 기본 필드 레이블 테이블을 참조하십시오.

  3. 사용자 정의 필드 레이블을 작성하려면 새로 작성을 클릭하십시오.

    • 공백 없이 필드 레이블을 지정하십시오. 예를 들어, complex_task의 경우는 유효한 필드 레이블입니다.

      필드 레이블 이름을 사용하거나 Discovery에 대해 특별한 의미가 있는 이름에 숫자 부호 (#) 또는 마침표 (.) 와 같은 문자를 포함하지 마십시오. 자세한 정보는 필드 처리 방법 을 참조하십시오.

    • 필드를 표시하는 데 사용되는 색상을 변경하려면 사용할 색상으로 표시될 때까지 색상 블록 원을 가리키는 두 개의 화살표가 있는 색상의 정사각형 블록 을 반복적으로 클릭하십시오.

      나중에 필드 레이블 색상을 변경할 수 없습니다.

    • 작성을 클릭하십시오.

  4. 먼저 필드 레이블을 클릭하여 활성화하십시오.

  5. 그런 다음 필드 유형으로 레이블을 지정할 컨텐츠를 표시하는 블록을 클릭하십시오.

    블록이 필드 레이블의 색상으로 변경됩니다. 필드에 레이블을 지정했습니다!

  6. 이 프로세스를 반복하여 문서의 추가 필드에 어노테이션을 작성하십시오.

    걱정하지 마십시오. 모든 페이지에 레이블을 지정할 필요는 없습니다. 레이블을 적용하고 페이지를 제출할 때 Watson 은 어노테이션을 작성하고 어노테이션을 예측하기 시작하는 내용을 학습합니다.

    다음 지침을 따르십시오.

    • 섹션에 특별한 사항이 없는 경우에는 기본적으로 적용되는 text 로 레이블 지정된 상태로 두십시오.
    • 레이블은 여러 페이지에 걸쳐 있을 수 없습니다.
    • 볼드체, 이탤릭체 또는 밑줄친 텍스트를 다르게 처리하지 마십시오. 스타일이 아니라 컨텍스트를 기반으로 레이블을 지정하십시오.
    • 모든 문서에 일관된 레이블을 사용하십시오.
    • 다중 페이지 문서의 첫 번째 페이지에서 마지막 페이지까지 작업합니다.
    • 단일 어노테이션을 제거하려면 다른 레이블 (예: text) 을 선택하고 이를 항목에 적용하여 이전 어노테이션을 겹쳐쓰십시오.
    • 전체 페이지에 추가한 어노테이션을 제거하려면 도구 모음에서 변경사항 지우기 아이콘을 클릭하십시오.
    • 테이블에 어노테이션을 작성하려면 테이블의 시작 부분에 있는 텍스트를 클릭한 후 끌어서 전체 테이블에서 텍스트를 선택하십시오.
    • 하나 이상의 테이블에 레이블을 지정하면 전체 콜렉션에 대해 테이블 이해 인리치먼트가 자동으로 사용됩니다. 자세한 정보는 테이블 이해 를 참조하십시오.
    • 소스 문서의 이미지는 미리보기에서 렌더링되지 않습니다. OCR (Optical Character Recognition) 을 사용하는 경우 이미지 또는 다이어그램의 텍스트가 추출되어 미리보기에서 렌더링됩니다.
    • 공백을 레이블하지 마십시오.
  7. 레이블을 지정할 모든 항목에 레이블이 지정되면 페이지를 제출하십시오. 페이지 제출을 클릭하십시오.

    Watson 이 서로 다른 유형의 컨텐츠를 적절한 필드에 올바르고 일관되게 맵핑할 수 있을 때까지 계속 문서에 어노테이션을 작성하십시오.

  8. Watson 이 필드를 식별하도록 교육한 후 변경사항 적용 및 재처리를 클릭하십시오.

SDU 도구를 사용하여 정의하는 사용자 정의 필드는 루트 레벨 필드로 색인화됩니다.

다음에 수행할 작업

사용자 훈련 모델을 빌드할 때 문서에서 정보가 저장되는 위치를 변경합니다. 그런 다음 검색 결과가 구성되는 방법을 변경하십시오. 기본적으로 검색 결과는 단락 또는 텍스트 필드에서 검색됩니다. 결과 본문의 소스로 사용하기에 더 나은 필드가 있을 수 있습니다. 자세한 정보는 결과 컨텐츠 변경 을 참조하십시오.

가상 어시스턴트에서 프로젝트를 사용 중인 경우 다른 필드에서 응답 본문을 가져오도록 검색 스킬 구성을 업데이트하십시오. 자세한 정보는 검색 구성을 참조하십시오.

SDU 모델에서 생성되는 새 루트 필드에 인리치먼트 (사용자 정의 또는 사전 빌드된 인리치먼트) 를 적용할 수 있습니다.

검색 결과와 함께 더 짧은 텍스트 스니펫을 리턴하려는 경우 정의한 새 필드 (예: 장 또는 섹션) 중 하나를 기반으로 문서를 분할할 수 있습니다.

사용 가능 필드

Smart Document Understanding 도구를 사용하여 문서에 적용할 수 있는 필드는 다음과 같습니다.

필드는 임의적입니다. 원하는 경우 문서의 모든 제목에 image 필드를 적용할 수 있습니다. 그러나 필드 이름이 컨텐츠와 일치하지 않는 경우 나중에 필요한 정보를 검색할 필드를 알기 어려울 수 있습니다. 기본 세트는 시작하는 데 도움이 되는 대표 필드 유형입니다. texttable 필드만 특별한 의미를 갖습니다. 텍스트 및 테이블 이외의 항목을 식별하는 데 사용하지 마십시오.

기본 필드 레이블
필드 정의
answer 질문과 답변 쌍(주로 FAQ에 있음)에서 질문에 대한 답변.
author 저자 이름.
footer 이 태그를 사용하면 페이지 끝에 나타나는 문서 관련 메타 정보(예: 페이지 번호 또는 참조 정보)를 표시할 수 있습니다.
header 이 태그를 사용하면 페이지의 시작 부분에 나타나는 문서에 대한 메타 정보를 나타낼 수 있습니다.
question 질문과 답변 쌍(주로 FAQ에 있음)에서 질문.
subtitle 문서의 부제목입니다.
table_of_contents 목차의 목록에 이 태그를 사용하십시오.
text 기본적으로 문서의 모든 텍스트 블록은 텍스트로 레이블 지정됩니다. 특별한 의미가 있는 텍스트 블록에만 다른 레이블을 적용하십시오.
title 문서의 주요 제목입니다.
table 이 태그를 사용하여 문서의 표에 어노테이션을 작성합니다.
image 이미지는 문서 미리보기에 표시되지 않습니다. OCR을 사용하는 경우 이미지 또는 다이어그램의 텍스트가 대신 미리보기에 표시됩니다. 일부 이미지의 텍스트가 검색 결과에 포함되지 않도록 하려면 이미지 텍스트를 이미지로 태그 지정하십시오. 나중에 색인에서 이미지 필드를 제외할 수 있습니다.

SDU 모델 재사용

SDU 도구를 사용하여 모델을 정의한 후, 모델을 저장하고 한 콜렉션에서 내보낸 후 다른 콜렉션으로 가져와서 다른 콜렉션에서 재사용할 수 있습니다.

새 모델을 가져오면 콜렉션의 기존 모델을 겹쳐씁니다. 기존 모델이 이미 사용자 정의 필드 레이블 및 어노테이션을 통해 훈련된 경우 새 모델을 가져오면 콜렉션에 영향을 주며 데이터가 유실될 수 있습니다.

모델을 재사용하려면 다음 단계를 완료하십시오

  1. 재사용하려는 모델을 내보냅니다. SDU 도구 모음 메뉴에서 모델 내보내기를 선택하십시오.

    가져오기 및 내보내기 메뉴*
    및 내보내기

  2. 모델을 재사용할 콜렉션을 작성하십시오. 처음에는 콜렉션에 하나의 문서만 추가하십시오.

  3. SDU 도구 모음에서 모델을 가져오십시오. 내보낸 모델의 파일 확장자는 .sdumodel 입니다.

  4. 콜렉션에 나머지 문서를 추가하십시오. 콜렉션 관리 페이지의 활동 탭을 열고 데이터 업로드 를 클릭하여 콜렉션에 파일을 더 추가하십시오.

가져온 모델을 그대로 사용하십시오. 더 이상 어노테이션을 작성하지 마십시오. .sdumodel 파일을 가져온 후 어노테이션을 작성하면 가져온 모델을 겹쳐씁니다.

Smart Document Understanding 한계

Smart Document Understanding 모델별로 작성할 수 있는 사용자 정의 필드의 수는 Discovery 플랜 유형에 따라 다릅니다.

사용자 정의 필드 한계
플랜 SDU 모델당 사용자 정의 필드
Cloud Pak for Data 무제한
프리미엄 100년
구축 100년
Plus (평가판 포함) 40

콜렉션당 SDU 모델을 훈련시키기 위해 어노테이션을 작성할 수 있는 최대 문서 수는 Discovery 플랜 유형에 따라 다릅니다.

훈련 세트 한계
플랜 콜렉션당 문서
Cloud Pak for Data 40
프리미엄 40
구축 40
Plus (평가판 포함) 40

필드 관리

필드 관리 탭에는 여러 가지 옵션이 있습니다.

색인화할 필드 식별
자세한 정보는 조회 결과에서 컨텐츠 제외 를 참조하십시오.
문서를 분할하여 쿼리 결과 개선
자세한 정보는 조회 결과를 더 간결하게 만들기 위해 문서 분할 을 참조하십시오.
날짜 형식 설정
자세한 정보는 날짜 형식 설정 을 참조하십시오.

필드 관리 페이지 에 액세스하려면 탐색 패널에서 컬렉션 관리 아이콘을 클릭하고 컬렉션을 여십시오. 필드 관리 탭을 클릭하십시오. 콜렉션에 대한 자세한 정보는 콜렉션 작성 을 참조하십시오.