사전 학습된 SDU 모델 적용

텍스트를 추출할 수 있고 문서에서 표, 목록, 섹션을 식별하도록 학습된 사전 구축된 SDU(스마트 문서 이해) 모델을 적용하세요.

문서에 캡처하려는 중요한 정보가 포함된 표가 있는 경우 사전 학습된 모델을 사용하세요. 또한 이 모델은 표, 목록 및 섹션의 중첩 구조에 내재된 의미를 보존할 수 있습니다. 사전 학습된 모델을 사용하면 문서 구조에서 정보를 캡처하는 프로세스의 속도가 빨라집니다.

문서 구조가 문서에서 의미를 추론하는 데 사용되는 방식을 사용자 지정하거나 SDU 모델에서 생성된 필드로 문서를 분할하려는 경우에는 대신 사용자 학습 모델을 만드세요. 자세한 내용은 사용자 학습 SDU 모델 정의하기 를 참조하세요.

사전 학습된 모델이 계약 문서 검색 프로젝트에 자동으로 적용됩니다. 문서에서 계약 관련 콘텐츠에 주석을 다는 대신 이 프로젝트는 계약에 중요한 용어와 개념을 인식하는 방법을 이미 알고 있는 모델을 적용합니다.

문서 준비

다음 파일 유형에만 사전 학습된 SDU 모델을 적용할 수 있습니다:

  • 이미지 파일(PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Discovery가 지원하는 파일 형식의 전체 목록은 지원되는 파일 형식 를 참조하세요.

스마트 문서 이해 도구는 광학 문자 인식(OCR)을 사용하여 분석하는 파일의 이미지에서 텍스트를 추출합니다. 이미지는 OCR에서 지원하는 최소 품질 요구 사항을 충족해야 합니다. 자세한 내용은 광학 문자 인식 를 참조하세요.

이 도구는 다음과 같은 특성을 가진 문서를 읽을 수 없으므로 시작하기 전에 컬렉션에서 해당 문서를 제거하세요:

  • 다른 텍스트를 덮는 텍스트가 있는 것으로 보이는 문서는 이중으로 겹쳐진 것으로 간주되어 주석을 달 수 없습니다.
  • 단일 페이지에 여러 열의 텍스트가 포함된 문서에는 어노테이션을 작성할 수 없습니다.

스마트 문서 이해 모델을 적용하면, AI 모델을 문서에 적용하는 데 필요한 리소스로 인해 컬렉션의 변환 시간이 늘어날 수 있습니다.

사전 학습된 모델 적용

사전 학습된 스마트 문서 이해 모델을 컬렉션에 적용하려면 다음 단계를 완료하세요:

  1. 탐색 패널에서 컬렉션 관리 페이지를 엽니다.

  2. 모델을 적용할 컬렉션을 선택합니다.

  3. 필드 식별 페이지 로 이동합니다.

  4. 사전 학습된 모델을 선택합니다

    텍스트 추출만 옵션이 기본적으로 사용됩니다. 이 모델을 사용하면 소스 문서에서 인식되는 모든 텍스트가 text 필드에 색인됩니다.

  5. 제출를 클릭한 다음 변경 사항 적용 및 재처리를 클릭합니다.

출력 이해하기

SDU 모델이 문서에서 테이블과 같은 구조를 찾아 처리하는 경우 구조의 표현을 enriched_{field} 이라는 필드에 저장하며, 여기서 {field} 는 구조가 저장된 필드입니다.

다음 발췌문은 사전 학습된 SDU 모델에 의해 처리된 문서의 enriched_html 필드에 있는 테이블의 JSON 표현을 보여줍니다.

섹션 제목, 행_헤더, 테이블_헤더, 위치 등의 섹션이 포함된 테이블 개체가 있는 enriched_html 필드가 포함된 JSON 스니펫을 표시합니다.
JSON table representation

처리된 구조에서 텍스트를 추출하려면 location 필드를 사용하여 텍스트 문자열이 시작하고 끝나는 위치를 식별하는 인덱스 값을 찾을 수 있습니다.

인덱싱된 테이블의 구조에 대한 자세한 내용은 테이블 이해하기 를 참조하세요.

문제점 해결

스마트 문서 이해 도구로 작업할 때 문제가 발생하는 경우 다음 해결 방법을 따르세요.

문서 처리를 위한 리소스 부족

오류
미리 학습된 모델을 컬렉션에 적용하면 문서 처리가 성공적으로 완료되지 않고 Insufficient resources to process document 메시지가 표시됩니다.
원인
이 오류는 머신 러닝 모델을 구축하는 프로세스의 구문 분석, 구조 식별 또는 어셈블리 단계에서 메모리 부족 오류가 발생하여 표시됩니다. 컬렉션에 있는 문서 중 하나 이상이 너무 크거나 복잡한 표가 너무 많아 도구가 처리할 수 없는 경우 리소스가 부족합니다.
솔루션
컬렉션에 미리 학습된 모델을 적용하기 전에 큰 문서나 표가 많은 문서가 있는지 검토하고 더 작은 문서로 분할한 다음 컬렉션에 적용하세요. 정확한 한도는 문서의 복잡성에 따라 다릅니다. 일반적으로 400페이지가 넘는 문서는 분할하고 단일 문서에 20개 이상의 복잡한 표를 포함하지 마세요.