事前トレーニングされた SDU モデルの適用
テキストを抽出でき、文書内の表、リスト、およびセクションを識別するためにトレーニングされる、事前作成された Smart Document Understanding (SDU) モデルを適用します。
キャプチャーしたい貴重な情報を含む表が文書に含まれている場合は、事前にトレーニングされたモデルを使用します。 また、モデルは、表、リスト、およびセクションのネスト構造に固有の意味を保持することもできます。 事前にトレーニングされたモデルを使用すると、文書の構造から情報を取り込むプロセスが高速化されます。
文書から意味を推測するために文書構造がどのように使用されるかをカスタマイズする場合、または SDU モデルによって生成されるフィールドを使用して文書を分割する場合は、代わりにユーザーがトレーニングしたモデルを作成します。 詳しくは、 ユーザーがトレーニングした SDU モデルの定義 を参照してください。
事前トレーニングされたモデルは、 「契約の文書の取得 (Document Retrieval for Contracts)」 プロジェクトに自動的に適用されます。 文書内の契約関連のコンテンツにアノテーションを付ける代わりに、プロジェクトは、契約にとって重要な用語と概念を認識する方法を既に知っているモデルを適用します。
文書の準備
事前トレーニングされた SDU モデルは、以下のファイル・タイプにのみ適用できます。
- イメージ・ファイル (PNG、TIFF、JPG)
- Microsoft PowerPoint
- Microsoft Word
Discovery がサポートするファイル・タイプの完全なリストについては、 サポートされるファイル・タイプ を参照してください。
Smart Document Understanding ツールは、光学式文字認識 (OCR) を使用して、分析対象のファイル内のイメージからテキストを抽出します。 イメージは、OCR でサポートされる最小品質要件を満たしている必要があります。 詳しくは、 光学式文字認識 を参照してください。
ツールは、以下の特性を持つ文書を読み取ることができません。開始する前に、コレクションからそれらを削除してください。
- 他のテキストに重なっているように見えるテキストを含む文書は、 二重に重なっていると見なされ、注釈を付けることはできません。
- 単一ページに複数列のテキストを含んでいる文書に注釈を付けることはできない。
スマートドキュメント理解モデルを適用すると、AIモデルをドキュメントに適用するために必要なリソースにより、コレクションの変換時間が長くなる場合があります。
事前トレーニングされたモデルの適用
事前トレーニングされた Smart Document Understanding モデルをコレクションに適用するには、以下の手順を実行します。
-
ナビゲーション・パネルから 「コレクションの管理」 ページを開きます。
-
モデルの適用先のコレクションを選択します。
-
識別フィールドページを開きます。
-
「事前トレーニングされたモデル」 を選択します。
デフォルトでは、 「テキスト抽出のみ」 オプションが使用されます。 このモデルでは、ソース文書で認識されるテキストはすべて、
textフィールドで索引付けされます。 -
「実行依頼」 をクリックし、 「変更を適用して再処理」 をクリックします。
出力について
SDU モデルは、文書内で表などの構造を検出して処理すると、その構造の表現を enriched_{field} という名前のフィールドに保管します。ここで、 {field} は構造が保管されたフィールドです。
以下の抜粋は、事前トレーニングされた SDU モデルによって処理された文書の enriched_html フィールドからの表の JSON 表現を示しています。
処理された構造からテキストを抽出する場合は、 location フィールドを使用して、テキスト・ストリングの開始位置と終了位置を識別する索引値を見つけることができます。
索引付き表の構造について詳しくは、 表について を参照してください。
問題のトラブルシューティング
Smart Document Understanding ツールを使用しているときに問題が発生した場合は、以下の回避策に従ってください。
文書を処理するためのリソースが不十分です
- エラー
- 事前トレーニングされたモデルをコレクションに適用すると、文書処理が正常に完了せず、
Insufficient resources to process documentというメッセージが表示されます。 - 原因
- このエラーは、機械学習モデルを作成するプロセスの解析、構造識別、またはアセンブリーの各フェーズでメモリー不足エラーが発生したために表示されます。 コレクション内の 1 つ以上の文書が大きすぎる場合、またはツールが処理する複雑な表が多すぎる場合は、リソースが不足しています。
- ソリューション
- 事前トレーニングされたモデルをコレクションに適用する前に、大規模な文書または多数の表を含む文書のコレクションを確認し、それらをより小さい文書に分割してください。 正確な制限は、文書の複雑さによって異なります。 通常、400 ページを超える長さの文書を分割し、1 つの文書に 20 を超える複雑な表を含めないようにします。