注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。

PDF からレイアウトを保持したコンテンツの抽出

サポート対象:バッチ、高速

指定したドキュメントから、レイアウトを保持しながらコンテンツを抽出します。

式のカテゴリー: メディア

宣言された引数

  • 検出する言語: 入力ファイルで検出する言語。
    セット<列挙型<アフリカーンス語、アルバニア語、アムハラ語、アラビア語、アルメニア語、アッサム語、アゼルバイジャン語、アゼルバイジャン語 - キリル文字、バスク語、ベラルーシ語、ほか ...>>
  • メディア参照: コンテンツを抽出する PDF。
    式<Media Reference>
  • 出力形式: 希望する出力の形式。シンプルなテキストベースの出力、または境界ボックスを含むすべての詳細を保持する構造化された出力から選択します。
    列挙型<完全な抽出、テキストとテーブル>
  • 任意 終了ページ: ページ範囲の最後のページ(このページを含みます)。値を指定しない場合は、デフォルトで最終ページになります。
    式<Integer>
  • 任意 エラー処理: 処理に失敗した入力に対するパイプラインの動作を指定します。
    列挙型<FAIL, NULL>
  • 任意 開始ページ: ページ範囲の最初のページ。値を指定しない場合は、デフォルトで先頭ページになります。
    式<Integer>

出力タイプ: 配列<配列<構造体<block_index, block_id:文字列, page, block_type:文字列, content:文字列, bounding_box:文字列, languages:配列<文字列>, confidence>>> | 配列<文字列>

例

例1:基本ケース

引数の値:

  • 検出する言語: {ENG}
  • メディア参照: mediaReference
  • 出力形式: TEXT
  • 終了ページ: End Page
  • エラー処理: FAIL_FAST
  • 開始ページ: Start Page
mediaReferenceアウトプット
{"mimeType":"application/pdf","reference":{"type":"mediaSetItem","mediaSetItem":{"mediaSetRid":"ri.mio.main.media-set.a", "mediaItemRid":"ri.mio.main.media-item.a"}}}抽出されたコンテンツ