+
K
注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。
分割データ加工は、指定した条件に基づいて入力データを2つの異なる出力にパーティション分割するために使用します。このデータ加工は、入力データの各行を定義した条件に照らして評価し、その結果に応じていずれかの出力に振り分けます。
分割データ加工は、標準バッチパイプライン(Spark を基盤とする)と高速パイプライン(DataFusion を基盤とする)でのみサポートされます。ストリーミングパイプラインでは、分割の選択肢は表示されません。
現在サポートされている実行モードの一覧については、関数リファレンスの Split on condition の項目を参照してください。
Split on condition
グラフでテーブルノードを1個選択し、次のいずれかの方法で操作します。
分割の選択肢が表示されない場合は、標準バッチパイプラインまたは高速パイプラインで作業していること、およびテーブルノードをちょうど1個選択していることを確認してください。この選択肢は利用できない場合には非表示になるため、ストリーミングパイプラインでは表示されません。また、メディアセットやファイルベースの入力など、選択したノードがテーブル形式ではない場合も表示されません。
分割データ加工では、入力データの分割方法を決める条件を定義できます。この条件は、評価結果が真または偽になる論理式です。
真の出力には、条件の評価結果が true となる行が含まれます。これらの行は1番目の出力に振り分けられます。
偽の出力には、条件の評価結果が false となる行が含まれます。これらの行は2番目の出力に振り分けられます。
出力をプレビューするには、下部パネルの左上にあるドロップダウンを使用できます。True の出力を表示するには真を、False の出力を表示するには偽を選択します。
下流のデータ加工で出力を使用するには、データ加工を選択し、次の入力として使用する真または偽の出力を選択します。
顧客の注文データセットを考えます。しきい値に基づいて、注文を高額注文と低額注文の2つのカテゴリーに分けたいとします。
この場合、条件は order_value > 1000 になります。
order_value > 1000
真の出力には order_value が 1000 を超える注文が含まれ、 偽の出力には order_value が 1000 を超えない注文が含まれます。
order_value
1000