データ接続と統合Python (Spark)PySparkリファレンス概念:クエリ

注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。

概念:クエリ

重複のない行、重複行の削除

DataFrame.distinct()

元の DataFrame の重複のない行を含む新しい DataFrame を返します。

Copied!
1 df = df.distinct()

DataFrame.drop_duplicates(subset=None)

重複行を削除した新しい DataFrame を返します。任意で、特定の列のみを考慮できます。

Copied!
1 2 df = df.drop_duplicates() df = df.drop_duplicates(["firstname", "lastname"])

null 値の削除

DataFrame.dropna(how='any', thresh=None, subset=None)

エイリアス: DataFrame.na.dropna(how='any', thresh=None, subset=None)

null 値を含む行を除外した新しい DataFrame を返します。DataFrame.dropna() と DataFrameNaFunctions.drop() は互いのエイリアスです。

パラメーター:

  • how – 'any' または 'all'。
    • 'any' の場合、null 値を1つでも含む行を削除します。
    • 'all' の場合、すべての値が null の行のみを削除します。
  • thresh – 整数。デフォルトは None です。指定した場合、null 以外の値の数が thresh より小さい行を削除します。(how パラメーターを上書きします)。
  • subset – 考慮する列名のリスト(任意)。

行数の制限

DataFrame.limit(number)

並べ替え

DataFrame.sort(*cols, **kwargs)

エイリアス: DataFrame.orderBy(*cols, **kwargs)

  • Column.asc() または F.asc(col)
  • Column.desc() または F.desc(col)