タグ

ブックマーク / qiita.com/kodai_sudo (1)

  • データ分析のための並列処理ライブラリDask - Qiita

    この記事は、Brainpad Advent Calender 15日目の記事です。 記事では、メモリに乗らないようなデータもPandasやNumPyライクに操作を行い、スケールアップ・スケールアウトにも対応できるライブラリ、Daskについて、簡単に紹介をします。 はじめに Pythonデータ分析機械学習をする際、PandasやNumPyを用いる場面が非常に多くなってきました。 しかし、PandasやNumPyではメモリに乗らないデータの扱いが難しかったり、基的にシングルコアでの処理を行うため、速度が遅い、といった問題があります。例えば、サーバー上で実行する際、CPUの論理コアが32個あっても、1個のCPUしか使用していない、といった感じです。 近年、データ分析関連のライブラリは非常に多様化しており、派閥(?)が沢山あるようです。 個人的には、Pandas作者であるWes McKin

    データ分析のための並列処理ライブラリDask - Qiita
    serihiro
    serihiro 2018/04/24
  • 1