タグ

ブックマーク / yutori-datascience.hatenablog.com (2)

  • Kaggle Tokyo Meetup #4 開催レポート - tkm2261's blog

    こんにちは。tkm2261です。 今日は2018/5/12に開催したKaggle Tokyo Meetup #4の模様をレポートします。 connpass.com このmeetupも4回目となり、今回はGoogle様からサポートを頂いた事もあり、かなり大規模なmeetupになりました。 今回からMaster枠とExpert枠を設けたり、Youtube Liveをしたり、人数を増やしたりと色々新しいことを試しています。 さらに自分で言うのもアレですが超豪華なスピーカーになっています。 日の見どころは 競プロ界の神tourist wataさん 金メダル2個のnovice pocketさん 苦労人masterのterekaさん scikit-learn生みの親davidCさん LTなのに一ヶ月前から資料作ってたjackさん 2 stage制の鬼osciiartさん talkingdata覇者f

    Kaggle Tokyo Meetup #4 開催レポート - tkm2261's blog
    knok
    knok 2018/05/14
  • PythonでCSVを高速&省メモリに読みたい - tkm2261's blog

    今日はPython (Pandas)で高速にCSVを読むことに挑戦したいと思います。 Kaggleに参加するたびに、イライラしていたので各実装の白黒はっきりさせようと思います。 R使いが羨ましいなぁと思う第一位がCSV読込が簡単に並列出来て速いことなので、 なんとかGILのあるPythonでも高速に読み込みたいと思います。 ただ、この検証ではコーディング量が多いものは検証しません。 CSV読込は頻出するので、フットワークの軽さが重要です。(オレオレライブラリ嫌い) Pickleは早いけど。。。 結論はDask使おう! 検証環境 データ 速度検証 pandas.read_csv() pandas.read_csv() (dtype指定) pandas.read_csv() (gzip圧縮) numpy.genfromtxt() pandas.read_csv() (chunksize指定 +

    PythonでCSVを高速&省メモリに読みたい - tkm2261's blog
  • 1