Sparkのpython版DataFrameのWindow関数を使って、カラムをグルーピング&ソートしつつ、累積和を計算するための方法です。 公式のPython APIドキュメントを調べながら模索した方法なので、もっと良い方法があるかも。 使ったSparkのバージョンは1.5.2です。 サンプル・データ PostgreSQLのテーブルにテスト用データを用意し、pysparkにDataFrameとしてロードします。 $ SPARK_CLASSPATH=postgresql-9.4-1202.jdbc41.jar PYSPARK_DRIVER_PYTHON=ipython pyspark (..snip..) In [1]: df = sqlContext.read.format('jdbc').options(url='jdbc:postgresql://localhost:5432/pos
![SparkでDataFrameを使ってグループごとの累積和・総和を求める方法【Python版】 - Qiita](https://cdn-ak-scissors.b.st-hatena.com/image/square/0e0e19459697c445e2a690424205c1c0f5aa1bf3/height=288;version=1;width=512/https%3A%2F%2Fqiita-user-contents.imgix.net%2Fhttps%253A%252F%252Fcdn.qiita.com%252Fassets%252Fpublic%252Farticle-ogp-background-412672c5f0600ab9a64263b751f1bc81.png%3Fixlib%3Drb-4.0.0%26w%3D1200%26mark64%3DaHR0cHM6Ly9xaWl0YS11c2VyLWNvbnRlbnRzLmltZ2l4Lm5ldC9-dGV4dD9peGxpYj1yYi00LjAuMCZ3PTk3MiZoPTM3OCZ0eHQ9U3BhcmslRTMlODElQTdEYXRhRnJhbWUlRTMlODIlOTIlRTQlQkQlQkYlRTMlODElQTMlRTMlODElQTYlRTMlODIlQjAlRTMlODMlQUIlRTMlODMlQkMlRTMlODMlOTclRTMlODElOTQlRTMlODElQTglRTMlODElQUUlRTclQjQlQUYlRTclQTklOEQlRTUlOTIlOEMlRTMlODMlQkIlRTclQjclOEYlRTUlOTIlOEMlRTMlODIlOTIlRTYlQjElODIlRTMlODIlODElRTMlODIlOEIlRTYlOTYlQjklRTYlQjMlOTUlRTMlODAlOTBQeXRob24lRTclODklODglRTMlODAlOTEmdHh0LWFsaWduPWxlZnQlMkN0b3AmdHh0LWNvbG9yPSUyMzIxMjEyMSZ0eHQtZm9udD1IaXJhZ2lubyUyMFNhbnMlMjBXNiZ0eHQtc2l6ZT01NiZzPThkZTc4NmNiOWY0ZGM1Y2UyYzA0YmI1ZTM2YjhjMWRi%26mark-x%3D142%26mark-y%3D57%26blend64%3DaHR0cHM6Ly9xaWl0YS11c2VyLWNvbnRlbnRzLmltZ2l4Lm5ldC9-dGV4dD9peGxpYj1yYi00LjAuMCZoPTc2Jnc9NzcwJnR4dD0lNDBid3Rha2FjeSZ0eHQtY29sb3I9JTIzMjEyMTIxJnR4dC1mb250PUhpcmFnaW5vJTIwU2FucyUyMFc2JnR4dC1zaXplPTM2JnR4dC1hbGlnbj1sZWZ0JTJDdG9wJnM9ZWU1MjM2OGI3ZDAwNjhkNWQxM2NiNDZmZWJiN2U4ZmM%26blend-x%3D142%26blend-y%3D436%26blend-mode%3Dnormal%26txt64%3DaW4gUXVpcHBlciBMaW1pdGVk%26txt-width%3D770%26txt-clip%3Dend%252Cellipsis%26txt-color%3D%2523212121%26txt-font%3DHiragino%2520Sans%2520W6%26txt-size%3D36%26txt-x%3D156%26txt-y%3D536%26s%3De560b8498a46e38aad4426b46d2ed2b5)