本記事で紹介する手法は、対象サイトの利用規約・robots.txtを遵守した上での利用を前提としています。 はじめに Pythonでスクレイピングを始めると、最初に使うのは requests です。シンプルで直感的で、ほとんどの用途で十分に機能します。 しかし、スクリプトをスケールさせようとしたとき「requests は非同期に対応していない」という壁にぶつかります。そこで調べると httpx が出てきます。「requests の上位互換なのか?」「全部 httpx に移行すべきか?」「curl_cffi はどう違うのか?」——この3択で迷った経験があります。 以前、300件のURLを同期で取得していたスクリプトを非同期化しようとしたとき、httpx に移行するか asyncio + requests を使うか(これはできない)、curl_cffi の非同期版にするかで迷いました。違いを整

