モデルにはgpt-5.4-nanoを使用する(※記事執筆時点のモデル名。実際の利用時は最新のOpenAIモデル一覧を確認されたい)。記事では「このタスクに大規模な推論モデルは不要」と明示しており、コスト最適化の観点からも小型モデルで十分と判断している。 ステップ1:HTMLのクリーニング 最も実装が面白いのがこのステップだ。BeautifulSoupでscript、style、nav、header、footer、form、buttonといったタグを一括除去した後、さらにクラス名やID属性に含まれるノイズワードでフィルタリングする。 noise_words = [ "cursor", "modal", "popup", "floating", "signup", "login", "cookie", "banner", "navbar", "menu", "footer", "header"

