こんにちは、 Legalscape (採用情報) で法情報をいい感じに収集・運用しているあざらし🦭です。 一次情報・二次情報に関わらず、形式や公開方法が多岐にわたる法情報を正確に分析あるいは表示するためには構造化という処理が必要になります。弊社ではこの構造化処理フローと構造化モデルについて日々議論を重ね、改良を続けています。 この記事では、そんな構造化データの表現形式の一つであるHTMLの様々な側面について詳しく考えてみたいと思います。 pの中にdivを入れてみる このHTMLを見てください。 <p> これはpです。 <div>これはdivです。</div> </p> このとき意図しているのは次のような構造です。 P ├── "これはpです。" └── DIV └── "これはdivです。" しかし、標準的なHTMLパーサーはこのDOMを作りません。 できあがったDOMをHTMLに直すと

