ブックマーク / zenn.dev/hellorusk (1)

  • Claude がテキストに電子透かしを入れ始めたので、LLM ウォーターマーキングの仕組みを調べた

    この例では、確率2位の dog が、たまたま高い乱数 r = 0.95 を引いたおかげで勝っています。とはいえ p_i が大きいほど指数 1/p_i が小さく r_i^{1/p_i} は 1 に近づくので、基的には確率の高い候補ほど勝ちやすい競争です。そして、この選び方でトークン i が勝つ確率は元の p_i に厳密に一致することが、Gumbel-Max トリックとして知られる古典的な性質から従います。乱数でくじ引きする代わりに「乱数を使った決定的な最大値選び」をしているだけなので、外から観察できる振る舞いは通常のサンプリングと区別がつかないわけです。 では、分布が同じなのにどうやって検出するのでしょうか。着眼点は、透かし入りテキストの各単語が「高い r_i を引いたから勝った」勝者の集まりだという点です。 人間が書いた文章に同じ計算を適用すると、各単語に割り当たる r は書き手と無関係

    Claude がテキストに電子透かしを入れ始めたので、LLM ウォーターマーキングの仕組みを調べた
    dltlt
    dltlt 2026/08/13
    人間の書き方の癖も「偏り」だし、書きたい内容(意味)が秘密鍵由来の「当たり領域」に偶々入ってしまうこともあるだろうから、擬陽性かなり出そうに思う。
  • 1