Are You in the Weights: 個人のLLM認識の分析

「Are You in the Weights」の概要

「Are You in the Weights」は、個人が大規模言語モデル(LLM)の学習データに残す足跡を測定するためのツールです。 複数の最先端モデルと小規模モデルに並行してクエリを投げ、得られた応答をクラスタリングし、"strength" スコアを算出して、さまざまなウェイトに対してどれだけ強く認識されているかを判断します。

ウェブトラフィックがますますLLMを介した情報探索へとシフトする中、このツールはユーザーが自分のアイデンティティの痕跡—あるいはアイデンティティの幻覚—が最新のAIモデルのウェイトにどの程度残っているかを確認できる手段を提供します。

技術実装と手法

並列クエリとクラスタリング

システムは単一モデルの出力に依存しません。代わりに、さまざまなモデルに同時にクエリを投げます。認識度を判断するために、ツールは応答をクラスタリングします。つまり、複数のモデルが同じ人物について似たような記述を返した場合、ツールは一回限りの応答ではなく、認識のパターンとしてそれを捉えます。

認識指標

ツールはユーザーに対して2つの主要指標を提供します:

  • Strength(強度): 認識の強さを表す数値。
  • Top N%(上位N%): ツールを利用した他のユーザーと比較したパーセンタイル順位。

ユーザーの所見とモデル性能

幻覚 vs. 正確性

ユーザー体験からは、実際の認識とAIが生成する幻覚との間に大きなばらつきがあることが示されています。多くのユーザーが、自分が実際には存在しない職業として認識されたと報告しています。例として:

  • 「メキシコの画家/俳優/サッカー選手」として認識されたユーザー。
  • 「アメリカの火山学者」として認識されたユーザー。
  • 「プロのラグビー選手または神経科医」として認識されたユーザー。
  • 「実在しないスコットランドのサッカー選手」として認識されたユーザー。

モデル別観察結果

ユーザーは、モデルごとに認識精度やバイアスが異なることに気付いています:

  • Kimi: 他のモデルが失敗するような廃止されたブログや特定の職歴を認識する点で、より正確だと感じたユーザーがいます。
  • Gemini: オンラインハンドル、GitHubプロファイル、Rustプログラミングとの関連を認識すると報告されていますが、英語の活動をドイツ語に翻訳してしまうことがあると指摘するユーザーもいます。
  • DeepSeek: 情報量が多いと評価するユーザーもいれば、結果が幻覚的であると感じるユーザーもいます。
  • Mistral: 一部のユーザーのアイデンティティを部分的にしか認識しないと報告されています。

「オープンソースバブル」

オープンソースコミュニティで活動している個人が、LLMにより頻繁かつ正確に認識される傾向があると観察されたユーザーもいます。これは、オープンソースリポジトリや関連ドキュメントがこれらのモデルの学習セットで大きく重み付けされていることを示唆しています。

プライバシーとセキュリティの懸念

公開データの露出

コミュニティからのフィードバックで、名前やテキストがサイト上の公開「latest」リーダーボードに掲載されるという重大なプライバシー問題が指摘されています。つまり、ステータスを確認するだけで自分の名前が公開リストに加えられることになります。

データ収集への疑念

複数のユーザーが、サイトの意図に対して懐疑的で、Hacker Newsコミュニティから実名を収集する仕組みになる可能性があると指摘しています。また、トラッキングクッキーの存在や正式なプライバシーポリシーの欠如についても懸念が示されています。

ユーザーインターフェースと体験

美的デザイン

サイトは8ビットのレトロテーマを採用し、ピクセルアートのポートレートやスクロール時のクリック音など、"Retro Bowl" スタイルを彷彿とさせる演出が施されています。

安定性の問題

Hacker Newsで取り上げられた後のトラフィック急増により、一部のユーザーは "429 Too Many Requests" エラーを受け取り、ツールのAPI制限に達していることが報告されています。


要約: ツール "Are You in the Weights" は、複数の最先端モデルと小規模LLMに並行してクエリを投げ、応答をクラスタリングすることで、ユーザーがそれらのモデルにどの程度認識されているかを確認できるようにします。

タイトル: Are You in the Weights: 個人のLLM認識の分析

Sources