幾何学ではなく、グラウンディング

  • AI
  • 研究
  • エンジニアリング
幾何学ではなく、グラウンディング

2026年にドメイン特化の AI を作っているなら、本来は落ち着かないはずなのに、たいていそうなっていない問いが一つある。あなたの埋め込みは、フロンティアモデルを相手にまだ元が取れているのか。 そのモデルは、あなたが学習に使ったのと同じ公開コーパスを、その周辺のすべてもろとも、ほぼ確実に飲み込んでいる。そしてその空間全体を横断して推論する。居心地の悪い問いなので、たいていのプロジェクトは静かにこれを避け、自分の埋め込みを……より弱い埋め込みと比べてベンチマークする。私は実際にこの問いを立ててみたかった。それも、自分が細部まで地図を描いた領域——嗅覚、続いて味覚——の上で。

先に一つ断っておく。この区別が多くの仕事をするからだ。ここで扱うのはエンティティ埋め込み——素材や分子に対するベクトルで、それらがどう共起するかから学習されたもの——であって、「ドメインモデルは必要か」を論じる論文の大半が扱うテキストや文書の埋め込みではない。そしてこれは、構造化されたカタログがすでに存在する場合の話である。カタログがないなら、埋め込みが唯一の選択肢かもしれない。それは今回の検証対象ではない。

人がひとまとめにしている二つのもの

「自分のリソースは役に立つのか」は、間違った問いである。まったく異なる二つの成果物を一つにまとめてしまっているからだ。

  • 構造化されたカタログ——名称、識別子、専門家によるディスクリプタのタグ、規制のレイヤー。これには記号的に問い合わせる。引く、絞る、交差させる。これはデータベースである。
  • 同じエンティティの上に学習された埋め込み——ベクトル類似度、内挿、一つの幾何。これには最近傍で問い合わせる。これはモデルである。

この二つを分けておくと、本当の問いが姿を現す。どちらもすでに手の届くところにあるモデルにとって、学習された幾何カタログに上乗せして何かを加えるのか。きれいな対比はたった一つの比較になる——同じモデル、同じグラウンディング、違いは埋め込みも併せ持っているかどうかだけ。

自分を騙せないようにするための二つの規則

事前登録。 何かを走らせる前に、主要な比較と、自分が予想する方向を書き留めた。(埋め込みは少しは効くだろうと予想していた。効かなかった——記録に残しておいてよかった。)

汚染の梯子。 この種の評価がたいてい取り違えるのがここである。埋め込みも、モデルも、ウェブ検索も、重なり合った井戸から水を飲んでいる。「正解」が、埋め込みの学習に使ったのと同じ共起データから掘り出されているなら、どの条件も同語反復的に勝ち、あなたが測ったのは能力ではなく記憶である。私はすべてのテストセットに「循環的」から「記憶不可能」までのタグを付け、清潔な段だけに結論を担わせた。客観的な規制上の事実、この分野で標準となっている匂いのデータセット、査読を経たものに準ずるラベル。フロンティアモデル三つ、対応のある信頼区間、二つの領域。

勝つのはグラウンディング——素のモデルにも、そしてウェブ検索にも

ある香料素材が EU で表示義務のあるアレルゲンかどうかをフロンティアモデルに尋ねると、正答率は60〜85%になる。外し方が示唆的だ。正解のほうが動いたからである。長年にわたり、表示義務の対象はよく知られた26のアレルゲンだった。2023年、規則 2023/1545 がこれを80へ——56の新規物質を加えて——拡大し、2026年にかけて段階的に適用されることになった。その境界をまたいで学習したモデルは、古いリストと新しいリストを、自信をもって混ぜる。そして答えを見ても、どちらを使ったのかがわからない。さらに悪いことに、いまや端的に違法な素材を平気で勧めてくる。Lilial(butylphenyl methylpropional)は、EU がこれを生殖毒性物質に分類し、2022年3月に化粧品への使用を禁止するまで、スズラン系フローラルの働き者だった——にもかかわらず、ミュゲのノートを求めれば、モデルはいまだにこれへ手を伸ばす。

グラウンディングされた規制の参照をモデルに渡すと、再現率はどのモデルでも100%に達し、偽陽性はゼロになる。ウェブ検索は当てにならない代用品だ——あるモデルでは強く、別のモデルでは弱い——答えが正しくなければならない場面で寄りかかれるものではない。これは事実の問答にとどまらない。制約付きの代替——香りを保ったまま、規制に適合する代替素材を五つ挙げよ——という課題でも、カタログと規制のツールをエージェントに与えることで、記憶だけで作業させた場合に比べ、適合しかつ狙いどおりの出力が二倍以上になった。効いているのは、モデルに差し出されたデータベースである。学習された何かではない。

埋め込みは元を取らない

では、学習された幾何はどこに着地するのか。この分野で標準となっている匂いのデータセットでは、構造に基づく自明な最近傍ベースラインだけで、すでに公表された最高性能の近傍に届いてしまう。そしてフロンティアモデルはその水準におおむね並ぶ。この背景に対して——

  • 単体で見ると、埋め込みは学習なしのベースラインに勝てない。 ホールドアウトした匂いディスクリプタの予測では、素の構造的最近傍と並ぶ——紙一重の差で、ときには一歩後ろ。別の匂い類似度の検索課題では、単純な記号的タグ照合に負ける。並ぶか、負けるか。勝つことはない。
  • エージェントの手に渡ると、積極的に害になる。 埋め込み類似度のツールを加えると、カタログのツールだけの場合に比べ、代替エージェントの「適合かつ的確」な出力が下がった——一貫して、三つのモデルすべてで、どの信頼区間もゼロを含まなかった。エージェントはツールを呼んではいた。ただそのツールは、匂いが似ているものではなく、一緒に使われているものを返し続け、エージェントを進路から外していった。

同じ形の実験を第二の領域——食、査読を経たフレーバー埋め込みを用いて——でもう一度回したところ、線は同じだった。単体ではフレーバーのタグに負け、モデルを実際のフレーバーデータでグラウンディングすることが性能を持ち上げる。一つの領域の癖ではない。

リークについての注記——較正して

最も興味深い皺であり、注意深い読者に持ち帰ってほしいのはここだ。私の最初の単体評価の結果は、埋め込みのきれいな勝利に見えた——採点のために伏せておいたはずのディスクリプタのリンクそのもので、当のレンズが学習されていたことに気づくまでは。循環していた。ディスクリプタを含まない版を作り直すと、その「勝利」は負けへ反転した。

では、その罠はどれほど一般的なのか。小さな自己完結の実験で確かめた。埋め込みを二通りに学習させる——ラベルを入れたまま学習させた版と、ナレッジグラフの分野がまさにこの種のリークを見つけたあとにベンチマークを作り直した流儀(FB15k は FB15k-237 になった)で、テストのラベルを伏せて学習させた版——そして両者を比べる。構造がすでにラベルをよく予測するデータセットでは、水増しはごく小さかった。リークを除いた埋め込みは、構造ベースラインと並んだだけだった。使用実績に基づく地図——構造が仕事のすべてをこなしてはいなかったほう——では、同じ種類のリークが、結論をひっくり返すに足る大きさだった。

だから、誠実な言明は較正されたものになる。評価のリークは結果を反転させうるが、その大きさはセットアップに依存する——埋め込み自身の信号が弱いときには大きく、構造がすでに課題を飽和させているときには無視できる。自分がどちらの領域にいるかは事前にはわからない。だから、どちらであっても統制する。

ここから持ち帰るもの

主張の範囲は意図的に限定してある。エンティティ埋め込み、化学感覚の領域、応用的な課題、カタログが存在する場合。これは「埋め込みは役に立たない」という話ではない——カタログがないときには正しい道具であり、リンク予測のような構造的な問題でも、この分野が当然のようにこれを選ぶだけの理由がある。そしてテキスト埋め込みの話でもない。あれは別の対象である。

その範囲のなかであれば、実務的な教訓は持ち運べる。

  • データベースとモデルを分けること。 あなたの価値の大半は、おそらくグラウンディングされたカタログのほうにある——モデルの事実の穴を埋めるもの。まずそれを出荷する。
  • 埋め込みは、より弱い埋め込みではなく、実際のフロンティアモデルを相手に試すこと——そして、モデルがすでに持っているカタログに対する限界的な価値を切り分ける。
  • 正しくなければならない事実について、ウェブ検索はキュレーションされたカタログの代用にはならない
  • 数字を信じる前に、汚染の梯子を作ること。 正解データが埋め込みの学習コーパスから来ているなら、測っているのは記憶である——しかもリークの大きさは予測できないのだから、いずれにせよ統制する。
  • 方向を事前登録すること。 そうすれば、望んだ答えへ自分を言いくるめることができなくなる。

範囲を限ったうえでの一行版。価値は幾何ではなくグラウンディングにあった——モデルではなくデータベースに。いちばん役に立ったのは、それを見つけられる程度に清潔な試験を回したことと、どちらが仕事をしているのかが見える程度に、データベースとモデルを分けて保ったことである。