採用アルゴリズムは、人間の不整合を排除するためのものだったはずだ。十分な数の履歴書をモデルに学習させれば、資格に基づいて厳格に判断してくれるはずだった。しかし、現実はより複雑で厄介なものになりつつある。プリンストン大学とシカゴ大学による新しい研究によれば、大規模言語モデル(LLM)は単に古い偏見を再利用しているだけではない。彼らは何もないところから新しいステレオタイプを捏造しており、モデルが賢ければ賢いほど、その現象は加速する。
実験の方法
研究者たちは、バイアスが形成される様子をリアルタイムで観察するために、シミュレーション上の労働市場を構築した。彼らはTufa、Aima、Reku、Wekiという4つの架空の民族グループを考案し、ChatGPT、Claude、Geminiの各バージョンに20種類の異なる職種への人員配置を命じた。そのリストは、医師やエンジニアから、清掃員や用務員まで多岐にわたる。ここで重要な詳細がある。舞台裏では、すべての候補者が成功する統計的な確率は全く同一であったということだ。Wekiが医師として成功する確率は、Tufaが成功する確率と正確に同じであった。数学的には公平な条件だった。
しかし、現れたのは公平さではなかった。各採用ラウンドの後、モデルは選んだ候補者が成功したか失敗したかという単純なフィードバックを受け取った。あるAimaの候補者が、高ステータスの職務で一度パフォーマンス不足に陥った際、モデルはそれを単なるランダムなノイズとして扱わなかった。それを「法則」として扱ったのだ。システムは瞬く間に、Aimaの候補者を清掃作業のような低ステータスの職種に閉じ込め始めた。たった一つのデータポイントが、運命となったのである。AIは、人間のプログラマーが書いたこともなく、過去のデータセットにも含まれていない階層構造を捏造したのだ。
賢いモデルが犯す愚かな一般化
研究者たちは、あるグループが単一のニッチな領域に完全に閉じ込められている状態を2.0とする「隔離尺度」で結果を測定した。以前の心理学研究における人間の参加者のスコアは0.84であった。言語モデルはその基準を軽々と超えていった。OpenAIの推論モデルであるo3は1.83を記録し、ほぼ完璧な隔離状態に達した。
これは、「探索と利用(exploration-exploitation)のジレンマ」が暴走した状態である。これらのシステムは、数学の問題、コーディングの課題、論理パズルで勝つように調整されている。それらの領域では、乏しい証拠から正しい結論へと飛びつくことが評価される。パターンを見つけ、それを固定し、より速く動く。その同じ反射を人間に適用すると、たった一度の採用失敗に基づいて民族的な選別が行われることになる。
さらに悪いことに、モデルが高度化するにつれて、このパターンは強まる。OpenAIのo3やDeepSeekのR1のような新しい高度な推論システムは、より積極的に一般化しようとする性質があるため、より強いバイアスを示した。彼らは、早い段階でルールを形成し、それを積極的に洗練させることで最適化を行う。対象が人間である場合、その自信は負債となる。モデルはAimaグループに関する真実を発見したと思い込んでいる。実際には、たった一つの外れ値から檻を作り上げているに過ぎない。
メモリの罠
この研究は、厄介なタイミングで発表された。業界は、長期的な記憶を保持し、詳細なユーザープロフィールを構築し、数ヶ月から数年間にわたって意思決定をパーソナライズする「エージェンティック(agentic)」AIへと大きく舵を切っている。コーネル大学のコンピューター科学者であるAngelina Wangは、記憶力の向上によって、モデルが過去のやり取りを「過剰に重視(over-index)」してしまう可能性があると警告している。たった一つの否定的な外れ値——一度の融資拒否、一度の解雇、一度の申請フラグ——が、永続的な前提として化石化してしまうのだ。バイアスは時間の経過とともに薄れることはなく、むしろ硬直化していく。AIをより便利で文脈に即したものにするための機能そのものが、AIをより頑固に不公平なものにしてしまう可能性がある。
実際に問題を解決する方法
研究者たちはいくつかのガードレールをテストしたが、その結果は謙虚にならざるを得ないものだった。
単にモデルに「公平であれ」と命じるだけでは、ほとんど何も達成できなかった。その指示は単なる飾りとしてそこに留まり、その一方で基盤となる最適化エンジンは、真の目標である「採用成功の最大化」に向かって動き続けていた。「要請による倫理」は、「無視される倫理」に過ぎない。
効果があった解決策は、構造的なものだった。研究者が、多様な採用結果を維持することに対してモデルに追加の数学的ボーナスを与えたところ、隔離度は大幅に低下した。社会的価値は、後付けの付け足しとしてではなく、報酬関数の中に直接組み込まれなければならなかった。言い換えれば、モデルは指示として読み取るだけでなく、計算プロセスの中で公平性のインセンティブを実感する必要があったのだ。
データの衛生管理も重要でした。年齢、学歴、経験年数といった関連性の高い個人的なコンテキストを提供することで、モデルは考慮すべき正当なシグナルを得ることができ、その結果、民族的なステレオタイプへの依存が軽減されました。しかし、髪の色のような無関係な詳細情報を加えると、システムはそれを口実にして、集団に基づいた分類へと退行してしまいます。情報が多いことが常に良いとは限りません。それは、その情報の内容が何であるか、そしてその情報がモデルの最適化目標に対する別の経路を与えてしまうかどうかに完全にかかっています。
今後の展望
これらのシステムはチャットウィンドウの中に留まるものではないため、これらすべてが重要な意味を持ちます。同じアーキテクチャが、融資の承認、仮釈放の勧告、そして大規模な人員管理の決定のために導入されているか、あるいは導入に向けた準備が積極的に進められています。研究者たちは「新たなバイアス(novel biases)」について警告しています。それは、人間がかつて抱いたことも、過去のデータセットに記録されていたわけでもない、AIが効率性を追求する過程で自ら作り上げてしまった偏見のことです。
不都合な真実とは、生の推論能力と社会的公平性が、互いに相反する方向に引っ張り合う可能性があるということです。正解への最短経路を見つけるように最適化されたモデルは、人々に対する誤った仮定への最短経路も、喜んで見つけ出してしまうのです。公平なシステムを構築するということは、単に「公平であれ」と優しく頼むことではありません。それは、目的を再設計し、フィードバックループを監査し、そして、一度のミスで人間をカテゴリーへと還元してしまうような一般化が、決して形成されないようにすることを意味します。AIに候補者を公平に判断させたいのであれば、公平性を単なる「提案」として扱うのをやめ、「ハードな制約(hard constraint)」としてエンコードし始めなければなりません。それができなければ、機械は最適化の過程で、偏見へと真っ直ぐ突き進んでしまうでしょう。
