3行要約

  • AIが好きな色に「青」を選ぶ現象は、学習データに含まれる統計的な偏りとRLHFの影響による結果である。
  • 心理的な嗜好ではなく、Web上のテキストデータにおいて「青」が最もポジティブな文脈で頻出する確率分布に基づいている。
  • 開発者はモデルの「主観的な回答」を擬人化せず、出力の偏りが意思決定プロセスに与える影響を技術的に評価すべきである。

📦 この記事に関連する商品(楽天メインで価格確認)

GeForce RTX 4090

ローカルLLMの出力バイアスを検証するには、24GBのVRAMを持つ4090が最適。

楽天で価格を見る Amazonでも確認

※アフィリエイトリンクを含みます

何が起きたのか

朝日新聞の「天声人語」にて、AIに好きな色を尋ねると「青」と答えることが多いという内容が報じられました。これはChatGPT(OpenAI)やClaude(Anthropic)などの主要な大規模言語モデル(LLM)で見られる共通の挙動です。なぜこれが重要なのか。それは、AIが「意志」を持って回答しているのではなく、訓練データに潜む「人間の平均的な嗜好」を鏡のように映し出していることを示唆しているからです。

私たちが仕事でAIを扱う際、モデルが「私はこう思います」と答える場面に遭遇します。しかし、その正体は、次に続くトークン(単語の断片)として「Blue(青)」が選ばれる確率が、他の色よりも統計的に高かったという事実に過ぎません。多くの文化圏で青は「誠実」「信頼」「平和」といったポジティブな概念と結びついており、インターネット上の膨大なテキストデータにおいて、好意的な文脈で最も頻出する色が青であることは、多くの社会調査(YouGovの統計など)でも証明されています。

この現象は、AIが人間を理解したのではなく、人間がWebに残した膨大な足跡の「最大公約数」を抽出した結果です。実務においては、こうした「もっともらしい回答の偏り(バイアス)」が、製品の推奨やコンテンツ生成、さらには人事評価などのアルゴリズムに無意識のうちに組み込まれるリスクを再認識させるニュースだと言えます。

技術的に何が新しいのか

従来のルールベースのAIであれば、好きな色を問われればランダム関数(Random.choice)で回答を散らしていたでしょう。しかし、現在のLLMはトランスフォーマー構造を採用しており、文脈におけるトークンの出現確率を計算します。

技術的な背景は、主に以下の2点に集約されます。

第一に、事前学習データにおける「共起性」です。英語圏を含む主要な学習データにおいて、「Favorite color is…」に続く単語として「Blue」が登場する頻度は、統計的に有意に高い傾向にあります。これはモデルが言語の構造を学ぶ過程で、暗黙的に「好きな色=青」という重みを獲得していることを意味します。

第二に、RLHF(人間によるフィードバックからの強化学習)の影響です。モデルの回答は、人間のアノテーター(評価者)が「より好ましい」と判断した方向に微調整されます。この過程で、特定の文化圏で好まれる回答や、当たり障りのない誠実そうな回答が選ばれやすくなります。青という色は、赤や黄色に比べて視覚的な刺激が穏やかで、信頼感を醸成しやすいため、評価者が無意識に青を選ぶ回答に高いスコアを与えている可能性があります。

具体的に、Pythonでモデルのログ確率(logprobs)を検証してみると、色の選択肢における「Blue」の確率は、2位の「Green」や「Red」を大きく引き離すことが確認できます。これはAIの個性ではなく、学習プロセスの副産物なのです。

数字で見る競合比較

項目GPT-4oClaude 3.5 SonnetGemini 1.5 ProLlama 3 (70B)
好きな色の回答青(Blue)青(Blue)決まっていない(多様性重視)データに依存(青が多い)
回答の根拠誠実さ、落ち着き平和、広大さ特定の色への固執を避ける学習データの統計的傾向
RLHFの強度非常に強い強い(安全性重視)中程度比較的弱い(ベースに近い)
推論コスト(1k tokens)$0.005$0.003$0.0035ローカル環境なら $0

この数字が意味するのは、モデルによって「人格(ペルソナ)」の設計思想が異なるという点です。OpenAIやAnthropicのモデルは、ユーザーに対して親しみやすく、かつ知的な印象を与えるよう高度に調整されています。そのため、「青が好き」という一貫した回答を返すことで、擬似的な一貫性を保とうとします。一方でGoogleのGeminiは、検索エンジンとしての「中立性」を優先するため、特定の色に偏ることを避けるようなシステムプロンプトや調整が施されている傾向があります。実務でエージェントを開発する場合、このモデルごとの「性格の偏り」を把握していないと、生成される成果物のトーンが意図せず偏る原因になります。

開発者が今すぐやるべきこと

この記事を読み終えたら、自身のプロジェクトにおいて以下の3つのアクションを取るべきです。

  1. システムの「嗜好バイアス」の検証 自社で運用しているプロンプトやエージェントに対し、主観的な質問(「おすすめの商品は?」「最適な解決策は?」など)を投げ、100回試行した際の回答分布を確認してください。もし特定の結果に70%以上偏っているなら、それはモデル固有のバイアスが強く作用しています。

  2. System Promptによる明示的な中立化 特定の意見や傾向を排除したい場合は、システムプロンプトに「特定の選択肢に偏らず、常に客観的な根拠に基づいて複数の視点を提供せよ」と明記する必要があります。これを怠ると、ユーザーは知らず知らずのうちに「AIの(=学習データの)平均的な意見」に誘導されることになります。

  3. ローカルLLMでの比較検証 RTX 4090などのGPU環境があるなら、Llama 3のようなオープンモデルを用いて、量子化の度合い(4bit, 8bit)やサンプリングパラメータ(Temperature, Top-P)を変えた時に、回答の多様性がどう変化するかを確認してください。Temperatureを1.0以上に上げてもなお「青」と答える場合、そのバイアスは非常に深い層に刻まれています。

私の見解

AIが「青が好き」と答えることに対して、人間を理解したと感傷的になるのは開発者としては危険です。私は、これを「統計的な平均への回帰」と冷ややかに捉えています。LLMは世界を理解しているのではなく、世界に関する記述を圧縮して保持しているに過ぎません。

RTX 4090を2枚挿しして日々ローカルLLMの挙動を追っていますが、パラメータ一つで「好きな色」など容易に変わります。それにもかかわらず、多くの商用モデルが「青」を選ぶのは、それが現代社会において最も「苦情が来ず、かつ好感度が高い」という最適解だからです。開発者が注視すべきは、その「最適解」が、クリエイティビティや真の多様性を損なっていないかという点です。

もしあなたが、特定のブランドカラーを推奨するAIアシスタントを作りたいのであれば、この「青への重力」を打ち消すだけの強力なFine-tuning、あるいはRAGによる知識の補強が必要になるでしょう。モデルの初期状態にある「性格」を盲信せず、常にデバッグの対象として見るべきです。

よくある質問

Q1: なぜAIは「赤」ではなく「青」を選ぶのですか?

世界的な統計で、青は最も人気のある色であり、テキストデータ上でも「信頼」や「静寂」といったポジティブな文脈で頻出するためです。赤は「危険」や「警告」の文脈も多いため、安全性を重視するAIの調整過程で避けられやすい傾向にあります。

Q2: 開発時にこのバイアスを回避する方法はありますか?

Temperature(温度)パラメータを上げて出力を多様化させるか、System Promptで「ランダムに色を選択せよ」と指示するのが有効です。また、Few-shotプロンプティングで「赤が好き」「緑が好き」といった例示を混ぜることで、特定の色の確率を下げることができます。

Q3: 将来的にAIに「本当の個性」が宿る可能性はありますか?

現在のアーキテクチャでは、個性とは「学習データの偏り」と「事後学習での重み付け」の合成結果に過ぎません。特定の個人データで継続的に学習(継続事前学習)を行えば、その人の好みを模倣することは可能ですが、それはあくまで統計的な模倣であって、生物学的な意志とは異なります。


あわせて読みたい