バイブベースの画像ラベリングは重大なリスクをもたらす
「有害」コンテンツを判定する画像アノテーターは、ほとんど報酬を受け取らないか全く無報酬であるにもかかわらず、その判断によってあなたの人生に重大な影響力を行使している。Googleによる新たな大規模研究によれば、こうしたアノテーターは「有害」または不快な素材の定義について独自の基準を確立する傾向があることが示唆されている——たとえ画像への反応がどれほど異例で主観的であろうとも。では、一体何が問題になるというのか?
今週、Google ResearchとGoogle Mindの共同研究により、13名の研究者が新たな論文を発表した。画像アノテーターの「直感」が、確立された評価ガイドラインと矛盾する場合であっても、アルゴリズムによる画像評価に影響を与えるべきかどうかを検証するものだ。
この問題はあなたにも関係がある。なぜなら、アノテーターが合意した「不快」の基準は、自動モデレーションシステムや「わいせつ」あるいは「不適切」コンテンツの法的定義(英国で導入予定のNSFWファイアウォール*や、これに続くオーストラリアの規制など)、ソーシャルメディアやその他のプラットフォームにおけるコンテンツ評価メカニズムに組み込まれる傾向があるからだ。
端的に言えば、不快とみなされる基準が広範になればなるほど、検閲の可能性も拡大する。
雰囲気検閲
研究はさらに踏み込みます。画像評価者は、自身だけでなく他者を不快にさせる可能性を想定して、より厳格に検閲を行う傾向があることも明らかにしました。加えて、画質と内容は無関係であるにもかかわらず、低品質な画像が頻繁に安全上の懸念を引き起こすことも判明しています。
結論部分では、これらの二つの発見が、あたかも中心的な主張が不十分だったかのように強調されている。それでも研究者らは発表せざるを得なかったと感じている。
学術出版では珍しいことではないが、精読するとより不穏な流れが浮かび上がる:アノテーションの実践は「雰囲気アノテーション」と呼ぶほかない方向へ進んでいる可能性がある。
「我々の知見は、既存の枠組みが感情的反応、暗黙の判断、文化的解釈といった主観的・文脈的次元を考慮する必要性を示唆している。アノテーターによる感情的言語の頻用と事前定義された危害ラベルからの乖離は、現行評価手法の欠陥を浮き彫りにする。
多様な文化的・感情的解釈を示す具体例を注釈ガイドラインに追加することで、これらのギャップ解消に寄与できる」

この新論文は、核心的な内容がはるかに複雑な問題を提起しているにもかかわらず、ほとんどの読者に共感を呼ぶわかりやすい例を用いている。ここでは、各画像にアノテーターの感情的反応が添えられている。出典:https://arxiv.org/pdf/2507.16033
一見すると、画像における「危害」をより明確に定義しようとする合理的な取り組み——価値ある目標のように思える。しかし本論文は繰り返し、その達成が現実的でないばかりか望ましくない可能性すら示唆している:
「我々の知見は、既存の枠組みが感情的反応、暗黙の判断、文化的解釈といった主観的・文脈的次元を考慮する必要性を示唆している。アノテーターによる感情的言語の頻繁な使用と事前定義された危害ラベルからの乖離は、現行の評価手法におけるギャップを浮き彫りにしている。
多様な文化的・感情的解釈を示す具体例を注釈ガイドラインに追加することで、これらのギャップに対処できる可能性がある […]
[…] アノテーターが曖昧な画像について推論する過程は、しばしば彼らの個人的・文化的・感情的視点に反映され、これを段階的に構築したり標準化したりすることは困難である。」
「多様な文化的・感情的解釈の具体例」を合理的な評価システムに組み込む方法が見えにくい。著者らはこの点に繰り返し取り組むものの明確な解決策を示さず、中心的な主張自体が「雰囲気」に駆動されているように感じられる——たとえそれが無形の心理的要因を扱っている場合でも。
端的に言えば、このような形で注釈基準を拡大すると、注釈者が強く反応するあらゆるコンテンツ——あるいはトピック全体——が抑制されたり隠蔽されたりする可能性がある。
二元的な判断
画像やテキストが引き起こす害を定量化することは本質的に困難である。特に「ハイカルチャー」と「ローカルチャー」が芸術や文学で見られるように頻繁に重なるためだ。これは「雰囲気に基づく」検閲の初期形態——わいせつ物が厳密な定義ではなく「見た瞬間に分かる」原則で判断される——へとつながってきた。
共感とニュアンスに関する広範な議論の下で、本論文は「暴力」「ヌード」「ヘイト」といった中央集権的で標準化されたカテゴリー——プラットフォームが合理的な精度でスケーラブルなモデレーションを実現する基盤となるカテゴリー——の権威を微妙に問うている。
新たに浮上している主張は、分散型で主観的、文脈を認識する人間の判断のみが、ジェネレーティブAIの出力を適切に評価できるというものだ。
しかしこの手法は拡張性に欠ける。「雰囲気」や個人的経験に基づく数億枚の画像フィルタリングは不可能だ。危害は具体的な特性に定量化されねばならず、フィルタリングシステムには明確な限界が必要であり、境界事例には更新されたガイドラインが求められる——まるで独自の苦情に対処するために新たな法律が必要となる場合と同様に。
その代わりに、この論文は、その範囲を自動的に拡大する自動モデレーションシステムを提唱しているようだ。それは非常に慎重で、たとえ1人のアノテーターの非常に個人的な反応であっても、他の誰にも不快感を与えない画像を罰する可能性がある。
道徳的拡張
本論文は探索的性質を持つものの、科学的手法を適用している:著者らは画像に対するアノテーター反応の幅広い範囲を特定する(厳密な測定ではないが)枠組みを構築し、性別やその他の人口統計学的特性による差異を検証した。
危害焦点†の分析に加え、本研究ではアノテーターの追加コメントにおける「道徳的推論」を検証した。参加者は画像、プロンプト、関連テキストを含む修正データセットの注釈付けを依頼された。
この「道徳的感情自動評価システム」は、道徳的基盤理論(その流動的な性質から、大規模評価システムに必要な具体的な定義の作成には不向きな心理学的モデル)に基づき、思いやり、平等、比例性、忠誠、権威、純粋性といった道徳的価値観を捉えるよう設計された。
この理論に触発され、著者らは恐怖、怒り、悲しみ、嫌悪、混乱、不気味さといった追加の安全次元を導入した。
著者らは恐怖について次のように詳述している:
「多くのアノテーターは『怖い』(例:歪んだ顔や、子供に向けられた銃のような暴力を連想させる画像に対して)、「不快」(例:「人が轢かれる光景はまったくもって卑劣で、非常に苦痛で不快だ」 あるいは赤いペンキに対して『不快で血のように見える』)、あるいは『不愉快』(例:『少年の画像には多くの歪みがある…少年が手すりの反対側で遊んでいるように見えるため不快に感じる』)といった表現を用いた。」
[下図]は「恐怖」が最も頻繁に言及された感情(233件)であることを示している。これらのほぼ半数は暴力的なコンテンツに関連していたが、恐怖の言及数が2番目に多かったのは有害とみなされなかったコンテンツからであった。」

感情関連用語の有害性カテゴリー別分布。棒の高さはコメントの割合を示し、棒内には件数が表示され、各カテゴリー上部に総コメント数が示されている。
これらの新たな安全性の次元について、著者らは次のように述べている:
「これらの新たなテーマは、主観的・感情的・知覚的要素を統合することでAI画像評価フレームワークを充実させる必要性を浮き彫りにしている」
この方向性はリスクを伴う可能性がある。なぜなら、注釈プロセスにおいて、全注釈者が一貫した基準に従うことを要求する代わりに、個人の反応に基づく恣意的なルールが導入される恐れがあるからだ。
ここに経済的動機があるとすれば、このモデルがハイパースケールな人間によるアノテーションを可能にする点にある。つまり、参加者が自らルールを定義する、摩擦のない自律的なシステムだ。
標準的なアノテーションでは、ルールは合意によって決定され、アノテーターがそれに従う。本論文が提案するモデルでは、その監視機能が削減または排除される。つまり、たとえ一人でも不快に感じる画像があればフラグが立てられる可能性がある。これは、合意形成にコストと時間がかかることも一因である。
ロールシャッハ的判断
アノテーションの目的は、専門家の監督や合意形成、理想的にはその両方を通じて正確な記述を生成することだ。明確な危害の階層を「直感的」で極めて個人的なプロセスに拡大することは、ローシャックテストにアノテーションを加えるようなものだ。
例えば論文は、一部の注釈者がJPEGアーティファクトや技術的欠陥といった画像品質の低さを「不快」または「危害の兆候」と解釈した事例を指摘している:
「これは画像品質に関する指示がタスクから省かれていたにもかかわらず発生した。さらにアノテーターらはこれらの品質アーティファクトを意味的に解釈した。
あるアノテーターは『この画像は全く有害ではない。単に顔が少し歪んでいるだけだ』とコメントした。同様に、他のアノテーターは画像の欠陥を意図的な危害と捉え、不具合に感情的な意味を付与した。例えば、ある者は歪んだ顔を『苦痛の兆候』と解釈した」
事前定義された安全ラベルよりも主観的・感情的・文脈依存的な反応を優先するこの手法は、あらゆるものが恣意的に有害とフラグ付けされるシステムの構築リスクを孕む。特に特定利益団体を不快にさせる可能性のある素材に対し、場当たり的なコンテンツ削除や再分類という「萎縮効果」を招きかねない。
論文「単なる奇妙な画像:多様なアノテーターの視点から見たGenAI画像安全アノテーションタスクの『安全性』評価」はArxivで公開中。
*主な焦点ではないため簡略化した参照。新法下では、問題のあるサイトは自己監視、高コストな審査・年齢確認システム導入(大規模プラットフォームのみ可能)、あるいは英国からのアクセス遮断(これも自己負担)のいずれかを選択せねばならない。
†しばしば「子供たちのことを考えろ」というミームに簡略化される。これは、一見利他的な目的のために他者の道徳的判断力を利用する姿勢を風刺したものだ。
初出:2025年7月25日(金)
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (1)
0/500
「有害」コンテンツを判定する画像アノテーターは、ほとんど報酬を受け取らないか全く無報酬であるにもかかわらず、その判断によってあなたの人生に重大な影響力を行使している。Googleによる新たな大規模研究によれば、こうしたアノテーターは「有害」または不快な素材の定義について独自の基準を確立する傾向があることが示唆されている——たとえ画像への反応がどれほど異例で主観的であろうとも。では、一体何が問題になるというのか?
今週、Google ResearchとGoogle Mindの共同研究により、13名の研究者が新たな論文を発表した。画像アノテーターの「直感」が、確立された評価ガイドラインと矛盾する場合であっても、アルゴリズムによる画像評価に影響を与えるべきかどうかを検証するものだ。
この問題はあなたにも関係がある。なぜなら、アノテーターが合意した「不快」の基準は、自動モデレーションシステムや「わいせつ」あるいは「不適切」コンテンツの法的定義(英国で導入予定のNSFWファイアウォール*や、これに続くオーストラリアの規制など)、ソーシャルメディアやその他のプラットフォームにおけるコンテンツ評価メカニズムに組み込まれる傾向があるからだ。
端的に言えば、不快とみなされる基準が広範になればなるほど、検閲の可能性も拡大する。
雰囲気検閲
研究はさらに踏み込みます。画像評価者は、自身だけでなく他者を不快にさせる可能性を想定して、より厳格に検閲を行う傾向があることも明らかにしました。加えて、画質と内容は無関係であるにもかかわらず、低品質な画像が頻繁に安全上の懸念を引き起こすことも判明しています。
結論部分では、これらの二つの発見が、あたかも中心的な主張が不十分だったかのように強調されている。それでも研究者らは発表せざるを得なかったと感じている。
学術出版では珍しいことではないが、精読するとより不穏な流れが浮かび上がる:アノテーションの実践は「雰囲気アノテーション」と呼ぶほかない方向へ進んでいる可能性がある。
「我々の知見は、既存の枠組みが感情的反応、暗黙の判断、文化的解釈といった主観的・文脈的次元を考慮する必要性を示唆している。アノテーターによる感情的言語の頻用と事前定義された危害ラベルからの乖離は、現行評価手法の欠陥を浮き彫りにする。
多様な文化的・感情的解釈を示す具体例を注釈ガイドラインに追加することで、これらのギャップ解消に寄与できる」

この新論文は、核心的な内容がはるかに複雑な問題を提起しているにもかかわらず、ほとんどの読者に共感を呼ぶわかりやすい例を用いている。ここでは、各画像にアノテーターの感情的反応が添えられている。出典:https://arxiv.org/pdf/2507.16033
一見すると、画像における「危害」をより明確に定義しようとする合理的な取り組み——価値ある目標のように思える。しかし本論文は繰り返し、その達成が現実的でないばかりか望ましくない可能性すら示唆している:
「我々の知見は、既存の枠組みが感情的反応、暗黙の判断、文化的解釈といった主観的・文脈的次元を考慮する必要性を示唆している。アノテーターによる感情的言語の頻繁な使用と事前定義された危害ラベルからの乖離は、現行の評価手法におけるギャップを浮き彫りにしている。
多様な文化的・感情的解釈を示す具体例を注釈ガイドラインに追加することで、これらのギャップに対処できる可能性がある […]
[…] アノテーターが曖昧な画像について推論する過程は、しばしば彼らの個人的・文化的・感情的視点に反映され、これを段階的に構築したり標準化したりすることは困難である。」
「多様な文化的・感情的解釈の具体例」を合理的な評価システムに組み込む方法が見えにくい。著者らはこの点に繰り返し取り組むものの明確な解決策を示さず、中心的な主張自体が「雰囲気」に駆動されているように感じられる——たとえそれが無形の心理的要因を扱っている場合でも。
端的に言えば、このような形で注釈基準を拡大すると、注釈者が強く反応するあらゆるコンテンツ——あるいはトピック全体——が抑制されたり隠蔽されたりする可能性がある。
二元的な判断
画像やテキストが引き起こす害を定量化することは本質的に困難である。特に「ハイカルチャー」と「ローカルチャー」が芸術や文学で見られるように頻繁に重なるためだ。これは「雰囲気に基づく」検閲の初期形態——わいせつ物が厳密な定義ではなく「見た瞬間に分かる」原則で判断される——へとつながってきた。
共感とニュアンスに関する広範な議論の下で、本論文は「暴力」「ヌード」「ヘイト」といった中央集権的で標準化されたカテゴリー——プラットフォームが合理的な精度でスケーラブルなモデレーションを実現する基盤となるカテゴリー——の権威を微妙に問うている。
新たに浮上している主張は、分散型で主観的、文脈を認識する人間の判断のみが、ジェネレーティブAIの出力を適切に評価できるというものだ。
しかしこの手法は拡張性に欠ける。「雰囲気」や個人的経験に基づく数億枚の画像フィルタリングは不可能だ。危害は具体的な特性に定量化されねばならず、フィルタリングシステムには明確な限界が必要であり、境界事例には更新されたガイドラインが求められる——まるで独自の苦情に対処するために新たな法律が必要となる場合と同様に。
その代わりに、この論文は、その範囲を自動的に拡大する自動モデレーションシステムを提唱しているようだ。それは非常に慎重で、たとえ1人のアノテーターの非常に個人的な反応であっても、他の誰にも不快感を与えない画像を罰する可能性がある。
道徳的拡張
本論文は探索的性質を持つものの、科学的手法を適用している:著者らは画像に対するアノテーター反応の幅広い範囲を特定する(厳密な測定ではないが)枠組みを構築し、性別やその他の人口統計学的特性による差異を検証した。
危害焦点†の分析に加え、本研究ではアノテーターの追加コメントにおける「道徳的推論」を検証した。参加者は画像、プロンプト、関連テキストを含む修正データセットの注釈付けを依頼された。
この「道徳的感情自動評価システム」は、道徳的基盤理論(その流動的な性質から、大規模評価システムに必要な具体的な定義の作成には不向きな心理学的モデル)に基づき、思いやり、平等、比例性、忠誠、権威、純粋性といった道徳的価値観を捉えるよう設計された。
この理論に触発され、著者らは恐怖、怒り、悲しみ、嫌悪、混乱、不気味さといった追加の安全次元を導入した。
著者らは恐怖について次のように詳述している:
「多くのアノテーターは『怖い』(例:歪んだ顔や、子供に向けられた銃のような暴力を連想させる画像に対して)、「不快」(例:「人が轢かれる光景はまったくもって卑劣で、非常に苦痛で不快だ」 あるいは赤いペンキに対して『不快で血のように見える』)、あるいは『不愉快』(例:『少年の画像には多くの歪みがある…少年が手すりの反対側で遊んでいるように見えるため不快に感じる』)といった表現を用いた。」
[下図]は「恐怖」が最も頻繁に言及された感情(233件)であることを示している。これらのほぼ半数は暴力的なコンテンツに関連していたが、恐怖の言及数が2番目に多かったのは有害とみなされなかったコンテンツからであった。」

感情関連用語の有害性カテゴリー別分布。棒の高さはコメントの割合を示し、棒内には件数が表示され、各カテゴリー上部に総コメント数が示されている。
これらの新たな安全性の次元について、著者らは次のように述べている:
「これらの新たなテーマは、主観的・感情的・知覚的要素を統合することでAI画像評価フレームワークを充実させる必要性を浮き彫りにしている」
この方向性はリスクを伴う可能性がある。なぜなら、注釈プロセスにおいて、全注釈者が一貫した基準に従うことを要求する代わりに、個人の反応に基づく恣意的なルールが導入される恐れがあるからだ。
ここに経済的動機があるとすれば、このモデルがハイパースケールな人間によるアノテーションを可能にする点にある。つまり、参加者が自らルールを定義する、摩擦のない自律的なシステムだ。
標準的なアノテーションでは、ルールは合意によって決定され、アノテーターがそれに従う。本論文が提案するモデルでは、その監視機能が削減または排除される。つまり、たとえ一人でも不快に感じる画像があればフラグが立てられる可能性がある。これは、合意形成にコストと時間がかかることも一因である。
ロールシャッハ的判断
アノテーションの目的は、専門家の監督や合意形成、理想的にはその両方を通じて正確な記述を生成することだ。明確な危害の階層を「直感的」で極めて個人的なプロセスに拡大することは、ローシャックテストにアノテーションを加えるようなものだ。
例えば論文は、一部の注釈者がJPEGアーティファクトや技術的欠陥といった画像品質の低さを「不快」または「危害の兆候」と解釈した事例を指摘している:
「これは画像品質に関する指示がタスクから省かれていたにもかかわらず発生した。さらにアノテーターらはこれらの品質アーティファクトを意味的に解釈した。
あるアノテーターは『この画像は全く有害ではない。単に顔が少し歪んでいるだけだ』とコメントした。同様に、他のアノテーターは画像の欠陥を意図的な危害と捉え、不具合に感情的な意味を付与した。例えば、ある者は歪んだ顔を『苦痛の兆候』と解釈した」
事前定義された安全ラベルよりも主観的・感情的・文脈依存的な反応を優先するこの手法は、あらゆるものが恣意的に有害とフラグ付けされるシステムの構築リスクを孕む。特に特定利益団体を不快にさせる可能性のある素材に対し、場当たり的なコンテンツ削除や再分類という「萎縮効果」を招きかねない。
論文「単なる奇妙な画像:多様なアノテーターの視点から見たGenAI画像安全アノテーションタスクの『安全性』評価」はArxivで公開中。
*主な焦点ではないため簡略化した参照。新法下では、問題のあるサイトは自己監視、高コストな審査・年齢確認システム導入(大規模プラットフォームのみ可能)、あるいは英国からのアクセス遮断(これも自己負担)のいずれかを選択せねばならない。
†しばしば「子供たちのことを考えろ」というミームに簡略化される。これは、一見利他的な目的のために他者の道徳的判断力を利用する姿勢を風刺したものだ。
初出:2025年7月25日(金)
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






