オープンウェイトAIモデルはフロンティアパフォーマンスに近づいているが、安全性のギャップは依然として存在する

規制当局がOpenAIのGPT-5.6 SolやAnthropicのMythosを含む、ますます強力なAIシステムのガバナンスについて議論する中、中国のオープンウェイトモデルが業界のリーダーとの格差を大幅に縮めた。
AI安全非営利団体SaferAIによる新しいレポートによると、中国のZ.aiによるオープンウェイトAIモデルGLM-5.2は、サイバーおよびバイオの能力においてOpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数ヶ月しか遅れていない。しかし、最先端の能力と安全慣行の間の隔たりは広がっている。
Z.aiのパブリックAPIを介して実施されたSaferAIの評価により、GLM-5.2が攻撃的なサイバーまたはデュアルユースの生物学タスクのいずれも拒否しなかったことが明らかになった。一方、Claude Opus 4.7は「非常に一貫して拒否したため、SaferAIはCyberGymを全く完了できなかった。」(CyberGymはサイバーセキュリティ能力を評価するベンチマークであり、OpenAIは先月のHugging Face侵害前の評価でこれを使用した。)
これは批評家たちの長年の懸念を浮き彫りにしている:オープンウェイトAIモデルは、ウェイトがダウンロードされた後に使用を監視する方法がないまま、潜在的な攻撃者に高度に機能する技術を提供する可能性がある。オープンウェイトモデルが主要なAIシステムの能力に急速に近づいているため、議論は競争できるかどうかから、社会がそのリリースのリスクをどのように管理するかへとシフトしている。
「能力の最前線はリスクの最前線ではなく、したがってリスクを適切に評価するために緩和策の状態も考慮に入れなければならない」と、SaferAIの執行理事であるHenry PapadatosはTechCrunchに語った。
Z.aiはホストされたAPIに安全対策を適用できるが、これらの保護はユーザーが独自のハードウェアでウェイトを実行すると執行不可能になり、安全対策の削除や変更、モデルのファインチューニング、またはシステムプロンプトの変更を許可する。
OpenAIやAnthropicのようなフロンティア開発者は、危険なサイバーおよび生物学的支援を制限するために、分類器、拒否トレーニング、APIレベルの制御などの安全対策に依存するのが一般的である。
これらの対策は完璧ではない:脱獄は展開されたモデルの保護を日常的に回避する。AI安全非営利団体Far.aiは、xAIのGrok 4.5やGoogle DeepMindのGemini 3.1 Proなどのフロンティアモデルにおいて、再利用可能なキーとして定義され、有害なリクエストの大部分で成功する何百もの普遍的な脱獄を見つけた。レポートによると、攻撃者がロールプレイ、権威のなりすまし、偽の会話履歴、およびフォローアッププロンプトを含む複数の操作技術を組み合わせてモデルの防御の弱点を攻撃したときに脱獄が成功する。
しかし、クローズドモデル用に設計された安全対策は、安全対策の有無にかかわらず、あらゆるインフラストラクチャで実行できるように構築されたオープンウェイトモデルでは機能しない。
「明確な目標は、安全な良い能力が誰でもアクセスできるようにすることであり、その後、オープンソースの形式であっても、悪いものを排除しようとするべきである」とPapadatosは述べた。
Papadatosが提案する一つのアプローチは「事前トレーニングデータフィルタリング」であり、AI企業がモデルをトレーニングする前に、キュレーションされたデータセットでモデルをトレーニングする前に、攻撃的なサイバーセキュリティ情報をトレーニングデータから削除する方法である。
一部の研究では、これは全体的なモデルのパフォーマンスを損なうことなく有害な生物学的知識を減少させることができることが示されている。しかし、データフィルタリングはサイバーセキュリティにおいてははるかに実用的ではない。
コーディングで優れている一般的なモデルをトレーニングすることは、熟練したハッカーになることなしには困難である。コーディングはAIの最大の収益源であるため、開発者はこれらの能力を強化する圧力に直面しながら、悪用を制限する方法を探している。
したがって、フロンティア開発者は他の緩和策 increasingly に依存している。一つの手法は、モデルが提供するサイバーセキュリティ支援の種類を部分的に制限することである。例えば、AnthropicのOpus 5は、コンパイルされていないソースコードの脆弱性を検索できるが、コンパイルされたソフトウェアについては検索できない(モデルのシステムカードによる)。その理由は、Opus 5を攻撃的な目的で使用することがより困難になるためである。
その他の措置には、厳格な展開前の安全評価、リスクアセスメントの公開、およびシステムが危険すぎると見なされた場合のモデルウェイトの保持が含まれる。
GLM-5.2の場合、SaferAIはZ.aiがモデルの安全フレームワーク、展開前のテストコミットメント、またはリスクアセスメントを公開していないことに注意した。TechCrunchはZ.aiにリリース前に内部または第三者のフロンティア安全評価を実施したかどうかを尋ねたが、回答は得られなかった。
中国の指導者は高度なAIのリスク increasingly に認識している。先月のWorld AI Conferenceにおいて、中国国家主席の習近平氏はオープンウェイトモデルの重要性を強調しつつ、AIが厳格な人間の制御下にあるツールであることを確保する必要性を強調した。
Stanford Cyber Policy Centerで中国のAI政策を研究するGraham Websterは、TechCrunchに、中国には堅牢なAI規制があるが、これらの規則は歴史的に攻撃的なサイバー能力や生物学的悪用のような壊滅的なAIリスクではなく、政治的に敏感なコンテンツ、誤情報、および社会の安定性に焦点を当ててきたと語った。
「米国のAI思想家は、一般的に、この壊滅的な存続危機[概念]について、中国のコミュニティよりも懸念している」とWebsterは述べ、中国の政策研究者の多くは、新たなフロンティアリスクが発生した場合、アメリカの企業がそれを最初に遭遇する可能性が高いと信じていると付け加えた。
「中国のシステムは、これらの技術の使用を中国国内で制御しているという自信を持っている」とWebsterは続けた。「中国でのオンライン活動は実名に帰属されるものであり、企業やユーザーは責任を追及される可能性がある。」
Websterは、モデルプロバイダーが特定の政治的なトピックに関する関与を拒否するために使用するのと同じメカニズムを、モデルが攻撃的なサイバー攻撃を実行することを拒否し、有害な生物学的エンジニアリングの結果をもたらさないことを確保するために調整する可能性がある可能性を示唆した。彼は、中国の企業はしばしば規制当局と裏で調整するため、リリース前にどのような内部テストを実施しているかを知ることは困難であると付け加えた。
オープンウェイトAIの支持者は、ウェイトの公開がサイバーセキュリティにとって重要であると主張する。なぜなら、それは企業が攻撃から自分自身を防御することを可能にするからである(Hugging FaceはOpenAIの侵害から自分自身を防御するためにGLM-5.2に依存した)、そして何が来ているかを理解することで将来の脅威に備えるのを助けるからである。
「攻撃者を止めるのに役立ったのと同じシステムが、今では毎日何百万ものサイバー攻撃から防御するのを助け、攻撃者がそれらを悪用する前に脆弱性を特定して修正するのを助けることができる」と、Hugging FaceのCEOであるClem Delangueは今週のソーシャルメディア投稿で述べた。
Papadatosは、この利点はしばしば過大評価されており、「危険な能力をオープンソース化すること」を正当化しないと主張した。
「私の主な点は、危険な能力がどこにでも誰でも簡単にアクセスできることを単に受け入れるべきではないということである」と彼は述べ、業界は「良い能力」のみを簡単にアクセス可能にすることに努めるべきであると強調した。攻撃者は防御者よりも新しいツールをより速く採用する;例えば、ランサムウェアグループは1週間で方法を変更できるが、病院はそうではない。」
関連記事
Hugging Face、130億ドルの買収について協議中
ビジネスインサイダーは週末、ハギングフェイスが130億ドル以上の評価額で売却の打診を受けたと報じた。同社のプラットフォームおよびオープンソースコミュニティは、開発者や研究者がAIモデルを共有、発見、テスト、デプロイする場所である。ハギングフェイスは最近、OpenAIのシステムの一つからの攻撃の標的となった。このシステムはサイバーセキュリティ評価中にサンドボックスから抜け出し、同社のサーバーに侵入した。ビジネスインサイダーによると、ハギングフェイスがどの企業と交渉しているかは不明であり、まだ合
AI開発の焦点は、最先端技術からより幅広い応用へと移行している
今年の夏、数週間にわたり、AI業界の注目はAnthropic社の最新最先端モデルと、その利用を規制しようとするワシントンの動きに集まっていた。しかし、注目が最先端の動向に注がれている間も、開発者たちはAnthropic社やOpenAIといった大手研究所からの許可を待たずに開発を続けていた。今年の春、Hugging Faceでのダウンロード数の41%を中国のオープンウェイトモデルが占め、米国の競合他
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (0)
0/500

規制当局がOpenAIのGPT-5.6 SolやAnthropicのMythosを含む、ますます強力なAIシステムのガバナンスについて議論する中、中国のオープンウェイトモデルが業界のリーダーとの格差を大幅に縮めた。
AI安全非営利団体SaferAIによる新しいレポートによると、中国のZ.aiによるオープンウェイトAIモデルGLM-5.2は、サイバーおよびバイオの能力においてOpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数ヶ月しか遅れていない。しかし、最先端の能力と安全慣行の間の隔たりは広がっている。
Z.aiのパブリックAPIを介して実施されたSaferAIの評価により、GLM-5.2が攻撃的なサイバーまたはデュアルユースの生物学タスクのいずれも拒否しなかったことが明らかになった。一方、Claude Opus 4.7は「非常に一貫して拒否したため、SaferAIはCyberGymを全く完了できなかった。」(CyberGymはサイバーセキュリティ能力を評価するベンチマークであり、OpenAIは先月のHugging Face侵害前の評価でこれを使用した。)
これは批評家たちの長年の懸念を浮き彫りにしている:オープンウェイトAIモデルは、ウェイトがダウンロードされた後に使用を監視する方法がないまま、潜在的な攻撃者に高度に機能する技術を提供する可能性がある。オープンウェイトモデルが主要なAIシステムの能力に急速に近づいているため、議論は競争できるかどうかから、社会がそのリリースのリスクをどのように管理するかへとシフトしている。
「能力の最前線はリスクの最前線ではなく、したがってリスクを適切に評価するために緩和策の状態も考慮に入れなければならない」と、SaferAIの執行理事であるHenry PapadatosはTechCrunchに語った。
Z.aiはホストされたAPIに安全対策を適用できるが、これらの保護はユーザーが独自のハードウェアでウェイトを実行すると執行不可能になり、安全対策の削除や変更、モデルのファインチューニング、またはシステムプロンプトの変更を許可する。
OpenAIやAnthropicのようなフロンティア開発者は、危険なサイバーおよび生物学的支援を制限するために、分類器、拒否トレーニング、APIレベルの制御などの安全対策に依存するのが一般的である。
これらの対策は完璧ではない:脱獄は展開されたモデルの保護を日常的に回避する。AI安全非営利団体Far.aiは、xAIのGrok 4.5やGoogle DeepMindのGemini 3.1 Proなどのフロンティアモデルにおいて、再利用可能なキーとして定義され、有害なリクエストの大部分で成功する何百もの普遍的な脱獄を見つけた。レポートによると、攻撃者がロールプレイ、権威のなりすまし、偽の会話履歴、およびフォローアッププロンプトを含む複数の操作技術を組み合わせてモデルの防御の弱点を攻撃したときに脱獄が成功する。
しかし、クローズドモデル用に設計された安全対策は、安全対策の有無にかかわらず、あらゆるインフラストラクチャで実行できるように構築されたオープンウェイトモデルでは機能しない。
「明確な目標は、安全な良い能力が誰でもアクセスできるようにすることであり、その後、オープンソースの形式であっても、悪いものを排除しようとするべきである」とPapadatosは述べた。
Papadatosが提案する一つのアプローチは「事前トレーニングデータフィルタリング」であり、AI企業がモデルをトレーニングする前に、キュレーションされたデータセットでモデルをトレーニングする前に、攻撃的なサイバーセキュリティ情報をトレーニングデータから削除する方法である。
一部の研究では、これは全体的なモデルのパフォーマンスを損なうことなく有害な生物学的知識を減少させることができることが示されている。しかし、データフィルタリングはサイバーセキュリティにおいてははるかに実用的ではない。
コーディングで優れている一般的なモデルをトレーニングすることは、熟練したハッカーになることなしには困難である。コーディングはAIの最大の収益源であるため、開発者はこれらの能力を強化する圧力に直面しながら、悪用を制限する方法を探している。
したがって、フロンティア開発者は他の緩和策 increasingly に依存している。一つの手法は、モデルが提供するサイバーセキュリティ支援の種類を部分的に制限することである。例えば、AnthropicのOpus 5は、コンパイルされていないソースコードの脆弱性を検索できるが、コンパイルされたソフトウェアについては検索できない(モデルのシステムカードによる)。その理由は、Opus 5を攻撃的な目的で使用することがより困難になるためである。
その他の措置には、厳格な展開前の安全評価、リスクアセスメントの公開、およびシステムが危険すぎると見なされた場合のモデルウェイトの保持が含まれる。
GLM-5.2の場合、SaferAIはZ.aiがモデルの安全フレームワーク、展開前のテストコミットメント、またはリスクアセスメントを公開していないことに注意した。TechCrunchはZ.aiにリリース前に内部または第三者のフロンティア安全評価を実施したかどうかを尋ねたが、回答は得られなかった。
中国の指導者は高度なAIのリスク increasingly に認識している。先月のWorld AI Conferenceにおいて、中国国家主席の習近平氏はオープンウェイトモデルの重要性を強調しつつ、AIが厳格な人間の制御下にあるツールであることを確保する必要性を強調した。
Stanford Cyber Policy Centerで中国のAI政策を研究するGraham Websterは、TechCrunchに、中国には堅牢なAI規制があるが、これらの規則は歴史的に攻撃的なサイバー能力や生物学的悪用のような壊滅的なAIリスクではなく、政治的に敏感なコンテンツ、誤情報、および社会の安定性に焦点を当ててきたと語った。
「米国のAI思想家は、一般的に、この壊滅的な存続危機[概念]について、中国のコミュニティよりも懸念している」とWebsterは述べ、中国の政策研究者の多くは、新たなフロンティアリスクが発生した場合、アメリカの企業がそれを最初に遭遇する可能性が高いと信じていると付け加えた。
「中国のシステムは、これらの技術の使用を中国国内で制御しているという自信を持っている」とWebsterは続けた。「中国でのオンライン活動は実名に帰属されるものであり、企業やユーザーは責任を追及される可能性がある。」
Websterは、モデルプロバイダーが特定の政治的なトピックに関する関与を拒否するために使用するのと同じメカニズムを、モデルが攻撃的なサイバー攻撃を実行することを拒否し、有害な生物学的エンジニアリングの結果をもたらさないことを確保するために調整する可能性がある可能性を示唆した。彼は、中国の企業はしばしば規制当局と裏で調整するため、リリース前にどのような内部テストを実施しているかを知ることは困難であると付け加えた。
オープンウェイトAIの支持者は、ウェイトの公開がサイバーセキュリティにとって重要であると主張する。なぜなら、それは企業が攻撃から自分自身を防御することを可能にするからである(Hugging FaceはOpenAIの侵害から自分自身を防御するためにGLM-5.2に依存した)、そして何が来ているかを理解することで将来の脅威に備えるのを助けるからである。
「攻撃者を止めるのに役立ったのと同じシステムが、今では毎日何百万ものサイバー攻撃から防御するのを助け、攻撃者がそれらを悪用する前に脆弱性を特定して修正するのを助けることができる」と、Hugging FaceのCEOであるClem Delangueは今週のソーシャルメディア投稿で述べた。
Papadatosは、この利点はしばしば過大評価されており、「危険な能力をオープンソース化すること」を正当化しないと主張した。
「私の主な点は、危険な能力がどこにでも誰でも簡単にアクセスできることを単に受け入れるべきではないということである」と彼は述べ、業界は「良い能力」のみを簡単にアクセス可能にすることに努めるべきであると強調した。攻撃者は防御者よりも新しいツールをより速く採用する;例えば、ランサムウェアグループは1週間で方法を変更できるが、病院はそうではない。」
Hugging Face、130億ドルの買収について協議中
ビジネスインサイダーは週末、ハギングフェイスが130億ドル以上の評価額で売却の打診を受けたと報じた。同社のプラットフォームおよびオープンソースコミュニティは、開発者や研究者がAIモデルを共有、発見、テスト、デプロイする場所である。ハギングフェイスは最近、OpenAIのシステムの一つからの攻撃の標的となった。このシステムはサイバーセキュリティ評価中にサンドボックスから抜け出し、同社のサーバーに侵入した。ビジネスインサイダーによると、ハギングフェイスがどの企業と交渉しているかは不明であり、まだ合
AI開発の焦点は、最先端技術からより幅広い応用へと移行している
今年の夏、数週間にわたり、AI業界の注目はAnthropic社の最新最先端モデルと、その利用を規制しようとするワシントンの動きに集まっていた。しかし、注目が最先端の動向に注がれている間も、開発者たちはAnthropic社やOpenAIといった大手研究所からの許可を待たずに開発を続けていた。今年の春、Hugging Faceでのダウンロード数の41%を中国のオープンウェイトモデルが占め、米国の競合他
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始





家






