xAI Grok 4.20、業界最低レベルの幻覚発生率を達成、性能よりも正確性を優先
AI大手各社がトップクラスの性能スコアを追求するために熱狂的にリソースを投入する一方で、イーロン・マスク氏のxAIは異なるアプローチを取り、この分野で最も根深い問題である「情報の捏造」に焦点を当てています。 本日、xAIは「Grok4.20Beta」を正式にリリースした。絶対的な知能スコアでは依然としてトップクラスのモデルには及ばないものの、「真実性」という重要な指標において業界新記録を樹立した。

Artificial Analysisによる最新の評価によると、Grok4.20は推論モードにおける知能指数で48点を記録した。 や (いずれも57点)には及ばないものの、事実の信頼性に関するパフォーマンスは特に印象的である。
低い幻覚率:AA Omniscienceテストにおいて、Grok4.20は78%の「非幻覚率」を達成し、新記録を樹立した。
「知っていることを知る」:答えられない質問に直面した際、このモデルはもはや虚偽の事実をでっち上げる傾向がなく、代わりに「わからない」とより正確に認めるようになりました。この正直さは、厳格なオフィスや研究環境において極めて重要です。
技術アーキテクチャ:3-in-1 APIマトリックス
多様なニーズに応えるため、xAIは3種類のAPIバリエーションをリリースしました:
推論モード:速度よりも深い論理的思考を優先します。これが、今回の「幻覚」記録を更新する鍵となりました。
標準モード:迅速な応答と日常的な対話に最適化されています。
マルチエージェントモード:複数のAIインスタンスが連携して複雑なタスクを処理することをサポートします。
市場戦略:コンテンツの拡充、追加費用なし
独自の性能に加え、Grok4.20は積極的な商業戦略も導入しています:
大規模コンテキスト:最大200万トークンのコンテキストウィンドウに対応しており、書籍1冊分や大規模なコードベースを一度に処理可能です。
価格面での優位性:100万トークンあたり2~6ドルの価格設定で、前バージョンのGrok4よりも安価であるだけでなく、現在の欧米の主流モデルの中でも極めて競争力があります。
Grok4.20のリリースは、xAIの戦略的転換を反映しています。もはやAGIに向けた総合スコアの競争に固執するのではなく、「エンタープライズレベルの信頼性」という課題に的確に焦点を当てているのです。 評価機関が指摘したように、他のモデルが「全知全能の預言者」を目指しているのに対し、Grok4.20は「決して嘘をつかない助手」を目指している。
データの正確性に対して極めて高い要件を持つユーザーにとって、Grok4.20はOpenAIやGoogleに次ぐ、第3の主要な選択肢となる可能性がある。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
AI大手各社がトップクラスの性能スコアを追求するために熱狂的にリソースを投入する一方で、イーロン・マスク氏のxAIは異なるアプローチを取り、この分野で最も根深い問題である「情報の捏造」に焦点を当てています。 本日、xAIは「Grok4.20Beta」を正式にリリースした。絶対的な知能スコアでは依然としてトップクラスのモデルには及ばないものの、「真実性」という重要な指標において業界新記録を樹立した。

Artificial Analysisによる最新の評価によると、Grok4.20は推論モードにおける知能指数で48点を記録した。
低い幻覚率:AA Omniscienceテストにおいて、Grok4.20は78%の「非幻覚率」を達成し、新記録を樹立した。
「知っていることを知る」:答えられない質問に直面した際、このモデルはもはや虚偽の事実をでっち上げる傾向がなく、代わりに「わからない」とより正確に認めるようになりました。この正直さは、厳格なオフィスや研究環境において極めて重要です。
技術アーキテクチャ:3-in-1 APIマトリックス
多様なニーズに応えるため、xAIは3種類のAPIバリエーションをリリースしました:
推論モード:速度よりも深い論理的思考を優先します。これが、今回の「幻覚」記録を更新する鍵となりました。
標準モード:迅速な応答と日常的な対話に最適化されています。
マルチエージェントモード:複数のAIインスタンスが連携して複雑なタスクを処理することをサポートします。
市場戦略:コンテンツの拡充、追加費用なし
独自の性能に加え、Grok4.20は積極的な商業戦略も導入しています:
大規模コンテキスト:最大200万トークンのコンテキストウィンドウに対応しており、書籍1冊分や大規模なコードベースを一度に処理可能です。
価格面での優位性:100万トークンあたり2~6ドルの価格設定で、前バージョンのGrok4よりも安価であるだけでなく、現在の欧米の主流モデルの中でも極めて競争力があります。
Grok4.20のリリースは、xAIの戦略的転換を反映しています。もはやAGIに向けた総合スコアの競争に固執するのではなく、「エンタープライズレベルの信頼性」という課題に的確に焦点を当てているのです。 評価機関が指摘したように、他のモデルが「全知全能の預言者」を目指しているのに対し、Grok4.20は「決して嘘をつかない助手」を目指している。
データの正確性に対して極めて高い要件を持つユーザーにとって、Grok4.20はOpenAIやGoogleに次ぐ、第3の主要な選択肢となる可能性がある。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






