Grok 4.6 がリリースされ、コストを60%以上抑えながら GPT-5.6 と同等のパフォーマンスを実現

xAIはGrok 4.6をリリースし、AIインテリジェンス指数で61点を達成し、GPT-5.6 Sol (Max)と同等のスコアを記録し、Claude Opus 5 (63点)およびClaude Fable 5 (62点)にはわずかに及ばない。このパフォーマンスにより、Grok 4.6は世界最高峰のモデルの一つに位置づけられ、OpenAIおよびAnthropicのフラッグシップ製品に直接挑戦している。Grok 4.5を基盤として構築されたこのアップデートは、推論能力と高度な技術概念のトレーニングにおける中核的な強化を導入し、モデル自体が生成した厳選されたデータ、高品質なエンジニアリングデータセット、最適化されたトレーニングアルゴリズムを活用している。
トレーニング方法論における重要な転換点は、自己強化型のデータループである。Grok 4.5は、推論、エージェントツールの利用、STEM、ソフトウェアエンジニアリング、知識労働などの領域に焦点を当てて、監督付き微調整の軌道を再生成するために使用された。また、モデルは、知識労働、一般的なコーディング、カーネル最適化、ウェブ開発、コンピュータ支援設計など、エージェントベースの強化学習タスクに対して広範なトレーニングを受けた。これは、新興の「エージェント時代」の主要なワークロードに対処することを明確に意図した戦略である。
エージェントベンチマークは劇的な改善を見せ、複雑で長期にわたるタスクに必要な努力が大幅に削減された。
エージェント関連のベンチマーク評価において、Grok 4.6は卓越したパフォーマンスを示した。GDPval-AA v2でEloスコア1753を達成し、Claude Opus 5に次いで2位となった。DeepSWE v1.1のスコアは65.9%に上昇し、Grok 4.5の54%から顕著な増加を示した。一方、APEX-Agentsは47.1%から57.5%に跳ね上がった。Terminal-Bench v3.0は15.7%から26%に改善し、CursorBench v3.2で69.9%、FrontierCode v1.1で61.3%という強力な結果も加わり、コーディングおよびエージェント能力の両方で顕著な突破を示した。
特筆すべきは、Grok 4.6が明確なコスト効率の優位性を提供することである。入力トークン100万あたり2ドル、出力トークン100万あたり6ドルという価格設定は、Claude Opus 5 ($5/$25)およびGPT-5.6 Sol ($5/$30)よりも60%以上安い。AA-Briefcaseの長期知識労働ベンチマークにおいて、Grok 4.6は約5億の入力トークンを使用して平均53ラウンドでタスクを完了したのに対し、Claude Opus 5は約103ラウンドおよび20億トークンを必要とした。これは、Grok 4.6が四分の一未満のリソースで同等の結果を達成することを意味し、明確なコストパフォーマンスの優位性を浮き彫りにしている。現在、このモデルはCursor、Grok Build、API、OpenRouter、Vercel、Cloudflareを通じてアクセス可能である。初週には、Grok BuildおよびCursorで利用クレジットが2倍になる。50万トークンのコンテキストウィンドウを備え、「同等の知能をより低い価格で」という競争環境が正式に始まった。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500

xAIはGrok 4.6をリリースし、AIインテリジェンス指数で61点を達成し、GPT-5.6 Sol (Max)と同等のスコアを記録し、Claude Opus 5 (63点)およびClaude Fable 5 (62点)にはわずかに及ばない。このパフォーマンスにより、Grok 4.6は世界最高峰のモデルの一つに位置づけられ、OpenAIおよびAnthropicのフラッグシップ製品に直接挑戦している。Grok 4.5を基盤として構築されたこのアップデートは、推論能力と高度な技術概念のトレーニングにおける中核的な強化を導入し、モデル自体が生成した厳選されたデータ、高品質なエンジニアリングデータセット、最適化されたトレーニングアルゴリズムを活用している。
トレーニング方法論における重要な転換点は、自己強化型のデータループである。Grok 4.5は、推論、エージェントツールの利用、STEM、ソフトウェアエンジニアリング、知識労働などの領域に焦点を当てて、監督付き微調整の軌道を再生成するために使用された。また、モデルは、知識労働、一般的なコーディング、カーネル最適化、ウェブ開発、コンピュータ支援設計など、エージェントベースの強化学習タスクに対して広範なトレーニングを受けた。これは、新興の「エージェント時代」の主要なワークロードに対処することを明確に意図した戦略である。
エージェントベンチマークは劇的な改善を見せ、複雑で長期にわたるタスクに必要な努力が大幅に削減された。
エージェント関連のベンチマーク評価において、Grok 4.6は卓越したパフォーマンスを示した。GDPval-AA v2でEloスコア1753を達成し、Claude Opus 5に次いで2位となった。DeepSWE v1.1のスコアは65.9%に上昇し、Grok 4.5の54%から顕著な増加を示した。一方、APEX-Agentsは47.1%から57.5%に跳ね上がった。Terminal-Bench v3.0は15.7%から26%に改善し、CursorBench v3.2で69.9%、FrontierCode v1.1で61.3%という強力な結果も加わり、コーディングおよびエージェント能力の両方で顕著な突破を示した。
特筆すべきは、Grok 4.6が明確なコスト効率の優位性を提供することである。入力トークン100万あたり2ドル、出力トークン100万あたり6ドルという価格設定は、Claude Opus 5 ($5/$25)およびGPT-5.6 Sol ($5/$30)よりも60%以上安い。AA-Briefcaseの長期知識労働ベンチマークにおいて、Grok 4.6は約5億の入力トークンを使用して平均53ラウンドでタスクを完了したのに対し、Claude Opus 5は約103ラウンドおよび20億トークンを必要とした。これは、Grok 4.6が四分の一未満のリソースで同等の結果を達成することを意味し、明確なコストパフォーマンスの優位性を浮き彫りにしている。現在、このモデルはCursor、Grok Build、API、OpenRouter、Vercel、Cloudflareを通じてアクセス可能である。初週には、Grok BuildおよびCursorで利用クレジットが2倍になる。50万トークンのコンテキストウィンドウを備え、「同等の知能をより低い価格で」という競争環境が正式に始まった。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






