オプション
ニュース
人類の主張は、AIが失速しておらず、ベンチマークを抜いています

人類の主張は、AIが失速しておらず、ベンチマークを抜いています

2025年4月17日
183

人類の主張は、AIが失速しておらず、ベンチマークを抜いています

大規模言語モデル(LLM)やその他の生成AI技術は、自己修正において大きな進歩を遂げており、これが「エージェントAI」と呼ばれる新しいアプリケーションへの道を開いていると、主要なAIモデル開発企業であるAnthropicの副社長、マイケル・ガーステンハーバー氏は述べています。

「自己修正や自己推論が非常に優れてきています」と、AnthropicでAPI技術をリードするガーステンハーバー氏は、ニューヨークでのブルームバーグ・インテリジェンスのアヌラグ・ラナ氏とのインタビューで語りました。ClaudeファミリーのLLMを開発したAnthropicは、OpenAIのGPTモデルと直接競合しています。「数か月ごとに新しいモデルをリリースし、LLMの能力を拡張しています」と彼は付け加え、モデル改訂ごとに新たな可能性が開かれる業界のダイナミックな性質を強調しました。

AIモデルの新たな能力

Anthropicの最新モデルは、タスク計画などの能力を導入し、人間がコンピュータ上で行うようなタスク、例えばオンラインでピザを注文することなどを可能にしています。「昨日は実現不可能だった中間ステップの計画が、今では手の届くところにあります」とガーステンハーバー氏は、このステップごとのタスク実行について述べました。

この議論には、AIスタートアップScale AIの主任技術者ビジェイ・カルナムルティ氏も参加し、ブルームバーグ・インテリジェンスが主催する「生成AI:生産性の約束を果たせるか?」という一日会議の一部でした。

AI懐疑論への挑戦

ガーステンハーバー氏の洞察は、生成AIやより広範なAI分野が「壁にぶつかっている」と主張し、各モデルの反復で収益が減少していると考えるAI懐疑論者への挑戦です。例えば、AI学者のゲイリー・マーカス氏は2022年以来、AIモデル(パラメータの増加)の規模を大きくするだけでは性能が比例して向上しないと警告しています。

しかし、ガーステンハーバー氏は、Anthropicが現在のAIベンチマークで測定できる範囲を超えて限界を押し広げていると主張します。「一部の領域で進歩が遅れているように見えても、それは私たちが全く新しい機能を開拓しているからであり、ベンチマークや古いタスクの実行能力が飽和しているだけです」と彼は説明しました。これにより、現在の生成AIモデルが達成できることの全貌を測ることがますます難しくなっています。

スケーリングと学習

ガーステンハーバー氏とカルナムルティ氏は、生成AIモデルのスケーリングが自己修正能力を高めるために重要であると強調しました。「私たちは確実に知能のスケーリングがますます進んでいるのを見ています」とガーステンハーバー氏は述べました。カルナムルティ氏は、「計画や推論で壁にぶつかっていないと信じる理由の一つは、モデルが新しい多様な環境に適応できるようにタスクを構造化する方法をまだ学んでいるからです」と付け加えました。

ガーステンハーバー氏は同意し、「私たちは初期段階にあり、アプリケーション開発者から彼らのニーズやモデルが不足している部分を学び、それを言語モデルに統合しています」と述べました。

リアルタイム学習と適応

ガーステンハーバー氏によると、この進歩の多くは、Anthropicでの基礎研究の急速なペースと、業界からのリアルタイムのフィードバックによる学習によって推進されています。「業界が私たちに必要としていることを適応し、リアルタイムで学んでいます」と彼は述べました。

顧客はしばしば大きなモデルから始め、特定の目的に合わせてよりシンプルなモデルにスケールダウンします。「最初に、モデルがタスクを適切に実行できるほど賢いかどうかを評価し、次にアプリケーションのニーズを満たすほど速いか、そして最後に、可能な限りコスト効率が良いかを評価します」とガーステンハーバー氏は説明しました。

関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト 『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法 Core Web Vitalsを修正してSEOランキングを向上させる方法 AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
コメント (8)
0/500
JoseRoberts
JoseRoberts 2025年8月13日 0:00:59 JST

This self-correction stuff is wild! 😮 It's like AI is learning to double-check its own homework. Wonder how far this 'agentic AI' will go—could it outsmart us at our own jobs soon?

WalterAnderson
WalterAnderson 2025年7月31日 20:35:39 JST

It's wild to think AI can now self-correct! 😮 Makes me wonder how soon we'll see these 'agentic AI' systems running our lives—hope they don’t outsmart us too much!

RonaldMartinez
RonaldMartinez 2025年7月22日 16:39:52 JST

This article really opened my eyes to how fast AI is evolving! Self-correcting LLMs sound like a game-changer for agentic AI. Can’t wait to see what new apps come out of this! 😄

WillieJackson
WillieJackson 2025年4月18日 16:00:28 JST

La perspectiva de Anthropic sobre que la IA no se estanca sino que supera los benchmarks es bastante genial. Es como si la IA estuviera jugando ajedrez mientras nosotros aún estamos tratando de entender las damas. Lo de la autocorrección suena prometedor, pero aún estoy un poco escéptico. 🤔

GeorgeWilson
GeorgeWilson 2025年4月18日 2:45:24 JST

Anthropic의 AI가 정체되지 않고 벤치마크를 뛰어넘는다는 생각이 멋지네요. AI는 체스를 하고 있는데, 우리는 아직 체커를 이해하는 단계예요. 자기 교정 이야기는 유망하지만, 아직 조금 회의적이에요. 🤔

NicholasCarter
NicholasCarter 2025年4月17日 20:27:31 JST

Anthropic's take on AI not stalling but outsmarting benchmarks is pretty cool. It's like AI is playing chess while we're still figuring out checkers. The self-correction stuff sounds promising, but I'm still a bit skeptical. 🤔

OR