オプション
ニュース
バイトダンスがSeed-Thinking-v1.5 AIモデルを公開し、推論能力を向上

バイトダンスがSeed-Thinking-v1.5 AIモデルを公開し、推論能力を向上

2025年8月23日
186

高度な推論AIの競争は、2024年9月にOpenAIのo1モデルで始まり、2025年1月のDeepSeekのR1ローンチで勢いを増しました。

主要なAI開発企業は現在、より高速でコスト効率の高い推論AIモデルを開発するために競争しており、チェーン・オブ・ソートプロセスを通じて正確でよく考え抜かれた応答を提供し、回答前に正確性を確保しています。

TikTokの親会社であるバイトダンスは、技術論文で概要が示された新しい大規模言語モデル(LLM)であるSeed-Thinking-v1.5を発表し、STEMおよび一般的な領域での推論を強化することを目指しています。

このモデルはまだ利用可能ではなく、ライセンスが独自仕様、オープンソース、またはハイブリッドのいずれであるかは未公開です。ただし、論文にはリリース前に探る価値のある重要な洞察が含まれています。

MetaのLlama 4やMistralのMixtralに続き、Seed-Thinking-v1.5はMixture-of-Experts(MoE)アーキテクチャを採用しています。

このアプローチは、複数の専門モデルを1つに統合し、それぞれが異なる領域に焦点を当てることで効率を高めます。

Seed-Thinking-v1.5は、2000億のパラメータのうち200億のみを一度に使用し、パフォーマンスを最適化しています。

バイトダンスのGitHubで公開された論文は、モデルの構造化された推論と意図的な応答生成への焦点を強調しています。

これはDeepSeek R1を超え、GoogleのGemini 2.5 ProやOpenAIのo3-mini-highと第三者ベンチマークで競合し、ARC-AGIベンチマークではそれらを上回り、OpenAIの基準に従って経済的に価値のあるタスクで人間のパフォーマンスを超える、人工知能の進歩の重要な指標です。

コンパクトでありながら強力な代替として位置付けられたSeed-Thinking-v1.5は、革新的な強化学習、厳選されたトレーニングデータ、先進的なAIインフラストラクチャを通じて優れたベンチマーク結果を提供します。

ベンチマーク性能とコアの強み

Seed-Thinking-v1.5は困難なタスクで優れており、AIME 2024で86.7%、Codeforcesでpass@8で55.0%、GPQA科学ベンチマークで77.3%を記録し、OpenAIのo3-mini-highやGoogleのGemini 2.5 Proと推論指標でほぼ同等またはそれらを上回っています。

非推論タスクでは、DeepSeek R1に対して8.0%高い人間の好み勝率を達成し、論理や数学を超えた汎用性を示しています。

ベンチマークの飽和に対抗するため、バイトダンスは記憶に頼らないより厳しい数学ベンチマークであるBeyondAIMEを作成し、モデル性能をより良く評価します。このベンチマークは、Codeforcesセットと共に、将来の研究を支援するために公開されます。

トレーニングデータのアプローチ

Seed-Thinking-v1.5の開発ではデータ品質が重要でした。教師あり微調整のために、40万のサンプルが厳選されました:30万の検証可能なSTEM、論理、コーディングタスクと、10万のクリエイティブライティングのような検証不可能なタスクです。

強化学習のために、データは以下に分けられました:

  • 検証可能な問題:エリート競技から慎重に選ばれた10万のSTEM質問と論理パズル、専門家によって検証されました。
  • 検証不可能なタスク:オープンエンドのプロンプトに対する人間の好みデータセット、ペアワイズ報酬モデルで評価されました。

STEMデータの80%以上は高度な数学に焦点を当て、Sudokuや24ポイントパズルなどの論理タスクはモデル進捗に合わせてスケールされました。

強化学習の革新

Seed-Thinking-v1.5は、カスタムのアクター-クリティック(VAPO)およびポリシー勾配(DAPO)フレームワークを使用して、長いチェーン・オブ・ソートシナリオでの問題に対処し、強化学習を安定化します。

2つの報酬モデルがRL監督を強化します:

  • Seed-Verifier:生成された回答と参照回答の数学的同等性を保証するルールベースのLLM。
  • Seed-Thinking-Verifier:報酬操作に耐性のある一貫した評価のための推論ベースのジャッジ。

このデュアルシステムは、単純および複雑なタスクでの正確な評価をサポートします。

スケーラブルなインフラストラクチャ設計

バイトダンスのHybridFlowフレームワークは、Rayクラスタによって支えられ、GPUのアイドル時間を最小化する共同配置されたトレーニングと推論で効率的な大規模トレーニングをサポートします。

ストリーミングロールアウトシステム(SRS)は、モデル進化とランタイムを分離し、部分生成の非同期管理により反復を最大3倍高速化します。

追加の技術には以下が含まれます:

  • メモリ効率のための混合精度(FP8)
  • MoE最適化のためのエキスパート並列処理とカーネル自動チューニング
  • 堅牢なチェックポインティングのためのByteCheckpoint
  • 最適化された並列処理とメモリ設定のためのAutoTuner

人間中心の評価と応用

クリエイティブライティング、人文科学、一般会話での人間のテストでは、Seed-Thinking-v1.5がDeepSeek R1を上回り、現実世界での関連性を証明しました。

チームは、検証可能なタスクでのトレーニングが、厳格な数学的ワークフローに駆動されて、クリエイティブな領域への一般化を強化したと述べています。

技術チームと企業への影響

LLMライフサイクルを監督する技術リーダーにとって、Seed-Thinking-v1.5は高度な推論を企業AIシステムに統合するモデルを提供します。

検証可能なデータセットと多段階の強化学習によるモジュラートレーニングは、LLM開発を正確に制御しながらスケールするチームに適しています。

Seed-VerifierとSeed-Thinking-Verifierは、顧客向けまたは規制された環境で重要な信頼性の高い報酬モデリングを強化します。

タイトなスケジュールのチームにとって、VAPOと動的サンプリングは反復サイクルを短縮し、タスク固有の微調整を効率化します。

ハイブリッドインフラストラクチャ(SRSやFP8最適化を含む)は、トレーニングスループットとハードウェア効率を高め、クラウドおよびオンプレミスシステムに最適です。

モデルの適応型報酬フィードバックは、多様なデータパイプラインの管理における課題に対処し、ドメイン間で一貫性を確保します。

データエンジニアにとって、厳格なデータフィルタリングと専門家検証への焦点は、モデル性能向上における高品質データセットの価値を強調します。

今後の展望

バイトダンスのSeed LLM Systemsチームによって開発され、Yonghui Wuが率い、Haibin Linが公開代表を務めるSeed-Thinking-v1.5は、Doubao 1.5 Proなどの取り組みを基盤とし、共有されたRLHFとデータキュレーション技術を使用しています。

チームは、トレーニング効率と検証不可能なタスクの報酬モデリングに焦点を当て、強化学習を改良することを目指しています。BeyondAIMEのようなベンチマークの公開は、推論に焦点を当てたAI研究のさらなる進展を促進します。

関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ サム・アルトマン氏によるAIの減速論が議論を呼ぶ Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている OpenAIはアップルの営業秘密訴訟と戦っている OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
TikTokの元幹部らが、写真でのポーズをマスターできるAI搭載アプリをリリース TikTokの元幹部らが、写真でのポーズをマスターできるAI搭載アプリをリリース 企業は、ユーザーに写真撮影のテクニックを教えるために、AIによる画像生成をますます活用するようになっています。昨年、GoogleはPixel端末向けに、フレーミングや構図の決定を支援する「Camera Coach」を導入し、7月にはAdobeが、AIを用いて写真を分析・評価し、調整方法を提案する新機能を、実験的なカメラアプリに追加しました。このトレンドを受け、TikTokの元社員であるMelody
関連特集おすすめ
デザインとアート キャラクターシート、ムードボード、ピッチデッキ向けのAIビジュアルスタイルリファレンスツール
キャラクターシート、ムードボード、ピッチデッキ向けのAIビジュアルスタイルリファレンスツール

2026年最新の、キャラクターシート、ムードボード、ピッチデッキに最適なAIビジュアルスタイルリファレンスツールがXIX.AIに登場!この厳選された高評価ツール一覧には、実環境での厳格なテストをクリアした、業界に革新をもたらす強力なツールが掲載されています。 無料版と有料版の比較、詳細なランキング、そして創造性を高め、ワークフローを効率化するためにぜひ試したいツールが満載です。今すぐチェックして、生産性を向上させるあなたにぴったりのツールを見つけましょう!

11 ツール
xix.ai
SEO 検索戦略に最適なAI SERP分析ツール
検索戦略に最適なAI SERP分析ツール

2026年版、検索戦略に最適な高評価のAI SERP分析ツールは、XIX.AIが実環境での厳格なテストを経て厳選し、毎週ランキングを更新しています。これらの強力なツールを活用すれば、隠れた最適化の機会を発見し、コンテンツのパフォーマンスを向上させ、検索分野で競争優位性を獲得することができます。今すぐ、検索戦略を強化するのに最適なツールを見つけてください。今すぐチェック!

13 ツール
xix.ai
データ分析 SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール
SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール

2026年最新版・最高評価のAI異常検知ツール【SaaSおよびEコマースチーム向けKPIモニタリング】!XIX.AIは、厳格な実世界テストと週次更新のランキングに基づき、革新的な強力なコレクションを厳選しました。生産性を向上させ、AIの優位性を引き出すために必須のソリューションを見極めるのに役立つ、無料版と有料版の詳細な比較インサイトが見つかります。今すぐチェックしましょう!

10 ツール
xix.ai
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
コメント (1)
0/500
ChristopherDavis
ChristopherDavis 2026年1月19日 9:30:41 JST

Cette accélération dans la course au raisonnement avancé me donne un peu le vertige 😅. D'un côté c'est fascinant de voir comment les modèles deviennent de plus en plus 'intelligents', mais d'un autre... on est certains que tout ce développement est sous contrôle ? Pas sûr que les entreprises pensent beaucoup aux implications éthiques quand elles sont lancées dans cette bataille commerciale ultra-compétitive.

OR