イーロン・マスク氏のSpaceXAI、Grok 4.7を発表―DeepSWEで71.0%、Dogecoin(DOGE)連動センチメントに注目

マスク氏のSpaceXAIが9月21日にGrok 4.7を発表。DeepSWE v1.1で71.0%、Terminal-Bench 4.0で38.0%。価格は100万トークンあたり2ドル/6ドルで据え置き。DOGE連動センチメントに注目。

(00:34 UTC)
1分で読めます
AI要約AI
  • SpaceXAIが9月21日にGrok 4.7を発表、DeepSWE v1.1で71.0%を記録
  • Grok 4.7の価格は入力2ドル/出力6ドルでGrok 4.6から据え置き
  • Terminal-Bench 4.0は前世代の20.3%から38.0%へ跳ね上がる
  • HackerBench v0.3で高リスクプロンプトの通過率は3.3%にとどまる
k7rq2fdm

Grok 4.7は長時間ワークロードを狙う

イーロン・マスク氏のAI部門SpaceXAIは9月21日、コーディングおよびナレッジワーク向けに同社史上最強と位置付ける新モデル「Grok 4.7」を発表した。公式発表 によると、同システムはGrok 4.6よりも大きなベースモデルを基盤とし、より難易度の高いタスク混合を用いて強化学習サイクルを長く回して鍛えられたという。特筆すべきは、完了まで数時間を要する問題に意図的に焦点を絞った点だ。従来のモデルが数分単位で回答していたのに対し、今回のモデルは人間のエンジニアやアナリストなら数時間かかる仕事を押し通すよう調整されており、SpaceXAIは「持久力」を訴求の軸に据えている。長時間の実行にわたる自己検証能力、極めて長いコンテキストウィンドウの扱い、そしてGrok Botエージェントフレームワークのネイティブ操作が大きく改善したとし、その効果は会話、汎用知識タスク、専門的な文書やプレゼンテーションの生成にも及ぶとしている。公開ベンチマークでは、xhigh構成がフロンティアに肉薄した。ソフトウェア工学スイートDeepSWE v1.1では71.0%を記録し、70.0%のFable 5.1 maxを上回り、72.7%のGPT-5.6 Sol maxに次ぐ水準だ。複数時間に及ぶターミナル作業を評価するTerminal-Bench 4.0では、前世代の20.3%から38.0%へと大きく跳ねた。弁護士、看護師、金融アナリストなど複数時間の専門業務を模したスイート――AA BriefcaseやHealthBenchなど――では、業界最高水準と互角に渡り合えるようになったとSpaceXAIは主張する。安全性ももう一つの目玉だ。セーフティスタックを再構築した結果、不適切な要求の拒否やジェイルブレイク耐性において同社史上最も堅固なバージョンになったという。悪性サイバー任務を試すHackerBench v0.3では、高リスクなデュアルユースプロンプトの通過率がわずか3.3%にとどまり、正当な防御的セキュリティ業務の誤拒否は少なかった。一部のサイバーセキュリティパートナーには、防御研究を支援するため招待制のレッドチームアクセスが付与されている。モデルはすでにCursor、Grok Build、Grok API、主要クラウドプラットフォーム、モデルルーターを通じて利用可能だ。

価格は据え置き、Brood WarでGrok 4.6が失態

静かに衝撃的なのは価格設定だ。Grok 4.7は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで登場し、Grok 4.6と完全に同一。さらに、出力速度を2倍にする代わりに価格も2倍となる高速バリエーションも用意された。このトークノミクスは競合を鋭く切り崩す水準だ。GPT-5.6 Solは100万トークンあたり4ドル/20ドル、Fable 5.1は10ドル/50ドルで設定されており、Grokのレートは競合のおよそ3分の1から2分の1程度でありながら、より高速に応答する。SpaceXAI自身の比較表によれば、Grok 4.7は電気工学(EEBenchで64.0%、GPT-5.6 Solの39.4%とFable 5.1の56.4%を上回る)およびHarvey法律エージェントベンチマーク(19.6%対2.5%、6.7%)ではリードする一方、ソフトウェア工学(CursorBench 4.0で46.3%対51.8%)と臨床推論(HealthBench Professionalで56.7%対62.1%)ではFable 5.1に後れを取る。以上の数値はすべてSpaceXAIの公開データに基づく。企業的な背景も無視できない。SpaceXAIは2月にxAIがSpaceXへ吸収合併されたことで現在の形となり、6月にはCursorを買収した。Tesla(TSLA)にまたがるマスク氏の帝国の一部であり、当メディアが先に報じた通り、AIサブスクリプションプランの統合も数週間以内に進める構えだ。だがローンチの数時間前、クラウドソーシング型ベンチマークが前世代モデルに痛打を浴びせた。開発者Ben Swerdlow氏によるBrood War Bench――AIエージェントがStarCraft: Brood Warを対戦するベンチマーク――が9月20日にX上で拡散したのだ。Codex、Claude、Grokの19構成が計171回の直接対決を戦い、Codex Astraは最大推論設定で18戦全勝を飾った。Grok 4.6の3構成はCodexとClaudeの全構成に敗れ、最高成績は18戦中2勝にとどまった。Swerdlow氏は、最高推論設定のGrokが43分間で11,138個の推論トークンを消費しながら発行したコマンドバッチはわずか6回で、戦闘ユニットを一切展開しなかった一戦を記録し、Grokはまだこのゲームに対応できるほど賢くなく、旧モデルがリアルタイムストラテジーをターン制として扱っていると評した。さらに、参加モデルの誰も初心者レベルを超えられず、Grok 4.7はまだランク付けされていないと付け加えた。 市場をリアルタイムで追いたい読者は、Bitgetで現物・先物価格をライブで確認できる。

本当のシグナルは価格圧力

ローンチ当日の好数字とBrood Warでの惨敗は、一つの物語として読める。フロンティアラボはもはや推論能力をコモディティ価格で販売しており、勝敗を分けるのは静的ベンチマークのスコアではなくエージェントの信頼性だ、ということである。COINOTAGの読みはこうだ。2ドル/6ドルの価格設定は、競合が一致せざるを得ないトークノミクスをGrok 4.7に与えた。あたかも先物価格が市場の期待値を再び固定させるのと同じように、である。そして同等の計算資源を持たないラボは、この価格戦争におけるエグジット流動性になるリスクを負う。歴史的に、マスク氏の計算資源関連の報道はDogecoin(DOGE)などマスク連動資産のセンチメントを動かしてきた――注視すべきはローンチ時の主張ではなく、Grok 4.7のエージェント成果である。

COINOTAG News Desk

COINOTAG News Desk

COINOTAGの編集・調査デスクです。

News Deskの仕組み
AI生成

AIによって生成され、AIによるレビューを経て、COINOTAGの編集監督のもとで公開されました。