DeepSeek V4.1 FlashがGPT-6の約70分の1のコストで81.2点を記録、Sahara AI(SAHARA)の筋書きに重し
DeepSeekのV4.1 FlashはOpenDesign Arenaで81.2点を獲得し、GPT-6 Astraに1.5点差。1デザインあたり0.023ドル対1.61ドル──70倍のコスト差がSahara AIなどAIトークンに波紋を広げる。
AI要約AI
- DeepSeekのV4.1 FlashがOpenDesign Arenaで81.2点を獲得
- GPT-6 Astraは82.7点で1位、差は1.5ポイント
- 1タスクのコストはV4.1 Flashが0.023ドル、GPT-6 Astraが1.61ドル
- V4.1 Flashの総パラメータは5,520億、うち約160億を出力生成に活性化
81.2対82.7──ベンチマークの僅差
DeepSeekのV4.1 Flashが、デザイン評価プラットフォームOpenDesign Arenaのウェブデザイン部門で平均81.2点を獲得した。結果は9月11日に公表されており、13モデル中首位のOpenAI「GPT-6 Astra」の82.7点に対し、差は1.5ポイントまで縮まっている。AIリーダーボード最上位の能力差はほぼノイズレベルに迫った──だが、両モデルのコスト差はまったく縮まっていない。
OpenDesign Arenaは実践的なデザイン作業を評価軸にしており、ウェブアプリケーション、ダッシュボード、モバイル画面、ランディングページを、要件の充足度、レイアウト、視覚的階層、配色、成果物全体の完成度で採点する。その基準のもと、V4.1 Flashは81.2点で2位に入り、同一評価で80.3点を記録したAnthropicのClaude Fable 5.1を上回った。
DeepSeekモデルが他を大きく引き離すのは経済性だ。デザインタスク1件あたりの平均コストは、V4.1 Flashが0.023ドルであるのに対し、GPT-6 Astraは1.61ドル──およそ70分の1の価格差だ。さらにClaude Fable 5.1は1タスクあたり3.66ドルと、より高額に設定されている。処理速度でもV4.1 Flashが優位で、平均作業時間は5.3分。Astraの11.1分、Claude Fable 5.1の12.8分と比較して、半分以下で完了している。
一方、品質面の数値はより慎重な見方を促す。修正なしでそのまま使えると判定された成果物の割合は、GPT-6 Astraが60%、V4.1 Flashが57.7%、Claude Fable 5.1が56.7%で、上位2モデルの差は2.3ポイントにとどまる。この留保は重要だ。OpenDesign Arenaが測定しているのは一つの縦割り領域にすぎず、ウェブデザインでのほぼ互角の結果は、コーディング、推論、科学研究におけるGPT-6 Astraとの全面的な同等性を証明しない。DeepSeek自身もそこまでは主張していない。だが、この数値が示す事実は明確だ。企業が実際に生成デザインに支出しているタスク領域では、もはや生の性能ではなく、タスク単価とスループットが決定変数になりつつある。
総パラメータ5,520億、うち160億を活性化
V4.1 Flashのコスト優位は補助金ではなくアーキテクチャに由来しており、定量的に説明できる。同モデルは総パラメータ5,520億を擁するが、すべてを常時稼働させるわけではない。入力処理には約80億、出力生成には約160億のパラメータを活性化して対応する仕組みだ。DeepSeekはこれを非対称アーキテクチャと位置づけている。Mixture-of-Experts(MoE)設計により、大規模モデルの知識容量を保ちながら、リクエストごとの実際の計算消費を削減する。この発想は、ブロックチェーンインフラにおける代替仮想マシン(AltVM)の論理と精神的に重なる。トランザクションに必要なモジュールだけを実行し、ランタイム全体を動かさない考え方だ。
モデルは9月10日に正式リリースされた。事前にDeepSeekが示していたスケジュール通りの展開である。社内テストでは出力速度が毎秒420トークンと計測されていたが、測定条件は競合モデルのそれと完全に同一ではなく、単純な速度比較は正確さを欠く点に注意が必要だ。リリース時、DeepSeekは効率的なアーキテクチャにより低コストでより多くのユーザーにサービスを提供できると説明し、そのコスト削減分はユーザーに還元されていると付け加えた。
当メディアのベンチマークデータの読み解きはこうだ。少なくともこの縦割り領域においては、効率性の主張は独立系評価との照合に耐えた。とはいえ、実環境でのコストや速度は入力長、リクエストパターン、サーバー状況で変動し、API価格はプロバイダごとに異なるため、表向きのタスク単価は契約値というより方向性を示す指標と捉えるべきだ。しかし方向性でなくなったのがトレンドそのものである。1タスク0.023ドルでフロンティア級の成果物を届ける時代は、推論コストのあり方に関する期待値を塗り替えた。 市場をリアルタイムで追いたい読者は、Bitgetで現物・先物価格をライブで確認できる。
タスク単価がAI指標になる日
互角に近いスコアと70倍のコスト差を並べて読むと、一つの流れが見えてくる。AI競争は能力ベンチマークからユニットエコノミクスへと軸足を移しつつある。この転換はAI関連の暗号資産に直撃する。Sahara AI(SAHARA)といったトークンは、分散型機械学習インフラがコスト面で中央集権的なラボを上回るというテーゼを取引されている。中央集権型のフロンティアラボが最接近する競合の約70分の1の価格を提示したとき、このテーゼは売り込みにくくなる。その価格再評価の最初の表れは、AIトークン群の出来高に映るはずだ。効率向上は、無駄な計算サイクルの最小化を競うブロックチェーン型コンピュートネットワークにとっても両刃の剣である。注目すべき次の指標は、OpenDesign Arenaや類似の評価機関がコスト調整済みランキングの公表を始めるかどうかだ。実現すれば、DeepSeekがエスカレートさせたばかりの価格戦争が、業界の公式なスコアボードになる。

AIによって生成され、AIによるレビューを経て、COINOTAGの編集監督のもとで公開されました。


