TypeSafe AIのJevモデル、Bitcoin(BTC)自動化に向け70〜500ミリ秒の型付き判定を返す

TypeSafe AIのJevモデルはテキスト生成なしで70〜500ミリ秒の型付き確率的判定を返す。公開1週間でオープンソースの模倣実装が登場した。

(05:32 UTC)
1分で読めます
AI要約AI
  • TypeSafe AIが9月15日にJevの早期アクセスを開始
  • Jevの応答時間は70〜500ミリ秒を公表
  • System Oneタスクは1件0.114秒・0.000081ドルを主張
  • 入力価格は10億トークンあたり42ドルでClaude Fable 5.1の238分の1
k7rq2fdm

70〜500ミリ秒、テキスト生成は一切なし

AIスタートアップのTypeSafe AIは9月15日、判断だけを返す「System One」モデル第1号と位置付けるJevの早期アクセスを開始した。同社の定義によればSystem Oneとは、言語ではなく判断そのものを返すソフトウェアのカテゴリだ。公式の発表記事によると、Jevは状態と事前定義された質問セットを受け取り、それらを並列に評価して確率付きの型付き回答を返す。文字列はどこにも生成されないため、アプリケーション側は自由形式のテキストをパースせず、出力をそのままコードで消費できる。

公開されているインターフェースは3種類の質問タイプを備える。Choiceは固定リストから1つの選択肢を選び、選ばれた項目、選択肢ごとの確率、信頼度を返す。Scoreは状態をルーブリックに照らして採点し、スコア、確率分布、信頼度を返す。Noulは文の真偽を判定し、0〜1の単一の数値を返す。技術ドキュメントは、この3タイプを1回のAPI呼び出しで混在できること、質問を追加しても応答時間はほとんど変わらないこと、そして文脈の破損が起きないことを明記している。

確率そのものがプロダクトだ。TypeSafe自身の例はチケットのトリアージで、91%対9%のエンジニアリング寄りの判定は自動ルーティングされ、52%対48%のような拮抗した判定はエスカレーション、コンテキストの追加、あるいはより強力なモデルへの引き継ぎを引き起こす。社の訴求は「文字列ではなく、判断」に集約される。ただし留意点がある。型安全が防ぐのはフォーマットの誤りであって判断の誤りではない。宣言されていない選択肢を返せないモデルでも、宣言済みの選択肢を誤って返すことはできる。パフォーマンス数値はすべてTypeSafe自身の公表値である。System Oneタスク1件あたり0.114秒、1件あたり0.000081ドル、10億入力トークンあたり42ドル、入力価格はClaude Fable 5.1の238分の1、総合で193.6倍高速かつ444.6倍低コストという集計主張まで含まれる。応答時間は70〜500ミリ秒で、フロンティアモデル比較集合の3〜329秒に対置される。同社は新アーキテクチャ、並列サンプラー、RLCD(較正型意思決定強化学習)という訓練手法をその実現要因に挙げ、現在は開発者が早期アクセスの順番待ちをしている。

数日で出現したオープンソースの亜流

Hacker Newsでの公開議論を見ると、このカテゴリはほぼ1日で広がった。9月16日以降、ローカルGPUで動く代替実装、既存の大規模言語モデルでJevの挙動を再現するエミュレーション、レイテンシ測定専用のプロジェクトが相次いで登場した。いずれのオープンソースプロジェクトもTypeSafe独自の訓練レシピを再利用していない。共通しているのはインターフェース、つまり固定候補を並列評価し、ループ内でテキストを生成しないという設計だ。

Hugging Faceにも同方向のモデルがホストされている。9月16日に登録されたsystem-one-qwen3.5-4b-scorerは、Qwen3.5を基盤とし、文字列を生成せずに1パスで質問と選択肢をスコアリングする。9月18日にアップロードされたcua-s1-formsはコンピュータ操作タスクを対象とし、選択肢ごとの確率をスタンドアロンの実装として返す。MITライセンスで公開されており、2日間で57件のお気に入りを集め、ONNXとCoreML形式のコミュニティ移植版もすでに出現している。ただしこのモデルはTypeSafeのRLCD手法を適用しておらず、Jevの実測パフォーマンスも再現していない。

コミュニティの評価は予想どおりの線で割れている。一方の陣営は、分類・ルーティング・スコアリングにモデルを特化させること自体が実用的だと主張する。こうした処理は自動化パイプラインの大半を占めるからだ。もう一方は、判断専用モデルと汎用言語モデルの比較は単純ではないと指摘する。両者は同じものを交換していないため、速度とコストの差だけでは実質を証明しない。このカテゴリがローンチ週の話題で終わらず定着するかを決める未解決の問いは、ベンチマークスクリプト上ではなく実運用の自動化で、これらのインターフェースがどの程度の精度と安定性を保つかだ。 市場をリアルタイムで追いたい読者は、MEXCで現物・先物価格をライブで確認できる。

Web3のための判断レイヤー

COINOTAGが公式発表と1週間のフォローアップから読み取る限り、判断専用モデルが最も自然に収まるのはオンチェーンロジックではなく、自動化されたWeb3バックエンドだ。Bitcoin(BTC)エコシステムでの最初の用途は管理業務の見込みが高い。ウォレットプロバイダーのサポート振り分け、アナリティクス部門でのトランザクションラベリング、ノード監視でのアラート閾値——生成文章よりも70ミリ秒の型付き回答が勝る分類タスクである。コンセンサスに関する判断は、そもそもこの設計の対象外だ。AIトレーディングボットを含む自動化層でオープンソース移植版が並列評価インターフェースを維持し、独立系ベンチマークが揃えば、判断レイヤーはlayer-3サービスを含むアプリケーション層の標準的な配管になり得る。

COINOTAG News Desk

COINOTAG News Desk

COINOTAGの編集・調査デスクです。

News Deskの仕組み
AI生成

AIによって生成され、AIによるレビューを経て、COINOTAGの編集監督のもとで公開されました。