Saturnの1万回答検証、AIは金融質問の57%に誤答 — Bittensor(TAO)に波及

Saturnの検証で18のAIモデルが金融質問の57%に誤答、難問では88%に達した。信頼だけは上昇が続く中、Bittensor(TAO)など分散型AIへの影響も。

(15:58 UTC)
1分で読めます
k7rq2fdm

1万回答のうち57%が誤答

英フィンテック企業Saturnが実施した検証で、主要AIモデルが個人の資産運用に関する質問の57%に誤った、あるいは不十分な回答を返したことが明らかになった。より複雑な複数ステップの質問では誤答率が88%にまで上昇しており、実際の家計が直面する類型で最も苦手としていることを示す。検証では121の質問を、ChatGPT、Alphabet(GOOGL)系のGemini、Claude、Copilotを含む18の無料・有料モデルに投げかけ、各質問を最大5回繰り返して回答の一貫性を確認し、合計1万件超の回答を収集した。事実誤認、重要事項の省略、必要な警告の欠落があった場合に誤答と判定された。無料版は63%が誤答したのに対し、有料版は49%。最難関の質問では無料モデルの93%が不正解だった。全体トップに立ったのは推論モードのClaude Opus 5だが、それでも39%の回答で誤りがあり、計算ミス、税制改正の見落とし、実在しないルールの提示など多岐にわたった。年金税に関する一つの回答では、英国税務当局(HMRC)から1万7,500ポンドの課金を個人に招きかねない内容だった。SaturnのCEOであるAmal Jolly氏は「数百万人がAIモデルに資産運用の助言を求めているが、損失につながりうる誤った回答を受け取っている」と指摘する。消費者のチャットボットへの依存が急速に深まっている中、57%という誤答率は研究室の話題ではなく、現実の消費者保護問題となっている。暗号資産領域では、規制された助言層を持たない自己責任投資が一般的であり、影響は直接及ぶ。

信頼だけは上がり続ける

データが示す最も鋭い矛盾は、精度が低迷しているにもかかわらず、こうしたツールへの信頼が上がり続けていることだ。世界1万8,000人の消費者を対象にしたEYの調査では、貯蓄・投資の意思決定にAIを活用した経験がある人は49%に達した。英国金融規制当局(FCA)が8月に公表した調査では、経験の浅い投資家の5人に4人が投資判断でAIを利用しており、回答者の56%がAIツールを信頼すると答えた。これは同じく47%だったテレビやラジオを上回る水準だ。より懸念される誤解も浮かび上がった。回答者の44%が、AIが生成した金融情報は規制されていると誤って信じていたのである。別の調査として、米国の成人1,000人を対象としたPensionBeeの調査では、約6割が金融の助言を自ら検証せずに行動すると回答し、約4人に1人はすでにチャットボットから自身の財務に関する誤情報を受け取ったと答えた。暴露面でも変化がある。Apple(AAPL)のSiriからAndroidのGeminiまで、アシスタントはOSレベルに組み込まれ、あらゆる年齢層が対象となっている。Jolly氏の構造的指摘は重要だ。AIによる金融助言は規制の射程外にあり、人間のアドバイザーが提供する補償の権利をユーザーは持たない。同氏はFCAに迅速な対応を促している。 市場をリアルタイムで追いたい読者は、Binanceで現物・先物価格をライブで確認できる。

Bittensor(TAO)と信頼のギャップ

COINOTAGの見立てでは、Saturnの結果が最も強く打ち所るのは、機械学習を売りにする暗号資産セグメントである。Bittensor(TAO)は、機械学習モデルの提供者に報酬を支払う分散型ネットワークであり、この検証が傷つけた信頼性の曲線と同じものを取引している。チャットボットが金融質問の57%に失敗することを小売投資家が知れば、クローズドソースのアシスタントと並んでAIトークンの物語も割り引く可能性がある。より深い問題は検証可能性だ。ブロックチェーンオラクルが存在するのは、信頼できない入力が自動化された資金を破壊するからであり、金融チャットボットには同等の検証機構がない。モデルの信頼性が向上し、助言の空白が規制されない限り、分散型AIは演算の物語である前に、まず信頼の物語であり続ける。

COINOTAG News Desk

COINOTAG News Desk

COINOTAGの編集・調査デスクです。

News Deskの仕組み
AI生成

AIによって生成され、AIによるレビューを経て、COINOTAGの編集監督のもとで公開されました。