![]()
この記事のまとめ
4つのモデルを比べるとき、見る場所は価格、利用上限とアクセス条件、コーディング、セキュリティ特化の4点にしぼれます。指標の点数は上位が僅差で並んでいるため、順位よりも仕事で使えるかどうかが判断を分けます。
- 価格はトークン単価ではなくタスク1件あたりで見ます。Gemini 3.8 Flash(high)は0.58ドル、Muse Spark 1.3(xhigh)は0.55ドル、Claude Fable 5.1は9.18ドル、GPT-6 Astraは4.72ドルです。
- 使える量も条件です。GPT-6 Astraは承認プログラムに参加する組織だけが利用でき、Claude Fable 5.1にはレート制限への不満が出ています。
- コーディングは僅差です。Codex上のGPT-6 Astraは67点、Claude Code上のClaude Fable 5.1が70点で先頭です。
- セキュリティは提供条件で差が出ます。Gemini 3.8 Flash Cyberは、Fairwind Programを通じた限定提供です。
ベンチマーク飽和と4つの判断軸

モデルの発表が数日おきに続き、どれを仕事に入れるか決めかねている人は多いはずです。私自身、ChatGPT、Claude、Gemini、Perplexityといったモデルを実務で使い比べていますが、新しいモデルが出るたびに「宣伝文句ではなく、手元のタスクで実力を確かめる」という姿勢を取っています。
比較の情報が飽和しているのは、公開のタイミングが重なっているからです。Muse Spark 1.3が公開された日はローンチシーズンのただ中で、同じ日にGemini 3.8 Flashのうわさも流れていました。Muse Spark 1.3は、Artificial Analysis Intelligence Indexで世界第3位という位置づけになりました(参照*1)。
GPT-6 Astraは、AnthropicがFable 5.1を発表したわずか2日後に登場し、入力100万トークンあたり10ドル、出力100万トークンあたり50ドルという高い価格帯で並びました(参照*2)。顔ぶれが数日単位で変わる状況では、順位表だけを追っても選び切れません。新モデルが出るたびにベンチマークスコアを見比べるだけでは、実務での判断にはつながらないのです。
点数の高さと実際の費用が一致しない例もあります。Gemini 3.8 Flashは6週間で3つ目のFlashモデルで、一部のエージェント型コーディング指標ではClaude Opus 5に並び、費用は下回ります。ただし、より強く考える設定では1タスクあたりの出力トークンが約30%増えるため、トークン単価が同じでも前の世代より実際には高くつきます(参照*3)。
そこで実務では見る場所を4つにしぼれます。1つ目は価格で、トークン単価ではなくタスク1件あたりの費用で見ます。トークン単価が同じでも、出力量や推論深度の設定次第で実際の支払いは大きく変わるため、この視点が欠かせません。2つ目は利用上限とアクセス条件で、申し込んで実際に使える量があるかを確かめます。
3つ目はコーディングで、自社のハーネス、つまりモデルを動かす実行環境に近い条件の結果を見ます。4つ目はセキュリティ特化で、防御用途の専用モデルを使えるかを見ます。指標の点数は評価の仕組みや努力レベルの設定で変わるため、単純な順位づけには向きません。私はこの4点を手元のメモに残し、新モデルが出るたびに同じ順番で確認するようにしています。
4モデルの基本スペック整理

Gemini 3.8 Flashの位置づけ
Gemini 3.8 Flashは、低コスト帯で日常業務を回す主力として作られたモデルです。
扱える情報量と設定の幅が広いのが特徴です。Gemini 3.8 Flashは100万トークンのコンテキストウィンドウに対応し、出力は最大6万4,000トークンです。
思考レベルはlow、medium、highから選べ、組み込みのツール群も同じものを使えます(参照*4)。長い資料の読み込みと、考える深さの調整を同じモデルで切り替えられます。
位置づけは主力の働き手モデルです。ソフトウェア開発、エージェント作業、専門領域での多段の推論で、3.7 Flashから大きく改善したとGoogleは説明しました。価格は3.7 Flashと同じ導入価格で、入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルです。
サイバーセキュリティ向けのGemini 3.8 Flash Cyberは、通常のFlashとは別のバリアントです(参照*5)。導入価格という表記のとおり、恒久的な単価ではない前提で費用を見積もれます。
Claude Fable 5.1の強みと価格
Claude Fable 5.1は、長時間の自律コーディングと知識作業に振ったモデルです。
価格の見え方が前の版から少しだけ変わりました。Claude Fable 5.1はClaude Fable 5を拡張したモデルで、入力と出力の価格は同じです。キャッシュ読み取りは4分の1のコストになりました。
強化されたのは、長時間にわたるエージェント型コーディング、複数段階の調査、文書・スプレッドシート・スライドの作業です。公式のドキュメントは、ほとんどのワークロードではClaude Opus 5から始めるよう案内しています(参照*6)。
総合スコアも上位に位置します。適応型推論で高い労力、サーバー側のフォールバックを既定にした条件では、Artificial Analysis Intelligence Indexが62点でした。比較できるモデルの中央値は36点です。
この評価では3500万トークンを生成し、中央値の6200万トークンより簡潔でした(参照*7)。この62点は、努力レベルとフォールバックの条件込みの数値です。
Muse Spark 1.3の到達点
Muse Spark 1.3は、短い間隔で更新を重ねてきたモデルです。
開発の速さがそのまま特徴になっています。Metaは、5か月間で4回目となるMuse SparkモデルとしてMuse Spark 1.3をリリースしました。パートナー向けに限定プレビュー中のMuse Spark 1.3(max)は、Artificial Analysis Intelligence Indexで62点を獲得し、Claude Fable 5.1とClaude Opus 5に次ぐ結果でした。
一般に使えるxhighの料金は据え置きで、100万トークンあたり入力1.25ドル、出力4.25ドル、キャッシュされた入力は0.15ドルです(参照*8)。maxは限定プレビューのため、誰でも同じ設定を使えるわけではありません。
重みの公開についても線引きがあります。Metaがこれまで公開を約束したのはMuse Spark 1.2の重みで、1.3の重みが続くかは未定です(参照*9)。自社サーバーで動かす計画を立てる場合は、対象が1.2までである点が前提になります。
OpenAI Astraの設計思想
OpenAI Astraは、GPT-6 Astraとして公開されたコンピューター操作向けのモデルです。
会話用というより、画面や道具を操る用途を想定した設計です。モデルページによると、コンテキストウィンドウは1,050,000トークン、最大出力トークン数は128,000、知識カットオフは2026年4月30日です。入力はテキストと画像に対応し、出力はテキストのみです(参照*10)。
長い文脈を保ったまま操作を続ける前提の仕様です。
スコアも上位帯に入ります。GPT-6 Astra(max)はArtificial Analysis Intelligence Indexで61点を獲得し、比較できるモデルの平均を大きく上回りました。中央値は36点です。
評価では4200万トークンを生成し、中央値の6200万トークンと比べて簡潔でした(参照*11)。これはmax設定での数値であり、他の設定と同じ条件ではありません。
価格とタスク単価、利用上限

タスク単価で見る価格差
同じ点数帯でも、1タスクにかかる金額は大きく違います。
トークン単価が同じでも総額は動きます。Gemini 3.8 Flash(high)は、Intelligence Indexのタスク1件あたり0.58ドルで、同じ知能水準では最も安いモデルです。
トークンあたりの価格は変わっていないのに、Gemini 3.7 Flashの0.40ドルから約40%上がりました(参照*12)。出力量やターン数が増えれば、単価が据え置きでも支払いは増えます。
Muse Spark 1.3(xhigh)は、変更のない料金のままタスクあたり0.55ドルです。競合のGPT-5.6 Sol(max)は0.95ドル、Grok 4.6(high)は0.94ドルで、70%以上高い水準です(参照*8)。
上位モデル同士にも開きがあります。Artificial Analysisの数値では、Claude Fable 5.1は1タスクあたり9.18ドル、GPT-6 Astraは4.72ドルです(参照*2)。
Astraの価格はGPT-5.6 Solの2.5倍で、100万トークンあたり4ドル/20ドルから10ドル/50ドルに上がりました。キャッシュ読み取りの90%割引と、キャッシュ書き込みの25%割増は同じ条件が続きます(参照*13)。
同じ資料を何度も読ませるエージェント用途では、このキャッシュ割引の効き方が総額を左右します。私が実務でエージェント型の処理を試したときも、キャッシュヒット率によってコストが想定の半分以下になった経験があります。いずれの金額も評価データセットに基づく推計で、自社の作業での実費とは別物です。
利用上限とアクセス条件
価格表に載らない条件が、使えるかどうかを決めます。これは見落とされやすい点ですが、実際に導入を検討した組織が「申し込んでみたら使えなかった」という状況に陥るケースは少なくありません。
まずアクセスそのものが限られる場合があります。Astraは重みが公開されていないクローズドなホスト型モデルで、自前のサーバーで動かす選択肢はありません。
利用できるのは、OpenAIのTrusted AccessとDaybreakのプログラムに参加する組織だけです(参照*10)。限定提供の状況は時期で変わるため、検討する時点の条件を確かめる形になります。
使い勝手への不満も出ています。Fable 5.1に対する開発者の反応は分かれ、コーディングと計画の力や応答の調子には強い称賛が集まりました。
一方で、レート制限、セーフガードの誤検知、サブスクリプションの使い勝手、ベンチマークの示し方のわかりにくさには不満が出ました(参照*14)。これらは個々の体験談で、公式の仕様ではありません。
開発者の@theoは、Googleについて、ハーネスやコードアプリ、サードパーティー統合に関する開発者体験が弱く、中核となるGoogleアカウントに関連する積極的な利用停止が問題だと主張しました(参照*1)。
コーディングとエージェント性能

コーディング指標の勢力図
コーディングの指標では、上位が僅差で並んでいます。
同じ指標でも、動かす実行環境が違えば条件も変わります。CodexではGPT-6 Astraが67点で、Claude CodeのClaude Opus 5およびFable 5、Muse CodeのMuse Spark 1.3とおおむね同等でした。
先頭はClaude Code上のFable 5.1で、70点です(参照*13)。ハーネスが異なる結果を横に並べても、モデル単体の優劣にはなりません。実行環境込みで性能を評価することが、実務判断では必須です。
個別のベンチマークでも差は小さいです。AstraはDeepSWE v1.1で74.1%を記録し、GPT-5.6 Solの72.7%を上回りました。Metaは、最大推論時のMuse Spark 1.3について75.4%を報告しています。
公開リーダーボードでは、Gemini 3.8 FlashとClaude Opus 5が約74%です(参照*10)。1ポイント前後の差は数タスク分にとどまることがあり、順位が入れ替わる幅です。
長時間エージェント作業の差
長い作業を任せるときは、ツール使用と文脈の保ち方が効いてきます。
Gemini 3.8 Flashの伸びは、エージェント評価に集中しています。Intelligence Indexの3点の向上は、主にツール使用のτ³-Banking、コーディングのTerminal-Bench v2.1、実世界タスクのGDPval-AA v2での性能向上によるものです。
最大の伸びはτ³-Bankingで、Gemini 3.7 Flashから12ポイント上がって45%になりました(参照*12)。伸びた領域が道具を使う作業に寄っているため、単発の質問より委任作業で差が見えます。
Muse Spark 1.3も同じ系統の評価で伸びました。Tau3-Bench Bankingは35%から47%(xhigh)に上がり、maxでは52%です。maxは、これまで検証されたモデルの中で最高スコアです(参照*9)。
この最高スコアは限定提供の設定によるものです。
Anthropicの説明はわかりやすく、Fable 5.1は難しく、任せきりにする長期の作業のためのモデルで、知識作業には対になるMythos 5.1を用意しました(参照*14)。任せる時間の長さで、使い分けの線を引けます。
セキュリティ特化と安全設計

サイバー特化モデルの実力
セキュリティ用途では、専用モデルの中身と入手の条件を両方見ます。
Googleは防御向けの特化モデルを用意しました。Gemini 3.8 Flash Cyberは、脆弱性の検出と自動パッチ適用で最前線級の性能をうたうサイバーセキュリティモデルで、新しいFairwind Programを通じて信頼できる防御者に提供されます(参照*5)。
Fairwind Programでは、Gemini 3.8 Flash Cyberへの限定アクセスを提供し、単独のモデルとしても、CodeMenderと組み合わせても使えます(参照*15)。
報告された数値は具体的です。CyberGymで86.2%、パッチ適用のCWE-Benchで47.2%、20のプログラミング言語にわたる社内の脆弱性発見ベンチマークで70%以上の成功率です(参照*1)。誰でも申し込めば使えるモデルではなく、審査を通った組織が防御目的で使うという線引きが、提供の条件そのものに組み込まれています。
安全制御と監視の変化
能力が上がった分、安全側の制御も強くなりました。
Astraでは、サイバー関連の依頼が止まる場面があります。標準アクセスでは、エクスプロイトの発見を含む高度なサイバーセキュリティ作業が拒否されます。
API開発者向けには、サイバーセキュリティの安全性チェックが、承認のために一時停止するのではなく、タスクを直ちに停止します(参照*10)。防御目的の調査でも止まりうる前提で、作業の組み立てを考える形になります。
開発元自身の評価では、監視のしやすさが下がりました。OpenAIは、GPT-6 Astraについて、以前のモデルと比べて思考の連鎖の監視可能性が大幅に低下したと報告しています。同時に、アラインメント評価ではAstraがGPT-5.6 Solよりもセキュリティと安全性の制限を尊重する可能性が高いとし、より広く展開する判断につなげました(参照*16)。
社内の幻覚ベンチマークでは、AstraはGPT-5.6 Solの9.4%から下がって2%でした(参照*2)。いずれも自社評価に基づく報告の数値です。
用途別の選び方と導入の注意点

4つの軸を組み合わせると、用途ごとの選び方が見えてきます。ベンチマークスコアの僅差に惑わされず、「自分の仕事のどの工程に入れるか」から逆算するのが現実的な判断の順序です。
用途で分けると迷いが減ります。日常業務や大量処理では、タスク1件あたり0.58ドルで同じ知能水準では最も安いGemini 3.8 Flash(high)が候補になります(参照*12)。
長時間の自律コーディングでは、Claude Code上で70点と先頭に立ったClaude Fable 5.1が候補です(参照*13)。
低い単価で上位のスコアを求めるならMuse Spark 1.3、画面操作を含む長い文脈の作業ならGPT-6 Astra、防御目的のセキュリティならFairwind Program経由のGemini 3.8 Flash Cyberという並びになります。万能な一択はなく、条件ごとの使い分けです。
導入の前に確かめたい条件もあります。Gemini 3.8 Flashの0.75ドルと3.75ドルという料金は2026年12月31日までの導入料金で、2027年1月1日からは入力100万トークンあたり1.50ドル、出力100万トークンあたり7.50ドルの標準料金が適用されます(参照*4)。
Claude Fable 5をすでに呼び出している場合、互換性に影響する変更が3つあります。強制的なツール使用はエラーを返し、以前のモデルはその思考ブロックを読み取れず、以前のターンを編集するとその思考ブロックが無効になります(参照*6)。
Gemini 3.8 Flashには幻覚のような基盤モデル共通の限界が残り、脱獄への耐性は継続して改善中で、まれに遅延やタイムアウトが起きるとモデルカードは記しました(参照*17)。切り替え手順の細部は、各社の公式ドキュメントで確かめられます。
費用を抑える設定も選べます。Claude Fable 5.1を中程度の労力で動かした場合、Intelligence Indexは60点で、評価時の生成トークンは2100万でした(参照*18)。
GPT-6 Astraの非推論設定は55点で、生成トークンは440万にとどまります(参照*19)。
重みの公開を前提に計画する場合は、対象の版に注意が要ります。Metaが公開を約束したのはMuse Spark 1.2の重みで、その版は57点とKimi K3、GLM-5.3、Qwen3.8の後ろに位置し、1.3の重みが続くかは未定です(参照*9)。努力レベルを下げる運用は、点数と消費トークンのバランスを取る選択肢になります。
おわりに
モデル比較は、価格、利用上限とアクセス条件、コーディング、セキュリティ特化の4点で足ります。点数の順位は僅差で入れ替わり、実行環境や努力レベルの設定でも動きます。仕事に入れるかどうかを決めるのは、タスク1件あたりの費用と、実際に使える量です。私自身、新モデルの発表を見るたびに、宣伝文句ではなく手元の業務課題でどこまで使えるかを確かめることを優先しています。
発表の間隔が数日という状況では、大きく作り込むより、自社の作業で小さく試して差し替える運用が現実的です。生成AIの導入で最初に詰まるのは、プロンプトでもモデル選定でもなく、「AIに何をさせるか」を業務レベルで定義するところです。導入料金の期限や移行時の非互換、承認プログラムの条件は、試す段階で確かめられます。4つの軸を手元のメモに残しておけば、次のモデルが出たときも同じ順番で比べられます。
監修者
安達裕哉(あだち ゆうや)
デロイト トーマツ コンサルティングにて品質マネジメント、人事などの分野でコンサルティングに従事しその後、監査法人トーマツの中小企業向けコンサルティング部門の立ち上げに参画。大阪支社長、東京支社長を歴任したのち2013年5月にwebマーケティング、コンテンツ制作を行う「ティネクト株式会社」を設立。ビジネスメディア「Books&Apps」を運営。
2023年7月に生成AIコンサルティング、およびAIメディア運営を行う「ワークワンダース株式会社」を設立。ICJ2号ファンドによる調達を実施(1.3億円)。
著書「頭のいい人が話す前に考えていること」 が、95万部(2026年6月時点)を売り上げる。
(“2023年・2024年上半期に日本で一番売れたビジネス書”(トーハン調べ/日販調べ))
参照
- (*1) [AINews] Muse Spark 1.3 matches GPT-5.6-Sol, confirming Meta Superintelligence as the newest Frontier Lab, >90% discount for training
- (*2) theregister – OpenAI throws Astra into the top-tier model ring
- (*3) The Decoder – Artificial Intelligence: News, Business, Science
- (*4) Google AI for Developers – What's new in Gemini 3.8 Flash
- (*5) Google – Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- (*6) Claude Platform Docs – Claude Fable 5.1
- (*7) Claude Fable 5.1 (high with fallback) – Intelligence, Performance & Price Analysis
- (*8) Muse Spark 1.3: Meta reaches the frontier
- (*9) Trending Topics – Muse Spark 1.3: Meta Is Back at the Top, and the Best Open-Weight Model Could Follow
- (*10) MarkTechPost – OpenAI Releases GPT-6 Astra: A 1.05M-Context Computer-Use Model Gated Behind a 'Critical' Cyber Threshold
- (*11) GPT-6 Astra (max) – Intelligence, Performance & Price Analysis
- (*12) Google has released Gemini 3.8 Flash, its fourth Flash model in under four months
- (*13) Benchmarking GPT-6 Astra | Artificial Analysis
- (*14) [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens
- (*15) Google DeepMind – Fairwind Program
- (*16) OpenAI Deployment Safety Hub – GPT-6 Astra System Card
- (*17) Google DeepMind – Gemini 3.8 Flash
- (*18) Claude Fable 5.1 (medium with fallback) – Intelligence, Performance & Price Analysis
- (*19) GPT-6 Astra (Non-reasoning) – Intelligence, Performance & Price Analysis