Meta AI の「Muse」は何が違う?

2026.07.22

WorkWonders

Meta AI の「Muse」は何が違う?

この記事のまとめ

Muse Spark 1.1 は、Meta Superintelligence Labs が公開したマルチモーダル推論モデルで、agenticタスクや長い文脈の扱いに強みを持ちます。Muse Image・Video を含む一連の発表では、SNSやクリエイティブ機能との統合、Meta Model API を通じた低価格提供が示されました。ポイントは次の通りです。

  • Muse Spark 1.1 は100万トークンの文脈を能動的に管理します。
  • Muse Image は自己修正型のagentic画像生成で Arena 2位です。
  • Muse Video はプレビュー段階で、音声同期などに課題を残します。
  • Meta Model API は入力$1.25/出力$4.25という価格設定です。

Muse Spark 1.1 の基礎知識

Muse Spark 1.1 の基礎知識

Meta Superintelligence Labsの位置づけ

Muse Spark 1.1 は、Meta Superintelligence Labs が公開したモデルで、以前の Muse Spark からの大幅な改良版として位置づけられています。

agenticタスク向けに設計されたマルチモーダル推論モデルであり、ツール利用やコンピュータ操作、コーディング、マルチモーダル理解の各領域で性能が伸びたと説明されています(参照*1)。

企業向けの文脈では、複数のアプリをまたいで計画・推論・多段タスクをこなし、人の介入を最小限に抑えることを狙ったモデルとされています(参照*2)。

私がこれまで生成AIを業務で試してきた経験から言うと、「単発の応答をさせるモデル」と「作業をまかせるモデル」はそもそも使い方が変わります。Muse Spark 1.1 は明らかに後者の設計です。つまり、何を頼むかではなく、どこまで任せるかをあらかじめ決めておかないと、性能を引き出せないまま終わります。

マルチモーダル推論とagenticタスク

Muse Spark 1.1 は、ツール使用や複数エージェントを前提にした設計が特徴です。

公式には、ツール使用とコンピュータ操作、コーディング、マルチモーダル理解の各分野で大きな向上があると説明されています(参照*1)。加えて、複数のAIエージェントを協調させ、長いワークフローを通じて文脈を保つ設計が示されています(参照*2)。

別の解説では、ネイティブツールやMCPサーバー、カスタムスキルをまたいで一般化でき、マルチエージェントの連携も想定されていると整理されています。そのため、モデル単体だけでなく、周辺の権限設計や実行ログ、評価計画も同じくらい重要になると指摘されています(参照*3)。

私が生成AI導入支援で繰り返し見てきたパターンですが、「モデルに何をさせるか」を決める前に試し始めると、たいてい「便利だけど使いこなせない」で止まります。ツールと権限の設計まで含めて考えることが、agentic系モデルを実務に乗せる最初の条件です。

100万トークンの文脈管理

Muse Spark 1.1 は、長い文脈を能動的に管理できる点が特徴です。

100万トークンの文脈ウィンドウを能動的に管理できると説明されており、過去の作業から情報を引き出し、後の工程で必要な重要ステップを残しつつコンテキストを圧縮する動きが示されています(参照*1)。企業向けの紹介でも、長期にわたる作業の中で文脈を保ち続ける点が強調されています(参照*2)。

ここで重要なのは、「文脈が長い」と「文脈を正しく使える」は別の話だという点です。私の検証でも、コンテキストウィンドウが大きいモデルでも、後半になるにつれて前半の情報への参照精度が落ちるケースは珍しくありません。長いプロジェクトや複雑な資料をまとめて扱いたい場面では、文脈保持の仕組みが「どの作業を任せられるか」の判断材料になるのは確かですが、実際に試して確認する姿勢は手放さないほうがよいでしょう。

Muse Image のagentic画像生成

Muse Image のagentic画像生成

ツール使用と自己修正の仕組み

Muse Image は、ツール使用と自己修正を前提にした画像生成モデルです。

プロンプトから画像へ直接変換するのではなく、エージェントとして動く設計です。検索やコーディングのツールを呼び出して精度を高め、自分の生成物を自己修正しながら、テスト時の計算資源を増やすことで品質を上げると説明されています。さらに Muse Spark と統合されており、両モデルがツールを共有し、一緒に計画を立てることでagenticなメディア生成を実現するとされています(参照*4)。

別の解説では、画像全体を下書きしたあとに視覚的な細部を総点検し、矛盾や欠点がある領域を反復的に修正してから最終出力を渡すという流れが紹介されており、Meta はこの一連のワークフローを Agentic Image Generation と呼んでいるとされています(参照*5)。

「一発描き」ではなく、道具を使いながら描き直す、という設計思想は興味深いと思います。私が生成AIで画像制作のワークフローを試してきた経験から言うと、1回の出力に全部賭けるより、複数案を出させて選ぶほうが品質は安定します。自己修正をモデル側に組み込む発想は、その方向を自動化しようとするものとして素直に評価できます。

マルチリファレンス構成と編集精度

Muse Image は、複数画像の構成や編集精度でも評価されています。

Muse Image は、テキストから画像への生成に加えて、単一画像の編集と複数画像の編集にも対応しており、人間の好みに基づく Elo ランキングで、いずれも Arena 上位に位置していると説明されています(参照*4)。

より具体的には、Arena の text-to-image リーダーボードで Elo スコア 1,280 を記録し、単一画像編集と複数画像編集の両アリーナでも2位にあると整理されています(参照*6)。

複数の参考画像を組み合わせて構図を作り込みたい用途では、こうした編集アリーナの評価が、実務での比較検討の手がかりになります。

Arenaベンチマークでの評価

Muse Image は、Arena で複数カテゴリの上位に位置づけられています。

公式の説明では、Muse Image は執筆時点で、テキストから画像、単一画像編集、複数画像編集の Arena で、人間の好みに基づく Elo ランキングの2位にあるとされています(参照*4)。第三者の記事でも、text-to-image では Elo 1,280 で OpenAI の GPT Image 2 に次ぐ2位、単一画像編集と複数画像編集でも2位という位置づけが紹介されています(参照*6)。

ベンチマーク上の順位は変動しますし、私は新モデルが出るたびに宣伝文句ではなく手元のタスクで実力を確かめるようにしています。ただ、人間の好みに基づく Elo 評価を複数カテゴリで合わせて確認するのは、実務での比較判断として筋の良いアプローチです。現時点の相対的な立ち位置を掴む手がかりとして、参考にする価値はあります。

Muse Video のプレビュー概要

Muse Video のプレビュー概要

映像品質とネイティブ音声対応

Muse Video は、映像品質とネイティブ音声対応を打ち出したプレビュー段階のモデルです。

Muse Image のリリースに合わせて、Muse Video の早期プレビューが公開されており、プロンプト追従、映像の忠実度、時間的な一貫性の面で競争力のある性能を持つと説明されています。近日中にクリエイター向けおよび Meta AI 上で提供予定とされています(参照*4)。

別の解説では、Muse Video が Muse Image と同じ事前学習ベースを共有しており、高い視覚的忠実度に加えてネイティブ音声への対応を備えていることが紹介されています(参照*7)。

短尺の映像を試作する段階では、画像生成と地続きに動ける点が、ワークフローを組む上での判断材料になります。

現状の課題と改善領域

Muse Video には、プレビュー段階で改善中の領域もあります。

公式の説明では、音声と映像の同期や、物理的に正確な高速モーションといった性能ギャップがある領域に投資していると述べられています(参照*4)。第三者の記事でも、強いプロンプト追従、映像の忠実度、時間的一貫性を打ち出す一方で、音声と映像の同期や高速な動きのシーンには現状の限界があると認められている、と整理されています(参照*6)。

口の動きと音の一致、速い動作の描写は、映像制作の現場では基本的な要件です。この2点がプレビュー段階で課題として残っているのは、正直に開示している点では評価できますが、商用利用を検討する前に自分の用途でどれくらい影響が出るかを実際に試しておく必要があります。プレビューだから仕方ない、で済まないケースもあるからです。

SNS統合とクリエイティブ機能

SNS統合とクリエイティブ機能

Instagram Stories・WhatsAppでの展開

Muse Image は、Meta のアプリ群でも展開が進んでいます。

Meta のアプリ群にまたがる新しいクリエイティブツールの土台にもなっており、Instagram Stories 向けに30種類以上の新しい AI 活用エフェクトが用意されるほか、WhatsApp の Meta AI とのダイレクトチャットで画像を生成できるようになると紹介されています。提供は一部の国から始まり、対応地域は順次拡大していくとされています(参照*8)。

普段使いのアプリの中に画像生成が入り込む形は、プラットフォームの流通特性を考えると理にかなっています。専用ツールを開かせるよりも、すでに使っているアプリの中で完結させるほうが、ユーザーの行動を変えやすい。私が観察してきた範囲でも、コンテンツはプラットフォーム内完結のほうが使われやすく、生成AIの機能も同じ原理が働くと見ています。

Content Seal透かしと来歴管理

Muse Image には、AI生成画像の来歴確認を助ける仕組みがあります。

画像が AI 生成かどうかを確認しやすくするために、Muse Image には Content Seal と呼ばれる不可視の電子透かしが組み込まれています。Meta AI アプリや meta.ai 上で Muse Image が生成した画像は、隠された来歴の信号を持ち、切り抜きや圧縮、リサイズ、スクリーンショットを経ても信号が保たれると説明されています(参照*4)。

関連する電子透かし技術の公開情報では、PixelSeal が知覚できなさと堅牢性のトレードオフで最先端に位置づけられ、敵対的学習と JND ベースの減衰によりパレートフロンティアに達していると整理されています。加えて ChunkySeal では、容量が4倍の1024ビットに増え、電子透かしの限界がまだ先にあることが示されています(参照*9)。

二次流通や再アップロードが前提の SNS では、来歴信号が残るかどうかが、素材の扱いを左右する条件になります。

プライバシー論争と@メンション機能

SNS統合では、@メンション機能をめぐるプライバシー論争も起きました。

提供開始時には、公開プロフィールを持つ他の Instagram ユーザーの画像を AI で加工できる機能が搭載されており、対象のユーザーをタグ付けするだけで、その人の画像を素材にした新しい AI 画像を作れる仕組みが紹介されました(参照*10)。これに対して非営利の消費者団体 Public Citizen は、ユーザーのプライバシーへの重大な侵害だと批判し、連邦AIガバナンス・技術政策担当ディレクターの J.B. Branch 氏が、Meta が再び「もっとも不気味な道」を選んだと述べたと伝えられています(参照*11)。その後、この機能はフィードバックを踏まえて的外れだったとされ、現在は提供されていないとアナウンスされています(参照*8)。

この件は、生成AI導入で私が繰り返し強調している点と直結しています。技術的にできることと、社会的に許容されることは別です。機能が存在しても、生成対象と本人同意の関係を運用ルールとして定めていなければ、即座に炎上リスクになる。新機能の採用時は、まずその点を確認する必要があります。

Meta Model API の低価格戦略

Meta Model API の低価格戦略

$1.25/$4.25の攻撃的価格設定

Meta Model API では、Muse Spark 1.1 に低価格な料金が示されています。

Meta は Meta Model API の公開プレビューを発表し、Muse Spark 1.1 について、入力100万トークンあたり$1.25、出力100万トークンあたり$4.25という価格を提示しました。競合するフロンティア AI に対して攻撃的なポジショニングだと説明されています(参照*2)。CNBC の報道として、新規 API アカウントごとに$20分の無料クレジットが用意され、プレビューは開始時点で米国の開発者に限定されていると伝えられています。Mark Zuckerberg 氏は、これを Meta として初めての本格的な API と位置づけ、価格設定は非常に攻撃的で魅力的なものになると語ったとされています(参照*12)。

さらに別の解説では、Meta Model API の価格が OpenAI や Anthropic のトップモデルが提示している価格のおよそ25%の水準にあると整理されています(参照*13)。

私自身、ChatGPT や Claude に毎日のようにタスクを投げていますが、大量トークンを消費する処理はコストが積み上がります。競合の25%という価格は、実験的な用途だけでなく、本番運用のコスト設計にも影響するレベルです。ただし、価格は維持される保証がないため、プレビュー期間中の数字だけで判断しないほうがよいでしょう。

OpenAI・Anthropic互換の開発体験

Meta Model API は、既存APIとの互換性を意識した開発体験も打ち出しています。

Meta Model API が OpenAI Chat Completions と Anthropic Messages の両形式をネイティブにサポートすると紹介されており、既存の主要 API を意識した設計であることが示されています(参照*12)。新規アカウントごとに$20の無料クレジットが付き、対象は米国の開発者に限られると伝えられており、Zuckerberg 氏は Meta にとって初の本格的な API だと位置づけています(参照*12)。

OpenAI と Anthropic の両フォーマットに対応するのは、乗り換えのコストを下げる明確な戦略です。既存のスタックからの移行を検討する場合でも、コードの大幅な書き直しが不要になる。ただし、互換性があることと、出力品質や挙動が同等であることは別の話です。価格、地域制限、無料枠の条件に加えて、実際のタスクで動作を確認してから判断するのが筋です。

競合モデルとの比較・選び方

競合モデルとの比較・選び方

Muse Spark 1.1 は、ツール連携や長文脈を軸に比較すると位置づけをつかみやすくなります。

ベンチマーク面では、MCP Atlas のツール使用で88.1のスコアを取り首位に立つ一方、DeepSWE 1.1 では53.3で GPT-5.5 の67.0を下回るという結果が紹介されており、オーケストレーション寄りのモデルとして位置づけられています(参照*12)。別の追跡サイトでは、100万トークンの長文脈対応マルチモーダルモデルとして、長い文脈を要するクリエイティブ用途に位置づけられていると整理されています(参照*14)。

業界では、Meta のモデルが Google のすべてのモデルを上回るのは記憶する限りこれが初めての節目かもしれない、というコメントも出ています(参照*13)。

私が複数モデルを実際のタスクで比較してきた感覚と照らすと、「ツール連携が強い」と「コーディングが強い」は別の能力軸です。ツール連携や長文脈を軸にする用途は Muse Spark 1.1 が候補になりますが、コーディング中心の作業では他モデルとの比較を外さないほうが無難です。モデルを1つに絞るより、タスクごとに使い分ける前提で検討するのが現実的です。

導入時の注意点と失敗例

導入時の注意点と失敗例

導入前は、公開プレビューの条件と運用面の変更可能性を確認する必要があります。

公開プレビューの告知は、そのまま本番運用の契約ではないと指摘されており、Muse Spark 1.1 を採用する前に、公式のモデル ID、地域ごとの提供状況、価格、レート制限、コンテキスト上限、ツールの挙動、プライバシー条件、サポート体制を Meta Model API のドキュメントとコンソールで確認するよう促されています(参照*3)。

運用面では、Instagram ユーザーの画像を素材にする機能に対し、意味のある同意を求めずにユーザーを既定でシステムに組み込み、オプトアウトを設定の奥に埋めているという批判が消費者団体から出ていました(参照*11)。その後この機能は提供が取りやめられましたが(参照*8)、こうした変更が短期間で起きることは想定しておく必要があります。

私が生成AI導入支援で繰り返し見てきたのは、「プレビューで試して本番に入れたら仕様が変わっていた」という失敗です。機能の存在だけでなく、提供条件が変わる前提で社内の利用規程や説明資料を作っておくことが、現実的な備えです。

おわりに

Muse Spark 1.1 と Muse Image・Video は、agentic な作業と SNS への統合、そして低価格な API 提供という3つの軸で構成されています。長い文脈を扱う推論、自己修正型の画像生成、プレビュー段階の動画、電子透かしによる来歴管理まで、周辺の設計まで含めた組み合わせが特徴です。

一方で、プライバシー論争と機能の提供停止が短期間で起きた経緯は、「技術的にできること」と「運用として許容されること」が今なおずれていることを示しています。私が生成AI事業を立ち上げてから2年半ほど見てきた中で、新しいモデルや機能の発表よりも、導入後の運用設計と変更対応のほうがはるかに難しいと実感しています。

まずは公式ドキュメントで最新の提供条件を確認し、自分の用途に合う範囲から試す。その際、何を任せるか、どこは人間が確認するか、変更があったときにどう対応するかまでをセットで決めておくのが、失敗を減らす最短の道です。

監修者

安達裕哉(あだち ゆうや)

デロイト トーマツ コンサルティングにて品質マネジメント、人事などの分野でコンサルティングに従事しその後、監査法人トーマツの中小企業向けコンサルティング部門の立ち上げに参画。大阪支社長、東京支社長を歴任したのち2013年5月にwebマーケティング、コンテンツ制作を行う「ティネクト株式会社」を設立。ビジネスメディア「Books&Apps」を運営。
2023年7月に生成AIコンサルティング、およびAIメディア運営を行う「ワークワンダース株式会社」を設立。ICJ2号ファンドによる調達を実施(1.3億円)。
著書「頭のいい人が話す前に考えていること」 が、95万部(2026年6月時点)を売り上げる。
(”2023年・2024年上半期に日本で一番売れたビジネス書”(トーハン調べ/日販調べ))

参照

ワークワンダースからのお知らせ

ウェブ集客に効く、AI検索対策「AUTOMEDIA」のご紹介はこちらから。

WORK WONDERSメディアの記事も「AUTOMEDIA」で執筆されています。