音楽生成AI比較2026、主要3サービスを作る・直す・持ち出すで見極める

2026.09.28

WorkWonders

音楽生成AI比較2026、主要3サービスを作る・直す・持ち出すで見極める

この記事のまとめ

音楽生成AIの比較で差が出るのは、音質の良し悪しよりも、生成後に何ができるかという点です。Suno v6、Udio、Google Lyria 3.5は、作る・直す・持ち出す・商用に載せるという4つの軸で性格が分かれます。まずは全体の見取り図を整理します。

  • 作る:1回の生成で作れる長さや入力形式が異なり、プロンプトの書き方もそのまま流用することはできません。
  • 直す:Suno v6は歌詞を1行だけ書き換えるような編集に対応しますが、Lyria 3.5はフルミックスの生成が中心です。
  • 持ち出す:ダウンロード回数や商用利用権はプランごとに定められており、無料プランには厳しい上限があります。
  • 商用に載せる:ライセンス済みデータによる学習を掲げる動きと、SynthIDなどの電子透かしによる識別が並行して進んでいます。

主要3サービスの現在地

主要3サービスの現在地

Suno v6の3モデル構成

Suno v6は単一のモデルではなく、用途に応じた3つのモデル構成で登場しました。この設計は、ライトユーザーから有料会員まで間口を広げる意図が見えます。

Sunoは2026年9月9日のv6発表にあわせて、3つのモデルを導入しました。有料会員向けのv6、実験的なバリエーションを試せるv6-wild、誰でも利用できる無料プランのv6-miniです。

今回のリリースにはWarner Music Group、BMG、Believeの意向が取り入れられました。レーベルの関与なしに収集した音声で学習していた以前の姿勢から、明確な方針転換を見せています(参照*1)。私がこの変化を注目するのは、AI音楽生成の法的な正当性を巡る議論が、モデルの性能向上と並行して急速に整理されつつあるからです。

ただし、レーベルとの提携があっても、すべての生成物が法的に保護されるわけではありません。SunoとWarner Music GroupやBMGとの合意は、各社の所属アーティストや作曲家を対象としたオプトイン方式の枠組みです。

報道によれば、AI生成物において名前、肖像、声、楽曲をどのように活用できるかを定め、対価の補償も含まれます。これはSuno側のプラットフォームとしての法的リスクを低減する施策であり、特定の既存曲を露骨に模倣したプロンプトなどによる生成物に対して、第三者からの権利侵害の申し立てが一切発生しないことを保証するものではありません(参照*1)。

Udioの法的状況と生成上限

Udioにとっては、新モデルの投入よりも法的な係争への対応が際立つ1年となりました。生成AIのコンテンツ関連訴訟を追う立場から見ると、和解の進捗はモデルのアップデートと同じくらい重要な動きです。

この期間中、Udioから新たな主力モデルは発表されませんでした。その一方で、2026年は抱えていた法的問題が大きく前進した年といえます。Universal Music Groupは2025年10月にUdioとの訴訟で和解に達し、同年11月にはWarner Music Groupもこれに続きました。

訴訟却下の申し立ては2025年11月25日に提出されています。なおSony Musicについては、本稿の執筆時点で確認できる報道の限りでは和解に至っていません(参照*1)。

生成可能な長さにも明確な制約が存在します。Udioは1回の生成時間を約2分10秒に制限しており、長尺の楽曲を制作する際は追加生成を重ねる設計となっています(参照*1)。

Lyria 3.5の配布力とAPI

Lyria 3.5の大きな強みは、ユーザーが日常的に利用する環境の中にすでに組み込まれている点です。これは、専用サービスとして認知を獲得しようとするSunoやUdioとは根本的に異なる戦略です。

Googleは9月4日にLyria 3.5を発表し、極めて忠実度の高い音楽生成モデルとして位置づけました。表現力豊かなボーカルと厚みのあるアレンジを特長として挙げています。Geminiアプリ上では操作系が刷新され、ジャンル選択やテキスト指示に加え、ボーカルの有無も指定できるようになりました。

用意されたテンプレートを使えば、BGMやバースデーソングなども手軽に作り始められます。生成する長さも短尺から長尺まで柔軟に設定可能です(参照*2)。

この違いは、単なる音質の優劣というより、ユーザーへの到達力の差として捉えるべきです。私はコンテンツ配信を長く見てきた経験から、いくら品質が高くても「使われる場所にあるか」が普及を左右すると考えています。Lyria 3.5の真価は音声のクオリティにとどまらず、その提供基盤の広さにあります。

SunoやUdioが専用の独立したサービスであるのに対し、Lyria 3.5はGeminiアプリやGoogleのFlow Music、さらに開発者向けAPIに内包されています。制作に特化したワークフローを省く代わりに、Googleが抱える幅広い既存ユーザーへのリーチ力を優先した設計といえます(参照*1)。

作る:入口と曲の長さ

作る:入口と曲の長さ

1回の生成で作れる長さ

似たような指示を与えても、1回の手続きで出力される曲の長さには大きな隔たりがあります。

Udioは1回の生成を約2分10秒に制限しており、続きを生成することで長い楽曲を仕上げていきます。一方、Suno v6は初期の報道において1回あたり最長約8分まで出力可能と伝えられたものの、公式発表の確定仕様ではなく二次情報にとどまります。Google側もLyria 3.5の最大生成時間については公式見解を明らかにしていません(参照*1)。

一方、API環境では秒数単位の明確な仕様が提示されています。Vertex AIのリリースノートによると、2026年3月25日にLyria 3のパブリックプレビューが開始されました。

lyria-3-pro-previewは184秒、lyria-3-clip-previewは30秒の音声を生成します(参照*3)。ただしこの数値はAPIモデル固有の仕様であり、Geminiアプリ上で利用できるLyria 3.5の上限とは切り離して考える必要があります。

入力形式とプロンプトの違い

生成の起点となる素材やプロンプトの構成方法も、サービスごとに大きく異なります。

公開されている比較情報によれば、入力形式はSunoがテキスト、音声、画像、動画に対応し、Udioはテキストと音声、LyriaはGeminiやFlow経由のテキストプロンプトを受け付けます(参照*1)。

そのためプラットフォームを移行する際には、使い慣れたプロンプトを再構築しなければなりません。あるツールで成功した指示文をそのまま移植しても、同じ結果は得られません。ジャンルや雰囲気、歌唱スタイルを指定するSuno独自の記法は、UdioやLyriaの構文と1対1で互換性がないためです(参照*1)。これはテキスト生成AIのプロンプトと同じで、ツールごとに「何をどう伝えるか」の設計が必要になります。

Lyria 3 Pro向けには、Google公式のプロンプティングガイドが提示されています。単語を並べるだけでも楽曲は作れますが、意図通りに制御するには体系的な枠組みが推奨されます。推奨される枠組みは6項目です(参照*4)。

  • 音楽ジャンルと様式
  • 曲のムード
  • 楽器編成
  • テンポやリズム
  • 歌唱表現と言語
  • 歌詞

直す:部分編集とステム

直す:部分編集とステム

部分だけ作り直す機能

生成された楽曲の特定箇所だけを手直しできるかどうかは、ツール選びの大きな分かれ目です。完成品を一発で出すか、繰り返し微調整できるかは、用途によって重要度が大きく変わります。

Suno v6の全3モデルには、前世代のv5には備わっていなかった新しい編集ツールが導入されています。楽曲全体を再生成することなく特定の歌詞フレーズだけを差し替えたり、複数のクリップを組み合わせてマッシュアップを作成したりできます。特定の楽器パートを抽出して再サンプリングすることや、テキストや参照音声、画像、動画を起点にした生成も可能です(参照*1)。

対照的にLyria 3.5は、GeminiおよびAPIを介したフルミックスの一括生成に主眼を置いています(参照*1)。

楽曲の一部だけを再生成する手法は、インペインティングとも呼ばれます。ElevenLabsではこの機能の強化により、クリエイターによる細かなトラック調整を実現しました。

生成曲の任意のセクションを指定し、その区間だけを差し替えられます。たとえばサビのメロディを維持したまま、ブリッジ部分の展開だけを微調整するといった柔軟な編集が可能です(参照*5)。

ステム・MIDI書き出しの可否

DAWで本格的に仕上げるなら、ステムやMIDIを出力できるプランを選ぶ必要があります。

各サービスのステム・MIDI書き出しへの対応は次のとおりです(参照*1)。

  • SunoはProプランでステムの書き出しに対応し、PremierプランではSuno Studioを介した高度なステム・MIDI編集ツールを提供します。
  • Udioも有料プランでステム分離機能を備えますが、機能範囲は限定的です。
  • Lyria 3.5は素材単位の書き出しを想定しておらず、制作支援ツールというよりGeminiやAPIを通じた完成版フルミックスの提供に重きを置いています。

つまり、トラックを分解して手元で加工したいクリエイターと、完成された1本のオーディオを即座に使いたいユーザーとでは、選択すべきサービスが自ずと異なります。自分のワークフローに「編集」が入るかどうかを先に確認してから選ぶのが正しい順序です。

持ち出す・商用に載せる

持ち出す・商用に載せる

ダウンロード上限と商用利用権

生成した楽曲をオーディオファイルとして保存できる回数は、各契約プランで厳密に管理されています。

SunoのFAQによれば、無料プランは私的かつ非営利の利用に限られ、ダウンロード回数も生涯で計7回までに制限されています。これに対し、Proは月20回、Premierは月60回のダウンロード枠が用意され、いずれも商用利用権が付与されます。ダウンロード枠は毎月の請求日に更新されますが、Suno上での再生や楽曲共有自体は全プラン共通で無制限のままです(参照*6)。

この制限は2026年9月3日より過去に生成された楽曲も含めて一律に適用され、外部へファイルを書き出す操作のみが対象となります(参照*6)。

ElevenLabsの場合、掲載元によって規約の記述が分かれています。公開された仕様上、ダウンロード上限はいずれも共通で、Freeは1日5回(ロスレス)、Proは月400回と規定されています。

ただしElevenLabsの本体案内では、FreeユーザーでもElevenMusicのクレジットを明記すれば商用利用が可能とされています。一方、ElevenMusic名義の案内ではその記載がなく、所有権条項において「権利および商用利用は契約階層によって異なる」との注記とともに規約へのリンクが示されています(参照*7)。

学習データと出力の識別

学習データの透明性を高める動きと、生成物に識別用の標識を埋め込む施策は、足並みをそろえて進行しています。企業がAI生成音楽を商用利用する際、この2点は法務リスクと直結するため、見逃せない論点です。

ElevenLabsは、自社の音楽モデルが許諾済みの音源データのみで学習され、正式に商用利用が認められている点を強く打ち出しています。著作権侵害をめぐる議論が過熱するなかで、この透明性は大きな強みとなっています。

2024年6月には全米レコード協会(RIAA)が米大手3社を代表してSunoとUdioを提訴しました。争点は両社が許諾を得ずに膨大な商用楽曲を学習データとして流用した点にあり、侵害1作品あたり最大15万ドルの賠償請求が取り沙汰されました(参照*5)。

他方、Googleは生成物の識別と出力制御に関する方針を明確にしています。Geminiアプリで生成された全音源には、Google AIによる生成物であることを証明する不可視の透かし技術「SynthID」が埋め込まれます。上位のGoogle AI Plus、Pro、Ultra会員には、より余裕のある利用上限が設定されています(参照*8)。

またLyria 3は既存アーティストの模倣を避け、独自の音楽表現を生み出すよう設計されています。特定のアーティスト名をプロンプトに入力しても、AIは作風の着想源として大まかに解釈し、似たトーンの楽曲を仕立てます。さらに既存曲との一致を検出するフィルタリング機能も組み込まれています(参照*8)。

用途から選ぶ

用途から選ぶ

最終的なアウトプットの用途を明確にすれば、選ぶべきサービスは自然と絞り込まれます。「何を作りたいか」ではなく「作ったものをどう使うか」から逆算するのが、私がコンテンツ制作ツールを選ぶときの基本的な考え方です。

短い音源を求める用途なら、1回あたりの生成制限はさほど問題になりません。YouTube動画やポッドキャストのオープニング・エンディング用であれば、15〜30秒程度で足りるため、Udioの2分10秒という枠でも十分対応できます。

すべての素材に商用権を求めない個人クリエイターにとっても、無料枠の範囲で手軽に試せます。インディーゲームのBGM制作であれば、雰囲気の指定から生成でき、曲全体を壊さずに特定パートだけを修正できるSuno v6の編集機能が適しています(参照*1)。

少数の素材をスポットで調達したい広告制作などでは、料金体系が選定の基準になります。15〜30秒程度のSNS広告向けなら、Lyria 3.5のAPIを利用することで30秒クリップを約0.04ドルで生成できます。キャンペーンごとに数パターンの音源しか使わない代理店にとっては、月額10ドルのサブスクリプション契約を結ぶよりもコストを抑えられる可能性があります(参照*1)。

API経由の課金は定額制ではなく従量制であり、外部報道によるとフル楽曲で1曲あたり約0.08ドル、30秒クリップで0.04ドルと試算されています。ただしこれらはGoogleの公式料金表ではなく開発者向けメディアの報道数値であるため、システム設計を行う前にGoogle Cloudコンソールで最新の単価を確認することが推奨されます(参照*1)。

権利処理の安全性が求められる企業ユースでは、APIの利用規約が重要な判断材料です。ElevenLabsは、音楽レーベルや出版社、アーティストとの正式な合意に基づいて構築されたEleven Music APIを提供しており、生成物は広範な商用利用に対応します。

メディアやエンタメ領域のアプリ開発を想定しており、パーソナライズされた瞑想アプリ、ゲームの動的BGM、AI広告クリエイティブなどに利用できます。ただし映画やテレビ放映といった大規模用途には、別途Enterpriseプランの契約が必要となります(参照*9)。

おわりに

長期的なツール選びで鍵を握るのは、生成された音源をどこまで自由に編集でき、どのような条件でエクスポートし、ビジネスに組み込めるかという実用面です。音質の優劣を比べる前に、この3点を確認することをお勧めします。

柔軟な編集機能とプランごとの保存制限を持つSuno v6、約2分10秒の生成枠と権利訴訟の和解を進めたUdio、そしてGeminiやAPIを通じた幅広い普及力とSynthIDによる識別を強みとするLyria 3.5と、各社の個性は明確です。制作の目的とクリアすべき権利要件を見定めることで、最適な選択肢が見えてきます。私自身、生成AIツールを選ぶ際は「使えるかどうか」より「業務のどこに入れるか」を先に決めるようにしています。音楽生成AIも同じで、ツールの機能を覚える前に、自分のワークフローを言語化しておくことが選択を早めます。

監修者

安達裕哉(あだち ゆうや)

デロイト トーマツ コンサルティングにて品質マネジメント、人事などの分野でコンサルティングに従事しその後、監査法人トーマツの中小企業向けコンサルティング部門の立ち上げに参画。大阪支社長、東京支社長を歴任したのち2013年5月にwebマーケティング、コンテンツ制作を行う「ティネクト株式会社」を設立。ビジネスメディア「Books&Apps」を運営。
2023年7月に生成AIコンサルティング、およびAIメディア運営を行う「ワークワンダース株式会社」を設立。ICJ2号ファンドによる調達を実施(1.3億円)。
著書「頭のいい人が話す前に考えていること」 が、95万部(2026年6月時点)を売り上げる。
(“2023年・2024年上半期に日本で一番売れたビジネス書”(トーハン調べ/日販調べ))

参照

ワークワンダースからのお知らせ

ウェブ集客に効く、AI検索対策「AUTOMEDIA」のご紹介はこちらから。

WORK WONDERSメディアの記事も「AUTOMEDIA」で執筆されています。