完成した曲を聴きながら、ベースだけを詳しく追いたい、ドラムのパターンを確かめたい、歌と伴奏の関係を調べたいと思うことがある。従来は一つに混ざった音を耳で聞き分ける必要があったが、ステム分離を使うと、音の一部を分けて聴けるようになる。
AIを使ったステム分離は、ミックス済みの音声からボーカルやドラムなどを推定して取り出す技術である。耳コピやアレンジの研究を助ける一方、元の録音トラックを完全に復元する機能ではない。本記事では、仕組み、利用条件、学習への使い方、分離音の評価方法を整理する。
通常のステムとAIで分けた音を区別する
制作現場でいうステムは、ドラム、ベース、歌、鍵盤など、複数のトラックを役割ごとにまとめて書き出した音声を指すことがある。元のプロジェクトから作られるため、制作者がどの音を含めるかを選べる。個別トラックの書き出しとは分けて扱われる場合もある。
AIによるステム分離は、それとは逆に、すでに混ざった音から各要素を推定する。完成曲の二つのチャンネルには多くの楽器と処理が重なっており、元の情報をそのまま取り出せるわけではない。分離音は、制作時のフェーダー位置やエフェクト設定を再現したものではないのである。
例えばドラムのステムにベースの一部が残ったり、ボーカルのステムにシンセの響きが入ったりすることがある。分離されたから単独楽器の真実が得られた、と考えるのではなく、聞き分けを助ける別の見方として使うことが大切である。
仕組みは「混ざった音からの推定」
音源分離では、音の周波数や時間的な特徴などを分析し、各パートに属すると推定される成分を分ける。機械学習を用いる方式では、学習した特徴を手掛かりに処理する。音符や歌詞を理解して、原曲のセッションを開いているわけではない。
同じ高さで似た音色が鳴る、強い歪みがかかる、残響が広く重なるなど、区別が難しい素材では結果が不安定になることがある。音が水中のように揺れる、アタックが弱くなる、別の楽器が混ざるといった変化も起こり得る。
分離の精度は素材とツールの組み合わせで変わる。ある曲で良い結果が出ても、別の曲で同じとは限らない。最初は短い区間を選び、目的のパートが聞き取りやすくなったかを確認すると、長い処理を待つ前に使い方を判断できる。
DAW内の機能と対応条件を確認する
Ableton Liveでは、Live 12.3以降のSuiteにステム分離が搭載されている。対象はボーカル、ベース、ドラム、その他の四つであり、Lite、Intro、Standardで同じ機能が使えると考えないようにしたい。公式FAQでエディションや環境条件を確認できる。Ableton公式のステム分離FAQ
Logic ProのMac版ではStem Splitterを利用でき、Appleの公式ガイドではボーカル、ドラム、ベース、ギター、ピアノ、その他の抽出を案内している。M1以降のAppleシリコンを搭載するMacが条件になる。旧版の紹介記事だけで分離項目を判断せず、使用中の版と対応環境を確かめる必要がある。Apple公式のStem Splitterガイド
別のソフトやサービスでも、分離できる項目、処理場所、料金、保存形式は異なる。クラウドへ送る方式なら、素材の利用条件とサービスのデータの扱いも確認する。手元の未公開音源を扱う場合は、制作関係者が想定する保存先かも考慮したい。
最初の実践は自作の短い音源で行う
使い方を学ぶなら、自作のドラム、ベース、鍵盤、歌またはメロディーを含む短いミックスを用意するとよい。元の各トラックを持っていれば、分離結果と直接比較できる。市販曲の単独パートがどう鳴っていたかを推測するより、技術の特徴を把握しやすい。
まず二十秒程度の区間を書き出し、元のファイルを残して分離する。各ステムを順番に聴き、別の楽器が入っていないか、音の立ち上がりや余韻が変わっていないかを確認する。分離したファイルの名前には、元素材と処理方法が分かる情報を残す。
次に分離音を全部重ね、元のミックスと比較する。開始位置と音量をそろえることが重要である。ツールや設定によって差が残る可能性もあるため、完全に同じになることを前提にしない。この比較で、分離音のどこまでを分析に使えるかを判断する。
耳コピでは低音の動きから確認する
ベースは他の低い音と重なり、元のミックスでは音程を追いにくいことがある。分離したベースを聴けば、音が変わる位置、長さ、休符を確認しやすくなる場合がある。最初からすべての音程を当てるより、一小節ごとに発音の場所を記録すると進めやすい。
次にDAWの音源で候補の音を鳴らし、分離音と照らし合わせる。必要なら短い区間を繰り返し、再生速度を落として聴く。ただし、速度やピッチの処理によって音の印象が変わることもあるため、最後は元の速さとミックスへ戻って確認する。
ピッチ解析やオーディオからMIDIへの変換を使う場合も、自動結果を正解とは扱わない。分離時のにじみや倍音を別の音として認識する可能性がある。候補を得る補助として使い、耳と実際に弾いた音で確かめることが、学習としての価値を保つ。
ドラムは発音位置と強弱の関係を調べる
ドラムの分離音では、キック、スネア、ハイハットの配置を追いやすくなる場合がある。ただし、ドラムのステムは一つのまとまりであり、各打楽器が個別トラックへ完全に分かれるとは限らない。目的はパターンの関係を聞き取ることである。
二小節を選び、主要なキックとスネアの位置から記録する。その後、ハイハットや小さなスネアを加える。元のミックスと交互に聴き、分離結果で失われた打撃や、他の楽器の成分をドラムと誤認していないかを確認する。
波形から強弱を比較する場合も、分離処理でアタックが変わる可能性を考える。原曲のベロシティやコンプレッサー設定を波形から断定することはできない。主要な拍と装飾の関係、フィルが入る場所など、構造を中心に研究すると活用しやすい。
アレンジ研究では入る音と休む音を見る
ステム分離は、音色を取り出すだけでなく、曲の構成を観察するためにも役立つ。Aメロ、サビ、間奏を並べ、ベースやドラムがどこで入るか、どこで休むかを記録する。盛り上がりが、音を増やすことだけで作られていないと気づける場合がある。
例えばサビ直前にベースが短く休み、サビの頭で戻るなら、その空白が変化を強調している。歌のある部分では伴奏が長く伸び、間奏では細かく動くなら、主役の交代が見えてくる。こうした関係は自作の曲へ別の素材で応用できる。
研究メモには「どの音を使ったか」だけでなく、「何のためにそこへ置いたか」を書く。音をそのまま持ち込むより、密度、音域、休符、参加するタイミングという考え方を学ぶ方が、異なる曲にも使える技術になる。
分離音の音質から原曲の処理を断定しない
分離された歌に広がりや残響が聞こえても、その音だけで原曲のエフェクト設定は分からない。残響が別のステムへ分かれたり、他の楽器の成分が歌へ混ざったりすることがあるためである。原音より乾いて聞こえる結果も、必ずしも元の歌が乾いていたことを意味しない。
音質を比較するなら、同じ区間、同じ聴感上の音量で、輪郭、にじみ、残響、不要な混入を項目ごとに見る。一つの総合点だけで評価すると、耳コピには便利でも素材としては使いにくい結果を見落とすことがある。
例えば低音の音程が追えるなら、多少のざらつきがあっても耳コピの目的を果たせる。一方、露出の多い歌へ使うなら、言葉の欠けや音の揺れが問題になる。同じ結果でも、何に使うかで評価が変わることを意識したい。
分離できることと公開に使えることは別に確認する
ステム分離の機能は、素材の利用許諾を与えるものではない。公開するリミックスや動画に他者の録音を使う場合は、楽曲と音源それぞれの利用条件を確認する必要がある。動画配信についてJASRACも、市販音源の使用や編曲に関する確認事項を案内している。JASRACの動画配信に関する案内
最初の制作実験には、自作音源や、目的に合う利用条件が明示された素材を使うと整理しやすい。配布素材には、作品への組み込みと素材単体の再配布で条件が違う場合もあるため、公開先と使い方を基準に説明を確認する。
学習メモで分離結果を説明するときも、実際に比較していないツールを「最高精度」と評価しない。機能説明と実測結果を分け、使用した版、元の素材、処理条件が分かる形にすると、ほかの制作者が判断しやすい情報になる。
調べる区間と問いを先に決める
一曲を分離してから何となく聴くより、調べたい八小節と問いを一つ決める方が、学習の成果を残しやすい。「サビ前でベースは何拍休むか」「歌の切れ目に鍵盤は動くか」といった問いなら、元音源と分離音を往復して確認できる。
答えを得たら、その関係を自作の短いフレーズへ応用する。分離処理の実行で終わらず、聞き取った構造を別の音で試すことで、観察を制作の技術へつなげられる。
最後は元の曲へ戻り、聞き方を深める
分離音だけを聴き続けると、曲全体で各パートがどう支え合うかを見失いやすい。ベースを調べたらドラムと合わせ、歌を調べたら伴奏と合わせ、最後に元のミックスへ戻る。単独の情報を全体の関係へ戻すことが、耳コピとアレンジ研究の仕上げになる。
自作曲への応用では、研究した要素を一つだけ選ぶ。例えばベースを休ませる場所、サビでハイハットの密度を変える方法、歌の切れ目へ伴奏を置く方法などである。いくつも一度に模倣するより、効果を自分の曲で確かめやすい。
ステム分離は、聴き取る作業をなくす道具ではなく、注目する音を見つけやすくする道具である。結果に残る誤差を理解し、元音源と往復しながら使えば、今まで混ざって聞こえていた演奏の役割を、より具体的に研究できるようになる。

