ステムグラブツールを開く →
解説・率直な解説版

AIによるステム分離とは? 実際には、 どのように

機能するのか高音質のステム。アカウント登録不要、トラックごとの料金もなし。

私について

AI以前:位相キャンセルというテクニック

長い間、「ボーカル除去」とは、ただ一つの方法を意味していました。 位相反転です。多くの楽曲では、メインボーカルが中央に配置されており、左右のチャンネルで同じ音量です。一方のチャンネルの位相を反転させ、両方を合計すると、両方のチャンネルで同じ部分が打ち消し合います。その結果、ボーカルが消えます。

そして、他の中心にある音も同様に消えます。キックドラム、スネアドラム、ベースなどです。残った音は空虚で位相のずれがあるように聞こえ、まるでバンドが廊下の奥で演奏しているかのようです。また、この方法は一方通行であり、(ある程度) ボーカルを 中心から除去することはできますが、 ボーカルだけを 単独で分離することはできませんでした。また、モノラル録音、ステレオリバーブがかかったボーカル、または完全に中央にミックスされていないものに対しては、まったく効果がありませんでした。位相キャンセルは、単なるお遊びであり、実用的なツールではありませんでした。

スペクトログラムの時代:マスキング

最初の本格的な機械学習分離器(2015年頃から2019年頃にかけて登場。例:Open-UnmixやオリジナルのSpleeter)は、 スペクトログラムを使用していました。これは、楽曲の各瞬間における周波数の大きさを視覚的に表現したものです。ニューラルネットワークがこの画像を見て、 マスクを 描きます。「これらのピクセルはボーカルに属し、それらのピクセルはドラムに属する」というように。ミックスにマスクを掛け、オーディオに戻して変換すれば完了です。

これは大きな進歩でした。突然、ボーカルを単に打ち消すだけでなく、分離できるようになりました。しかし、マスキングには本質的な限界があります。ボーカルとギターが同じ周波数帯域を使用している場合、 同じ 周波数において、 同じ タイミング(これは実際の音楽では常に起こる現象)で、マスクはなんらかの方法でそのエネルギーを分割する必要があり、その結果として、初期のSpleeterユーザーなら誰もが覚えているような、水のような、水中でのうなり音が発生します。スペクトログラムもまた、 位相 情報を取り除き、モデルはその情報をオーディオに戻す際に再現する必要があります。

現在:ハイブリッドTransformerモデル

現代の分離ツール(StemGrabが使用するモデルを含む)は、問題を同時に2つの方向から解決します(したがって「ハイブリッド」):

モデルはそもそも「ボーカル」とは何かをどのように知っているのでしょうか? トレーニングによるものです。 モデルは、実際の分離されたトラックが利用可能な数千曲の楽曲から学習し、それらを組み合わせて、各パートをどれだけうまく復元できたかを自己評価しました。これを繰り返すうちに、モデルは声、キックドラム、スネアドラム、ベースラインなどがどのような音であるかを内部化し、聞いたことのないミックスからも推定できるようになりました。

重要なポイント: 分離は「アンミキシング」ではありません。元のマルチトラックは数学的に消去されています。モデルは 再構築します。 各トラックが最も可能性の高い音であるものを:非常に高度な推測であり、驚くほど正確です。

従来の方法:位相キャンセル・トリックLチャンネルRチャンネル ・極性が反転SUM → 音がこもった、位相のずれのある残響音キックとベースもキャンセルされ、分離されたボーカルは得られないMODERN:AIによる分離ボーカルドラムベースその他4つのクリアで独立したトラック
古い方式と新しい方式の比較:位相キャンセレーションは、中央に位置する音だけをキャンセルし、音のこもった残響音を残します。一方、学習済みのモデルは、各音源を個別のクリアなトラックとして推定します。
現在6つのトラックが上限となっている理由

従来の分割方式は4つのトラックです: ボーカル、ドラム、ベース、その他なぜなら、標準的な研究データセット(MUSDB18)はこのようにラベル付けされており、モデルは学習データのカテゴリ名に基づいてしか学習できないからです。StemGrabのような6トラックのモデルでは、さらに ギター が追加されます ピアノ他の音源から分離する。

さらに細かく(ボーカルと伴奏を分離したり、ギターを分割したり、シンセを単独で抽出したりする)場合、多くはモデリングの問題ではなく、むしろ データ の問題です。例えば、ラベル付けされたタンバリンのトラックが収録された大規模な公開ライブラリは存在しません。そのようなデータが存在するまでは、「他のすべての音」は元の トラックに 統合されたままになります。

なぜギターとピアノは、ボーカル、ドラム、ベースよりも分離しにくいのか?

分離しやすい音源は、それぞれが明確な特徴を持っているためです。

ギターとピアノは、音色を自在に変化させる楽器だ。 どちらもほぼ全周波数帯域をカバーし、コードやメロディーを奏でることができ、互いに重なり合う:お互い、シンセパッド、ストリングス、オルガンなど。クリアなピアノと暖かく響くパッドが同じコードを演奏すると、人間の耳でも区別がつかないことがある。ギターにディストーションを加えると、広帯域のノイズとなり、シンセとの区別がつきにくくなる。さらに、これらの2つのカテゴリーに対するトレーニングデータは、ボーカルと比較してごくわずかである。その結果、シンプルなシンガーソングライターの楽曲では、ギターの音源を美しく分離できる可能性がある一方、複雑なサウンドで構成された楽曲では、音が混ざり合ったり、ぼやけたりすることが予想される。

依然として問題が残る点

これらの問題があるからといって、この技術が悪いわけではない。現代の楽曲におけるボーカル、ドラム、ベースは、誰でも予想できたよりもはるかにクリアに分離できるようになった。これは、この技術が「魔法」のようなものではなく、「非常に優れた推定」を行うことを意味する。

実際に自分の音楽で試してみましょう。

この技術の性能を理解するための最も簡単な方法は、よく知っている楽曲を試すことだ。 StemGrabに曲を追加数分で、ボーカル、ドラム、ベース、ギター、ピアノ、その他のパートと、分離されたインストゥルメンタル音源を無料で入手できます。アカウント登録は不要です。ヘッドホンを装着して、モデルがどの部分をうまく分離できたか、また、どこで誤ったかを聴いてみましょう。

楽曲の分離(無料)→

StemGrabからさらに多くの機能: 各楽器パートを使って練習する · 楽器パートの使用に関する法的制限