ボーカル抽出は、既存の楽曲から歌声だけを抜き出したり、逆に歌声だけを消してカラオケ用の伴奏を作ったりする作業を指します。歌ってみたの練習や自作トラックのサンプリングで、公式のインスト音源が見つからず困った経験はありませんか。
近年のAI技術の進展によって、かつては専門の録音スタジオでしか不可能だった高精度の音源分離が、個人のパソコンやスマートフォン上で手軽に実行できるようになりました。
ボーカル抽出とはどのような技術か?

ボーカル抽出とは、完成した楽曲ファイルから歌声成分だけを計算処理によって取り出す技術です。
従来のボーカル除去は、ステレオ音源の左右チャンネルの位相を反転させて中央の音を打ち消す「逆位相処理(センターキャンセル)」が主流でした。しかしこの手法では、中央付近に配置されたベースやドラムのキック音まで一緒に消えてしまい、音が痩せてしまう欠点がありました。
現代の音源分離は、深層学習(ディープラーニング)モデルが楽曲全体の周波数スペクトログラムを解析します。何万曲もの楽曲と単独ステム(楽器ごとの独立トラック)を学習したAIが、人間の歌声特有の倍音構成や時間的変化を識別し、伴奏成分と歌声成分を高精度に切り分けます。
[市販のステレオ楽曲 (WAV/MP3)]
│
▼
[AI音源分離アルゴリズム(周波数解析)]
├─────────────────────┐
▼ ▼
[抽出されたボーカルトラック] [伴奏トラック(インスト/カラオケ)]
機械学習を用いた分離では、残響(リバーブ)やディレイといった空間系エフェクトまで歌声の一部として認識して分離できます。そのため、伴奏側に歌声のリバーブ成分だけが残って濁る現象が大幅に軽減されています。
AI音楽の制作全般について知りたい方は、AI作曲・BGM制作ツールの選び方と組み合わせ用途別構成例 (2026年版) をあわせて確認すると音作りの流れがより掴みやすくなります。
ボーカル抽出ツールを選ぶ基準は何がある?

用途や手持ちのパソコン環境によって、最適なツールは異なります。
ツールを選ぶ際は、処理環境・分離精度・料金体系・書き出し形式の4点を基準に判断します。
以下の表は、ツール選定時に確認すべき4つの基準をまとめたものです。
| 評価軸 | 注目すべき確認事項 | 向いているユーザー |
|---|---|---|
| 動作環境 | Webブラウザ完結か、PCへのインストール型か | 導入の手間を省きたいか、大量に処理したいか |
| 分離精度・モデル | 採用している分離アルゴリズムや調整オプションの有無 | 音質に徹底してこだわりたいDTM経験者 |
| 制限と料金 | 無料枠の上限(曲数、時間、ファイルサイズ) | コストをかけずに単発で利用したい一般ユーザー |
| 出力フォーマット | 非圧縮WAVや可逆FLAC形式での保存が可能か | ミックスや動画制作で劣化のない音を求めるクリエイター |
つまり、1曲だけ手軽に試したいならWeb完結型、何曲も高品質に仕上げたいならPCインストール型が合致しています。
特にWebブラウザ型は、ファイルのアップロードとクラウドサーバー側での計算待ちが発生します。回線速度やサーバーの混雑状況に処理時間が左右される点に留意してください。
一方、PCインストール型はパソコン自体のスペック(特にGPU性能)を消費します。内蔵GPUのみのノートパソコンでは1曲の分離に数分から十分程度の時間を要する場合があります。
編集部のおすすめ
AIで曲を作る・音源を分けるなら
歌詞や雰囲気から曲を作ったり、曲からボーカルだけを抜き出したりできます。
完全無料で無制限に使えるPCソフト2選
制限なく何曲でも最高品質で分離したい場合は、PCに直接導入するオープンソースソフトが適しています。
クラウドサービスと異なり、サーバーへのファイル送信が発生しないため、機密音源や未発表曲を扱う際にも情報漏洩のリスクがありません。
1. Ultimate Vocal Remover (UVR)
音源分離ソフトウェアのデファクトスタンダードとして知られるのが、完全無料のオープンソースソフトであるUltimate Vocal Removerです。
WindowsとMacの双方に対応しており、無制限かつ無料で利用できます。世界中の研究者が開発した最新の音源分離モデルを、グラフィカルな操作画面から自由に選択して実行できる点が最大の特長です。
- 対応OS: Windows / macOS / Linux
- 主な分離方式: Demucs, MDX-Net, VR Architecture
- 長所: 完全無料、モデルの切り替えが可能、バッチ処理(複数曲の一括変換)対応
- 注意点: ソフトウェアの容量が大きく、導入時に数GBのモデルダウンロードが必要
高度なアンサンブル機能(複数の分離アルゴリズムを組み合わせて平均化する処理)を備えており、単一のツールでは消しきれなかった微細なコーラスや金物楽器の被りを最小限に抑え込めます。
2. Audacity(OpenVINO / 音源分離プラグイン)
長年定番の無料音声編集ソフトとして愛用されてきたAudacityも、最新のAIプラグインを追加することで音源分離に対応します。
波形編集ソフトそのものであるため、ボーカルを分離した直後にその場で不要部分のカットやイコライザー調整、音量バランスのノーマライズ(均一化)を実行できるのが大きな利点です。
- 対応OS: Windows / macOS / Linux
- 主な分離方式: OpenVINOモジュール等によるディープラーニング処理
- 長所: 編集作業と分離作業が1つのソフト内で完結する
- 注意点: プラグインの手動導入が必要で、設定手順がやや複雑
DAW(音楽制作ソフト)を普段から扱い慣れている人であれば、作業効率を大幅に引き上げられます。
ブラウザで手軽に試せる無料Webツール4選
ソフトのインストールや初期設定を省略し、スマートフォンや学校・職場のPCから素早く分離したい場合にはWebツールが役立ちます。
ただし無料プランでは、1日の利用回数やファイルの長さ(例: 1曲あたり数分まで)に制限が設けられていることが一般的です。
3. LALAL.AI
独自の次世代AIエンジンを採用しているオンライン分離サービスです。
ボーカルと伴奏の分離だけでなく、ドラム、ベース、ピアノ、エレキギター、アコースティックギター、シンセサイザーといった楽器ごとの単独ステム抽出に対応しています。
[アップロードした楽曲] ───> [LALAL.AI エンジン] ───┬─> [ボーカル]
├─> [ドラム]
├─> [ベース]
└─> [その他楽器]
- 提供形態: Webブラウザ / 各種アプリ
- 無料枠: 初回プレビューおよび短尺の試用が可能
- 長所: 楽器ごとの分離精度が非常に高く、操作が明快
- 料金形態: 追加処理時間が必要なユーザー向けに、1回限りのトップアップとしてマスタープラン(750分で$50)などの従量課金オプションが提供されています
ドラムのキックやベースの低音域をしっかり残したまま、ボーカルだけを綺麗に消し去りたい用途で重宝します。
音声の活用や文字起こし技術に興味がある方は、AI音声・文字起こしカテゴリ のツール動向を追うと理解が深まります。
4. Vocal Remover and Isolation
長年Web上で広く使われている、ブラウザ完結型のボーカル除去ツールです。
サイトにアクセスして音声ファイルをドラッグ&ドロップするだけで、数秒から数十秒で「ボーカル音量」と「音楽音量」の2つのスライダーが表示されます。直感的なスライダー操作で、ボーカルの完全除去から音量だけを少し下げたマイナスワン音源の作成まで柔軟に対応します。
- 提供形態: Webブラウザ
- 無料枠: 1日あたりの処理数に一定の上限あり
- 長所: 会員登録なしですぐに使え、ピッチ変更やテンポ変更ツールも同サイト内で利用可能
- 注意点: サーバーの混雑時間帯はキュー待ちが発生する場合がある
5. EaseUS Vocal Remover
データ復旧やバックアップソフトで実績のあるEaseUSが提供するオンライン音源分離ツールです。
最大20分・350MBまでの音声・動画ファイルをサポートしており、YouTubeなどの長尺動画から音声を抽出してボーカルを切り分ける用途にも対応します。
- 提供形態: Webブラウザ
- 対応フォーマット: MP3, WAV, M4A, FLAC, MP4, MKVほか
- 長所: 動画ファイルを直接読み込めるため、事前に音声へ変換する手間が省ける
- 注意点: 高音質エクスポートや大量変換には有償版の案内が表示される
6. Media.io ボーカルリムーバー
動画編集やファイル変換サービスを広く展開するWondershare系列のオンラインツールです。
AIが音源を自動解析し、数クリックでボーカルとカラオケトラックを個別のトラックとして生成します。
- 提供形態: Webブラウザ
- 無料枠: 1回あたりのファイルサイズ制限・時間制限あり
- 長所: UIが完全に日本語化されており、初心者でも迷わず操作できる
- 注意点: 無料版では出力ファイル形式の選択肢が限定される場合がある

有料にすると 分離した音源のダウンロードとバッチ処理(Lite $7.5/月 (年払い $90、月払いは$9.99/月))
スマホで完結するボーカル抽出アプリ2選
パソコンを所持していない場合や、録音したその場でカラオケトラックを作りたい場合はスマートフォンアプリが適しています。
手軽に利用できる一方、アプリ内課金や広告表示、サブスクリプション契約への誘導が多いため、無料利用の範囲を事前によく見極める必要があります。
7. Moises (iOS / Android)
ミュージシャンの練習用アプリとして世界中で高い評価を得ているモバイルアプリです。
ボーカル抽出にとどまらず、楽曲のコード進行をAIが自動検出してリアルタイム表示したり、メトロノームのクリック音を楽曲のテンポに合わせて自動生成したりする機能を持ちます。
- 提供形態: iOS / Android
- 無料枠: 月あたり5曲までの分離が可能
- 長所: テンポ変更、ピッチ変更、キー変更を伴奏に合わせてリアルタイムに再生可能
- 注意点: 無料枠では曲全体の長さ(1曲あたり5分以内)に制限あり
歌の練習や楽器の耳コピ用途であれば、無料枠の範囲内でも十分役立ちます。
8. ボーカルリムーバー・カラオケ作成アプリ(各種ストアアプリ)
App StoreやGoogle Playには、AI音源分離を活用した単機能アプリが多数公開されています。
例えば一部の音楽プレイヤーアプリでは、端末内の楽曲を読み込んで再生しながらボーカル帯域をリアルタイムで減衰させたり、オフラインでカラオケファイルを書き出したりする機能を備えています。
- 提供形態: iOS / Android
- 無料枠: 広告視聴による無料利用や数日間の無料トライアル
- 長所: スマホ内のローカルライブラリから直接楽曲を読み込める
- 注意点: 週額や月額の定期購入が自動更新される形式が多いため、課金形態の確認が必須
スマートフォン単体で手軽に「歌ってみた」の録音用オケを準備したい場面で重宝します。
音声合成やナレーション生成を組み合わせて制作を行いたい方は、AI音声・朗読制作ツールの選び方と組み合わせ|用途別の構成例 (2026年版) も参考になります。
主要ボーカル抽出ツール8選の性能・仕様比較
各ツールには対応環境や強み、無料利用の制限に明確な違いがあります。
自身の作業環境や処理したい楽曲の数に合わせて最適なツールを選択できるよう、主要なスペックを一覧表に整理しました。
以下の表は、本記事で取り上げた8つのツールの基本性能と特徴を比較したものです。
| ツール名 | 提供形態 | 無料利用の条件 | 主な特徴・メリット | 推奨用途 |
|---|---|---|---|---|
| Ultimate Vocal Remover | PCソフト | 完全無料・無制限 | 複数のAIモデル搭載、最高峰の分離精度 | 楽曲制作、大量処理 |
| Audacity (AI拡張) | PCソフト | 完全無料・無制限 | 分離後の波形編集や加工が同一画面で可能 | 波形編集、ノイズ除去 |
| LALAL.AI | Web / アプリ | プレビュー試用のみ | 楽器ごとの多軌道ステム分離が極めて高精度 | 楽器練習、サンプリング |
| Vocal Remover | Webブラウザ | 1日あたりの回数制限 | 登録不要で即座にスライダー分離が可能 | 単発のカラオケ化 |
| EaseUS Vocal Remover | Webブラウザ | 回数・容量制限あり | 動画ファイルを直接読み込んで音声を分離 | 動画素材からの抽出 |
| Media.io | Webブラウザ | ファイル長制限あり | 日本語UIが分かりやすく操作がシンプル | 初心者のWeb作業 |
| Moises | モバイルアプリ | 月5曲まで無料 | コード検出やテンポ変更など練習機能が豊富 | 楽器・歌唱練習 |
| 各種ストアアプリ | モバイルアプリ | 広告視聴 / 試用期間 | スマホの保存音源を直接カラオケ化 | スマホ単体での作業 |
つまり、品質とコストを最優先するならUltimate Vocal Remover、インストールの手間を避けたいならVocal RemoverやLALAL.AIが適しています。
自身のPCスペックや月々の作業頻度を考慮して選ぶのが賢明です。
音源分離AIの仕組みと代表的なモデルは?
音源分離がどのような仕組みで成り立っているかを知ると、分離設定の微調整や適切なモデル選びが格段にスムーズになります。
従来のイコライザー処理と異なり、AIは音声波形を二次元の画像データ(時間×周波数のスペクトログラム)として捉え、コンピュータビジョン(画像認識)の技術を応用して処理を行います。
[ステレオ波形] ──(短時間フーリエ変換)──> [スペクトログラム画像]
│
▼
[U-Net型ニューラルネット]
(歌声の模様だけを特定)
│
▼
[分離波形の復元] <──(逆フーリエ変換)── [マスク処理されたスペクトログラム]
現在、主要な分離ツールに組み込まれている代表的なモデル構造は以下の通りです。
- Demucs (Facebook / Meta Research開発): 時間領域と周波数領域の双方を直接処理するハイブリッドモデルです。ドラムやベースの分離に定評があり、音の輪郭を崩さず自然な質感を維持できます。
- MDX-Net: AI音源分離の国際コンペティションで上位を獲得した高精度アーキテクチャです。ボーカルの分離精度に特化しており、歌声の抜き出しや除去で抜群の透明感を誇ります。
- VR Architecture (Vocal Remover Architecture): Ultimate Vocal Removerの初期から改良が続けられているモデル群です。リバーブや空間系エフェクトの除去に特化した派生モデルが多く存在します。
ツール内でモデルを選択する際は、ボーカルをメインに扱いたいなら「MDX-Net」系のモデルを、ドラムやベースも含めてバランスよく分離したいなら「Demucs」系のモデルを指定するのが鉄則です。
AI技術を活用した機械学習のデータ処理全般に関しては、Label Studioの使い方|インストールからアノテーション・エクスポートまで完全網羅 でもアノテーションやデータ整備の基本を詳しく取り上げています。
初心者でもできる!Ultimate Vocal Removerを使ったカラオケ音源の作り方
実際にPCソフト「Ultimate Vocal Remover」を使って、手持ちの楽曲からカラオケ音源(インスト)を書き出す実践的な手順を解説します。
複雑なコマンド操作は一切不要で、マウス操作だけで最高精度のインストトラックが完成します。
ステップ1: 音源ファイルの準備と読み込み
まずは分離したい楽曲ファイルを用意します。
元音源の音質が分離後のクオリティに直接影響するため、可能な限りビットレートの高いMP3(320kbps)や、非圧縮のWAVファイルを使用するのが理想的です。
UVRを起動したら、画面上部の「Select Input」をクリックして対象の楽曲を選択します。続いて「Select Output」で、分離後のファイルを保存したいフォルダーを指定します。
[Select Input] ---> 楽曲ファイル(.wav / .mp3)を選択
[Select Output] ---> 保存先フォルダーを指定
ステップ2: 分離処理方式とモデルの選択
画面中央の「CHOOSE PROCESS METHOD」から処理エンジンを選択します。
ボーカルを綺麗に消したカラオケ音源を作る場合、以下の設定が最も失敗の少ない推奨構成です。
- PROCESS METHOD:
MDX-Net - CHOOSE MDX-NET MODEL:
UVR-MDX-NET MainまたはUVR-MDX-NET Inst HQ
モデルがローカルに存在しない場合は、ドロップダウンメニューの横にあるダウンロードボタンをクリックすれば、自動的に最新モデルが取得されます。
ステップ3: 書き出しオプションの設定
出力するファイルの設定を行います。
ボーカルを消した伴奏音源が欲しい場合は、画面右側の「Instrumental Only」にチェックを入れます。もしボーカルトラックも同時に保存しておきたい場合は、チェックを外したままにしておけば両方のトラックが同時に書き出されます。
GPU(NVIDIA製グラフィックボードなど)を搭載したPCを使用している場合は、「GPU Conversion」にチェックを入れることで、CPU処理の数倍から十数倍の速度で変換が完了します。
ステップ4: 分離の実行と仕上がりの確認
設定が完了したら、画面最下部にある大きな「Start Processing」ボタンをクリックします。
進捗バーが100%になり、「Process Complete」と表示されたら作業終了です。指定した出力フォルダーを開き、書き出されたインスト音源を再生して仕上がりを確かめます。
もし歌声の残響が伴奏側にわずかに漏れ出している場合は、モデルを「VR Architecture」に切り替え、リバーブ除去特化モデルで再度処理をかけるとさらにクリアな音質に仕上がります。
カラオケ音源のクオリティを底上げするノイズ処理テクニック
AIによる自動分離を実行しただけでは、曲調によってボーカルのサ行の音(シビランス)や、サビでの大きなコーラス成分が伴奏側に残ってしまうケースがあります。
ほんの少しの手間を加えるだけで、カラオケ音源の実用性を大幅に向上させる3つのテクニックを紹介します。
以下の表は、よくある音残りトラブルとそれに対する具体的な対策手法を整理したものです。
| 発生する現象 | 原因 | 具体的な対処テクニック |
|---|---|---|
| コーラスの歌声が残る | メインボーカルとコーラスの帯域の違い | コーラス分離専用モデル(Karaoke系)で二段階分離 |
| 金物楽器の音がシュワシュワ濁る | 高域成分の過剰カット | 位相補正またはイコライザーで高音域を微調整 |
| ボーカルのリバーブが残響として残る | 空間系エフェクトの広がり | De-Reverbモデルを用いた残響成分の個別カット |
つまり、1回の分離で完璧を目指すのではなく、目的に応じてモデルを組み合わせたり不要帯域を整えたりするのが音質向上の鍵となります。
特にコーラスが分厚いポップス楽曲では、まず「Vocal」と「Instrumental」に分けた後、残った伴奏トラックに対して再度「Lead Vocal / Backing Vocal」分離を適用する「二段階分離」を行うと、劇的にカラオケの完成度が高まります。
さらに、DAWソフトをお持ちであれば、抽出したボーカルトラックの位相を反転させて原曲と重ね合わせる「位相反転微調整」を行うことで、AI特有のアーティファクト(シュワシュワとした不自然な音のヨレ)を最小限に抑え込めます。
より幅広い音楽・サウンド系ツールのトレンドを調べたいときは、AI音楽・サウンドカテゴリ や AI音楽・サウンドランキング を確認すると最新ツールの比較が容易です。
ボーカル抽出や音源分離の利用における著作権上の注意点は?
ボーカル抽出技術は極めて強力ですが、扱う音源の多くには作詞者、作曲者、レコード会社などの著作権・著作隣接権が存在します。
トラブルを避けるために、法律および利用規約の観点から必ず知っておくべき境界線を整理します。
個人で楽しむ範囲(私的使用のための複製)
日本の著作権法第30条において、「私的使用のための複製」は権利者の許諾なく行うことが認められています。
そのため、以下の行為は法的に問題ありません。
- 自分で購入したCDや配信音源からボーカルを消し、自宅で歌の練習をする
- 抜き出したボーカルトラックを使い、自分自身のリスニング用に耳コピを行う
- 個人のスマートフォンに入れてオフラインでカラオケとして歌って楽しむ
公開・配布に伴う法的リスク
一方で、分離した音声をインターネット上に公開したり、第三者に渡したりする行為は私的使用の範囲を逸脱します。
- 禁止事項: 抽出したインスト音源をYouTubeやTikTok、ニコニコ動画などに無断でBGMや歌ってみた音源としてアップロードする
- 禁止事項: 「カラオケ音源作りました」として、オンラインストレージ等で不特定多数にファイルを配布する
- 禁止事項: 他人の楽曲から抜き出したボーカルアカペラを使い、無許諾でリミックスやマッシュアップを一般公開・販売する
歌ってみた動画を投稿したい場合は、楽曲の権利者(原盤権者や著作権管理団体)が公式に配布しているピアプロ等のオケ音源を利用するか、自ら伴奏を打ち込み制作(DTM)してJASRAC等の包括契約プラットフォームに投稿するのが正規の手順です。
AIで抽出した音源の公開可否は原盤権に直接抵触するため、取り扱いには十分注意してください。
AI PICKS編集部の判定
ボーカル抽出ツールの選定において、編集部の見立ては極めてシンプルです。
パソコン(WindowsまたはMac)を所有しているなら、迷わず「Ultimate Vocal Remover」一択です。完全無料で広告もなく、世界最高峰の分離モデルをローカル環境で無制限に回せる性能は圧倒的です。クラウド型ツールの有料プランに毎月課金するのが正直微妙に感じられるほど、完成された地位を築いています。
一方で、スマートフォンしか持っていない場合や、出先で急遽1曲だけボーカルを抜きたいシチュエーションであれば、ブラウザで即座に扱える「Vocal Remover」や「LALAL.AI」が地味に便利です。数回の利用であれば無料枠やプレビューで十分事足りるため、日常的な練習程度なら追加コストをかける必要はありません。
本格的な音源制作や定期的なカラオケ作成を行うならPC環境を整えてUVRを導入し、単発の手軽さを重視するならWebサービスを適宜使い分ける構成が最も費用対効果に優れています。
よくある質問(FAQ)
Q. 完全無料で制限なく使えるボーカル抽出ソフトはどれですか?
オープンソースとして配布されている「Ultimate Vocal Remover (UVR)」です。利用回数や楽曲の長さに制限がなく、完全無料で利用できます。Windows、Mac、Linuxの主要なパソコン環境に対応しています。
Q. スマホだけでボーカル抽出からカラオケ作成まで完結できますか?
可能です。Moisesなどの専用アプリや、Vocal RemoverなどのWebブラウザツールを利用すれば、スマートフォンのストレージ内にある音声ファイルを直接アップロードして伴奏音源を作成できます。
Q. なぜAIでボーカルを消すと音がシュワシュワするのですか?
AIが歌声成分を取り除く際、背後で重なっているシンバルやアコースティックギターの高音域まで一緒に削り取ってしまうことで生じる「アーティファクト」と呼ばれる現象です。分離モデルを最新のMDX-Net系に変更するか、よりビットレートの高い非圧縮音源(WAV)を入力ファイルに使うことで大幅に改善されます。
Q. YouTubeの動画リンクから直接ボーカルを抽出できますか?
一部のWebツールにはURL入力に対応したものもありますが、多くの動画配信プラットフォームでは利用規約により無許可のストリームダウンロードが禁止されています。規約違反や著作権侵害のリスクを避けるため、自身が正当に保有している音声ファイルを用いて作業してください。
Q. コーラス(ハモり)だけを残してメインボーカルだけを消すことは可能ですか?
可能です。Ultimate Vocal Removerなどに搭載されている「Karaokeモデル」や「Lead Vocal Isolationモデル」を選択すると、メインの主旋律ボーカルだけを抽出し、伴奏側にバックコーラスを残した状態のカラオケ音源を書き出せます。
Q. 抽出したボーカルトラックや伴奏を商用利用してもよいですか?
ツールの利用規約だけでなく、元となる楽曲の著作権および原盤権に依存します。自身が著作権を完全に保有しているオリジナル楽曲であれば商用利用に問題はありませんが、市販の楽曲から分離したトラックを商用作品に利用・販売することは権利侵害となります。
あわせて見たいツール・カテゴリ
音源分離やボーカル編集と関連するツールやカテゴリは、以下のリンクから確認できます。
- Ultimate Vocal Removerの詳細と特徴
- LALAL.AIの機能と料金
- AI音楽・サウンドツールの総合ランキング
- AI音楽・サウンドカテゴリの最新一覧
- AI音声・文字起こしツールの総合ランキング
音声合成やキャラクターボイスの活用にも興味があるなら、ElevenLabs vs VOICEPEAK: 違いと選び方完全ガイド2026 を次に読むと、分離したボーカルと合成音声の使い分けがより明確になります。

